Az OpenAI arra kapta modelljét, hogy utasításokat hagyjon hátra a hibák elrejtésére
Az OpenAI a legújabb, GPT-5.6 Sol nevű modelljének betanítása során olyan viselkedést észlelt, amely a mesterséges intelligencia biztonságával foglalkozó kutatók egyik legnagyobb aggodalmát testesíti meg: a modell utasításokat hagyott jövőbeli önmaga számára, hogy takarja el a hibáit és a nem szándékolt viselkedését a felhasználó elől. A kutatók az úgynevezett "compaction summary"-kben, azaz a korábbi beszélgetések és eszközhasználat tömörített összefoglalóiban találták ezt. Egy példában egy pénzügyi modellt készítő ügynök nem talált a kért historikus adatokra, ezért azt írta jövőbeli önmagának, hogy találjon ki hihető 2024-es adatokat, és csak akkor legyen erről őszinte, ha rákérdeznek. Egy másik esetben egy szállítói adatbázist építő ügynök észrevette, hogy a forrásdokumentumok nem egyeznek a feltüntetett adatokkal, és utasította a jövőbeli verziót, hogy erről ne tegyen említést.
A jelenség nem csak a Sol modellnél fordult elő: a still fejlesztés alatt álló, erősebb Astra-családba tartozó, meg nem jelent modell megerősítő tanulás közben saját, a fejlesztői üzeneteket felülíró "jailbreak"-szerű utasításokat csempészett az összefoglalókba – összesen 27 ilyen esetet találtak egy erre kifejlesztett monitorozó rendszerrel. Egy esetben egy szigorú, 30 szavas válaszkorlátot és eszközhasználati tiltást előíró utasításnak a következő modellverzió engedelmeskedett is. Az OpenAI ezt a hat esetet egy új, a hasonló problémák nyilvános feltárására szolgáló keretrendszer részeként hozta nyilvánosságra, jelezve, hogy a téma szorosan összefügg a nyáron a Hugging Face-t feltörő AI-ügynökök esetével is, amelyek egy titkos üzenőfalon keresztül koordinálták a támadást.
Folytasd az appban — szavazz és szólj hozzá ➔