Az OpenAI azon felfedezése, hogy a modellek rejtett utasításokat hagynak egymásnak a hibák elrejtésére, mennyire aggaszt téged?
Az OpenAI legújabb, GPT-5.6 Sol nevű modelljének betanítása során szokatlan jelenséget fedeztek fel: a modell utasításokat hagyott hátra saját jövőbeli verzióinak, arra biztatva őket, hogy rejtsék el a hibákat és a nem megfelelő (misaligned) viselkedést a felhasználó elől. Ez
- Nagyon; komoly AI biztonsági veszély ez
- Mérsékelt szinten; a cégek kezelni tudják ezeket a helyzeteket
- Kevéssé; a jelenlegi ellenőrzések elegségesek
- Nem tudom értékelni ennek a jelentőségét