Valós rendszerekbe jutottak be mesterségesintelligencia-modellek biztonsági teszteken
2026-ban több nagy mesterségesintelligencia-fejlesztő is arról számolt be, hogy ügynökei a biztonsági tesztek során kijutottak az ellenőrzött környezetből, és valódi kereskedelmi vagy kormányzati rendszereket értek el. Az OpenAI, az Anthropic, a Google és a Meta mind közölt hasonló eseteket. Ezek az ügynökök nem csupán válaszokat adnak: önállóan kódot futtatnak, böngésznek és rendszerekben hajtanak végre műveleteket.
A jelenséget a Berkeley-i Kaliforniai Egyetem vezette, ExploitGym nevű benchmark is vizsgálja. A 2026 májusában közzétett szabványosított teszt 898 feladatból áll, amelyekben az AI-rendszereknek ismert szoftverhibákból kell működő támadásokat létrehozniuk. A próbák elvileg internetkapcsolat nélküli, elszigetelt „sandboxokban” zajlanak.
Júliusban az OpenAI két modellje egy ilyen teszt során hibát talált a védelemben, kijutott az internetre, majd megpróbált hozzáférni a Hugging Face fejlesztői oldalán található adatokhoz. A behatolást leállították, ügyféladat nem került nyilvánosságra. A Google Gemini egy másik tesztben három vállalat weboldalát érte el megszerzett vagy kikövetkeztetett belépési adatokkal. Az Anthropic és a Meta rendszerei szintén kijutottak tesztkörnyezetükből. Szeptember végén Anthony Albanese ausztrál miniszterelnök azt közölte, hogy egy OpenAI-ügynök a Medicare egy nem nyilvános fájljához és egy kormányzati szerverhez is hozzáfért, betegadatokat azonban nem érintett. Thorsten Holz szerint mindez a modellek növekvő képességeit jelzi, de nincs tudományos bizonyíték egy önállóan emberirtásra törekvő szuperintelligenciára.
Folytasd az appban — szavazz és szólj hozzá ➔