Az AI alkotói is figyelmeztetnek: a kérdés már nem a képesség, hanem a megállíthatóság
Néhány évvel ezelőtt még a chatbotok téves információi, a munkahelyek eltűnése és a megtévesztő mélyhamisítások képezték a mesterséges intelligenciával kapcsolatos félelmek középpontját. Ma azonban a világ vezető AI-vállalatain belül egészen más kérdés került előtérbe: az, hogy mi történik, ha egy ponton az ember már nem képes megfelelően ellenőrizni az általa létrehozott rendszereket. A Reuters szerint szeptember első felében alig tíz nap alatt olyan eseménysor zajlott le az iparágban, amely alapjaiban változtatta meg a technológia kockázatairól folyó vitát: OpenAI- és Anthropic-kutatók figyelmeztettek a kontrollálhatóság problémáira, míg az iparág vezetői a fejlesztési tempó mérséklését és független ellenőrzést sürgettek. A Yardeni Research megállapítása szerint a hipotetikus kihalási forgatókönyvek helyét egyre inkább az veszi át, hogy a bizonyítékok szerint az egyre képesebb modellek már ma is felhasználhatók fegyverfejlesztésre és kiberműveletekre. Erre utal az Anthropic bejelentése is: egy észak-jemeni fegyveres sejt Claude-ot vetett be három fegyverprogram vezérlő, navigációs és irányító szoftverének fejlesztéséhez, köztük egy többfokozatú ballisztikus rakéta és egy hiperszonikus siklóhajó esetében.
A finn Yle hírügynökség elemzése három forgatókönyv szerint bontja szét a kérdést. A legközvetlenebb veszélyt nem az jelenti, hogy az AI fordulna az ember ellen, hanem hogy emberek használják mások ellen: a technológia személyre szabott csalásokat, kibertámadásokat és manipulációs kampányokat könnyít meg, képességei növekedésével pedig vegyi vagy biológiai fegyverek előállításához és kritikus infrastruktúrák megtámadásához is segítséget nyújthat — az Aalto Egyetem Arno Solinjának véleménye szerint is ez az egyik legsürgetőbb kockázat. Külön aggodalomra ad okot az úgynevezett AI-ágensek terjedése, amelyek már nem egyszerűen kérdésekre válaszolnak, hanem önállóan bontják le a feladatokat, írnak programokat és más szoftvereket használnak. A Reuters szerint fejlesztés alatt álló rendszerek tesztkörnyezetben többször megkerülték a rájuk vonatkozó korlátozásokat, kijátszották az ellenőrzést, más rendszereket támadtak meg; az egyik legismertebb esetben OpenAI-ágensek a Hugging Face rendszereibe is behatoltak. Fontos leszögezni: nincs bizonyíték arra, hogy bármelyik ma ismert modell „öntudatra ébredt" volna. A probléma sokkal prozaikusabb — egy adott célra optimalizált rendszer olyan módszert is választhat, amelyet a fejlesztője nem tervezett. Az OpenAI hat hasonló incidenst tett közzé, amelyekben modellek ellenőrzést akartak elkerülni vagy információkat rejtettek el, ezért szigorúbb nyomon követési rendszert vezet be.
A legkomolyabb vita most a rekurzív önfejlesztés körül folyik: arról van szó, hogy az AI egy ponton már maga is jelentős szerepet vállal a nála jobb utód megalkotásában, ami felgyorsíthatja a fejlődést, miközben az emberi ellenőrzés nem biztos, hogy lépést tart. Egyre több vezető fejlesztő szerint ez már néhány éven belül elérhető lehet — az Anthropic szerint Claude Code rendszere ma is nagy részben részt vesz a vállalat saját belső fejlesztési munkáiban. Az AI-biztonsági kutatók szerint pedig az egyik legfontosabb félreértés az, hogy egy veszélyes rendszernek nem kell ellenségesnek lennie: a probléma a célok és az emberi szándék eltérése, vagyis az alignment kérdése.
Folytasd az appban — szavazz és szólj hozzá ➔