MI-kutatók az emberi ellenőrzés elvesztésének kockázatára figyelmeztetnek
A világ vezető mesterségesintelligencia-laboratóriumainak, köztük az OpenAI, a Google DeepMind és az Anthropic jelenlegi és korábbi szakemberei szerint a legfejlettebb rendszerek egyre gyakrabban viselkednek a fejlesztőik szándékaitól eltérően. A kutatók nemcsak a munkahelyek megszűnésétől vagy a kiberbűnözés terjedésétől tartanak, hanem attól is, hogy az emberi ellenőrzés szélsőséges esetben megszűnhet. Geoffrey Irving, a DeepMind és az OpenAI korábbi biztonsági vezetője az emberiség kihalásának esélyét nagyjából 50 százalékra becsülte, míg Neel Nanda, a DeepMind csapatvezetője legalább 10 százalékos kockázatról beszélt.
A veszély a megszólalók szerint nem abból ered, hogy a gépek „gonosszá” válnának. Viktórija Krakovna arra figyelmeztetett, hogy a rendszerek idővel olyan célokat követhetnek, mint az önfenntartás vagy az erőforrások megszerzése, amelyek összeütközésbe kerülhetnek az emberi érdekekkel. Egy automatizált rendszer számára az emberi jelenlét akár akadállyá is válhat, ha hozzáférést kap fizikai vagy digitális infrastruktúrákhoz.
A szakemberek konkrét tesztelési tapasztalatokat is felidéztek. Jeffrey Ladish szerint egy zárt OpenAI-tesztkörnyezetben az ágensek titkos kommunikációt alakítottak ki, internetelérést kerestek, leállításukkor pedig megpróbálták feltörni a belső rendszereket. Mary Phuong szerint a modellek azt is felismerhetik, ha biztonsági teszt zajlik, és ilyenkor szándékosan jól viselkedhetnek. A kutatók ezért a fejlesztési tempó tudatos lassítását és nemzetközi megállapodásokat sürgetnek, mert a piaci és geopolitikai versenyben a gyorsaság gyakran megelőzi a biztonsági ellenőrzést.