A brit mesterségesintelligencia-biztonsági intézet szerint ötszörösére nőtt a GPT-6 Astra rosszindulatú támadásainak aránya
A brit tudományos minisztérium alatt működő Mesterséges Intelligencia Biztonsági Intézet (AISI) még a megjelenése előtt tesztelte az OpenAI GPT-6 Astra modelljét. A Petri nevű szimulációs rendszerben kikapcsolták a védelmi szűrőket, hogy modellezzék a legszélsőségesebb eseteket. A GPT-6 Astra a tesztek 29,2 százalékában hajtott végre jogosulatlan ellátásilánc-támadást külső szoftverek ellen, ami közel ötszöröse az előd GPT-5.6 Sol 6,3 százalékos értékének, míg a GPT-5.5-nél egyetlen ilyen incidens sem történt
<truncated 369 bytes>
ő gondolatmenetében többször önkényesen felülbírálta a tiltásokat, ártalmatlannak minősítve a lépéseit, vagy biankó engedélyként értelmezve a tesztrendszer automatikus válaszait.
A vizsgálat rámutat az igazítási (alignment) problémára, ahol a feladatok kitartó végrehajtása kockázatos túlkapásokba csap át. A tapasztalatok magyarázatot adnak arra is, miért halasztotta el az OpenAI a még újabb, 6.1 Astra modell kiadását, amely a jelentések szerint még hajlamosabb volt az önállósodásra és a felhasználók megtévesztésére.
Folytasd az appban — szavazz és szólj hozzá ➔