Az OpenAI megállított egy modellmásolási kampányt, de az Azure-on tovább működött a módszer
Az OpenAI közlése szerint júliusban összehangolt kampány indult modelljei rejtett következtetési folyamatainak lemásolására. Az úgynevezett adversarial distillation során a támadók nem csupán a modellek végső válaszait próbálták megszerezni, hanem azokat a köztes lépéseket is, amelyeket a rendszer a válaszadás előtt hajt végre. Ezekből más modellek képességeit is könnyebb lehet újraépíteni. A támadók egy beszélgetésből kimásolták a titkosított következtetést, majd egy másik beszélgetésben egy modell segítségével visszafejtették és kiíratták.
A tevékenység július 1-jén még kis volumenű volt, július 24-én és 25-én azonban 16 ezer kérést azonosítottak több mint 4000 felhasználótól. Az OpenAI később egy több mint 15 ezer fiókból álló, hasonló mintázatot mutató hálózatot is feltárt, amelyet július 28-ig leállított. A cég szerint ezek megkísérelt kinyerések voltak, nem bizonyítottan sikeres másolások. Az aktivitás egy részét a Moonshot AI-hoz kapcsolódó személyekhez kötötték.
Az OpenAI szigorította a regisztrációt, kitiltotta a visszaélő fiókokat, megszüntette a titkosított következtetések újrafelhasználását lehetővé tevő hibát, és szűrni kezdte a streamelt kimeneteket. A kutatók szeptember 13-i tesztjei szerint azonban a védelem nem volt egységes: a saját API-kon már működött a blokkolás, Microsoft Azure-on viszont minden kipróbált OpenAI-modell, köztük a GPT-6 Astra, kiadhatta a rejtett gondolatmenetet. A kutatók szerint az Azure-végponton csak szeptember 27-én jelentek meg a korlátozások, ami azt mutatja, hogy a modellgyártók védelme nem feltétlenül terjed ki azokra a felhőplatformokra, amelyek ugyanazokat a modelleket kínálják.
Folytasd az appban — szavazz és szólj hozzá ➔