A Google kutatói módszert találtak az önfejlesztő mesterséges intelligenciák tesztmemóriájának korlátozására
Az önfejlesztő mesterségesintelligencia-ágensek gyors fejlődésének komoly akadálya, hogy a környezetüket optimalizáló rendszerek hajlamosak bemagolni a tesztfeladataikat, így az elért eredményeik az új, korábban nem látott kihívásokon jelentősen visszaesnek vagy teljesen elenyésznek. Ennek kiküszöbölésére fejlesztette ki a Google Cloud AI Research és több egyetem kutatócsoportja az RRSI (Regularized Recursive Self-Improvement of Agent Harnesse
<truncated 552 bytes>
bíráló modul automatikusan elveti azokat a javaslatokat, amelyek feladatneveket vagy konkrét benchmark-specifikus megoldásokat kódolnának be, és csak akkor engedélyezi a számítási igény növekedését, ha az mérhető javulással jár. A kutatók nyolc benchmarkon tesztelték a megoldást a változatlanul hagyott Claude Opus 4.8 modellen: az RRSI a tanítási feladatokon akár 14,1 pontos, míg az ismeretlen teszteken akár 4,7 pontos növekedést ért el – a legnagyobb ugrást a JobBench alatt rögzítve –, miközben 30 százalékkal kevesebb tokent fogyasztott a szabályozatlan változathoz képest. A technika hatékonyságát az is mutatja, hogy egy Gemini 3.5 Flash segítségével optimalizált kódolási keretrendszer az egyszerűbb Gemini 3.1 Flash Lite pontosságát is 11,2-ről 14,6 pontra növelte.
Folytasd az appban — szavazz és szólj hozzá ➔