Nyelvi modellel csökkenti az önfejlesztő kódolóügynökök tesztelési költségét a SIFT
Az önmagát fejlesztő kódolóügynökök egyik legnagyobb nehézsége annak megállapítása, hogy a módosított utasítások, eszközök vagy programkódok valóban javítják-e a teljesítményt. Minden jelölt változtatást tesztelni kell, egy nagyobb keresés pedig több ezer CPU-órát és több ezer dollárt emészthet fel. Az MIT és a Sakana AI kutatói által kidolgozott SIFT, vagyis a Recursive Self-Improvement via Fast Tree Search ezt a költséget próbálja mérsékelni. A keretrendszer egy külön nyelvi modellt használ arra, hogy a drága benchmarktesztek előtt összevesse a jelölt ügynököket, és rangsorolja, melyik változat érdemel további vizsgálatot. A rendszer először négy kódolási feladaton ellenőrzi az új verziót, hogy kiszűrje a hibás vagy alapvető problémák megoldására képtelen módosításokat. Ezután egy nyelvi modell legfeljebb tíz, korábban jól teljesítő ügynökkel páros összehasonlításban értékeli az új jelöltet. Az eredményeket Bradley–Terry-modell alakítja relatív rangsorrá; ez nem helyettesíti a teljes tesztelést, hanem a tesztelési sorrend meghatározását segíti. A javítások létrehozása, bírói értékelése és benchmarktesztje párhuzamosan futhat, így az új jelölteknek nem kell megvárniuk az előző változat teljes kiértékelését. A Polyglot kódolási benchmarkon egy SIFT-futtatás 35,1 százalékos pontosságot ért el kevesebb mint öt óra alatt, 42 CPU-óra és körülbelül 150 dollárnyi API-kredit felhasználásával. A módszer elsősorban olyan csapatoknak lehet hasznos, amelyek jól meghatározott feladatokon hangolják kódolóügynökeik működését.
Folytasd az appban — szavazz és szólj hozzá ➔