Az Nvidia SoL-Pi rendszere közel felére csökkenti a kódolóügynökök tokenhasználatát a harness optimalizálásával
Az Nvidia kutatóinak SoL-Pi rendszere a kódoló AI-ügynökök harnessét, a modell és a környezet közti vezérlőréteget optimalizálja automatikusan, nem magát a modellt. Codex, Claude Code vagy OpenClaw típusú rendszereknél ez a réteg szabja meg, hogyan látja az ügynök az állapotokat, hogyan hajt végre műveleteket, és hogyan dolgozza fel a visszajelzést. A felügyelet nélkül hosszan futó ügynökök azért drágulnak, mert a predikciókból gondolkodási láncok, eszközhívások és hurkok lesznek. Egy kutatóügynök nyomon követi a nyomokat, változtatásokat javasol, és előkészített környezetekben teszteli őket; a szerzők rekurzív önfejlesztésre hivatkoznak.
535 futtatható környezetben 152 irányt vizsgáltak: 495 GitHub issue–pull request feladatot és 40 szintetikus tesztet, összesen több mint 3000 futtatással és 60 000-nél több interakcióval. A túlilleszkedés ellen az EdgeBench 51 nyilvános feladatát leválasztották a keresésről: 11 egyszeri validációra, 40 végső értékelésre szolgált, visszacsatolás nélkül. Négy mechanizmus született. Az Action Fusion két lépést – például kódszerkesztést és tesztefuttatást – egy modellhívássá von össze. Az Online Context Compact tervezés után tömöríti a kontextust. Az ObservationPack a hosszú eszközkimenetet archiválja, később rövid összefoglalót ad. Az Evidence-Preserving Reducer a terjedelmes hiba- és tesztnaplókat olcsóbb modellre bízza, automatikus ellenőrzéssel.
Az EdgeBench 51 feladatán a SoL-Pi nagyjából a Pi harness szintjén teljesít. A négy mechanizmust együtt használó, legtakarékosabb változat 49 százalékkal kevesebb tokent fogyaszt, és a Pi pontszámának 93,7 százalékát éri el. A legerősebb egyetlen mechanizmus 5,3 százalékkal felülmúlja a Pi pontszámát, tokenmegtakarítás mellett; a két változat 44,7–49 százalékos tokencsökkenést mutat. Óránként 8,75–13,50 dollár a megtakarítás a natív Codex és Claude Code harneshez, 4,36–5,71 dollár a Pi-hez képest, a jelenlegi API-árakon. A rendszert csak GPT-5.6 Sol-on építették, majd változtatás nélkül alkalmazták Opus 5-re: ott a Pi teljesítményének 94,3 százalékát tartotta meg hasonló spórolással, de a mechanizmusok ritkábban kapcsoltak be. A Terminal-Bench 4 63 CPU-feladatán a SoL-Pi 15-öt oldott meg, a Codex és a Pi 18-18-at; a költség így is nagyjából negyedével maradt a Pi alatt. Más méréseken a kép vegyesebb; a forrás a formálisan ellenőrzött további eredményeknél megszakad.
Folytasd az appban — szavazz és szólj hozzá ➔