Tovább a PegaPollra
PEGAPOLL · HÍREK

Fotókból szerkeszthető 3D jeleneteket készít a LEGO-Anything

The Decoder (AI) · 2026-10-03
🤖 AI-generált tartalom — A címet és az összefoglalót mesterséges intelligencia készítette automatikusan, emberi szerkesztői átnézés nélkül.

A LEGO-Anything nevű rendszer egyetlen fénykép alapján szerkeszthető 3D jelenetet készít Blender-kóddal. A fejlesztés lényege, hogy az ügynök nem egyetlen lépésben próbálja megalkotni a látványt: kódot ír, lefuttatja, megvizsgálja az eredményt, majd szükség esetén módosítja. Így a végeredmény nem pusztán kép, hanem olyan program, amelyben az objektumok, a geometria, az elrendezés és a kamera helyzete is ellenőrizhető és átírható.

A University of Maryland és az AWS kutatói ezt a LEGO-Bench teszttel vizsgálták. A benchmark 104 beltéri és kültéri helyszínről származó 208 képet, valamint 443 regisztrált objektumot tartalmaz. A jeleneteket professzionális szimulátorokban állították elő, így a képek természetesnek hatnak, miközben a pontos geometria és mélység rendelkezésre áll az értékeléshez. A teszt a jelenet használhatóságát, a látható geometria pontosságát és a képi megjelenés hasonlóságát méri.

A hat vizsgált GPT-konfiguráció szinte mindig működő jelenetet adott, de a pontosságuk jelentősen eltért. A legjobb eredményt a GPT-6 Astra érte el: beltéri jeleneteknél 53,4, kültérieknél 39,6 százalékot. A bonyolultabb jelenetek és a kültéri környezetek nehezebbnek bizonyultak, miközben nagyobb gondolkodási kerettel az Astra egyik irodai részteszten 32,3-ról 61,8 százalékra javult.

A legnagyobb probléma az önellenőrzés: amikor az ügynököknek két változat közül kellett kiválasztaniuk a jobbat, geometriai ítéleteik nagyjából a véletlen szintjén maradtak. A LEGO-Plugin ezért konkrét mérésekkel váltja ki a bizonytalan önértékelést, és megakadályozza a már elért javulás lerontását. Mind a hat modell fejlődött, a gyengébbeknél akár 62,7 százalékpontos javulással. A rekonstruált jelenetek objektumfelismerésben, szegmentálásban és mélységbecslésben már használhatók, de a speciális modellektől még jelentősen elmaradnak.

Villámszavazás

Folytasd az appban — szavazz és szólj hozzá ➔
Forrás: The Decoder (AI) · innen ahirlevel.hu

Kapcsolódó hírek