PEGAPOLL · HÍREK

A Qwen multimodális modellje a Gemini töredékáért versenyez, és szinte ugyanazt tudja

The Decoder (AI) · 2026-09-19
🤖 AI-generált tartalom — A címet és az összefoglalót mesterséges intelligencia készítette automatikusan, emberi szerkesztői átnézés nélkül.

A Qwen bemutatta első, kifejezetten AI-ügynökök számára készült multimodális modelljét, a Qwen3.8-Omni-Flasht, amely a hangot és a videót együtt dolgozza fel, következtetéseket von le az anyagból, és saját kezdeményezésre használ eszközöket – vág vlogokat, fordít rövid videókat vagy foglalja össze filmeket. A modell kontextusablaka egymillió token, ami hosszú, akár órás felvételek egyszerre történő feldolgozását teszi lehetővé.

Az audiovizuális mérőszámokon a Qwen szerint a modell közel eléri a Google Gemini 3.8 Flash teljesítményét, miközben jóval olcsóbb: az API használata bemenetenként 0,15, kimenetenként 0,47 dollár millió tokenenként, szemben a Gemini 0,75 és 3,75 dolláros bevezető áraival – amelyek ráadásul 2027. január 1-jén megduplázódnak. Egy óra hangfelvétel feldolgozása így kevesebb mint 1 centbe kerül, 720p felbontású, másodpercenként egy képkockás videó hanggal körülbelül 0,20 dollárba (a válaszköltség nélkül).

A modell elérhető a Qwen Studio, a Qwen Cloud és az API felületén. A nyílt forrású Qwen-MM-Plugins videovágást, hangszórófelismerést, PDF-videójegyzeteket és újrafelhasználható munkafolyamatokat ad az olyan ügynököknek, mint a Claude Code, a Gemini CLI és a Qwen Code, a Qwen-Live Harness pedig kamera és mikrofon segítségével teszi lehetővé a valós idejű interakciót.

Folytasd az appban — szavazz és szólj hozzá ➔
Forrás: The Decoder (AI) · innen ahirlevel.hu