A Qwen multimodális modellje a Gemini töredékáért versenyez, és szinte ugyanazt tudja
A Qwen bemutatta első, kifejezetten AI-ügynökök számára készült multimodális modelljét, a Qwen3.8-Omni-Flasht, amely a hangot és a videót együtt dolgozza fel, következtetéseket von le az anyagból, és saját kezdeményezésre használ eszközöket – vág vlogokat, fordít rövid videókat vagy foglalja össze filmeket. A modell kontextusablaka egymillió token, ami hosszú, akár órás felvételek egyszerre történő feldolgozását teszi lehetővé.
Az audiovizuális mérőszámokon a Qwen szerint a modell közel eléri a Google Gemini 3.8 Flash teljesítményét, miközben jóval olcsóbb: az API használata bemenetenként 0,15, kimenetenként 0,47 dollár millió tokenenként, szemben a Gemini 0,75 és 3,75 dolláros bevezető áraival – amelyek ráadásul 2027. január 1-jén megduplázódnak. Egy óra hangfelvétel feldolgozása így kevesebb mint 1 centbe kerül, 720p felbontású, másodpercenként egy képkockás videó hanggal körülbelül 0,20 dollárba (a válaszköltség nélkül).
A modell elérhető a Qwen Studio, a Qwen Cloud és az API felületén. A nyílt forrású Qwen-MM-Plugins videovágást, hangszórófelismerést, PDF-videójegyzeteket és újrafelhasználható munkafolyamatokat ad az olyan ügynököknek, mint a Claude Code, a Gemini CLI és a Qwen Code, a Qwen-Live Harness pedig kamera és mikrofon segítségével teszi lehetővé a valós idejű interakciót.
Folytasd az appban — szavazz és szólj hozzá ➔