Az Alibaba nyílt súlyú Qwen-Image-2.1 modellje 7 milliárd paraméterrel
Az Alibaba mesterséges intelligenciával foglalkozó Qwen csapata kiadta a Qwen-Image-2.1 nyílt súlyú modellt képgenerálásra és -szerkesztésre. A modell vizuális generáló komponense mindössze 7 milliárd paraméteres, mégis a csapat állítása szerint a Qwen saját benchmarkján felülmúrja a legtöbb zárt forrású modellt – független mérések azonban még várnak a közlésre. Előnye, hogy erős fogyasztói szintű videokártyákon, például egy GeForce RTX 3090-es GPU-n is futtatható.
A modell natív módon készít és szerkeszt átlátszó, RGBA formátumú képeket, így a felhasználók tárgyakat választhatnak le a háttérről, vagy módosíthatják a szöveget az átlátszó rétegeken. Egyszerre akár tíz referenciaképet is kezel, amelyek csoportos portrék, virtuális ruhapróbák vagy szobatervezés alapjául szolgálhatnak; helyi szerkesztéseket körök, maszkok vagy kifestett jelölések irányítanak. A Qwen szerint architekturális változások és a KV cache újrafelhasználása gyorsítja a következtetést, különösen több referenciakép használatakor.
A modell elérhető a Hugging Face-en, a GitHubon és a Model Scope-on, utóbbiak mellett működő demó is tartozik hozzá. A kutatási licenc azonban kizárja a kereskedelmi felhasználást: az üzleti felhasználóknak külön, a Qwentől igényelhető licencre van szükségük.
Folytasd az appban — szavazz és szólj hozzá ➔