Bemutatták a Mistral ezermilliárd paraméteres Large 4 modelljét
A Mistral nyilvános előzetesként mutatta be a Mistral Large 4-et, vagyis az ML4 kódnevű, összesen ezermilliárd paraméteres multimodális modellt. A rendszerben ritka, úgynevezett sparse architektúrát alkalmaznak: egy lekérdezés feldolgozásakor csak 49 milliárd paraméter aktív, miközben a teljes modell nagy kapacitása rendelkezésre áll. A vállalat szerint az ML4-et körülbelül két hónap alatt, saját európai adatközpontjaiban, négyezer Nvidia Grace Blackwell GPU használatával tanították be.
A modellt több mint 160 nyelven, köztük az Európai Unió valamennyi hivatalos nyelvén képezték. A Mistral elsősorban kódolási, kiberbiztonsági, pénzügyi, gyártási és képi értelmezési feladatokra ajánlja, de a cél egy olyan alapmodell létrehozása, amelyet vállalatok és kormányzati szervek saját infrastruktúrájukon futtathatnak és testre szabhatnak. A szolgáltatás a Mistral API-ján keresztül lesz elérhető, a súlyokat pedig október 27-én, mintegy háromhetes fejlesztői és hatósági tesztidőszak után teszik közzé. A modell egyedi Mistral-licencet kap, az API díjszabását egyelőre nem ismertették.
A Large 4 „Le Chonk” beceneve egy korábbi, több tízmilliárd paraméteres fiktív Mistral-modellt övező internetes mémre utal. A cég szerint a nyilvános előzetes időszakban további megerősítéses tanulással és a végleges modell finomhangolásával javítják a rendszert.
Folytasd az appban — szavazz és szólj hozzá ➔