Új beszédfelismerő és szövegfelolvasó modelleket adott ki a Microsoft AI
A Microsoft AI új, valós idejű beszédfelismerő modellt mutatott be MAI-Transcribe-2-Streaming néven. A rendszer 60 nyelven képes átírni a beszédet, és az első részleges eredményeket alig több mint 100 ezredmásodperc alatt adja vissza. Ez lehetővé teszi, hogy a hangalapú ügynökök már akkor reagálni kezdjenek, amikor a beszélő még nem fejezte be a mondatot. A Microsoft közlése szerint a modell az Artificial Analysis pontossági rangsorában az első helyen áll. Az év végéig bevezető áron, óránként 0,54 dollárért érhető el.
A vállalat két új szövegfelolvasó modellt is kiadott. A MAI-Voice-2.1 ugyanazzal a hanggal 23 nyelven tud megszólalni, miközben az egyes nyelvekhez natív kiejtést használ. Ennek gyorsabb változata, a MAI-Voice-2.1-Flash 150 ezredmásodperces késleltetést ígér, és egymillió karakterenként 15 dollárba kerül a korábbi 22 dollár helyett.
Mindkét hangmodell képes néhány másodpercnyi referenciafelvétel alapján hangot klónozni. A Microsoft beépített védelmi megoldásokkal igyekszik megelőzni a visszaéléseket, a modellek pedig a Microsoft Foundryn és a MAI Playgroundon keresztül is elérhetők; a két szövegfelolvasó modell az OpenRouteren szintén használható. Egy tesztben a 4000 résztvevő mintegy fele valódi ember hangjának gondolta a mesterségesen létrehozott beszédet.
Folytasd az appban — szavazz és szólj hozzá ➔