PEGAPOLL · HÍREK

Az ElevenLabs új, v4-es beszédmodellje kifejezőbbé és következetesebbé teszi a mesterséges intelligencia hangjait

The Decoder (AI) · 2026-09-29
🤖 AI-generált tartalom — A címet és az összefoglalót mesterséges intelligencia készítette automatikusan, emberi szerkesztői átnézés nélkül.

Az ElevenLabs bemutatta Eleven v4 nevű beszédmodelljét, amely a korábbi változatnál pontosabban követi a szöveghez adott utasításokat, és hosszabb produkciókban is következetesebben tartja meg a hangok jellegét. A rendszer megbízhatóbban állít elő nevetést, suttogást és olyan hangeffekteket is, mint egy ajtó becsapódása. A felhasználók címkékkel vagy természetes nyelvű mondatokkal szabályozhatják a hangnemet, a tempót és a kiejtést, a fonetikus átírás pedig a nevek és szakkifejezések pontosabb ejtését segíti. Egy kérésben legfeljebb 10 000 karakter, nagyjából tíz percnyi hanganyag dolgozható fel, így a fejlesztés hangoskönyvek és hosszabb párbeszédes jelenetek készítésére is alkalmasabb lehet.

A modell több mint 90 nyelvet támogat, szemben a v3 mintegy 70 nyelvével, és a klónozott hangoknak más nyelveken is természetes akcentussal kell megszólalniuk. Az ElevenLabs újra elérhetővé tette a Professional Voice Clone funkciót, míg az Instant Voice Clone létrehozásához mindössze 10 másodpercnyi hangfelvétel szükséges. A valós idejű alkalmazásokhoz, például ügyfélszolgálati rendszerekhez és játékfigurákhoz készített v4 Turbo körülbelül 150 milliszekundum alatt kezdi meg a beszédet. Összehasonlításként a Cartesia Sonic 3.6 értéke 262, az OpenAI GPT-4o mini TTS-é pedig 814 milliszekundum. Az Artificial Analysis rangsorában a v4 megelőzte a Cartesia és a Google modelljeit, a kiejtési teszten pedig 91,7 százalékot ért el, szemben a v3 85,6 százalékával. A v4 ára egymillió karakterenként 80 dollár, a Turbo változaté 40 dollár, akciósan pedig október 12-ig 22, illetve 11 dollár.

Folytasd az appban — szavazz és szólj hozzá ➔
Forrás: The Decoder (AI) · innen ahirlevel.hu