ElevenLabs v4: синтез речи на 90 языках с управлением эмоциями
ElevenLabs представила новые модели синтеза речи Eleven v4 и v4 Turbo, позиционируя их как наиболее эмоционально выразительные решения на рынке.
Новые модели поддерживают более 90 языков, что расширяет возможности локализации контента. Система способна клонировать голос по 10-секундному аудиофрагменту, сохраняя акцент носителя оригинального языка.
Модель сохраняет целостность голоса в длинных текстах и автоматически подстраивает интонацию под контекст.
Управление эмоциями осуществляется через специальные теги в тексте, такие как [excited, happy] или [laughs]. Пользователи могут комбинировать теги для последовательного воспроизведения эмоций и добавлять фоновые звуки, например, дождь или звон телефона.
Версия Turbo оптимизирована для работы с голосовыми агентами. Задержка первого звука составляет около 150 мс, а генерация начинается еще до завершения формирования ответа большой языковой моделью.








