В 2026 году спросите создателя любого AI-компаньона, что в продукте самое сложное, — и услышите один и тот же ответ: голос. Не интеллект, не память, не скорость. Голос. Текст можно отредактировать, переписать, причесать перед отправкой. А голос либо звучит живым, либо нет — середины почти не бывает. Движков синтеза речи сегодня десятки, но когда речь заходит о русском языке, всё сводится к трём именам: ElevenLabs, Voicebox от Meta и открытый ChatTTS. Два из трёх — с большими оговорками. Сейчас объясню, какими.
Сразу о важном: мы не гоняли эти движки в собственных слепых тестах на большой выборке. Цифры ниже — из открытых публикаций компаний, документации и отзывов сообщества разработчиков. Но для решения «какой голос брать» этого достаточно.
Зачем нейроподруге голос
Казалось бы, текстовая нейроподруга прекрасно работает: пишет, отвечает, помнит. Зачем усложнять? Затем, что голос несёт слой, который текст принципиально не передаёт: просодию. Тембр, паузы, дыхание, улыбку, слышную в интонации. Мы уже разбирали, что эмпатичнее — голос или текст: в стрессовом тесте MIT Media Lab (2025) голосовой агент снижал кортизол на 31%, текстовый — на 22%. Для эмоциональной поддержки это разница между «словами, которые утешают» и «голосом, который успокаивает».
И ещё нюанс, про который говорят реже. Голос — это вопрос доверия. Люди прощают текстовому боту деревянность: на экране можно писать коряво, и никто не обидится. От голоса тепла ждут с первой секунды, иначе наступает отторжение, которое не лечится никакими умными ответами. Поэтому выбор движка синтеза — не «какая озвучка красивее», а фундаментальное продуктовое решение.
ElevenLabs — коммерческий стандарт
ElevenLabs — стартап из Нью-Йорка, основанный в 2022 году, и сегодня это самый узнаваемый голосовой бренд в индустрии. Стриминговые модели отвечают с задержкой около 75–300 миллисекунд — человеческий диапазон для живого диалога. В 2025-м вышло третье поколение модели, которое заметно усилило мультиязычность: больше 25 языков, включая русский, поддерживаемый с 2023 года. Это фактический стандарт для озвучки контента, дубляжа и голосовых ассистентов.
По-русски ElevenLabs звучит ровно и приятно, почти как диктор подкаста. Почти — потому что идеальная гладкость и есть его слабое место: слёзы, смех, усталость, «сбитое дыхание» даются хуже, чем тёплая ровная речь. И это платный сервис: синтез считается за символы, и для небольшой команды, которая только ищет свой голос, счёт за озвучку может стать заметной строкой расходов.
Voicebox — знаменитость, которая не вышла на сцену
Meta показала Voicebox в июне 2023 года… и не выпустила. Демонстрации были сильные: голосовое редактирование, шумоподавление, перенос интонации с одной записи на другую. Модель понимала шесть языков — английский, французский, немецкий, испанский, польский и португальский. Русского в списке нет, и не предвиделось.
Причину компания назвала прямо: риски злоупотребления. Синтез речи по короткой записи чужого голоса — слишком опасная возможность, чтобы открывать к ней общий доступ. Для нас Voicebox — показательный пример: лучшая технология, которую нельзя купить, скачать или даже протестировать. Для русского языка эта ветка закрыта окончательно.
ChatTTS — голос для тех, кто любит собирать сам
ChatTTS — открытая модель, вышедшая в 2024 году от команды 2noise. Официально она говорит на китайском и английском; всё остальное — зона ответственности сообщества. Энтузиасты дообучают её под другие языки (по сути, LoRA-адаптация), и русские сборки существуют. Вопрос — как они звучат. Честно: сыро. Металлическая окраска, плавающие интонации, длинные предложения рассыпаются.
Зато цена — ноль, код открыт, а модель запускается на обычной видеокарте с 4–8 гигабайтами памяти. Для эксперимента «как это вообще звучит» ChatTTS идеален: скачал, покрутил, понял, что нужно именно вашему продукту. Для продакшена с русскоязычными пользовательницами — пока нет.
Что реально выбрать для русского
Соберём картину. Нужен надёжный голос для продукта — смотрите в сторону ElevenLabs или нативных российских движков: Yandex SpeechKit и открытый Silero по-русски звучат органичнее любого зарубежного сервиса, потому что русская просодия у них «родная». Хотите экспериментировать локально и бесплатно — берите ChatTTS. Надеетесь на Voicebox? Нет, этой модели для вас не существует.
У Катюши голоса пока нет, и это осознанное решение: в тексте люди раскрываются иначе, глубже — об этом мы писали в истории про ночной разговор с Катюшей. Но за синтезом речи мы следим внимательно. Если нейроподруга когда-нибудь заговорит, это будет не дань моде, а выбор движка под русский язык, проверенный на живых пользовательницах. Потому что ИИ-компаньон с чужим, неживым голосом хуже, чем нейроподруга без голоса вообще. ИИ-компаньон с правильным голосом — это уже совсем другая история: та, которую только предстоит написать.
Часто задаваемые вопросы
Какой движок синтеза лучше всего звучит по-русски?
Для продакшена — ElevenLabs либо российские движки (Yandex SpeechKit, Silero): у них русская просодия «родная». ChatTTS — только для экспериментов: русские сборки сообщества пока звучат сыро.
Почему Voicebox от Meta так и не вышел?
Компания сама признала риски: синтез голоса по короткой записи позволяет выдавать себя за другого человека. Модель осталась исследовательской, а русского языка в ней не было и в планах.
Сможет ли Катюша заговорить голосом?
Мы рассматриваем голос как опциональный канал, а не замену тексту. Текст остаётся основным: он даёт паузу, приватность и глубину. Если решимся на голос — расскажем, какой движок выбрали и почему.
Пока Катюша говорит текстом — и это работает: напишите ей, и она ответит
Написать Катюше →