IskraGen

ElevenLabs: озвучка на русском, тарифы и доступ из России

Модели и цены26 августа 20268 мин чтения
Строки текста слева перетекают в плавную фиолетовую волну голоса справа
Сгенерировано в IskraGen · gpt-image-2-text-to-image
Промпт

Wide editorial hero image, 16:9. Scene: deep near-black space with a soft violet gradient glow at the horizon. Subject: a stack of thin horizontal glowing lines on the left, evoking lines of a written page, that bend and merge into one smooth continuous violet voice waveform travelling to the right. Details: photoreal 3D render, matte black surfaces, thin luminous violet strokes, gentle volumetric haze, soft rim light. Composition: left-to-right transformation, eye-level, wide framing, generous negative space, high contrast, quiet studio mood. Constraints: absolutely NO text, NO letters, NO logos, NO numbers, NO watermark, no brand marks, no people, no human figures, no faces. Palette: deep near-black background #0A0A0F with violet #7C3AFF accents, no other brand colors. Use: blog article cover about an AI text-to-speech service.

Главное:

  • Один кредит ElevenLabs примерно равен одному символу текста — так считается расход.
  • Бесплатный план даёт 10 000 кредитов, но без коммерческой лицензии и клонирования голоса.
  • Русская речь звучит естественно, ошибки собираются на омографах, именах и аббревиатурах.
  • Сервис официально ограничивает доступ из России, посредники добавляют 350–1050 ₽ комиссии.
  • В IskraGen голоса ElevenLabs стоят от 8 ₽ за генерацию с оплатой в рублях.

ElevenLabs — самый популярный синтез речи на рынке, и в русскоязычных обзорах его чаще всего называют самым естественным вариантом для нашего языка. Вопросов при этом обычно три: какую модель брать, сколько это стоит и что делать с оплатой из России. Ниже — ответы по каждому, плюс практическая часть про подготовку текста, из-за которой одна и та же нейросеть у одних звучит живым диктором, а у других роботом.

Как ElevenLabs превращает текст в речь

Синтез идёт в три шага: разбор текста, планирование интонации и генерация звука. Сначала модель разбирает написанное — слова, пунктуацию, контекст, ударения. Затем планирует просодию: где сделать паузу, где повысить тон, как быстро говорить, сколько тянуть гласную. И только потом синтезирует сам сигнал.

Из этого вытекает главное практическое следствие: пунктуация влияет на звучание сильнее, чем ползунки настроек. Точка, запятая, многоточие и абзац — это инструкции про ритм, а не украшение текста. Абзац без единого знака препинания модель прочтёт на одном дыхании, и никакие параметры «эмоциональности» этого не исправят.

Второе следствие — про голос. Тембр задаётся выбранным голосом из библиотеки, а характер речи — текстом и настройками стабильности. Один и тот же голос на сухом техническом абзаце и на рекламном слогане звучит по-разному, потому что модель подстраивает подачу под содержание.

Выбор голоса решает больше, чем кажется. В библиотеке сервиса голоса различаются не только по полу и возрасту, но и по тому, как они справляются с неродным для себя языком: часть тембров даёт на русском лёгкий акцент, который слышно на длинных фразах и почти незаметен на коротких. Поэтому голос подбирают не по названию, а по тестовому фрагменту из вашего же текста — с вашими терминами, именами и типичной длиной предложений.

ElevenLabs работает и как сервис с веб-интерфейсом, и как API. Второй вариант нужен, когда озвучка встроена в процесс: рассылка, приложение, генерация роликов пачками. В IskraGen обе модели доступны как обычные модели каталога — с оплатой за генерацию и без отдельной подписки.

Модели ElevenLabs: Multilingual v2 и Turbo, что выбрать

Выбор сводится к паре «качество против скорости», и обе стороны представлены в каталоге. Multilingual v2 — модель для длинной выразительной озвучки: она точнее расставляет паузы и акценты. Turbo v2.5 быстрее и дешевле, подачу даёт суше и берётся под массовые задачи, где важнее пропускная способность.

Разница слышна не везде. На рекламе, художественном тексте и эмоциональных фрагментах Multilingual v2 заметно выигрывает: там, где нужна интонационная игра, более простая модель звучит ровно и безучастно. На нейтральном дикторском чтении — новости, инструкция, описание товара — разница между ними минимальна, и переплачивать смысла нет.

Технические рамки тоже стоит знать. Multilingual v2 принимает до 10 000 символов за запрос и не относится к моделям с низкой задержкой: она думает дольше. Turbo v2.5 отвечает быстрее, но в 2026 году ElevenLabs постепенно вытесняет её моделью Flash v2.5, поэтому для новых проектов её выбирают всё реже.

В каталоге IskraGen это выглядит так:

  • elevenlabs/text-to-speech-multilingual-v2 — от 12 ₽ за генерацию. Берите для роликов, аудиокниг, курсов и всего, где голос слушают дольше минуты.
  • elevenlabs/text-to-speech-turbo-2-5 — от 8 ₽ за генерацию. Берите для черновиков, коротких уведомлений и массовой озвучки однотипных фраз.

Рабочая тактика — черновик на быстрой модели, финал на выразительной. Текст почти всегда правится после первого прослушивания: где-то не там пауза, где-то неверное ударение, где-то фраза длиннее, чем нужно. Гонять эти итерации дешевле на Turbo, а финальную версию собирать на Multilingual v2.

Тарифы ElevenLabs: кредиты, лимиты и коммерческая лицензия

Расход считается в кредитах, и в большинстве планов один кредит примерно равен одному символу текста. Это удобная единица: страница текста — около 2 000 символов, значит, примерно 2 000 кредитов.

По планам картина такая. Бесплатный даёт 10 000 кредитов — порядка десяти минут речи, без коммерческой лицензии и без клонирования голоса. Starter добавляет коммерческую лицензию, мгновенное клонирование и 30 000 кредитов. Creator — около 100 000 кредитов. Дальше идут Pro и планы для команд, где счёт идёт на сотни тысяч и миллионы кредитов. Годовая оплата фактически считается как десять месяцев вместо двенадцати — примерно 17 % скидки.

Посчитать свою задачу несложно. Сценарий ролика на три минуты — это примерно 2 500 символов, то есть около 2 500 кредитов. Бесплатного плана хватит на четыре таких ролика в месяц, но без права использовать их в работе. Младший платный план — это уже примерно десяток роликов, а с учётом перегенераций проблемных мест реально меньше: каждая повторная попытка списывает кредиты заново, даже если вы переозвучиваете один абзац.

Важная деталь для тех, кто озвучивает эпизодически: кредиты привязаны к месяцу. Не израсходовали — сгорели. Ролик раз в две недели и подкаст раз в месяц почти никогда не выбирают даже младший платный план целиком, а платить за него всё равно приходится.

Именно поэтому оплата за генерацию для нерегулярных задач выгоднее подписки. В IskraGen озвучка стоит от 8 ₽ за генерацию, деньги списываются с рублёвого баланса, и неиспользованный остаток никуда не исчезает в конце месяца. Разница особенно заметна, когда озвучка — не основная работа, а одна из задач в потоке: сегодня голос для ролика, завтра картинка для обложки, послезавтра видео.

Как считаются кредиты ElevenLabs и что дают тарифы
Как считаются кредиты ElevenLabs и что дают тарифы

Страница текста — примерно 2 000 кредитов

Русский язык: где ElevenLabs спотыкается и как готовить текст

Русская речь у сервиса звучит естественно, но ошибки собираются в предсказуемых местах: омографы, редкие имена, числительные и аббревиатуры. «Замок» и «замок», «Орган» и «орган», фамилия с нестандартным ударением, «ГОСТ» и «ГИБДД», дата в цифрах — вот типичный список того, что придётся править руками.

Приёмы простые и работают на любом синтезе, не только на этом:

  • Ударение помечайте заглавной буквой в ударной гласной или апострофом: «лаборатОрия» или «лаборато'рия».
  • Английские сокращения пишите транслитерацией: вместо «VPN» — «вэ-пэ-эн», вместо «YouTube» — «Ютуб».
  • Числа и даты пишите прописью, если важно, как именно они прозвучат.
  • Паузы ставьте многоточием или коротким тире, а восклицательные знаки не жалейте там, где нужна живая подача.
  • Убирайте из текста разметку, скобки и эмодзи — они читаются буквально или ломают интонацию.

Отдельная типичная ошибка новичка — озвучивать большой текст целиком. Материал лучше подавать кусками по два-три абзаца: так проще править проблемные места и не переплачивать за перегенерацию всей главы из-за одного слова. Если голос звучит монотонно, замедлите темп в настройках и разбейте длинные предложения запятыми — микропаузы дают речи дыхание.

Помогает и переписывание текста под речь. Канцелярская фраза «в целях повышения эффективности взаимодействия с клиентами» звучит тяжело любым голосом; «чтобы удобнее работать с клиентами» — нормально. Синтез не сокращает и не упрощает за вас: он честно произносит то, что написано, включая причастные обороты в три строки. Текст для озвучки пишут так, как говорят вслух, и это даёт больший прирост качества, чем смена модели.

Проверять сложные слова стоит до основной генерации. Короткий тестовый фрагмент с фамилиями, терминами и числами занимает секунды и экономит куда больше, чем стоит сам тест. Подробнее весь цикл подготовки текста разобран в статье как создать голос нейросетью.

Отдельная категория проблем — иностранные слова внутри русского текста. Названия сервисов, термины и модели читаются то по английским правилам, то по русским, и предсказать это заранее нельзя. Если слово встречается в тексте часто, проще один раз записать его транслитом и не возвращаться к вопросу: «Ай-скра-ген», «Юникод», «пи-ди-эф». То же касается адресов сайтов и почты — вслух они звучат прилично только в развёрнутом виде.

Список типичных ошибок синтеза речи на русском и способы их исправить
Список типичных ошибок синтеза речи на русском и способы их исправить

Правки в тексте дают больше, чем смена модели

Клонирование голоса и доступ из России

Клонирование доступно с платных планов и требует согласия владельца голоса — это правило сервиса, а не пожелание. Мгновенное клонирование по короткому образцу открывается на Starter, профессиональное — на планах выше, и для него нужна чистая запись достаточной длины.

Сценариев, где клон действительно нужен, немного: свой голос для регулярных роликов, чтобы не перезаписывать одно и то же; сохранённый тембр диктора для длинного курса; локализация, где важно узнаваемое звучание. Во всех остальных случаях библиотечный голос закрывает задачу быстрее и без юридических вопросов.

Юридическая часть строже технической. Чужой голос без явного согласия использовать нельзя, а подтверждение согласия стоит хранить — письменно или аудиозаписью. В России отдельного закона о голосовых дипфейках пока нет, голос защищают нормы о нематериальных благах и о персональных данных, но это не делает чужой тембр свободным ресурсом. Плюс техническое ограничение: голосовые клоны живут внутри сервиса и не переносятся в другой — уйти к другому провайдеру вместе с голосом не получится.

С доступом из России ситуация отдельная. Сервис официально ограничивает доступ, поэтому даже успешная оплата не гарантирует стабильную работу. Прямая подписка требует зарубежной карты, а посредники добавляют к платежу 350–1050 ₽ комиссии в зависимости от суммы — и эта комиссия платится каждый месяц, а не один раз.

Практичная альтернатива — брать те же модели через российский сервис. В IskraGen elevenlabs/text-to-speech-multilingual-v2 стоит от 12 ₽ за генерацию, elevenlabs/text-to-speech-turbo-2-5 — от 8 ₽, оплата идёт рублями через СБП, зарубежная карта и посредники не нужны. Голос получается тот же самый; отличается только способ оплаты и отсутствие ежемесячного платежа.

Порядок действий при этом привычный: выбираете модель, вставляете подготовленный текст, слушаете, правите проблемные места и перегенерируете только их. Файл скачивается сразу и дальше идёт в монтаж, в подкаст или в рассылку. Если озвучка нужна для видео, удобно держать оба шага на одном балансе — подборка нейросетей для видео показывает, во что обходится вторая половина задачи.

Итог по ElevenLabs. Это по-прежнему эталон естественности для русской речи, и большинство претензий к качеству на деле снимается подготовкой текста, а не сменой сервиса. Подписка оправдана при регулярной озвучке; для эпизодических задач дешевле платить за генерацию и не думать про курс, комиссию посредника и сгорающие кредиты.

Частые вопросы

Попробовать elevenlabs/text-to-speech-multilingual-v2 в IskraGen

Генерация без VPN, оплата в рублях через СБП. Первые генерации — за минуту.

Похожие статьи