Logo

Озвучка · qwen/qwen3-tts

Qwen3-TTS — голос, клон и дизайн в одной модели

Qwen3-TTS озвучивает текст на десяти языках и объединяет три рабочих режима: готовые дикторы, клонирование тембра по короткому аудио и создание нового голоса по обычному текстовому описанию. Отдельная инструкция управляет эмоцией, темпом и манерой речи.

от 3,1 ₽ за озвучку до 2 000 знаков

Что умеет Qwen3-TTS

  • Девять готовых голосов, включая Serena, Aiden, Vivian, Eric и Sohee.
  • Клонирование голоса по чистому аудио длительностью от трёх секунд.
  • Дизайн нового голоса по описанию тембра, возраста, акцента и характера.
  • Русский и ещё девять языков с автоматическим определением.

Три режима — три разных задачи

Режим переключается прямо в форме озвучки. Остальные поля меняются автоматически, поэтому в запрос не попадут лишние параметры.

Режим Что передать Когда использовать
Готовый голос Текст, язык и один из 9 дикторов Быстрая озвучка роликов, презентаций и объявлений
Клонирование Короткое аудио; расшифровка желательна Сохранить знакомый тембр или вести серию одним голосом
Создание голоса Описание тембра, возраста, акцента и подачи Собрать уникального диктора под бренд или персонажа

Как клонировать голос

  1. Подготовьте образец

    Запишите минимум три секунды чистой речи без музыки, эха и второго голоса.

  2. Добавьте расшифровку

    Введите произнесённый текст: это необязательно, но помогает модели точнее отделить голос от содержания.

  3. Задайте новый текст

    Выберите язык результата и при необходимости добавьте инструкцию по эмоции или темпу.

Языки и управление подачей

Модель поддерживает русский, английский, китайский, японский, корейский, французский, немецкий, итальянский, испанский и португальский. Режим Auto определяет язык по тексту.

Поле «Стиль и эмоция» принимает обычную фразу: «спокойно и медленно», «дерзко», «как диктор документального фильма». Инструкция не меняет исходный текст и отправляется модели отдельным параметром.

Частые вопросы о Qwen3-TTS

Сколько аудио нужно для клонирования?

Достаточно примерно трёх секунд, но более длинный чистый фрагмент обычно лучше передаёт тембр. Избегайте фоновой музыки, шума и реверберации.

Можно ли клонировать голос на одном языке, а озвучить на другом?

Да. Qwen3-TTS поддерживает межъязыковое клонирование: тембр берётся из образца, а язык задаётся для нового текста.

Чем дизайн голоса отличается от готового диктора?

Готовый диктор выбирается из списка. В режиме дизайна модель создаёт новый голос по описанию — например, «низкий мужской голос с лёгким британским акцентом».

Какие аудиоформаты принимает creator-ai?

WAV, MP3, M4A, AAC, OGG и WEBM до 10 МБ. Для лучшего клона используйте запись без обработки и музыки.

Можно ли управлять скоростью и эмоцией?

Да. Укажите желаемую подачу обычным текстом в поле стиля: модель понимает темп, настроение, громкость и характер речи.