Озвучка · qwen/qwen3-tts
Qwen3-TTS — голос, клон и дизайн в одной модели
Qwen3-TTS озвучивает текст на десяти языках и объединяет три рабочих режима: готовые дикторы, клонирование тембра по короткому аудио и создание нового голоса по обычному текстовому описанию. Отдельная инструкция управляет эмоцией, темпом и манерой речи.
от 3,1 ₽ за озвучку до 2 000 знаков
Что умеет Qwen3-TTS
- Девять готовых голосов, включая Serena, Aiden, Vivian, Eric и Sohee.
- Клонирование голоса по чистому аудио длительностью от трёх секунд.
- Дизайн нового голоса по описанию тембра, возраста, акцента и характера.
- Русский и ещё девять языков с автоматическим определением.
Три режима — три разных задачи
Режим переключается прямо в форме озвучки. Остальные поля меняются автоматически, поэтому в запрос не попадут лишние параметры.
| Режим | Что передать | Когда использовать |
|---|---|---|
| Готовый голос | Текст, язык и один из 9 дикторов | Быстрая озвучка роликов, презентаций и объявлений |
| Клонирование | Короткое аудио; расшифровка желательна | Сохранить знакомый тембр или вести серию одним голосом |
| Создание голоса | Описание тембра, возраста, акцента и подачи | Собрать уникального диктора под бренд или персонажа |
Как клонировать голос
-
Подготовьте образец
Запишите минимум три секунды чистой речи без музыки, эха и второго голоса.
-
Добавьте расшифровку
Введите произнесённый текст: это необязательно, но помогает модели точнее отделить голос от содержания.
-
Задайте новый текст
Выберите язык результата и при необходимости добавьте инструкцию по эмоции или темпу.
Языки и управление подачей
Модель поддерживает русский, английский, китайский, японский, корейский, французский, немецкий, итальянский, испанский и португальский. Режим Auto определяет язык по тексту.
Поле «Стиль и эмоция» принимает обычную фразу: «спокойно и медленно», «дерзко», «как диктор документального фильма». Инструкция не меняет исходный текст и отправляется модели отдельным параметром.
Частые вопросы о Qwen3-TTS
Сколько аудио нужно для клонирования?
Достаточно примерно трёх секунд, но более длинный чистый фрагмент обычно лучше передаёт тембр. Избегайте фоновой музыки, шума и реверберации.
Можно ли клонировать голос на одном языке, а озвучить на другом?
Да. Qwen3-TTS поддерживает межъязыковое клонирование: тембр берётся из образца, а язык задаётся для нового текста.
Чем дизайн голоса отличается от готового диктора?
Готовый диктор выбирается из списка. В режиме дизайна модель создаёт новый голос по описанию — например, «низкий мужской голос с лёгким британским акцентом».
Какие аудиоформаты принимает creator-ai?
WAV, MP3, M4A, AAC, OGG и WEBM до 10 МБ. Для лучшего клона используйте запись без обработки и музыки.
Можно ли управлять скоростью и эмоцией?
Да. Укажите желаемую подачу обычным текстом в поле стиля: модель понимает темп, настроение, громкость и характер речи.