Tencent AuK: единая модель на 1.5B для генерации и редактирования речи
Tencent Hunyuan открывает код AuK: речевая модель 1.5B для TTS, клонирования голоса, редактирования, улучшения и разделения звука с узлами ComfyUI.
ComfyUI-AuK) и готовый к запуску рабочий процесс, а также дистиллированный вариант AuK-Flash для быстрого вывода за 4 шага. Код и веса доступны под лицензией MIT на GitHub и Hugging Face.
Обзор
AuK обучен на миллионах часов разнообразного аудио. Вместо того чтобы распределять работу с речью по отдельным инструментам (одна модель для TTS, другая для очистки, третья для разделения на дорожки), AuK помещает все задачи за один и тот же интерфейс на основе сообщений: вы передаёте инструкцию на простом языке, при необходимости прикрепляете аудиоклип, и модель делает всё остальное. Технический отчёт проекта описывает бенчмарки по генерации, редактированию, улучшению и разделению.
Результаты бенчмарков по пяти семействам задач, которые поддерживает AuK.
Доступны два варианта:
| Модель | Описание |
|---|---|
| AuK | Базовая модель для генерации высокого качества, настраиваемые NFE и CFG |
| AuK-Flash | Дистиллированная модель, фиксированный вывод за 4 шага при CFG=0 |
Поддерживаемые задачи
Все задачи используют один и тот же формат инструкций на естественном языке. Главное:
- Zero-shot TTS: произнести целевой текст голосом из референсного клипа или описать голос вообще без референсного аудио (инструкционный TTS)
- Редактирование содержимого: переписать сказанное, заменить, вставить или удалить слова; даже переписать текст песни в вокальной записи, сохранив мелодию и голос
- Акустическое редактирование: изменить высоту тона в полутонах, темп речи и громкость
- Паралингвистическое редактирование: изменить эмоцию или тембр, убрать акцент, добавить или удалить вдохи и смех, преобразовать между обычной речью и шёпотом
- Улучшение и разделение: удалить шум и реверберацию, оставить одного говорящего из микса, извлечь вокал из музыки или изолировать нужного говорящего по тому, что он произносит
Архитектура AuK. Диффузионный трансформер и веса layer-fusion входят в checkpoint; кодировщик MLLM (Qwen2.5-Omni-3B) и VAE загружаются отдельными файлами.
Поддержка ComfyUI
Официальный репозиторий включает интеграцию с ComfyUI с двумя основными узлами: AuK Model Loader и AuK Generate / Edit, которые охватывают генерацию, редактирование, улучшение и разделение. Дополнительный Prompt Enhancer превращает произвольные запросы в готовые к запуску инструкции с помощью OpenAI-совместимой LLM.
Установка описана в руководстве по ComfyUI в репозитории:
- Установите дополнение
comfyuiв Python-окружении, в котором работает ComfyUI:pip install -e ".[comfyui]" - Свяжите
comfyui/ComfyUI-AuKсComfyUI/custom_nodes - Скачайте веса:
AuK(илиAuK-Flash) плюс кодировщикQwen2.5-Omni-3B - Откройте входящий в комплект рабочий процесс
auk.jsonи укажите пути в AuK Model Loader
Что важно знать перед запуском:
- Ограничение в 30 секунд: исходное/референсное аудио вместе со сгенерированной целью должны укладываться в 30 секунд; узел не разделяет длинное аудио автоматически
- Настройки Flash: для AuK-Flash задайте в загрузчике
nfe_steps=4,cfg_strength=0иsway_sampling_coef=-1 - Память: модели постоянно находятся на выбранном устройстве; автоматическое освобождение VRAM в ComfyUI для этих узлов не поддерживается
- Учётные данные PE: Prompt Enhancer читает OpenAI-совместимый файл
.env, который нужно загрузить до запуска ComfyUI
Доступность
Веса AuK и AuK-Flash доступны на Hugging Face и ModelScope под лицензией MIT, а код на Tencent-Hunyuan/AuK. Интерактивные демо работают в Hugging Face Space и ModelScope Space. SGLang-Omni объявил о поддержке serving для обоих вариантов с первого дня.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.