Tencent AuK: единая модель на 1.5B для генерации и редактирования речи

ComfyUI Wikinews

Tencent Hunyuan открывает код AuK: речевая модель 1.5B для TTS, клонирования голоса, редактирования, улучшения и разделения звука с узлами ComfyUI.

Tencent Hunyuan совместно с Шанхайским университетом Цзяо Тун и Шанхайским институтом инноваций открыл исходный код AuK: фундаментальной модели на 1.5B для генерации и редактирования речи. Единый интерфейс инструкций на естественном языке охватывает zero-shot и инструкционный TTS, редактирование содержимого и акустики, паралингвистическое редактирование, улучшение речи и разделение источников. Релиз включает официальные узлы ComfyUI (ComfyUI-AuK) и готовый к запуску рабочий процесс, а также дистиллированный вариант AuK-Flash для быстрого вывода за 4 шага. Код и веса доступны под лицензией MIT на GitHub и Hugging Face.

Обзор

AuK обучен на миллионах часов разнообразного аудио. Вместо того чтобы распределять работу с речью по отдельным инструментам (одна модель для TTS, другая для очистки, третья для разделения на дорожки), AuK помещает все задачи за один и тот же интерфейс на основе сообщений: вы передаёте инструкцию на простом языке, при необходимости прикрепляете аудиоклип, и модель делает всё остальное. Технический отчёт проекта описывает бенчмарки по генерации, редактированию, улучшению и разделению.

Производительность AuK в бенчмарках генерации, редактирования, улучшения и разделения речи

Результаты бенчмарков по пяти семействам задач, которые поддерживает AuK.

Доступны два варианта:

МодельОписание
AuKБазовая модель для генерации высокого качества, настраиваемые NFE и CFG
AuK-FlashДистиллированная модель, фиксированный вывод за 4 шага при CFG=0

Поддерживаемые задачи

Все задачи используют один и тот же формат инструкций на естественном языке. Главное:

  • Zero-shot TTS: произнести целевой текст голосом из референсного клипа или описать голос вообще без референсного аудио (инструкционный TTS)
  • Редактирование содержимого: переписать сказанное, заменить, вставить или удалить слова; даже переписать текст песни в вокальной записи, сохранив мелодию и голос
  • Акустическое редактирование: изменить высоту тона в полутонах, темп речи и громкость
  • Паралингвистическое редактирование: изменить эмоцию или тембр, убрать акцент, добавить или удалить вдохи и смех, преобразовать между обычной речью и шёпотом
  • Улучшение и разделение: удалить шум и реверберацию, оставить одного говорящего из микса, извлечь вокал из музыки или изолировать нужного говорящего по тому, что он произносит
Архитектура модели AuK

Архитектура AuK. Диффузионный трансформер и веса layer-fusion входят в checkpoint; кодировщик MLLM (Qwen2.5-Omni-3B) и VAE загружаются отдельными файлами.

Поддержка ComfyUI

Официальный репозиторий включает интеграцию с ComfyUI с двумя основными узлами: AuK Model Loader и AuK Generate / Edit, которые охватывают генерацию, редактирование, улучшение и разделение. Дополнительный Prompt Enhancer превращает произвольные запросы в готовые к запуску инструкции с помощью OpenAI-совместимой LLM.

Установка описана в руководстве по ComfyUI в репозитории:

  1. Установите дополнение comfyui в Python-окружении, в котором работает ComfyUI: pip install -e ".[comfyui]"
  2. Свяжите comfyui/ComfyUI-AuK с ComfyUI/custom_nodes
  3. Скачайте веса: AuK (или AuK-Flash) плюс кодировщик Qwen2.5-Omni-3B
  4. Откройте входящий в комплект рабочий процесс auk.json и укажите пути в AuK Model Loader

Что важно знать перед запуском:

  • Ограничение в 30 секунд: исходное/референсное аудио вместе со сгенерированной целью должны укладываться в 30 секунд; узел не разделяет длинное аудио автоматически
  • Настройки Flash: для AuK-Flash задайте в загрузчике nfe_steps=4, cfg_strength=0 и sway_sampling_coef=-1
  • Память: модели постоянно находятся на выбранном устройстве; автоматическое освобождение VRAM в ComfyUI для этих узлов не поддерживается
  • Учётные данные PE: Prompt Enhancer читает OpenAI-совместимый файл .env, который нужно загрузить до запуска ComfyUI

Доступность

Веса AuK и AuK-Flash доступны на Hugging Face и ModelScope под лицензией MIT, а код на Tencent-Hunyuan/AuK. Интерактивные демо работают в Hugging Face Space и ModelScope Space. SGLang-Omni объявил о поддержке serving для обоих вариантов с первого дня.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Tencent AuK: единая модель на 1.5B для генерации и редактирования речи | ComfyUI Wiki