AuK: открытое семейство речевых моделей Tencent

ComfyUI Wiki

AuK: открытое семейство речевых моделей 1.5B от Tencent Hunyuan: TTS, клонирование голоса, редактирование речи и акустики, улучшение и разделение, с официальными узлами ComfyUI.

A

AuK

AudioTTSVoice CloningSpeech EditingSource Separation

Открытая базовая речевая модель 1.5B от Tencent Hunyuan, Шанхайского университета Цзяо Тун и Шанхайского института инноваций. Единый интерфейс инструкций на естественном языке охватывает zero-shot и instruct TTS, редактирование текста песен и содержимого, редактирование высоты тона, скорости, эмоций и тембра, улучшение речи и разделение источников. Официальные узлы и рабочий процесс ComfyUI включены.

РазработчикTencent Hunyuan + Шанхайский университет Цзяо Тун
Дата выпуска2026-09-09
Архитектура1.5B diffusion transformer + MLLM-энкодер Qwen2.5-Omni-3B
ЛицензияMIT
ВыходДо 30 секунд аудио за один запуск

Модели

МодельОписаниеЛицензияДата выпуска
AuKБазовая модель для генерации высокого качества с настраиваемыми NFE и CFGMIT2026-09-09
AuK-FlashДистиллированный вариант с фиксированным выводом за 4 шага при CFG=0MIT2026-09-09

Выберите модель выше, чтобы увидеть подборку загрузок весов, учебники и связанную информацию.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…