AuK: открытое семейство речевых моделей Tencent
ComfyUI Wiki
AuK: открытое семейство речевых моделей 1.5B от Tencent Hunyuan: TTS, клонирование голоса, редактирование речи и акустики, улучшение и разделение, с официальными узлами ComfyUI.
A
AuK
AudioTTSVoice CloningSpeech EditingSource SeparationОткрытая базовая речевая модель 1.5B от Tencent Hunyuan, Шанхайского университета Цзяо Тун и Шанхайского института инноваций. Единый интерфейс инструкций на естественном языке охватывает zero-shot и instruct TTS, редактирование текста песен и содержимого, редактирование высоты тона, скорости, эмоций и тембра, улучшение речи и разделение источников. Официальные узлы и рабочий процесс ComfyUI включены.
| Разработчик | Tencent Hunyuan + Шанхайский университет Цзяо Тун |
| Дата выпуска | 2026-09-09 |
| Архитектура | 1.5B diffusion transformer + MLLM-энкодер Qwen2.5-Omni-3B |
| Лицензия | MIT |
| Выход | До 30 секунд аудио за один запуск |
Модели
| Модель | Описание | Лицензия | Дата выпуска |
|---|---|---|---|
| AuK | Базовая модель для генерации высокого качества с настраиваемыми NFE и CFG | MIT | 2026-09-09 |
| AuK-Flash | Дистиллированный вариант с фиксированным выводом за 4 шага при CFG=0 | MIT | 2026-09-09 |
Выберите модель выше, чтобы увидеть подборку загрузок весов, учебники и связанную информацию.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.