AuK-Flash: дистиллированная речевая модель Tencent с 4-шаговым выводом
AuK-Flash представляет собой дистиллированный вариант речевой модели AuK от Tencent: фиксированный вывод за 4 шага при CFG=0 для быстрой генерации и редактирования речи в ComfyUI.
AuK-Flash
TTSДистилляцияБыстрый выводРедактирование речиДистиллированный вариант речевой модели AuK от Tencent. Использует фиксированный вывод за 4 шага при CFG=0 для более быстрой генерации и редактирования с полным набором задач: TTS, клонирование голоса, редактирование речи, улучшение и разделение источников.
| Разработчик | Tencent Hunyuan + Шанхайский университет Цзяо Тун |
| Дата выпуска | 2026-09-09 |
| Архитектура | Диффузионный трансформер 1.5B, дистиллированный (NFE=4) |
| Лицензия | MIT |
| Параметры | 1.5B |
| Вывод | 4 фиксированных шага, CFG=0 |
Возможности
AuK-Flash охватывает те же задачи и использует тот же интерфейс инструкций, что и базовая модель AuK: zero-shot и instruct TTS, редактирование содержимого, акустических характеристик и паралингвистических особенностей, улучшение речи и разделение источников. Компромисс здесь: скорость вместо максимального качества.
Использование в ComfyUI
Загрузите auk_flash.safetensors в AuK Model Loader и задайте:
nfe_steps=4cfg_strength=0sway_sampling_coef=-1
Действуют те же ограничения: энкодер Qwen2.5-Omni-3B и лимит в 30 секунд на источник плюс цель. Подробности смотрите в официальном руководстве по ComfyUI.
См. также
Guides and workflows related to this model series.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.