AuK-Flash: дистиллированная речевая модель Tencent с 4-шаговым выводом

ComfyUI Wiki

AuK-Flash представляет собой дистиллированный вариант речевой модели AuK от Tencent: фиксированный вывод за 4 шага при CFG=0 для быстрой генерации и редактирования речи в ComfyUI.

A

AuK-Flash

TTSДистилляцияБыстрый выводРедактирование речи

Дистиллированный вариант речевой модели AuK от Tencent. Использует фиксированный вывод за 4 шага при CFG=0 для более быстрой генерации и редактирования с полным набором задач: TTS, клонирование голоса, редактирование речи, улучшение и разделение источников.

РазработчикTencent Hunyuan + Шанхайский университет Цзяо Тун
Дата выпуска2026-09-09
АрхитектураДиффузионный трансформер 1.5B, дистиллированный (NFE=4)
ЛицензияMIT
Параметры1.5B
Вывод4 фиксированных шага, CFG=0

Возможности

AuK-Flash охватывает те же задачи и использует тот же интерфейс инструкций, что и базовая модель AuK: zero-shot и instruct TTS, редактирование содержимого, акустических характеристик и паралингвистических особенностей, улучшение речи и разделение источников. Компромисс здесь: скорость вместо максимального качества.

Использование в ComfyUI

Загрузите auk_flash.safetensors в AuK Model Loader и задайте:

  • nfe_steps=4
  • cfg_strength=0
  • sway_sampling_coef=-1

Действуют те же ограничения: энкодер Qwen2.5-Omni-3B и лимит в 30 секунд на источник плюс цель. Подробности смотрите в официальном руководстве по ComfyUI.

См. также

Guides and workflows related to this model series.

No articles found.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…