AuK-Flash: Tencentによる4ステップ蒸留音声モデル

ComfyUI Wiki

AuK-FlashはTencentのAuK音声モデルの蒸留版です。CFG=0による固定4ステップ推論で動作し、ComfyUIでの高速な生成と編集を実現します。

A

AuK-Flash

TTS蒸留高速推論音声編集

TencentのAuK音声モデルの蒸留版。CFG=0による固定4ステップ推論を使用し、生成と編集を高速化しながら、TTS、音声クローニング、音声編集、強調、分離という全タスクをカバーします。

開発元Tencent Hunyuan + 上海交通大学
リリース日2026-09-09
アーキテクチャ1.5B diffusion transformer、蒸留版(NFE=4)
ライセンスMIT
パラメータ数1.5B
推論固定4ステップ、CFG=0

機能

AuK-Flashは、AuK ベースモデルと同じタスク範囲と指示インターフェースを備えています。ゼロショットTTSと指示ベースTTS、コンテンツ・音響・パラ言語的な編集、音声強調、音源分離に対応します。トレードオフとして、最高品質よりも速度が優先されます。

ComfyUIでの使用方法

AuK Model Loader で auk_flash.safetensors を読み込み、以下を設定します。

  • nfe_steps=4
  • cfg_strength=0
  • sway_sampling_coef=-1

同じ Qwen2.5-Omni-3B エンコーダー、およびソースとターゲットを合わせて30秒という制限が適用されます。詳細は公式の ComfyUIガイド を参照してください。

関連

Guides and workflows related to this model series.

No articles found.

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…