AuK-Flash: Tencentによる4ステップ蒸留音声モデル
ComfyUI Wiki
AuK-FlashはTencentのAuK音声モデルの蒸留版です。CFG=0による固定4ステップ推論で動作し、ComfyUIでの高速な生成と編集を実現します。
A
AuK-Flash
TTS蒸留高速推論音声編集TencentのAuK音声モデルの蒸留版。CFG=0による固定4ステップ推論を使用し、生成と編集を高速化しながら、TTS、音声クローニング、音声編集、強調、分離という全タスクをカバーします。
| 開発元 | Tencent Hunyuan + 上海交通大学 |
| リリース日 | 2026-09-09 |
| アーキテクチャ | 1.5B diffusion transformer、蒸留版(NFE=4) |
| ライセンス | MIT |
| パラメータ数 | 1.5B |
| 推論 | 固定4ステップ、CFG=0 |
機能
AuK-Flashは、AuK ベースモデルと同じタスク範囲と指示インターフェースを備えています。ゼロショットTTSと指示ベースTTS、コンテンツ・音響・パラ言語的な編集、音声強調、音源分離に対応します。トレードオフとして、最高品質よりも速度が優先されます。
ComfyUIでの使用方法
AuK Model Loader で auk_flash.safetensors を読み込み、以下を設定します。
nfe_steps=4cfg_strength=0sway_sampling_coef=-1
同じ Qwen2.5-Omni-3B エンコーダー、およびソースとターゲットを合わせて30秒という制限が適用されます。詳細は公式の ComfyUIガイド を参照してください。
関連
Guides and workflows related to this model series.
No articles found.
コメント
GitHubでサインインしてディスカッションに参加しましょう。