Tencent AuK: un modelo de 1.5B para generación y edición de voz
Tencent Hunyuan libera AuK, un modelo de voz de 1.5B: TTS, clonación de voz, edición de letras, mejora y separación, con nodos oficiales de ComfyUI.
ComfyUI-AuK) y un flujo de trabajo listo para ejecutar, además de una variante destilada AuK-Flash para inferencia rápida en 4 pasos. El código y los pesos están disponibles bajo licencia MIT en GitHub y Hugging Face.
Descripción general
AuK está entrenado con millones de horas de audio diverso. En lugar de repartir el trabajo de voz entre herramientas separadas (un modelo para TTS, otro para limpieza y un tercero para separación de pistas), AuK coloca todas las tareas detrás de la misma interfaz basada en mensajes: se pasa una instrucción en lenguaje natural, opcionalmente se adjunta un clip de audio y el modelo hace el resto. El informe técnico del proyecto describe los benchmarks de generación, edición, mejora y separación.
Resultados de benchmark en las cinco familias de tareas que soporta AuK.
Hay dos variantes disponibles:
| Modelo | Descripción |
|---|---|
| AuK | Modelo base para generación de alta calidad, con NFE y CFG configurables |
| AuK-Flash | Modelo destilado, inferencia fija de 4 pasos con CFG=0 |
Tareas compatibles
Todas las tareas comparten el mismo formato de instrucción en lenguaje natural. Aspectos destacados:
- TTS zero-shot: pronunciar el texto objetivo con la voz de un clip de referencia, o describir una voz sin audio de referencia alguno (TTS por instrucción)
- Edición de contenido: reescribir lo que se dice, reemplazar, insertar o eliminar palabras; incluso reescribir la letra de una grabación cantada manteniendo la melodía y la voz
- Edición acústica: ajustar el tono por semitonos, la velocidad de habla y el volumen
- Edición paralingüística: cambiar la emoción o el timbre, eliminar un acento, añadir o quitar respiraciones y risas, convertir entre habla normal y susurro
- Mejora y separación: eliminar ruido y reverberación, conservar a un hablante de una mezcla, extraer la voz de la música o aislar a un hablante objetivo por lo que dice
Arquitectura de AuK. El transformer de difusión y los pesos de fusión de capas vienen en el checkpoint; el codificador MLLM (Qwen2.5-Omni-3B) y el VAE se cargan como archivos separados.
Soporte de ComfyUI
El repositorio oficial incluye una integración con ComfyUI con dos nodos principales, AuK Model Loader y AuK Generate / Edit, que cubren generación, edición, mejora y separación. Un Prompt Enhancer opcional convierte solicitudes de formato libre en instrucciones listas para ejecutar usando un LLM compatible con OpenAI.
La configuración sigue la guía de ComfyUI del repositorio:
- Instalar el extra
comfyuien el entorno de Python que ejecuta ComfyUI:pip install -e ".[comfyui]" - Enlazar
comfyui/ComfyUI-AuKdentro deComfyUI/custom_nodes - Descargar los pesos:
AuK(oAuK-Flash) más el codificadorQwen2.5-Omni-3B - Abrir el flujo de trabajo incluido
auk.jsony establecer las rutas en AuK Model Loader
Aspectos a tener en cuenta antes de ejecutar:
- Límite de 30 segundos: el audio fuente/de referencia más el objetivo generado deben caber en 30 segundos; el nodo no divide audio largo automáticamente
- Configuraciones de Flash: para AuK-Flash establecer
nfe_steps=4,cfg_strength=0ysway_sampling_coef=-1en el loader - Memoria: los modelos permanecen residentes en el dispositivo seleccionado; la descarga automática de VRAM de ComfyUI no es compatible con estos nodos
- Credenciales de PE: el Prompt Enhancer lee un archivo
.envcompatible con OpenAI que debe cargarse antes de iniciar ComfyUI
Disponibilidad
Los pesos de AuK y AuK-Flash están en Hugging Face y ModelScope bajo licencia MIT, con el código en Tencent-Hunyuan/AuK. Las demos interactivas se ejecutan en el Hugging Face Space y el ModelScope Space. SGLang-Omni anunció soporte de servicio day-0 para ambas variantes.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.