Tencent AuK: un modelo de 1.5B para generación y edición de voz

ComfyUI Wikinews

Tencent Hunyuan libera AuK, un modelo de voz de 1.5B: TTS, clonación de voz, edición de letras, mejora y separación, con nodos oficiales de ComfyUI.

Tencent Hunyuan, junto con la Shanghai Jiao Tong University y el Shanghai Innovation Institute, ha publicado como código abierto AuK, un modelo fundacional de 1.5B para la generación y edición de voz. Una única interfaz de instrucciones en lenguaje natural cubre TTS zero-shot y basado en instrucciones, edición de contenido y acústica, edición paralingüística, mejora de voz y separación de fuentes. El lanzamiento incluye nodos oficiales de ComfyUI (ComfyUI-AuK) y un flujo de trabajo listo para ejecutar, además de una variante destilada AuK-Flash para inferencia rápida en 4 pasos. El código y los pesos están disponibles bajo licencia MIT en GitHub y Hugging Face.

Descripción general

AuK está entrenado con millones de horas de audio diverso. En lugar de repartir el trabajo de voz entre herramientas separadas (un modelo para TTS, otro para limpieza y un tercero para separación de pistas), AuK coloca todas las tareas detrás de la misma interfaz basada en mensajes: se pasa una instrucción en lenguaje natural, opcionalmente se adjunta un clip de audio y el modelo hace el resto. El informe técnico del proyecto describe los benchmarks de generación, edición, mejora y separación.

Rendimiento de AuK en los benchmarks de generación, edición, mejora y separación de voz

Resultados de benchmark en las cinco familias de tareas que soporta AuK.

Hay dos variantes disponibles:

ModeloDescripción
AuKModelo base para generación de alta calidad, con NFE y CFG configurables
AuK-FlashModelo destilado, inferencia fija de 4 pasos con CFG=0

Tareas compatibles

Todas las tareas comparten el mismo formato de instrucción en lenguaje natural. Aspectos destacados:

  • TTS zero-shot: pronunciar el texto objetivo con la voz de un clip de referencia, o describir una voz sin audio de referencia alguno (TTS por instrucción)
  • Edición de contenido: reescribir lo que se dice, reemplazar, insertar o eliminar palabras; incluso reescribir la letra de una grabación cantada manteniendo la melodía y la voz
  • Edición acústica: ajustar el tono por semitonos, la velocidad de habla y el volumen
  • Edición paralingüística: cambiar la emoción o el timbre, eliminar un acento, añadir o quitar respiraciones y risas, convertir entre habla normal y susurro
  • Mejora y separación: eliminar ruido y reverberación, conservar a un hablante de una mezcla, extraer la voz de la música o aislar a un hablante objetivo por lo que dice
Arquitectura del modelo AuK

Arquitectura de AuK. El transformer de difusión y los pesos de fusión de capas vienen en el checkpoint; el codificador MLLM (Qwen2.5-Omni-3B) y el VAE se cargan como archivos separados.

Soporte de ComfyUI

El repositorio oficial incluye una integración con ComfyUI con dos nodos principales, AuK Model Loader y AuK Generate / Edit, que cubren generación, edición, mejora y separación. Un Prompt Enhancer opcional convierte solicitudes de formato libre en instrucciones listas para ejecutar usando un LLM compatible con OpenAI.

La configuración sigue la guía de ComfyUI del repositorio:

  1. Instalar el extra comfyui en el entorno de Python que ejecuta ComfyUI: pip install -e ".[comfyui]"
  2. Enlazar comfyui/ComfyUI-AuK dentro de ComfyUI/custom_nodes
  3. Descargar los pesos: AuK (o AuK-Flash) más el codificador Qwen2.5-Omni-3B
  4. Abrir el flujo de trabajo incluido auk.json y establecer las rutas en AuK Model Loader

Aspectos a tener en cuenta antes de ejecutar:

  • Límite de 30 segundos: el audio fuente/de referencia más el objetivo generado deben caber en 30 segundos; el nodo no divide audio largo automáticamente
  • Configuraciones de Flash: para AuK-Flash establecer nfe_steps=4, cfg_strength=0 y sway_sampling_coef=-1 en el loader
  • Memoria: los modelos permanecen residentes en el dispositivo seleccionado; la descarga automática de VRAM de ComfyUI no es compatible con estos nodos
  • Credenciales de PE: el Prompt Enhancer lee un archivo .env compatible con OpenAI que debe cargarse antes de iniciar ComfyUI

Disponibilidad

Los pesos de AuK y AuK-Flash están en Hugging Face y ModelScope bajo licencia MIT, con el código en Tencent-Hunyuan/AuK. Las demos interactivas se ejecutan en el Hugging Face Space y el ModelScope Space. SGLang-Omni anunció soporte de servicio day-0 para ambas variantes.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Tencent AuK: un modelo de 1.5B para generación y edición de voz | ComfyUI Wiki