AKUSPACE: LoRA de Espacio Acústico para Audio LTX-2.5
KoshiMazaki lanza AKUSPACE v0.5, un LoRA de audio espacial para LTX-2.5 que sitúa voces y música generadas en habitaciones, clubes, catedrales o exteriores, con nodos de ComfyUI incluidos.
KoshiMazaki lanzó AKUSPACE v0.5, un LoRA de audio consciente del espacio para LTX-2.5 que otorga al audio generado o de referencia el carácter acústico de un espacio físico: una habitación pequeña, un club vacío, una catedral o un entorno exterior. El LoRA, el sitio de demostración y un paquete de nodos de ComfyUI complementario están disponibles: Hugging Face | demo interactiva | ComfyUI-Koshi-Nodes.
La superficie de control de AKUSPACE: fuente, oyente y el espacio acústico seleccionado, con el tiempo de decaimiento entrenado mostrado debajo.
Qué hace
AKUSPACE está entrenado como un adaptador de audio a audio: transforma el audio que recibe, dando forma a voces, ritmos e instrumentos con reverberación de sala, ambiente exterior y efectos de sonido espacial. La superficie de control es impulsada por prompts, con la palabra clave AKUSPACE y una palabra de nivel entre el espacio y su carácter:
AKUSPACE female spoken voice through synthetic cathedral reverb, moderate wide diffuse reflections and a long decaying tail, no background ambience| Modo | Opciones | Niveles |
|---|---|---|
| Espacio: habitaciones donde reside un sonido | habitación pequeña, habitación mediana, club vacío, catedral | suave / moderado / intenso |
| Lugar: entornos donde reside un sonido | día exterior, noche exterior | suave / intenso |
| Efectos de sonido: procesamiento por el que pasa un sonido | doble retardo | suave / intenso |
Los 'lugares' exteriores solo escalan hacia abajo, no hacia arriba: una cama de ambiente es una grabación separada en lugar de una cola de reverberación. Las descripciones de las salas llevan un tiempo de decaimiento; la catedral, el efecto granular y ambos lugares exteriores no tienen decaimiento numérico.
Flujos de trabajo compatibles
| Entrada | Salida |
|---|---|
| Audio | Tratamiento de audio a audio para una grabación existente |
| Texto + audio | Vídeo de texto a audio con audio sincronizado tratado con AKUSPACE |
| Imagen + audio | Vídeo de imagen a audio con audio sincronizado tratado con AKUSPACE |
La ruta probada para el vídeo es voz seca, luego un paso de espacio de audio a audio, luego imagen+audio a vídeo con el audio tratado mantenido fijo mientras la imagen condiciona el primer cuadro. El adaptador apunta a las ramas de audio; la generación de vídeo es manejada por el modelo base LTX-2.5. También puede ejecutarse como un paso de doblaje, donde su referencia alineada en tiempo mantiene el tratamiento anclado al rendimiento de la fuente.
Configuraciones y uso
Las configuraciones sugeridas son 24 pasos, CFG 1-2, ajustando a CFG 4 para mayor volumen y detalle. Las descripciones parciales funcionan menos bien que las completas, ya que las cláusulas finales estaban presentes en cada descripción de entrenamiento. El paquete de nodos de ComfyUI incluye un visor three.js para manipular el prompt desde una vista de escena: fuente, oyente y espacio.
Disponibilidad
- Pesos de LoRA: KoshiMazaki/akuspace-ltx25 bajo la licencia comunitaria LTX-2
- Nodos de ComfyUI: koshimazaki/ComfyUI-Koshi-Nodes
- Estudio audiovisual interactivo: akuspace.pages.dev
Comentarios
Inicia sesión con GitHub para unirte a la conversación.