Rumik OSS 1: открытая TTS-модель 3B для 22 индийских языков

ComfyUI Wikinews

Rumik AI открывает исходный код rumik-oss 1: TTS-модель на 3B параметров для 22 индийских языков и английского, с code-switched синтезом, управлением подачей и inline-тегами смеха.

Rumik AI выпустила rumik-oss 1: открытую TTS-модель с весами на 3B параметров, охватывающую 22 индийских языка и английский. Обученная менее чем на 70 000 часов речи, она справляется с code-switched синтезом, управлением тоном, акцентом и темпом через текстовое описание, а также inline-тегами <laugh>, <chuckle> и <sigh>. Также включён базовый чекпоинт для дообучения сообществом, а интерактивное демо на Hugging Face уже доступно.

Обзор

rumik-oss 1 расширяет tiny aya fire дискретными речевыми токенами из кодека mimi. Текстовое условие и генерация аудио совместно используют одну авторегрессивную последовательность: модель предсказывает восемь токенов кодовой книги на кадр аудио в порядке кодовых книг, после чего замороженный декодер mimi восстанавливает сигнал с частотой 24 кГц.

Возможности rumik-oss 1: многоязычная речь, выразительная подача и inline-вокализации

Четыре поставляемых голоса (Ira, Aisha, Siya, Zoya) каждый звучит на всех 22 языках, в отличие от TTS-моделей, привязывающих голос к одному языку. Префикс <description="..."> управляет тоном (радость, грусть, злость, воодушевление, деловой стиль), акцентом и темпом, а inline-теги размещают смех, хихиканье и вздохи на конкретных словах:

<description="excited, Hindi accent, fast pace"> जल्दी आओ, हमारा नाम लिस्ट में है! <laugh> आज घर में जश्न होगा।
Архитектура синтеза rumik-oss 1 с покадровым восстановлением кодек-токенов

Архитектура: покадровое предсказание кодек-токенов, декодируемое замороженным декодером mimi.

Бенчмарки

Вместе с моделью команда выпустила три новых бенчмарка, все с открытым кодом и результатами по каждому примеру:

БенчмаркЧто измеряетrumik-oss 1Лучшая система
IndicEmoВыразительная подача в code-switched речи2.92 / 5Gemini 3.1 Flash TTS (4.58)
NoVAВоспроизведение inline-вокализаций в правильных позициях0.884Grok TTS (0.972)
WER/CERТочность транскрипции на 15 языкахприведено по каждому языкусм. README

В NoVA rumik-oss 1 воспроизводит запрошенный смех и вздохи в нужных позициях слов надёжнее, чем ElevenLabs v3 (0.705) и Gemini 3.1 Flash TTS (0.664), уступая только Grok TTS и Inworld tts-2. Аудиопримеры в README демонстрируют все четыре голоса на хинди, английском, телугу, тамильском, бенгальском, каннада и панджаби, включая code-switched генерацию хинди-английский и телугу-английский.

Ограничения

Обучающие реплики не превышают 30 секунд, поэтому команда не рекомендует генерировать реплики длиннее 35 секунд, а незапрошенные вокализации появляются в 2.9–5.4% выходов. Аудио-токены должны декодироваться встроенным кодеком mimi; стандартный путь transformers.pipeline("text-to-speech") не поддерживается.

Доступность

Веса опубликованы на Hugging Face под лицензией CC-BY-NC 4.0 (исследовательское и некоммерческое использование) вместе с отдельно лицензируемым кодеком mimi, плюс MLX-сборка с квантованием для Apple Silicon. Hugging Face Space запускает интерактивные демо. Нативной интеграции с ComfyUI пока нет; модель рассчитана на вывод через Python с помощью примера одношаговой генерации из репозитория.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Rumik OSS 1: открытая TTS-модель 3B для 22 индийских языков | ComfyUI Wiki