Supra2-IMG: DiT-модель text-to-image на 100M параметров за 10 часов

ComfyUI Wikinews

SupraLabs выпускает Supra2-IMG: DiT-модель text-to-image на 105M параметров, обученную с нуля за 10 часов на одной H100, с примерами 256x256.

SupraLabs выпустила Supra2-IMG: diffusion transformer на 105M параметров для генерации изображений по тексту. Модель обучена с нуля за 10 часов на одной H100, и авторы описывают результат как state of the art для такого бюджета параметров.
Supra2-IMG: модель text-to-image на 100M параметров

Официальный баннер Supra2-IMG из репозитория модели.

Что это такое

Supra2-IMG: крошечный DiT, 104.1M параметров, генерирующий изображения 256x256 из 128 токенов контекста Flan-T5. Текстовое условие формируется замороженным энкодером Flan-T5-Base, а латентные представления декодируются через SD-VAE-FT-MSE, поэтому оба этих компонента берутся из своих репозиториев, а не поставляются в checkpoint.

КомпонентЗначение
Параметры104.1M (D_MODEL 576, глубина 14, 9 голов, размер головы 64, MLP ratio 4.0)
Разрешение256x256 (латент 32x32, размер патча 2)
Текстовый энкодерFlan-T5-Base, замороженный, контекст 128 токенов
VAESD-VAE-FT-MSE
Checkpointmodel_final_ema.pt

SupraLabs: независимая лаборатория, стоящая за языковыми моделями Supra2 на 100M параметров, и Supra2-IMG применяет тот же подход «обучай малым, обучай с нуля» к генерации изображений. Модель выпущена как чистый код PyTorch плюс веса: inference.py, config.json и model_final_ema.pt.

Обучение

Запуск намеренно скромный, в чём и смысл релиза:

  • Датасет: 10 эпох по полному датасету LucasFang/FLUX-Reason-6M, 5.6M изображений после подготовки.
  • Выбор подписей: для каждого изображения берётся первая доступная подпись в цепочке caption_composition, затем caption_entity, caption_text, caption_style и caption_imaginative, что сохраняет наиболее качественную аннотацию для каждого образца.
  • Оборудование: одна Nvidia H100 SXM 80GB на RunPod, 9 часов включая подготовку данных, на диске 2.5TB.

Поскольку вся модель занимает несколько сотен мегабайт, это практичная база для изучения предобучения в малом масштабе и для экспериментов по файнтюнингу, которые были бы слишком дорогими в масштабе 8B.

Примеры

Примеры Supra2-IMG

Официальные примеры из репозитория модели, все на рекомендуемых настройках, а не отобранные вручную запуски.

Пример вывода Supra2-IMG

Пример вывода 256x256, полученный поставляемым скриптом вывода.

Доступность

Поддержки ComfyUI нет: Supra2-IMG это обычный релиз PyTorch с собственной архитектурой SupraDiT, поэтому это не pipeline diffusers, и ни шаблон, ни нода ComfyUI не опубликованы. Для запуска нужен поставляемый скрипт плюс два внешних компонента:

wget https://huggingface.co/SupraLabs/Supra2-IMG/resolve/main/inference.py
python inference.py --prompt "a sea jellyfish floating in the pitch-black ocean depths" \
  --seed 0 --cfg 3.0 --steps 50 --n 1 --out jellyfish.png

Рекомендуемые настройки выборки: seed 0, CFG 3.0 и 50 шагов.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Supra2-IMG: DiT-модель text-to-image на 100M параметров за 10 часов | ComfyUI Wiki