ComfyUI ニュース&オープンソース AI リリース

ComfyUI エコシステムの最新情報:オープンソースモデルのリリース、カスタムノード、ワークフロー、ツールのアップデート。

テキスト→画像

アリババ通義ラボがZ-Image-Baseをリリース - 非蒸留版高品質画像生成モデル

テキスト→画像
ベースモデル
アリババ通義ラボがZ-Image-Baseをリリース - 非蒸留版高品質画像生成モデル

アリババ通義ラボがZ-Image-Baseをリリース。これはZ-Imageシリーズの非蒸留基盤モデルで、完全な生成能力を保持し、コミュニティのファインチューニングとカスタム開発に理想的な基盤を提供します

Open-Weights

マルチモーダル

DeepSeek、DeepSeek-OCR-2をリリース - ビジュアル因果フローを搭載した文書理解モデル

マルチモーダル
ベースモデル
DeepSeek、DeepSeek-OCR-2をリリース - ビジュアル因果フローを搭載した文書理解モデル

DeepSeekがDeepSeek-OCR-2をオープンソース化。新しいDeepEncoder V2ビジョンエンコーダを導入し、ビジュアル因果フローメカニズムを通じて人間の読解ロジックを模倣し、OmniDocBench v1.5で91.09%の精度を達成

Open-Weights

マルチモーダル

Moonshot AI、Kimi K2.5をリリース - 1Tパラメータのネイティブマルチモーダルエージェントモデル

マルチモーダル
ベースモデル
Moonshot AI、Kimi K2.5をリリース - 1Tパラメータのネイティブマルチモーダルエージェントモデル

Moonshot AIが正式にKimi K2.5をリリース。15兆の混合ビジュアル・テキストトークンで継続的に事前学習された1Tパラメータのネイティブマルチモーダルエージェントモデルで、画像・動画理解をサポートし、Agent Swarm自律協調メカニズムを搭載

Open-Weights

音声合成

アリババQwen、Qwen3-TTSをリリース - 97ms超低レイテンシ音声合成モデル

音声合成
ベースモデル
アリババQwen、Qwen3-TTSをリリース - 97ms超低レイテンシ音声合成モデル

アリババQwenがQwen3-TTS音声生成モデルシリーズをオープンソース化。Dual-Trackモデリングにより97ms超低レイテンシを実現し、3秒音声クローニングと自然言語音声デザインをサポート、10の主要言語をカバー

Open-Weights

音声認識

Microsoft、VibeVoice-ASRをリリース - 60分長音声シングルパス処理対応音声認識モデル

音声認識
ベースモデル
Microsoft、VibeVoice-ASRをリリース - 60分長音声シングルパス処理対応音声認識モデル

Microsoftが9Bパラメータの統合音声認識モデルVibeVoice-ASRをオープンソース化。最大60分の音声を一度に処理可能で、単一推論プロセスで認識、話者分離、タイムスタンプ生成を共同完了

Open-Weights

マルチモーダル

NVIDIA、PersonaPlex-7B-v1をリリース - 全二重音声対話モデル

マルチモーダル
ベースモデル
NVIDIA、PersonaPlex-7B-v1をリリース - 全二重音声対話モデル

NVIDIAがMoshiアーキテクチャベースの70億パラメータ全二重音声対話モデルPersonaPlex-7B-v1をオープンソース化。同時聴取・発話、自然な中断、役割カスタマイズをサポートし、中断応答レイテンシは240ミリ秒まで低減

Open-Weights

テキスト→画像

Alibaba Cloud PAI が Z-Image-Turbo-Fun-Controlnet-Union を発表 - 複数制御条件対応 ControlNet モデル

テキスト→画像
ControlNet
Alibaba Cloud PAI が Z-Image-Turbo-Fun-Controlnet-Union を発表 - 複数制御条件対応 ControlNet モデル

Alibaba Cloud PAI チームが Z-Image-Turbo-Fun-Controlnet-Union を発表。Canny、HED、Depth、Pose、MLSD を含む複数の制御条件に対応する ControlNet モデルで、1328 解像度でトレーニング済み

Open-Weights

テキスト→画像

アリババ通義ラボがZ-Image-Turboを発表 - 6Bパラメータの効率的な画像生成モデル

テキスト→画像
Turbo
アリババ通義ラボがZ-Image-Turboを発表 - 6Bパラメータの効率的な画像生成モデル

アリババ通義ラボがZ-Image-Turboを発表。6Bパラメータの効率的な画像生成モデルで、わずか8ステップのサンプリングで高品質な画像を生成し、16GB VRAMのコンシューマー向けGPUでスムーズに動作

Open-Weights

テキスト→画像

テンセントが混元画像3.0をオープンソースで公開 - 世界最大のオープンソーステキスト生成画像モデル

テキスト→画像
ベースモデル
テンセントが混元画像3.0をオープンソースで公開 - 世界最大のオープンソーステキスト生成画像モデル

テンセントは、総パラメータ数800億個の商用レベルネイティブマルチモーダル画像生成モデル混元画像3.0をリリースしました。世界知識推論機能を備え、数千文字の複雑な意味理解をサポートしています

Open-Weights

キャラクターアニメ

アリババ、Wan-Animateモデルを発表 - 統合キャラクターアニメーションおよび置換技術

キャラクターアニメ
ツール
アリババ、Wan-Animateモデルを発表 - 統合キャラクターアニメーションおよび置換技術

アリババ通義実験室がWan-Animateを発表、Wan2.2ベースの統合キャラクターアニメーションフレームワークで、キャラクターアニメーション生成およびビデオキャラクター置換をサポート、モデル重みと推論コードをオープンソース化

Open-Weights