アリババ通義ラボがZ-Image-Baseをリリース - 非蒸留版高品質画像生成モデル
アリババ通義ラボがZ-Image-Baseをリリース。これはZ-Imageシリーズの非蒸留基盤モデルで、完全な生成能力を保持し、コミュニティのファインチューニングとカスタム開発に理想的な基盤を提供します
Open-Weights
ComfyUI エコシステムの最新情報:オープンソースモデルのリリース、カスタムノード、ワークフロー、ツールのアップデート。
アリババ通義ラボがZ-Image-Baseをリリース。これはZ-Imageシリーズの非蒸留基盤モデルで、完全な生成能力を保持し、コミュニティのファインチューニングとカスタム開発に理想的な基盤を提供します
Open-Weights
DeepSeekがDeepSeek-OCR-2をオープンソース化。新しいDeepEncoder V2ビジョンエンコーダを導入し、ビジュアル因果フローメカニズムを通じて人間の読解ロジックを模倣し、OmniDocBench v1.5で91.09%の精度を達成
Open-Weights
Moonshot AIが正式にKimi K2.5をリリース。15兆の混合ビジュアル・テキストトークンで継続的に事前学習された1Tパラメータのネイティブマルチモーダルエージェントモデルで、画像・動画理解をサポートし、Agent Swarm自律協調メカニズムを搭載
Open-Weights
アリババQwenがQwen3-TTS音声生成モデルシリーズをオープンソース化。Dual-Trackモデリングにより97ms超低レイテンシを実現し、3秒音声クローニングと自然言語音声デザインをサポート、10の主要言語をカバー
Open-Weights
Microsoftが9Bパラメータの統合音声認識モデルVibeVoice-ASRをオープンソース化。最大60分の音声を一度に処理可能で、単一推論プロセスで認識、話者分離、タイムスタンプ生成を共同完了
Open-Weights
NVIDIAがMoshiアーキテクチャベースの70億パラメータ全二重音声対話モデルPersonaPlex-7B-v1をオープンソース化。同時聴取・発話、自然な中断、役割カスタマイズをサポートし、中断応答レイテンシは240ミリ秒まで低減
Open-Weights
テキスト→動画Stable Video Infinity 2.0 Pro が正式リリースされ、Wan 2.2 ベースモデルのサポートを追加。ComfyUI で無限長の動画コンテンツを生成するための HIGH および LOW バージョンの LoRA モデルを提供
画像編集Qwen-Image-Layered は画像を複数の RGBA レイヤーに分解でき、各レイヤーは他のコンテンツに影響を与えることなく独立して編集可能。色変更、置換、削除、サイズ変更、位置移動などの操作をサポート
Open-Weights
画像→3DMicrosoftが40億パラメータの大規模3D生成モデルTRELLIS.2を発表。数秒で画像を高品質な3Dアセットに変換し、完全なPBRマテリアルと複雑なトポロジーをサポート
Open-Weights
清華大学チームがTurboDiffusionをオープンソース化。RTX 5090単体で100-205倍のエンドツーエンド拡散生成加速を実現し、動画品質を維持する動画生成加速フレームワーク
Alibaba Cloud PAI チームが Z-Image-Turbo-Fun-Controlnet-Union を発表。Canny、HED、Depth、Pose、MLSD を含む複数の制御条件に対応する ControlNet モデルで、1328 解像度でトレーニング済み
Open-Weights
テキスト→画像Alibaba AIDC-AI チームが高品質なテキスト描画に特化した7Bパラメータのテキスト画像生成モデル Ovis-Image を発表。複数のテキスト描画ベンチマークで優れた結果を達成し、単一のハイエンドGPUで効率的に動作
Open-Weights
アリババ通義ラボがZ-Image-Turboを発表。6Bパラメータの効率的な画像生成モデルで、わずか8ステップのサンプリングで高品質な画像を生成し、16GB VRAMのコンシューマー向けGPUでスムーズに動作
Open-Weights
マルチモーダルByteDanceはSa2VAマルチモーダルモデルを発表し、SAM2とLLaVA技術を組み合わせて画像・動画の密なセグメンテーションと視覚的質問応答を実現し、複数のベンチマークテストで最高峰の性能を達成
Open-Weights
テンセントは、総パラメータ数800億個の商用レベルネイティブマルチモーダル画像生成モデル混元画像3.0をリリースしました。世界知識推論機能を備え、数千文字の複雑な意味理解をサポートしています
Open-Weights
Nunchakuチームは、4-Bit Lightning Qwen-Image-Edit-2509モデルの最適化バージョンをリリースしました。4/8ステップの高速推論をサポートし、8GB VRAM環境でもスムーズに実行できます
アリババ通義実験室がWan-Animateを発表、Wan2.2ベースの統合キャラクターアニメーションフレームワークで、キャラクターアニメーション生成およびビデオキャラクター置換をサポート、モデル重みと推論コードをオープンソース化
Open-Weights
Comfy Cloudは、強力なGPU、人気モデル、カスタムノードを備えたComfyUIへの簡単なアクセスを提供します。無料のクラウド版ComfyUIを体験できるプライベートベータにご参加ください。
画像→3Dテンセント・フンユアンチームがボイジャー技術をリリース、単一画像とユーザー定義のカメラパスからワールド一貫性のある3Dポイントクラウドシーケンスビデオを生成可能に、無限ワールド探索と直接3D再構成をサポート
Open-Weights
テキスト→画像ByteDanceがUSOモデルを発表。任意の主体と任意のスタイルを自由に組み合わせ、主体の一貫性を維持しながら高品質なスタイル転送効果を実現
Open-Weights