音声合成Higgs TTS 3は、4Bパラメータのテキスト読み上げモデルで、100以上の言語に対応し、ゼロショット音声クローン、表現力豊かな感情制御、インラインプロソディや効果音を備え、音声エージェントアプリケーションに最適です。
Open-Weights
ComfyUI エコシステムの最新情報:オープンソースモデルのリリース、カスタムノード、ワークフロー、ツールのアップデート。
音声合成Higgs TTS 3は、4Bパラメータのテキスト読み上げモデルで、100以上の言語に対応し、ゼロショット音声クローン、表現力豊かな感情制御、インラインプロソディや効果音を備え、音声エージェントアプリケーションに最適です。
Open-Weights
Meituan(美团)がLongCat-Video-Avatarを1.5にアップグレード。Whisper-Largeによるリップシンク、DMD2による8ステップ蒸留、マルチ音声サポートに加え、音声から動画へのアバター生成を実現するComfyUIカスタムノードも紹介します。
MIT
テキスト→動画Sulphur 2はLTX 2.3のコミュニティファインチューンであり、内蔵のプロンプトエンハンサーと蒸留LoRAを備えたテキストから動画への生成および画像から動画への生成を提供。125K以上の厳選されたクリップでトレーニングされています。
Open-Weights
OpenMOSS チームが MOVA (MOSS Video and Audio) をリリース。単一推論パスで動画と音声を生成するエンドツーエンドの音声・動画同期生成基盤モデルで、正確なリップシンクと環境認識音響効果を実現し、モデルウェイト、トレーニングおよび推論コードを完全オープンソース化
Open-Weights
アリババ通義ラボがZ-Image-Baseをリリース。これはZ-Imageシリーズの非蒸留基盤モデルで、完全な生成能力を保持し、コミュニティのファインチューニングとカスタム開発に理想的な基盤を提供します
Open-Weights
DeepSeekがDeepSeek-OCR-2をオープンソース化。新しいDeepEncoder V2ビジョンエンコーダを導入し、ビジュアル因果フローメカニズムを通じて人間の読解ロジックを模倣し、OmniDocBench v1.5で91.09%の精度を達成
Open-Weights
Moonshot AIが正式にKimi K2.5をリリース。15兆の混合ビジュアル・テキストトークンで継続的に事前学習された1Tパラメータのネイティブマルチモーダルエージェントモデルで、画像・動画理解をサポートし、Agent Swarm自律協調メカニズムを搭載
Open-Weights
ACE StudioとStepFunが、コンシューマーGPU上で数秒でフル楽曲を生成するオープンな音楽基盤モデルACE-Step 1.5をリリース。Comfy-Org公式のファイルとワークフローを提供します。
Apache-2.0
アリババQwenがQwen3-TTS音声生成モデルシリーズをオープンソース化。Dual-Trackモデリングにより97ms超低レイテンシを実現し、3秒音声クローニングと自然言語音声デザインをサポート、10の主要言語をカバー
Open-Weights
Microsoftが9Bパラメータの統合音声認識モデルVibeVoice-ASRをオープンソース化。最大60分の音声を一度に処理可能で、単一推論プロセスで認識、話者分離、タイムスタンプ生成を共同完了
Open-Weights
NVIDIAがMoshiアーキテクチャベースの70億パラメータ全二重音声対話モデルPersonaPlex-7B-v1をオープンソース化。同時聴取・発話、自然な中断、役割カスタマイズをサポートし、中断応答レイテンシは240ミリ秒まで低減
Open-Weights
テキスト→動画SVI 2.0 Pro と Wan 2.2 を使用して ComfyUI で無限長の動画を生成。HIGH・LOW バージョンの LoRA モデル対応。ワークフローをダウンロード。
画像編集Qwen-Image-Layered は画像を複数の RGBA レイヤーに分解でき、各レイヤーは他のコンテンツに影響を与えることなく独立して編集可能。色変更、置換、削除、サイズ変更、位置移動などの操作をサポート
Open-Weights
画像→3DMicrosoftが40億パラメータの大規模3D生成モデルTRELLIS.2を発表。数秒で画像を高品質な3Dアセットに変換し、完全なPBRマテリアルと複雑なトポロジーをサポート
Open-Weights
清華大学チームがTurboDiffusionをオープンソース化。RTX 5090単体で100-205倍のエンドツーエンド拡散生成加速を実現し、動画品質を維持する動画生成加速フレームワーク
Alibaba Cloud PAI チームが Z-Image-Turbo-Fun-Controlnet-Union を発表。Canny、HED、Depth、Pose、MLSD を含む複数の制御条件に対応する ControlNet モデルで、1328 解像度でトレーニング済み
Open-Weights
テキスト→画像Alibaba AIDC-AI チームが高品質なテキスト描画に特化した7Bパラメータのテキスト画像生成モデル Ovis-Image を発表。複数のテキスト描画ベンチマークで優れた結果を達成し、単一のハイエンドGPUで効率的に動作
Open-Weights
アリババ通義ラボがZ-Image-Turboを発表。6Bパラメータの効率的な画像生成モデルで、わずか8ステップのサンプリングで高品質な画像を生成し、16GB VRAMのコンシューマー向けGPUでスムーズに動作
Open-Weights
マルチモーダルByteDanceはSa2VAマルチモーダルモデルを発表し、SAM2とLLaVA技術を組み合わせて画像・動画の密なセグメンテーションと視覚的質問応答を実現し、複数のベンチマークテストで最高峰の性能を達成
Open-Weights
テンセントは、総パラメータ数800億個の商用レベルネイティブマルチモーダル画像生成モデル混元画像3.0をリリースしました。世界知識推論機能を備え、数千文字の複雑な意味理解をサポートしています
Open-Weights