NUSチームがOmniConsistencyプロジェクトを発表、2,600組の画像と500時間のGPU訓練のみでGPT-4oレベルの画像スタイル化一貫性を実現、ComfyUIノードにも対応
Open-Weights
ComfyUI エコシステムの最新情報:オープンソースモデルのリリース、カスタムノード、ワークフロー、ツールのアップデート。
NUSチームがOmniConsistencyプロジェクトを発表、2,600組の画像と500時間のGPU訓練のみでGPT-4oレベルの画像スタイル化一貫性を実現、ComfyUIノードにも対応
Open-Weights
Black Forest Labs は FLUX.1 Kontext シリーズモデルを発表し、テキストと画像入力に基づくコンテキスト認識編集を初めて実現、キャラクター一貫性保持とローカライズ編集機能をサポート
Open-Weights
テキスト→画像ByteDanceとミシガン州立大学が共同でID-Patch手法を提案。複数人物の個性を活かした画像生成を実現し、アイデンティティの保持と生成効率を向上。集合写真や広告など、複数キャラクターのシーンに適しています。
Open-Weights
キャラクターアニメテンセントは HunyuanVideo-Avatar を発表し、画像と音声から高精度かつ感情制御可能なデジタルヒューマン動画を生成。短編動画やEC広告など多様なシーンに対応。
Open-Weights
Pixel-ReasonerはQwen2をベースに、グローバルおよびローカルなピクセルレベルの視覚理解と推論能力を備え、細部の拡大分析をサポートし、視覚言語モデルの新たな進展を促します。
MIT
IndexTTSがバージョン1.5をリリース、モデルの安定性と英語性能を大幅に向上、ピンイン発音訂正と句読点による一時停止制御をサポート、複数のテストで主流TTSシステムを上回る性能を実現
Open-Weights
画像→3DStepFunが単一画像から高品質な3Dジオメトリとテクスチャを生成するオープンソースフレームワークStep1X-3Dをリリース。200万件の高品質データセット、完全な訓練コード、モデル重みを含む
Open-Weights
マルチモーダルByteDanceは、7Bアクティブパラメータを持つオープンソースのマルチモーダル基盤モデルBAGELを公開。テキスト・画像・動画の理解と生成をサポートし、各種ベンチマークで優れた成績を収めています。
Open-Weights
テキスト→画像最近のComfyUIアップデート後、一部のカスタムノードがフロントエンドの問題を引き起こす可能性があります。この記事では、影響を受けるプラグインと解決策をまとめ、適時のアップデートまたは関連プラグインのアンインストールを推奨しています。
Open-Weights
Step1X-3Dチームは高精度な3Dアセット生成ソリューションを公開し、モデル・データセット・コードをオープンソース化。多様な3Dアセット生成やテクスチャ合成に対応。
Open-Weights
マルチモーダルテンセントが、テキスト、画像、音声、動画の条件をサポートするマルチモーダル動画カスタマイズフレームワークHunyuanCustomを発表し、複数のシナリオで高い一貫性のある動画生成を実現
Open-Weights
画像編集Insert Anythingは、参照画像から人物、オブジェクト、衣服などの要素をターゲットシーンにシームレスに挿入できるオープンソースの統合フレームワークで、さまざまなアプリケーションシナリオをサポートしています
Open-Weights
テキスト→動画清華大学とテンセントARCラボが共同開発したFlexiActは、参照動画からのアクションを任意のターゲット画像に転送しながらアイデンティティの一貫性を維持します
Open-Weights
マルチモーダルStep1X-Editは自然言語指示による画像編集をサポートする強力なオープンソース画像編集フレームワークで、GPT-4oやGemini2 Flashに匹敵する画像編集能力を提供します。
Open-Weights
インペイントFlex.2-previewは、汎用的なコントロールと組み込みのインペイント機能を備えたオープンソーステキストから画像への拡散モデルで、クリエイターにより強力な画像生成ツールを提供します
Open-Weights
画像→動画Sand AIは、チャンク単位で動画を生成する自己回帰型モデルMAGI-1をオープンソース化し、24Bおよび4.5Bパラメータバージョンを提供、複数の動画生成モードをサポート
Open-Weights
画像→動画SkyworkAIが新しいオープンソース動画生成モデルSkyReels-V2をリリース。無限長の動画生成に対応し、テキストから動画および画像から動画の両機能を兼ね備える
Open-Weights
音声合成Nari Labsがオープンソースのテキスト音声変換モデルDia 1.6Bを発表。テキストから直接複数キャラクターの対話を生成し、感情表現や非言語コミュニケーションをサポート
Open-Weights
マルチモーダル崑崙万維のSkyReelsチームが、拡散強制フレームワークを使用した世界初の無限長映画生成モデルSkyReels-V2をリリースしオープンソース化。高品質で長時間の動画コンテンツを生成可能
Open-Weights
テキスト→画像Shakker Labsが制御効果を最適化し、複数の制御モードをサポートし、モデルサイズが小さくなった新しいFLUX.1-dev-ControlNet-Union-Pro-2.0モデルを発表
Open-Weights