日本語版
最新ニュース
世界

反復改良により 41.3% 優れた合成画像生成結果を達成

研究者たちは、プロンプトが複雑になり、複数のオブジェクトと属性を正確に配置することが求められる場合に、テキストから画像を生成するという永続的な課題に取り組んでいます。カーネギーメロン大学の Shantanu Jaiswal 氏、Mihir Prabhudesai 氏、Nikash Bhardwaj 氏は、Zheyang Qin 氏、Amir Zadeh 氏、Chuan Li 氏らとともに、テキストから画像への生成の忠実度を大幅に高める新しい反復改良戦略を発表しています。思考連鎖推論にインスピレーションを得た彼らの手法では、視覚的なフィードバックを重要なガイドとして使用し、モデルが複数のステップにわたって画像を段階的に改善することができます。これは、外部リソースを必要としないシンプルでありながら強力な手法です。このアプローチは、ConceptMix で 16.9% の改善、T2I-CompBench で 13.8% の改善など、確立されたベンチマーク全体で大幅な改善をもたらしました。そして重要なことに、人間の評価者は反復的に洗練された画像を明らかに好み、構成的な画像作成の新しい原理を示唆しています。 反復改良により、複雑な画像の生成が段階的に強化されます ビジョン言語フィードバックによる反復的な改良により、強力な 科学者は、テキストから画像 (T2I) 生成のための反復テスト時間戦略を開発し、複数のオブジェクト、関係、属性を含む複雑なプロンプトを処理する際の制限に対処しました。このアプローチは外部ツールや事前設定を必要とせず、さまざまな画像ジェネレーターや視覚言語モデルに柔軟に適用でき、方法論の大幅な進歩を示しています。最初は、。研究チームは結果と視覚化を github で公開しました。 io/ を使用して、この分野でのさらなる探索と開発を促進します。 反復改良により、複雑な画像の生成が段階的に強化されます このブレークスルーにより、複数のオブジェクト、関係、属性の同時管理が必要な複雑なプロンプトを処理する際のパフォーマンスが向上します。結果は、Qwen-Iter+Par モデルが TIFF ベンチマークで最先端のパフォーマンスを達成し、基本的な推論プロンプトで Qwen-Parallel と比べて 5.0% の大幅な改善を示していることを示しています。データによると、高度な…

反復改良により 41.3% 優れた合成画像生成結果を達成

1769225934
2026-01-24 02:39:00

研究者たちは、プロンプトが複雑になり、複数のオブジェクトと属性を正確に配置することが求められる場合に、テキストから画像を生成するという永続的な課題に取り組んでいます。カーネギーメロン大学の Shantanu Jaiswal 氏、Mihir Prabhudesai 氏、Nikash Bhardwaj 氏は、Zheyang Qin 氏、Amir Zadeh 氏、Chuan Li 氏らとともに、テキストから画像への生成の忠実度を大幅に高める新しい反復改良戦略を発表しています。思考連鎖推論にインスピレーションを得た彼らの手法では、視覚的なフィードバックを重要なガイドとして使用し、モデルが複数のステップにわたって画像を段階的に改善することができます。これは、外部リソースを必要としないシンプルでありながら強力な手法です。このアプローチは、ConceptMix で 16.9% の改善、T2I-CompBench で 13.8% の改善など、確立されたベンチマーク全体で大幅な改善をもたらしました。そして重要なことに、人間の評価者は反復的に洗練された画像を明らかに好み、構成的な画像作成の新しい原理を示唆しています。

反復改良により、複雑な画像の生成が段階的に強化されます

ビジョン言語フィードバックによる反復的な改良により、強力な

科学者は、テキストから画像 (T2I) 生成のための反復テスト時間戦略を開発し、複数のオブジェクト、関係、属性を含む複雑なプロンプトを処理する際の制限に対処しました。このアプローチは外部ツールや事前設定を必要とせず、さまざまな画像ジェネレーターや視覚言語モデルに柔軟に適用でき、方法論の大幅な進歩を示しています。最初は、。研究チームは結果と視覚化を github で公開しました。 io/ を使用して、この分野でのさらなる探索と開発を促進します。

反復改良により、複雑な画像の生成が段階的に強化されます

このブレークスルーにより、複数のオブジェクト、関係、属性の同時管理が必要な複雑なプロンプトを処理する際のパフォーマンスが向上します。結果は、Qwen-Iter+Par モデルが TIFF ベンチマークで最先端のパフォーマンスを達成し、基本的な推論プロンプトで Qwen-Parallel と比べて 5.0% の大幅な改善を示していることを示しています。データによると、高度な Relation+Reasoning タスクで 2.7% の向上、テキスト レンダリング機能で 4.0% の向上が示されており、多様な構成シナリオにわたるアプローチの汎用性が強調されています。具体的には、チームはさまざまな条件で 87.4、88.1、90.5、88.1、85.4、81.5、81.4、82.0、80.5、90.0、97.7、92.0 のスコアを記録し、モデルの堅牢なパフォーマンスを強調しました。
これらの測定により、反復的な自己修正が複雑な画像生成の課題に対処できることが確認されました。中間世代の分析により、批評家がジェネレーターを効果的にガイドしていることが明らかになりました。たとえば、ターゲットを絞った絞り込みプロンプトによってマウスの位置をキーの後ろに隠すことに成功しました。ある例では、批評家はミツバチの中にニンジンが入っているキュビズムのイメージの作成を指導し、新しいレンダリングから始めて、キュビズムのスタイルとオブジェクトの配置の両方を強調するようにプロンプトを改良しました。さらに、この研究では、この手法は概念の数が増加するにつれて効果的に拡張され、7 つの概念で約 90% の完全解決率を達成する一方、他の手法では 60 ~ 70% 程度で頭打ちになることが示されています。図 5 はこの利点を視覚的に示しており、複雑さが増しても反復アプローチによりパフォーマンスの向上が維持されることを示しています。研究チームはこれらの発見を細心の注意を払って文書化し、視覚化したものは github で入手できます。 io/ は、これらの驚くべき結果をさらに調査し複製するための包括的なリソースを提供します。

反復改良により、複雑な画像の生成が段階的に強化されます

科学者たちは、テキストから画像へのモデルを使用して合成画像の生成を強化するための反復改良戦略を開発しました。この方法は、ConceptMix、T2I-CompBench、Visual Jenga を含むいくつかのベンチマークにわたって一貫して画質を向上させ、全正解率で最大 16.9%、特定の空間カテゴリで 13.8% の向上を実証しました。この研究の重要性は、複数のオブジェクト、関係、属性を必要とする複雑なプロンプトから画像を生成するという課題に対処できることにあります。複雑なリクエストを連続した修正に分解することで、反復的な自己修正プロセスにより、より忠実で好ましい画像が生成されます。これは人間の評価者によって確認されており、平行ベースラインよりも 58.7% 対 41.3% のマージンで新しい方法を支持しました。著者らは、自分たちの手法のパフォーマンスが使用する基礎モデルの機能に依存しており、改善を達成するには最近の進歩が重要であることが判明していることを認めています。より小規模なオープンソース モデルを利用すると、わずかなパフォーマンスの低下が観察されました。将来の研究では、反復計算と並列計算の割り当ての間の最適なバランスを探索し、さまざまな視覚言語モデルとそのアクション空間の影響を調査する可能性があります。

#反復改良により #優れた合成画像生成結果を達成

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。