1769813714
2026-01-30 22:49:00
研究者たちは、拡散インタラクティブなテキストから画像への検索 (DAI-TIR) の進歩を妨げる重大な問題、つまりパフォーマンスを低下させる誤解を招く視覚的な「幻覚」をもたらす拡散モデルの傾向に取り組んでいます。湖南大学のZhuocheng Zhang、グラスゴー大学のKangheng Liang、Paul Hendersonは、Guanxuan Li、Richard Mccreadie、Zijun Longとともに、これらの不正確さが検索効率を大幅に低下させる可能性があることを経験的に実証している。彼らの新しいフレームワークである拡散認識マルチビュー対照学習 (DMCL) は、クエリの意図とターゲット画像の両方の表現を最適化し、これらの幻覚キューを効果的に除外し、テキスト情報と視覚情報の整合性を改善することにより、堅牢なトレーニング アプローチを提供します。このイノベーションにより、5 つのベンチマークにわたってマルチラウンド検索の精度が一貫して向上し、既存の方法と比較して最大 7.37% の向上を達成し、より信頼性の高い DAI-TIR システムへの道が開かれます。
しかし、研究チームは、拡散モデルによって「幻覚」と呼ばれる意図しない視覚的手がかりが生じ、元のテキスト クエリと矛盾し、検索パフォーマンスが低下する可能性があることを発見しました。この研究は、これらの幻覚合図が DAI-TIR システムの精度に大きな影響を与えることを経験的に証明しています。この革新的なアプローチにより、セマンティック フィルターとして機能するエンコーダーが実現され、幻覚キューをヌル空間に効果的にマッピングすることで、ロバスト性が強化され、ユーザーの意図する視覚検索の表現が向上します。注意の視覚化と幾何学的埋め込み空間分析は、このフィルタリング動作の裏付けとなる証拠を提供し、無関係な視覚情報を識別して無視するモデルの能力を確認します。この研究は、画像検索において拡散によって生成されたコンテンツによってもたらされる課題に対処するための強力なフレームワークを確立します。
さらに、この研究では、マルチビュー クエリ、ターゲット アラインメント目標とテキスト、拡散一貫性目標という 2 つの補完的なトレーニング目標を導入しています。アライメント目標は、モデルが不一致をフィルタリングしながらビュー全体で共有される手がかりを強調することを促進し、一方、一貫性目標はテキストと拡散クエリの間の一致を強化し、不一致や生成的幻覚に対する感度を低下させます。これらの目的を組み合わせることで、複数ラウンドのインタラクションでユーザーの意図が変化する場合でも、DAI-TIR タスクを確実にサポートする共有エンベディング スペースが作成されます。この研究は、拡散モデルが生成された画像に偽の詳細を導入し、検索精度を低下させる可能性があるという DAI-TIR の重要な制限に対処しています。研究者らは、これらの幻覚信号がパフォーマンスを大幅に低下させることを経験的に実証し、これらの誤解を招く信号を積極的に抑制しながら、テキストと拡散ベースのクエリビューを調整するための DMCL の作成を促しました。この研究は、クエリの意図とターゲット画像の両方の表現に焦点を当て、共同最適化プロセスとして DAI-TIR をキャストする方法を開拓しました。
チームは、アテンションの視覚化と幾何学的な埋め込み空間分析を利用して、開発されたエンコーダのフィルタリング動作を裏付けました。これらの分析により、DMCL がどのように埋め込み空間を再形成し、クロスモーダル アラインメントを強化し、競合する信号を抑制するかが明らかになりました。このシステムは、DAI-TIR 用の堅牢なトレーニング フレームワークを提供し、より正確で信頼性の高い対話型画像検索を容易にします。実験の結果、これらの幻覚キューによって DAI-TIR のパフォーマンスが低下する可能性があることが明らかになり、DMCL はクエリの意図とターゲット画像の表現を最適化することでこれを軽減することを目指しています。チームは意味の一貫性を測定し、拡散を意識した対比目標を採用してテキストビューと拡散クエリビューを調整し、偽の信号を抑制しました。現在の DAI-TIR 手法は拡散モデルを利用して、テキスト クエリとして表現されるユーザーの意図の追加ビューを生成しますが、これらの生成されたビューは幻覚として知られる不正確な視覚的手がかりを導入する可能性があり、パフォーマンスに悪影響を及ぼします。 DMCL は、クエリの意図とターゲット画像の両方の表現を同時に最適化することで、この問題に対処します。 DMCL の中核は、意味の一貫性と拡散を意識した対照的な目的にあり、これらの幻覚信号を積極的に抑制しながら、テキストと拡散ベースのクエリ ビューを調整します。
著者らは、現在の実装ではクエリ統合に単純な加法融合スキームを使用していることを認めており、今後の研究では、検索パフォーマンスをさらに向上させるためのより高度な融合技術の探索に焦点を当てる予定です。この分野でのさらなる調査を促進するために、大規模な DAI-TIR トレーニング データセットもリリースされました。最終的に、DMCL は、幻覚による視覚的手がかりの影響を軽減することにより、より信頼性が高く正確なテキストから画像への検索システムの構築に向けた重要な一歩となります。
#Dmcl #は幻覚的な視覚的手がかりを排除することで堅牢な #DaiTir #パフォーマンスを実現