日本語版
最新ニュース
世界

マルチモーダル推論モデルがうまくいかない新しいメトリックトラック

(a)推論モデルからの出力の例と、知覚タスクに関する非合理モデル。赤いハイライトは視覚的な幻覚を示します。マルチモーダル推論モデルは、一般に、推論プロセス中に、非合理的なカウンターパートと比較して幻覚を増幅する傾向があります。 (b)RHベンチデータセットの推論および認識タスクに関するさまざまなモデルのパフォーマンス。より良いパフォーマンスモデルは、右上隅に配置されています。さまざまなスケールのベースラインの非合理的なモデルは、通常、より弱い推論能力と幻覚が少ないことを示しますが、推論モデルは反対の傾向を示します。クレジット:Liu et al。 過去数十年にわたり、コンピューター科学者はますます洗練された機械学習ベースのモデルを導入してきました。これは、さまざまなタスクで非常にうまく機能する可能性があります。これらには、マルチモーダルの大手言語モデル(MLLM)、さまざまな種類のデータを処理および生成できるシステム、主にテキスト、画像、ビデオが含まれます。 OpenaiのGPT4 with Vision(GPT-4V)、DeepSeek-R1、Google Geminiなど、これらのモデルの一部は、現在、世界中のユーザーがソーシャルメディアの投稿や記事の画像や特定の用途に合わせたテキストなど、特定のマルチモーダルコンテンツを作成するために広く使用されています。 一方 推論 これらのモデルの能力は近年では大幅に改善されており、数学的および推論的な問題を解決できるようになりました。研究は、入力画像に実際に存在しない詳細を説明することにより、入力データに基づいていないものに時々応答することを示しました。 これらの幻覚は、大規模なテキストデータセットを分析している間に、トレーニング中にモデルが取得したかもしれない言語の事前と内部バイアスにリンクされています。これらのバイアスは、モデルに供給された視覚情報をオーバーライドすることができます(つまり、画像を入力します)、モデルが割り当てられたタスクを誤って完了させます。 UC Santa Cruz、Stanford University、およびUC Santa Barbaraの研究者は最近、これらの幻覚を研究するのに役立つメトリックと診断ベンチマークを開発しました。特にMLLMの推論と、入力画像で描かれているものを説明するように求められたときの幻覚の関係と幻覚の関係に焦点を当てています。これらの新しい研究ツールは、aで提示されます 紙 に arxiv プレプリントサーバーは、MLLMの評価と進歩に貢献する可能性があります。 「テスト時間コンピューティングにより、マルチモーダルの大規模な言語モデルに拡張された推論チェーンを生成し、マルチモーダル数学推論などのタスクで強力なパフォーマンスをもたらしました」と、Xhongxing Xu、および同僚の同僚は書いています。 「しかし、この改善された推論能力はしばしば幻覚を増やします。世代が長くなるにつれて、モデルは画像に基づいたコンテンツから離れ、言語の事前に大きく依存する傾向があります。」 5つの認識ベンチマーク上の推論モデルと非合理モデルの比較。 3Bモデル(左)および7Bモデル(右)の結果が表示されます。スコアが高いほど、幻覚が低いことを示します。クレジット: arxiv (2025)。 doi:10.48550/arxiv.2505.21523 研究者たちは、複雑な推論タスクでのMLLMのパフォーマンスを最初に評価し、推論チェーン(つまり、問題を解決するために必要な論理的なステップのシーケンス)が長さが増加すると、幻覚のモデルの傾向も増加することを発見しました。彼らは、これらの幻覚が注意を減らしたために現れたことを示唆しました 視覚刺激 そして、言語の事前に依存しています。 「注意分析により、推論チェーンが長くなると視覚入力に焦点が当てられ、幻覚に貢献することが示されています」とLi、Xu、および同僚は書いています。 「この現象を体系的に研究するために、モデルの知覚精度が推論長でどのように変化するかを定量化するメトリックであるRH-AUCを紹介し、モデルが推論中に視覚的な接地を保持するかどうかを評価できるようにします。 rh-aucとrh-benchは、Liu、Xu、および彼の同僚によって開発されたメトリックとベンチマークであり、他の研究者がすぐに使用して、特定のMLLMの推論能力と幻覚のリスクとの相互作用を評価することができます。さらに、チームの論文で提示された観察は、将来の努力を導くことができます。 幻覚。…

マルチモーダル推論モデルがうまくいかない新しいメトリックトラック

1749954500
2025-06-14 12:20:00

(a)推論モデルからの出力の例と、知覚タスクに関する非合理モデル。赤いハイライトは視覚的な幻覚を示します。マルチモーダル推論モデルは、一般に、推論プロセス中に、非合理的なカウンターパートと比較して幻覚を増幅する傾向があります。 (b)RHベンチデータセットの推論および認識タスクに関するさまざまなモデルのパフォーマンス。より良いパフォーマンスモデルは、右上隅に配置されています。さまざまなスケールのベースラインの非合理的なモデルは、通常、より弱い推論能力と幻覚が少ないことを示しますが、推論モデルは反対の傾向を示します。クレジット:Liu et al。

過去数十年にわたり、コンピューター科学者はますます洗練された機械学習ベースのモデルを導入してきました。これは、さまざまなタスクで非常にうまく機能する可能性があります。これらには、マルチモーダルの大手言語モデル(MLLM)、さまざまな種類のデータを処理および生成できるシステム、主にテキスト、画像、ビデオが含まれます。

OpenaiのGPT4 with Vision(GPT-4V)、DeepSeek-R1、Google Geminiなど、これらのモデルの一部は、現在、世界中のユーザーがソーシャルメディアの投稿や記事の画像や特定の用途に合わせたテキストなど、特定のマルチモーダルコンテンツを作成するために広く使用されています。

一方 推論 これらのモデルの能力は近年では大幅に改善されており、数学的および推論的な問題を解決できるようになりました。研究は、入力画像に実際に存在しない詳細を説明することにより、入力データに基づいていないものに時々応答することを示しました。

これらの幻覚は、大規模なテキストデータセットを分析している間に、トレーニング中にモデルが取得したかもしれない言語の事前と内部バイアスにリンクされています。これらのバイアスは、モデルに供給された視覚情報をオーバーライドすることができます(つまり、画像を入力します)、モデルが割り当てられたタスクを誤って完了させます。

UC Santa Cruz、Stanford University、およびUC Santa Barbaraの研究者は最近、これらの幻覚を研究するのに役立つメトリックと診断ベンチマークを開発しました。特にMLLMの推論と、入力画像で描かれているものを説明するように求められたときの幻覚の関係と幻覚の関係に焦点を当てています。これらの新しい研究ツールは、aで提示されます arxiv プレプリントサーバーは、MLLMの評価と進歩に貢献する可能性があります。

「テスト時間コンピューティングにより、マルチモーダルの大規模な言語モデルに拡張された推論チェーンを生成し、マルチモーダル数学推論などのタスクで強力なパフォーマンスをもたらしました」と、Xhongxing Xu、および同僚の同僚は書いています。

「しかし、この改善された推論能力はしばしば幻覚を増やします。世代が長くなるにつれて、モデルは画像に基づいたコンテンツから離れ、言語の事前に大きく依存する傾向があります。」

マルチモーダル推論モデルの幻覚を研究するための新しいメトリックと診断ベンチマーク

5つの認識ベンチマーク上の推論モデルと非合理モデルの比較。 3Bモデル(左)および7Bモデル(右)の結果が表示されます。スコアが高いほど、幻覚が低いことを示します。クレジット: arxiv (2025)。 doi:10.48550/arxiv.2505.21523

研究者たちは、複雑な推論タスクでのMLLMのパフォーマンスを最初に評価し、推論チェーン(つまり、問題を解決するために必要な論理的なステップのシーケンス)が長さが増加すると、幻覚のモデルの傾向も増加することを発見しました。彼らは、これらの幻覚が注意を減らしたために現れたことを示唆しました 視覚刺激 そして、言語の事前に依存しています。

「注意分析により、推論チェーンが長くなると視覚入力に焦点が当てられ、幻覚に貢献することが示されています」とLi、Xu、および同僚は書いています。

「この現象を体系的に研究するために、モデルの知覚精度が推論長でどのように変化するかを定量化するメトリックであるRH-AUCを紹介し、モデルが推論中に視覚的な接地を保持するかどうかを評価できるようにします。

rh-aucとrh-benchは、Liu、Xu、および彼の同僚によって開発されたメトリックとベンチマークであり、他の研究者がすぐに使用して、特定のMLLMの推論能力と幻覚のリスクとの相互作用を評価することができます。さらに、チームの論文で提示された観察は、将来の努力を導くことができます。 幻覚

「私たちの分析により、より大きなモデルが通常aを達成することが明らかになりました より良いバランス 推論と認識の間、そしてこのバランスは、その全体的な量よりもトレーニングデータのタイプとドメインによってより影響を受けると、Liu、Xu、およびその同僚は書いています。「これらの調査結果は、推論の質と知覚的忠実度の両方を共同で考慮する評価枠組みの重要性を強調しています。」

私たちの著者によってあなたのために書かれています Ingrid Fadelli、編集 ギャビー・クラーク、および事実確認され、レビューされました ロバート・イーガン– この記事は、慎重な人間の仕事の結果です。私たちはあなたのような読者に頼って、独立した科学ジャーナリズムを生かし続けます。この報告が重要な場合は、aを検討してください 寄付 (特に毎月)。あなたは得るでしょう 広告なし 感謝としてアカウント。

詳細:
Chengzhi liu et al、より多くの考え、見ることが少ない?マルチモーダル推論モデルにおける増幅幻覚の評価、 arxiv (2025)。 doi:10.48550/arxiv.2505.21523

ジャーナル情報:
arxiv


©2025 Science X Network
お問い合わせ・広告・著作権・不具合に関するご連絡は [email protected] までメールでお願いします。

引用:ベンチマーク幻覚:マルチモーダル推論モデルが間違っている新しいメトリックトラック(2025、6月14日)2025年6月14日https://techxplore.com/news/2025-06-benchmarks-hallucinations-metric-tracks-multimodal.html

このドキュメントは著作権の対象となります。私的な研究や研究の目的のための公正な取引とは別に、書面による許可なしに再現される部分はありません。コンテンツは情報のみで提供されます。

#マルチモーダル推論モデルがうまくいかない新しいメトリックトラック

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。