1745244198
2025-04-18 16:06:00
クレジット:Unsplash/CC0パブリックドメイン
AIモデルは、多くの場合、「偽の相関」に依存しており、重要でない誤解を招く可能性のある情報に基づいて意思決定を行います。研究者は現在、これらの学習したスプリアスな相関がトレーニングデータの非常に小さなサブセットに由来することができることを発見し、問題を克服する手法を実証しました。仕事はそうです 公開 に arxiv プリプリントサーバー。
「この手法は、AIがどのような疑いのある相関関係に依存しているのかわからない場合でも使用できるという点で斬新です」と、ノースカロライナ州立大学の作品に関する論文の著者であり、コンピューターサイエンスの助教授であるJung-eun Kim氏は言います。
「偽の機能が何であるかについてすでに良いアイデアを持っている場合、私たちの手法は問題に対処するための効率的かつ効果的な方法です。ただし、パフォーマンスの問題を抱えているだけでなく、理由を理解していても、私たちの手法を使用して、偽の相関が存在し、その問題を解決するかどうかを判断することができます。」
偽の相関は一般に、AI中の単純さのバイアスによって引き起こされます トレーニング。開業医はデータセットを使用してAIモデルをトレーニングして特定のタスクを実行します。たとえば、AIモデルを訓練して、犬の写真を特定することができます。トレーニングデータセットには、AIが犬が写真に入っていると言われた犬の写真が含まれます。
トレーニングプロセス中、AIは犬を識別するために使用できる特定の機能の特定を開始します。ただし、写真の犬の多くが首輪を着ている場合、首輪は一般に耳や毛皮よりも犬の複雑な特徴ではないため、AIはカラーを犬を識別する簡単な方法として使用する場合があります。これは、シンプルさのバイアスがスプリアスな相関を引き起こす可能性があることです。
「そして、AIが犬を識別するために使用する要因として首輪を使用する場合、AIは首輪を犬として身に着けている猫を特定するかもしれません」とキムは言います。
偽の相関によって引き起こされる問題に対処するための従来の手法は、問題を引き起こしている偽の特徴を特定できることに依存しています。その後、AIモデルのトレーニングに使用されるデータセットを変更することにより、これに対処できます。たとえば、開業医は、首輪を着ていない犬を含むデータセット内の写真に与えられた体重を増やす可能性があります。
しかし、彼らの新しい仕事では、研究者は、問題を引き起こしている偽の特徴を特定することが常に可能であるとは限らないことを示しています。
「データプルーニングとの偽りの相関を切断する」という論文は、4月24〜28日にシンガポールで開催される国際学習表現に関する国際会議(ICLR)で発表されます。論文の最初の著者は、博士号、ヴァルン・ムルカンダニです。 NC州の学生。
「この作業での私たちの目標は、それらの偽の特徴について何も知らないときでさえ、私たちが偽の相関を断ち切ることを可能にする手法を開発することでした」とキムは言います。
新しい手法は、AIモデルのトレーニングに使用されるデータのごく一部を削除することに依存しています。
「トレーニングデータセットに含まれるデータサンプルに大きな変動がある可能性があります」とキムは言います。 「一部のサンプルは非常に単純な場合がありますが、他のサンプルは非常に複雑な場合があります。また、各サンプルがトレーニング中のモデルの動作に基づいて「難しい」ことを測定できます。
「私たちの仮説は、データセット内の最も困難なサンプルはうるさいと曖昧であり、ネットワークにモデルのパフォーマンスを傷つける無関係な情報に依存するように強制する可能性が最も高いということでした」とキムは説明します。
「理解が困難なトレーニングデータの小さなスライバーを排除することにより、偽の機能を含むハードデータサンプルも排除しています。この排除は、重大な悪影響を引き起こすことなく、偽の相関問題を克服します。」
研究者は、新しい手法が最新の結果を達成することを実証しました。スプリアス機能が識別可能であるモデルの以前の作業と比較しても、パフォーマンスを改善します。
詳細:
Varun Mulchandaniら、データプルーニングとの偽の相関を切断する、 arxiv (2025)。 doi:10.48550/arxiv.2503.18258
によって提供されます
ノースカロライナ州立大学
引用:新しいテクニックは、2025年4月21日にhttps://techxplore.com/news/2025-04-technique-purious-problem-ai.htmlから取得したAI(2025、4月18日)の偽の相関問題を克服します。
このドキュメントは著作権の対象となります。私的な研究や研究の目的のための公正な取引とは別に、書面による許可なしに再現される部分はありません。コンテンツは情報のみで提供されます。
#新しいテクニックはAIの偽の相関問題を克服します