日本語版
最新ニュース
科学&テクノロジー

新しい方法により統計的推定の信頼性が向上 |マサチューセッツ工科大学ニュース

環境科学者が、大気汚染への曝露が特定の郡の出生体重の減少と関連しているかどうかを研究しているとします。機械学習手法は複雑な関係の学習に特に優れているため、機械学習モデルをトレーニングしてこの関連性の大きさを推定する可能性があります。標準的な機械学習手法は予測を行うことに優れており、場合によってはこれらの予測に対して信頼区間などの不確実性を提供します。ただし、通常、2 つの変数に関連性があるかどうかを判断する際の推定値や信頼区間は提供されません。この関連性の問題に対処し、信頼区間を提供するために、他の方法が特別に開発されています。しかし、MIT の研究者らは、空間設定では、これらの信頼区間が完全に的外れになる可能性があることを発見しました。大気汚染レベルや降水量などの変数が場所ごとに変化する場合、信頼区間を生成する一般的な方法では、実際には推定が実際の値を完全に把握できていないにもかかわらず、高い信頼レベルを主張する可能性があります。このような不正確な信頼区間により、ユーザーは失敗したモデルを信頼するという誤解を招く可能性があります。この不足を特定した後、研究者らは、空間全体で変化するデータを含む問題に対して有効な信頼区間を生成するように設計された新しい方法を開発しました。実際のデータを使用したシミュレーションと実験において、彼らの方法は一貫して正確な信頼区間を生成する唯一の手法でした。この研究は、環境科学、経済学、疫学などの分野の研究者が、特定の実験結果をいつ信頼すべきかをよりよく理解するのに役立つ可能性がある。「気象や森林管理など、人々が宇宙の現象を理解することに興味を持っている問題はたくさんあります。この広範な問題に対して、パフォーマンスを向上させ、何が起こっているのかをよりよく理解し、より信頼できる結果を得ることができる、より適切な方法があることを私たちは示してきました」と、MIT 電気工学およびコンピューターサイエンス学科 (EECS) の准教授であり、情報意思決定システム研究所 (LIDS) およびデータ研究所のメンバーであるタマラ ブロデリック氏は述べています。 Systems, and Society、Computer Science and Artificial Intelligence Laboratory (CSAIL) の関連会社であり、この本の上級著者 勉強。Broderick 氏には、共同主著者であるポスドクの David R. Burt 氏と EECS 大学院生の Renato Berlinghieri 氏がこの論文に参加しています。 Stephen Bates は EECS の助教授であり、LIDS のメンバーです。この研究は最近、神経情報処理システム会議で発表されました。無効な仮定空間的関連性には、変数と特定の結果が地理的領域にわたってどのように関連しているかを研究することが含まれます。たとえば、米国の樹木被覆率が標高とどのように関係しているかを研究したいと思うかもしれません。この種の問題を解決するには、科学者は多くの場所から観測データを収集し、それを使用してデータのない別の場所での関連性を推定できます。MIT の研究者らは、この場合、既存の方法では完全に間違った信頼区間が生成されることが多いことに気づきました。モデルは、その推定が樹木被覆率と標高の間の真の関係をまったく捉えていない場合でも、その推定が 95%…

新しい方法により統計的推定の信頼性が向上 |マサチューセッツ工科大学ニュース

1765549395
2025-12-12 05:00:00

環境科学者が、大気汚染への曝露が特定の郡の出生体重の減少と関連しているかどうかを研究しているとします。

機械学習手法は複雑な関係の学習に特に優れているため、機械学習モデルをトレーニングしてこの関連性の大きさを推定する可能性があります。

標準的な機械学習手法は予測を行うことに優れており、場合によってはこれらの予測に対して信頼区間などの不確実性を提供します。ただし、通常、2 つの変数に関連性があるかどうかを判断する際の推定値や信頼区間は提供されません。この関連性の問題に対処し、信頼区間を提供するために、他の方法が特別に開発されています。しかし、MIT の研究者らは、空間設定では、これらの信頼区間が完全に的外れになる可能性があることを発見しました。

大気汚染レベルや降水量などの変数が場所ごとに変化する場合、信頼区間を生成する一般的な方法では、実際には推定が実際の値を完全に把握できていないにもかかわらず、高い信頼レベルを主張する可能性があります。このような不正確な信頼区間により、ユーザーは失敗したモデルを信頼するという誤解を招く可能性があります。

この不足を特定した後、研究者らは、空間全体で変化するデータを含む問題に対して有効な信頼区間を生成するように設計された新しい方法を開発しました。実際のデータを使用したシミュレーションと実験において、彼らの方法は一貫して正確な信頼区間を生成する唯一の手法でした。

この研究は、環境科学、経済学、疫学などの分野の研究者が、特定の実験結果をいつ信頼すべきかをよりよく理解するのに役立つ可能性がある。

「気象や森林管理など、人々が宇宙の現象を理解することに興味を持っている問題はたくさんあります。この広範な問題に対して、パフォーマンスを向上させ、何が起こっているのかをよりよく理解し、より信頼できる結果を得ることができる、より適切な方法があることを私たちは示してきました」と、MIT 電気工学およびコンピューターサイエンス学科 (EECS) の准教授であり、情報意思決定システム研究所 (LIDS) およびデータ研究所のメンバーであるタマラ ブロデリック氏は述べています。 Systems, and Society、Computer Science and Artificial Intelligence Laboratory (CSAIL) の関連会社であり、この本の上級著者 勉強

Broderick 氏には、共同主著者であるポスドクの David R. Burt 氏と EECS 大学院生の Renato Berlinghieri 氏がこの論文に参加しています。 Stephen Bates は EECS の助教授であり、LIDS のメンバーです。この研究は最近、神経情報処理システム会議で発表されました。

無効な仮定

空間的関連性には、変数と特定の結果が地理的領域にわたってどのように関連しているかを研究することが含まれます。たとえば、米国の樹木被覆率が標高とどのように関係しているかを研究したいと思うかもしれません。

この種の問題を解決するには、科学者は多くの場所から観測データを収集し、それを使用してデータのない別の場所での関連性を推定できます。

MIT の研究者らは、この場合、既存の方法では完全に間違った信頼区間が生成されることが多いことに気づきました。モデルは、その推定が樹木被覆率と標高の間の真の関係をまったく捉えていない場合でも、その推定が 95% の確信を持って捉えていると言うかもしれません。

この問題を調査した結果、研究者らは、データが空間的に変化する場合、これらの信頼区間手法が依存する仮定が成り立たないと判断しました。

仮定は、統計分析の結果が有効であることを確認するために従わなければならないルールのようなものです。信頼区間を生成する一般的な方法は、さまざまな仮定の下で行われます。

まず、ソース データ (モデルをトレーニングするために収集された観測データ) が独立しており、同一に分布していると仮定します。この仮定は、データ内に 1 つの位置が含まれる可能性は、別の位置が含まれるかどうかには関係がないことを意味します。ただし、たとえば、米国環境保護庁 (EPA) の空気センサーは、他の空気センサーの位置を考慮して配置されています。

第 2 に、既存の手法ではモデルが完全に正しいと想定されることがよくありますが、この想定は実際には決して当てはまりません。最後に、ソース データが推定したいターゲット データと類似していると仮定します。

ただし、空間設定では、ターゲット データがソース データが収集された場所とは異なる場所にあるため、ソース データがターゲット データとは根本的に異なる場合があります。

たとえば、科学者は、EPA の汚染監視装置からのデータを使用して、監視装置のない田舎での健康への影響を予測できる機械学習モデルをトレーニングするかもしれません。しかし、EPAの汚染監視装置は交通量が多く重工業が多い都市部に設置される可能性が高いため、大気質データは地方の大気質データとは大きく異なることになる。

この場合、ターゲット データがソース データと体系的に異なるため、都市データを使用した関連性の推定にはバイアスが発生します。

スムーズな解決策

信頼区間を生成する新しい方法は、この潜在的なバイアスを明示的に説明します。

研究者らは、ソース データとターゲット データが類似していると仮定するのではなく、データが空間上で滑らかに変化すると仮定します。

たとえば、微粒子による大気汚染の場合、ある街区の汚染レベルが次の街区の汚染レベルと大きく異なるとは考えられません。その代わり、汚染源から遠ざかるにつれて、汚染レベルは滑らかに減少します。

「このようなタイプの問題には、この空間滑らかさの仮定の方が適切です。データ内で実際に起こっていることとよりよく一致します」と Broderick 氏は言います。

彼らの手法を他の一般的な手法と比較したところ、それが空間解析の信頼できる信頼区間を一貫して生成できる唯一の手法であることがわかりました。さらに、ランダムエラーによって観測データが歪んだ場合でも、彼らの方法は信頼性を保ちます。

研究者らは将来的に、この分析をさまざまなタイプの変数に適用し、より信頼性の高い結果が得られる他のアプリケーションを探索したいと考えています。

この研究は、MIT のコンピューティングの社会的および倫理的責任 (SERC) シード助成金、ジェネラリ、マイクロソフト、および国立科学財団 (NSF) の海軍研究局から一部資金提供を受けました。

#新しい方法により統計的推定の信頼性が向上 #マサチューセッツ工科大学ニュース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。