日本語版
最新ニュース
世界

モントリオール工科大学 – AIアルゴリズムのセキュリティ侵害:個人情報の追跡が数独を解くのと同じくらい簡単になる

匿名化された個人データで訓練された人工知能(AI)アルゴリズムは、意思決定の改善と迅速化のためにさまざまな分野で導入されつつあります。しかし、モントリオール工科大学のチームは、最近発表された研究で、その一部に警鐘を鳴らしています。「ランダムフォレスト」アルゴリズムは、訓練に使用されたデータを簡単に明らかにする可能性があります。この研究は、これらのアルゴリズムの使用だけでなく、匿名化されたデータの使用にも疑問を投げかけています。誰もが数独パズルに挑戦したことがあるでしょう。いくつかの開始点があれば、欠けている数字をどこに足すか考えることができます。時には間違えることもありますが、それでも挑戦するのは楽しいものです。では、数字をあなたの個人情報に置き換えたと想像してください。身長、住所、生年月日だけを情報として持っていても、例えば、あなたの医療データをすべて取得したり、信用情報を入手したりすることができます。ゲームが楽しくなくなるかもしれません。しかし、このシナリオはそれほど遠くない将来に実現する可能性もあります。 これは、モントリオール工科大学の数学・産業工学部の准教授ティボー・ヴィダルが率いるチームが提案しているものだ。 研究 この研究は、オーストリアのウィーンで開催された第41回国際機械学習会議で昨年7月に発表された。この会議は世界で最も有名な機械学習会議の1つで、提出された1万件の論文のうち、口頭発表に選ばれるのはわずか160件である。研究グループは論文の中で、一部の人工知能(AI)モデルのトレーニングに使用されるデータのプライバシーについて疑問を提起している。 ティボー・ビダル教授 (写真:ティエリー・デュ・ボワ) モントリオール工科大学の SCALE-AI 教授に所属するジュリアン・フェリー、リカルド・フカサワ、ティモシー・パスカル、ヴィダル教授らが行った研究では、人工知能で使用される特定の種類のアルゴリズム、ランダム フォレストが問題を抱えていることが明らかになっています。これらのアルゴリズムは、スパムを排除するために電子メールを分類したり、ソーシャル ネットワークで広告をターゲットにしたりするなど、さまざまな機能を実行するために使用されます。また、医療診断や個人の信用分析など、さまざまな機能にも使用されています。 そして、特にこのような用途では、靴が締め付けられる可能性があります。 「ランダムフォレストのような機械学習モデルは、個人の特定の名前や属性を保存せずに、大量のデータから相関関係や洞察を抽出できる強力なツールです」とヴィダル氏は言う。「このツールは関連性によって機能し、トレーニングに使用されるプロファイルの多くはほぼ一意であるため、研究で実証されているように、アルゴリズムは本質的にトレーニングデータの多くをその構造にエンコードします。」 理解するために例を挙げてみましょう。あなたの隣人は、病院の診断ツールのトレーニングに自分の医療データを使用することに同意しました。悪意のある人物は、彼の身長、年齢、居住地の郵便番号などの情報を持っています。このデータと病院がトレーニングしたモデルを使用することで、トレーニングに使用されたデータが匿名化されていたとしても、その人物はあなたの隣人に関する情報の一部を取得する可能性があります。 ジレンマが見えてきた 訓練されたモデルへのアクセスが保護されていれば、この話はそれほど恐ろしいものではないだろう。しかし、ヴィダル教授によると、既存の保護技術は、適用の難しさや予測性能の面でのコストがかかることから、すべてのセクターで採用されるにはほど遠い。多くのモデルは、透明性や監査上の理由から、直接的または間接的に公開されている。たとえば、欧州AI法第13条は、医療機器や採用ソフトウェアなどのいわゆる「高リスク」人工知能システムにそのような透明性の制約を課している。「これは本当に難しいことです」とヴィダル教授は説明する。「一方では、これらのモデルを公開することがしばしば必要ですが、他方では、個人データの機密性とセキュリティは法的要件です。」 同氏は、企業や研究者は学習モデルの開発と使用の全過程においてデータ保護を確実にするための措置を講じることが不可欠だと述べています。「これには、倫理的なデータ収集方法の採用、差分プライバシーなどのデータ保護技術の使用、データプライバシーの重要性に関するユーザー教育が含まれます」と同氏は言います。 「ランダムフォレスト」タイプのアルゴリズムについて 「ランダム フォレスト」タイプのアルゴリズムの図。 ランダム フォレスト アルゴリズムは、堅牢性と大量のデータ処理能力で知られています。このアルゴリズムは、トレーニング データのランダムなサブセットから構築された複数の決定木の予測を組み合わせることで機能します。このツリーの多様性により、エラーが削減され、最終結果の全体的な精度が向上します。 この種のアルゴリズムに基づくモデルではトレーニング データを保護できないことを実証するために、モントリオール工科大学のチームは、いわゆる「組み合わせ最適化」ツールを使用してモデルによって提供される情報を正確にエンコードし、その構造と一致する新しいバージョンのトレーニング データを再構築するという新しい攻撃パラダイムを採用しました。したがって、データ再構築のアプローチは、数独のマス目を埋めるために使用される戦略といくつかの点で似ています。 「これは大規模に解決するのが難しい問題ですが、この種の解決に特化したアルゴリズムはすでに、何千ものトレーニング例や何百ものツリーを含むケースを処理できます」とポリテクニークの教授は説明します。「再構築エラーは0%に近づくことが多く、これは攻撃者がすべてのトレーニングデータを非常に正確に復元することを意味します。」 もっと詳しく知る 専門知識シート ティボー・ヴィダル教授 サイト 数学・経営工学科 研究 訓練されたランダムフォレストがデータセットを完全に明らかにする、第 41 回国際機械学習会議での口頭発表が承認されました #モントリオール工科大学…

モントリオール工科大学 – AIアルゴリズムのセキュリティ侵害:個人情報の追跡が数独を解くのと同じくらい簡単になる

1723102840
2024-08-08 04:00:23

匿名化された個人データで訓練された人工知能(AI)アルゴリズムは、意思決定の改善と迅速化のためにさまざまな分野で導入されつつあります。しかし、モントリオール工科大学のチームは、最近発表された研究で、その一部に警鐘を鳴らしています。「ランダムフォレスト」アルゴリズムは、訓練に使用されたデータを簡単に明らかにする可能性があります。この研究は、これらのアルゴリズムの使用だけでなく、匿名化されたデータの使用にも疑問を投げかけています。

誰もが数独パズルに挑戦したことがあるでしょう。いくつかの開始点があれば、欠けている数字をどこに足すか考えることができます。時には間違えることもありますが、それでも挑戦するのは楽しいものです。

では、数字をあなたの個人情報に置き換えたと想像してください。身長、住所、生年月日だけを情報として持っていても、例えば、あなたの医療データをすべて取得したり、信用情報を入手したりすることができます。ゲームが楽しくなくなるかもしれません。

しかし、このシナリオはそれほど遠くない将来に実現する可能性もあります。

これは、モントリオール工科大学の数学・産業工学部の准教授ティボー・ヴィダルが率いるチームが提案しているものだ。 研究 この研究は、オーストリアのウィーンで開催された第41回国際機械学習会議で昨年7月に発表された。この会議は世界で最も有名な機械学習会議の1つで、提出された1万件の論文のうち、口頭発表に選ばれるのはわずか160件である。研究グループは論文の中で、一部の人工知能(AI)モデルのトレーニングに使用されるデータのプライバシーについて疑問を提起している。

ティボー・ビダル教授 (写真:ティエリー・デュ・ボワ)

モントリオール工科大学の SCALE-AI 教授に所属するジュリアン・フェリー、リカルド・フカサワ、ティモシー・パスカル、ヴィダル教授らが行った研究では、人工知能で使用される特定の種類のアルゴリズム、ランダム フォレストが問題を抱えていることが明らかになっています。これらのアルゴリズムは、スパムを排除するために電子メールを分類したり、ソーシャル ネットワークで広告をターゲットにしたりするなど、さまざまな機能を実行するために使用されます。また、医療診断や個人の信用分析など、さまざまな機能にも使用されています。

そして、特にこのような用途では、靴が締め付けられる可能性があります。

「ランダムフォレストのような機械学習モデルは、個人の特定の名前や属性を保存せずに、大量のデータから相関関係や洞察を抽出できる強力なツールです」とヴィダル氏は言う。「このツールは関連性によって機能し、トレーニングに使用されるプロファイルの多くはほぼ一意であるため、研究で実証されているように、アルゴリズムは本質的にトレーニングデータの多くをその構造にエンコードします。」

理解するために例を挙げてみましょう。あなたの隣人は、病院の診断ツールのトレーニングに自分の医療データを使用することに同意しました。悪意のある人物は、彼の身長、年齢、居住地の郵便番号などの情報を持っています。このデータと病院がトレーニングしたモデルを使用することで、トレーニングに使用されたデータが匿名化されていたとしても、その人物はあなたの隣人に関する情報の一部を取得する可能性があります。

ジレンマが見えてきた

訓練されたモデルへのアクセスが保護されていれば、この話はそれほど恐ろしいものではないだろう。しかし、ヴィダル教授によると、既存の保護技術は、適用の難しさや予測性能の面でのコストがかかることから、すべてのセクターで採用されるにはほど遠い。多くのモデルは、透明性や監査上の理由から、直接的または間接的に公開されている。たとえば、欧州AI法第13条は、医療機器や採用ソフトウェアなどのいわゆる「高リスク」人工知能システムにそのような透明性の制約を課している。「これは本当に難しいことです」とヴィダル教授は説明する。「一方では、これらのモデルを公開することがしばしば必要ですが、他方では、個人データの機密性とセキュリティは法的要件です。」

同氏は、企業や研究者は学習モデルの開発と使用の全過程においてデータ保護を確実にするための措置を講じることが不可欠だと述べています。「これには、倫理的なデータ収集方法の採用、差分プライバシーなどのデータ保護技術の使用、データプライバシーの重要性に関するユーザー教育が含まれます」と同氏は言います。

「ランダムフォレスト」タイプのアルゴリズムについて

「ランダム フォレスト」タイプのアルゴリズムの図。

ランダム フォレスト アルゴリズムは、堅牢性と大量のデータ処理能力で知られています。このアルゴリズムは、トレーニング データのランダムなサブセットから構築された複数の決定木の予測を組み合わせることで機能します。このツリーの多様性により、エラーが削減され、最終結果の全体的な精度が向上します。

この種のアルゴリズムに基づくモデルではトレーニング データを保護できないことを実証するために、モントリオール工科大学のチームは、いわゆる「組み合わせ最適化」ツールを使用してモデルによって提供される情報を正確にエンコードし、その構造と一致する新しいバージョンのトレーニング データを再構築するという新しい攻撃パラダイムを採用しました。したがって、データ再構築のアプローチは、数独のマス目を埋めるために使用される戦略といくつかの点で似ています。

「これは大規模に解決するのが難しい問題ですが、この種の解決に特化したアルゴリズムはすでに、何千ものトレーニング例や何百ものツリーを含むケースを処理できます」とポリテクニークの教授は説明します。「再構築エラーは0%に近づくことが多く、これは攻撃者がすべてのトレーニングデータを非常に正確に復元することを意味します。」

もっと詳しく知る

専門知識シート ティボー・ヴィダル教授
サイト 数学・経営工学科
研究 訓練されたランダムフォレストがデータセットを完全に明らかにする、第 41 回国際機械学習会議での口頭発表が承認されました

#モントリオール工科大学 #AIアルゴリズムのセキュリティ侵害個人情報の追跡が数独を解くのと同じくらい簡単になる

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。