日本語版
最新ニュース
健康

医療における合成データの可能性と危険性を乗り越える

サマセットハウスが大規模な展示会「ビッグバンデータ」を開催。 (写真提供: Peter Macdiarmid/Getty Images ... [+] サマセットハウス)ゲッティ 世界の医療業界が人材不足で崩壊し続ける中、人工知能は公共部門と民間部門の両方にとって救いの策として宣伝されています。 このテクノロジーは、スキャンから腫瘍を検出するなどのタスクを学習して処理する能力を備えているため、医療従事者の過労を軽減し、最高品質のケアの提供に集中する時間を与えることができる可能性があります。 ただし、AI が完全に機能するにはデータが必要です。 モデルが完全で偏りのない高品質のデータに基づいてトレーニングされていない場合、出力は基準に達しません。 何らかの能力で AI を活用しようとしているほとんどの医療機関にとって、この特定の側面は非常に骨の折れる作業です。 関与する患者データの機密性だけでも、プライバシーと機密性の要件を同時に満たしながら情報を収集して活用することが非常に困難になります。 ここで、「合成データ」と呼ばれる、まったく新しい代替手段が登場します。 米国国勢調査局によると、合成データは、現実世界のデータの統計的特性を模倣するために統計モデルまたはコンピューター アルゴリズムを使用して生成された人工のマイクロデータです。 医療研究、公衆衛生、医療情報技術における実際のデータを増強または置き換えることができるため、組織は実際の患者情報を収集して使用する煩わしさから解放されます。 合成データと元のデータの比較作者が作成した画像 合成データを正確に作成して導入すると、医療 AI モデルを改善できるだけでなく、新しい治療法の情報を提供し、証拠に基づいた政策立案を促進し、患者のアドヒアランスを高め、アウトブレイクへの対応を改善することもできます。 電子医療記録や医療請求データセットから患者の状態レポートに至るまで、当面のユースケースに応じてあらゆる形式で生成できます。 なぜ医療に合成データが必要なのか? 多くの人が現実世界の情報よりも合成データを好む最大の理由の 1 つは、プライバシー上の利点です。 合成データは、データセットに含まれる分析値は保持されますが、個人を特定できる情報はすべて非識別値に置き換えられる方法で生成されます。 これにより、内部使用のためのデータの容易な利用と共有が可能になり、同時に ID が特定の記録にリンクされたり、再識別の目的で使用されたりすることがなくなります。 PII を偽のデータに置き換えることにより、プロセス全体を通じて組織が GDPR や…

医療における合成データの可能性と危険性を乗り越える

1706350247
2024-01-27 05:01:52

世界の医療業界が人材不足で崩壊し続ける中、人工知能は公共部門と民間部門の両方にとって救いの策として宣伝されています。 このテクノロジーは、スキャンから腫瘍を検出するなどのタスクを学習して処理する能力を備えているため、医療従事者の過労を軽減し、最高品質のケアの提供に集中する時間を与えることができる可能性があります。

ただし、AI が完全に機能するにはデータが必要です。 モデルが完全で偏りのない高品質のデータに基づいてトレーニングされていない場合、出力は基準に達しません。 何らかの能力で AI を活用しようとしているほとんどの医療機関にとって、この特定の側面は非常に骨の折れる作業です。 関与する患者データの機密性だけでも、プライバシーと機密性の要件を同時に満たしながら情報を収集して活用することが非常に困難になります。

ここで、「合成データ」と呼ばれる、まったく新しい代替手段が登場します。

米国国勢調査局によると、合成データは、現実世界のデータの統計的特性を模倣するために統計モデルまたはコンピューター アルゴリズムを使用して生成された人工のマイクロデータです。 医療研究、公衆衛生、医療情報技術における実際のデータを増強または置き換えることができるため、組織は実際の患者情報を収集して使用する煩わしさから解放されます。

合成データを正確に作成して導入すると、医療 AI モデルを改善できるだけでなく、新しい治療法の情報を提供し、証拠に基づいた政策立案を促進し、患者のアドヒアランスを高め、アウトブレイクへの対応を改善することもできます。 電子医療記録や医療請求データセットから患者の状態レポートに至るまで、当面のユースケースに応じてあらゆる形式で生成できます。

なぜ医療に合成データが必要なのか?

多くの人が現実世界の情報よりも合成データを好む最大の理由の 1 つは、プライバシー上の利点です。

合成データは、データセットに含まれる分析値は保持されますが、個人を特定できる情報はすべて非識別値に置き換えられる方法で生成されます。 これにより、内部使用のためのデータの容易な利用と共有が可能になり、同時に ID が特定の記録にリンクされたり、再識別の目的で使用されたりすることがなくなります。

PII を偽のデータに置き換えることにより、プロセス全体を通じて組織が GDPR や HIPAA などの規制に確実に準拠し続けることが保証されます。

合成データセットは、プライバシーだけでなく、組織が従来の方法で現実世界のデータへのアクセスと維持に費やす時間とリソースの節約にも役立ちます。 これらは、企業が複雑なデータ共有契約、プライバシー規制、データ アクセス制限に取り組む必要がなく、元のデータを正確に表します。

現実世界のデータの制限が合成データによって取り除かれると、組織はプライマリ アプリケーションを超えてデータセットを柔軟に活用できるようになります。 これには、学生が合成臨床データを使用して現実的な症例について学び、実践できる教育目的や、業界での広範なコラボレーションや知識共有のためのデータの公開が含まれる可能性があります。 後者は、研究者、データサイエンティスト、イノベーターがヘルスケアの研究開発の進歩のためにデータを使用できるようにするため、ここでは特に重要です。

現在医療分野で一般的に利用可能な合成データセットには、CMS、SyntheticMass、米国合成世帯人口データベースによって公開されている DE-SynPUF ファイルがあります。

しかし、それだけではありません。

合成データは、既存の医療データセットを拡張および一般化するのにも役立ちます。 組織は実際のデータ リソースと合成データ リソースを組み合わせることができるため、研究者は利用可能なデータの範囲と多様性を拡大でき、より堅牢な分析と洞察を得ることができます。 このプロセスにより、データ不足と異質性の課題を簡単に克服でき、より包括的な研究が可能になり、集団の健康傾向をより深く理解できるようになります。

注目すべきことに、人工データセットは、健康状態、人口特性、疾患パターンをより包括的に理解するためによく使用されるデータ連携方法やアルゴリズムのテストにも役立ちます。

すべての段階で注意が必要です

合成データは実世界のデータに比べて大きな利点を約束しますが、どの段階でも気軽に利用できるものではありません。

たとえば、データの生成に使用されている統計モデルやアルゴリズムに何らかの欠陥や偏りがある場合、出力の信頼性や精度が予想よりも低くなり、下流のアプリケーションに影響を与える可能性があります。 同様に、情報が部分的にしか保護されていない場合、悪意のある者によって再識別される可能性があります。

このようなケースの 1 つは、合成データに次のものが含まれる場合に発生する可能性があります。 外れ値または固有のデータポイント、少数のレコードにしか存在しない珍しい状態のようなものです。 元のデータセットに簡単にリンクできます。 特に攻撃者が合成データと生成モデルの両方にアクセスできる場合、敵対的機械学習技術を使用して合成データ内のレコードを再識別することもできます。

ただし、この問題は、生成プロセスに差分プライバシーや開示制御などの技術を含めることによって回避することもできます。 前者はデータにノイズを追加しますが、後者は情報の変更と摂動を伴います。

合成データを生成するプロセス全体は非常に複雑かつ不透明になる可能性があり、透明性や再現性などの側面が制限される可能性があります。 チームメイトや研究者も潜在的なリスクに縛られることなく同じアプローチに確実に従うことができるように、チームは合成データの生成に使用された方法を文書化して共有することに常に努めるべきです。

さらに、作成された合成データの正確性と信頼性を徹底的な検証と検証によって評価する必要があります。 検証方法。 データが優れているほど、下流のアプリケーションもより細かくなります。

#医療における合成データの可能性と危険性を乗り越える

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。