日本語版
最新ニュース
世界

「AI 生成データの永久機関と「科学者」としての ChatGPT の気晴らし」への回答

ジェニファー・リストガーテンの議論の多くは説得力があります。特に、タンパク質の折り畳み問題は、問題を述べる正確な方法とパフォーマンスを測定する方法、そして利用可能なデータの量の両方の点で、科学における他の壮大な課題と比べて外れ値であるということです。 、高品質のデータ1。 しかし、既存の生物学的データベースは、大規模な言語モデルを訓練するために使用される大要に比べて小さい傾向にありますが、生物学的データの 1 つのタイプである全ゲノム配列決定が、これまで主張されてきたこととは逆に、間もなく大規模な規模で生成されることはもっともらしいと思われます。1。 ゲノム配列決定のコストが下がり、ゲノムデータの臨床利用の可能性が高まるにつれ、全員を完全に配列決定することは経済的に合理的になります。 30 億塩基対の個々のゲノムはそれぞれ 3,000 万個の固有の塩基として表現できるため、米国の人口 3 億人の完全配列を解析すると、合計 9 × 10 が得られます。15 これは、大規模な言語モデルのトレーニングに使用される 400 テラバイトの Common Crawl データセットに匹敵するサイズです。 このようなデータを使用して大規模な機械学習モデルをトレーニングすることは、プライバシーを考慮するため困難になります。 それにもかかわらず、私はそのようなモデルを膨大なゲノムデータに基づいて構築できる少なくとも 4 つの道があると考えています。最初のパスにはフェデレーション データ アクセスが含まれます。 フェデレーション アプローチでは、ソフトウェアを使用して複数のデータベースを 1 つとして機能できるようにし、自律性と分散化を維持しながら相互運用性を促進します。2。 連合の機能は、英国バイオバンク、NIH All of Us、フィンランドの FinnGen イニシアチブなどの既存のゲノム…

「AI 生成データの永久機関と「科学者」としての ChatGPT の気晴らし」への回答

1714719487
2024-05-01 00:00:00

ジェニファー・リストガーテンの議論の多くは説得力があります。特に、タンパク質の折り畳み問題は、問題を述べる正確な方法とパフォーマンスを測定する方法、そして利用可能なデータの量の両方の点で、科学における他の壮大な課題と比べて外れ値であるということです。 、高品質のデータ1。 しかし、既存の生物学的データベースは、大規模な言語モデルを訓練するために使用される大要に比べて小さい傾向にありますが、生物学的データの 1 つのタイプである全ゲノム配列決定が、これまで主張されてきたこととは逆に、間もなく大規模な規模で生成されることはもっともらしいと思われます。1。 ゲノム配列決定のコストが下がり、ゲノムデータの臨床利用の可能性が高まるにつれ、全員を完全に配列決定することは経済的に合理的になります。 30 億塩基対の個々のゲノムはそれぞれ 3,000 万個の固有の塩基として表現できるため、米国の人口 3 億人の完全配列を解析すると、合計 9 × 10 が得られます。15 これは、大規模な言語モデルのトレーニングに使用される 400 テラバイトの Common Crawl データセットに匹敵するサイズです。 このようなデータを使用して大規模な機械学習モデルをトレーニングすることは、プライバシーを考慮するため困難になります。 それにもかかわらず、私はそのようなモデルを膨大なゲノムデータに基づいて構築できる少なくとも 4 つの道があると考えています。

最初のパスにはフェデレーション データ アクセスが含まれます。 フェデレーション アプローチでは、ソフトウェアを使用して複数のデータベースを 1 つとして機能できるようにし、自律性と分散化を維持しながら相互運用性を促進します。2。 連合の機能は、英国バイオバンク、NIH All of Us、フィンランドの FinnGen イニシアチブなどの既存のゲノム バイオバンクによってサポートされています。3、lifebit.ai などの営利団体によってさらに促進されます。 連合アプローチでは、プライバシーの保証を維持しながら、複数のバイオバンクから抽出されたデータから深層学習モデルをトレーニングできます。

連合アプローチはすでに成功していることが証明されていますが、基本的な制限に直面しています。つまり、設計上、ゲノム データはデータベース内の表現型データとしか照合できないということです。 したがって、このアプローチでは、ゲノミクスを電子医療記録や集約された顧客データ プロファイルなどの他の豊富なデータ ソースにリンクすることができなくなります。

大規模なゲノム データでディープ ラーニング モデルをトレーニングするための 2 番目の潜在的なパスには、ハッキングが含まれます。 プライベートとされる消費者データの大規模な漏洩は一般的になっていますが、公的資金が提供されるバイオバンクの高レベルのセキュリティ、漏洩する必要がある膨大な量のデータ、漏洩したデータを外部プロファイルにリンクし、訓練および訓練するために必要なその後のリソース。大規模な機械学習モデルをデプロイすると、この経路はありそうになくなります。

おそらく、ゲノムデータのかなりの部分が自発的にパブリックドメインまたは準パブリックドメインに移行する可能性があります。 個人は、祖先分析、オンラインデート、または All4Cure などの患者サポートグループのためにゲノムプロファイルをアップロードすることを選択できます。4。 このようなデータは、営利団体によって日常的に収集および集約される、ますます詳細な消費者データ プロファイルに組み込まれる可能性があります。 そうしたデータが私たちのオンライン プロフィールに入り始めると、個人のプライバシーを維持するモチベーションが低下します。 結局のところ、個人の親、兄弟、子供のゲノムが公開されると、その個人のゲノムも事実上公開されることになります。

最後に、一部の国家主体が大規模なゲノム モデルを自らトレーニングすることを決定する可能性があります。 政府がゲノムデータ、電子医療記録、消費者データ、法執行機関のデータにアクセスすれば、下流分析用の特に強力なデータセットが得られる可能性があります。

これは、人口規模のゲノムデータを使用して重要な科学的問題に対処できるかどうかという問題につながります。 このようなデータだけでも、人類の進化の歴史についての推論を導き出すことができる可能性があります。 電子医療記録や集約された顧客データ プロファイルと組み合わせて、ゲノム データを使用すると、機械学習モデルが遺伝子型と表現型の関係について推論を導き始めることも可能になる可能性があります。 個人のオンライン履歴 (ソーシャル メディア、購買履歴、ブラウザ履歴) は非常に詳細に把握できるため、そのようなデータの傾向を発見しようとする強い経済的動機がすでに存在します。 このようなデータがゲノムデータや電子医療記録に関連付けられると、それらの傾向はヒトの病気に関連付けられる可能性があります。 したがって、これら 3 種類のデータすべてにアクセスできる自己教師型機械学習システムは、ライフスタイルの選択、医療転帰、遺伝子プロファイルの間の関係を自動的に解明することを学習できる可能性があります。 タンパク質の折り畳みのような、特定の教師付きの壮大な課題を解決するのではなく、この方法で学習するモデルは、科学的仮説生成のエンジンとなる可能性があります。

このようなモデルは深い洞察をもたらす可能性がありますが、提供されたデータの偏りや不正確さも反映します。 政府は自国の集団の特徴を明らかにすることを優先する自然な傾向があるため、現在、ゲノムデータの収集は裕福な国の個人に大きく偏っています。 この傾向は、ゲノムデータを収集してオーダーメイドの医療を可能にする精密医療によってさらに悪化するでしょう。 このようなアプローチは、少なくとも短期的には、より裕福な患者、または少なくとも裕福な国の患者に大きく偏る可能性も高い。 機械学習モデルは、トレーニング データのバイアスを自動的に学習します。たとえば、データセットが肌の色が明るい男性に偏っている場合、白人の男性の顔認識タスクでより高い精度を達成します。5。 このようなバイアスは、変数間の新しい関係を特定しようとする教師なしシステムよりも、顔認識などの明確に定義された設定の方が検出しやすい可能性があります。 このようなシステムでは、バイアスの可能性が、システムが提供する回答だけでなく、システムが尋ねることを決定した質問にも存在するため、リスクが 2 倍になります。 これらすべての考慮事項は、ゲノムデータの収集における公平性の強い必要性と、大規模な機械学習システムにおけるバイアスを特定して軽減するための研究の増加を示唆しています。

#生成データの永久機関と科学者としての #ChatGPT #の気晴らしへの回答

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。