がんは、DNA 配列の順序や、DNA と呼ばれる DNA 上の化学タグなど、生物学的設計図のいくつかの層を破壊します。 メチル化。がん患者の場合、結腸や皮膚などの場所から直接採取された腫瘍サンプルには、正常なレベルのメチル化を持つ健康な細胞と、異常なメチル化を持つがん細胞の混合物が含まれています。この混合物により、医師がそれらを区別し、どのメチル化シグナルが実際に腫瘍から来ているのかを判断することが困難になります。
さらに、腫瘍を直接採取するには、多くの場合、患者に痛みを伴う手術が必要です。一部の科学者は、初期診断の代替手段として患者の血液を採取することを提案しています。しかし、血液サンプルも同じ問題に直面しており、多くの場合、微量のがん DNA しか含まれていません。
過去に科学者たちは、患者のサンプルから採取した多くの DNA 断片の平均メチル化レベルを要約して、そこに含まれるがん DNA と正常 DNA の量を推定しました。しかし、この従来の方法では、患者の DNA のまれで非常に微妙な破壊に関する貴重な情報が失われます。ドイツとベルギーの研究者らは、この失われた情報はがんを早期に発見し診断するために重要であると主張した。そこで、彼らは、と呼ばれる新しい計算ツールを導入しました。 メチルバート この課題に対処するために。このツールは、DNA 配列の個々の文字列を使用して DNA メチル化を分析します。 シーケンスリードこれらの微妙なディテールを保持しています。
チームは、ChatGPT などの最新の言語モデルを強化するのと同じテクノロジーを使用して MmethylBERT を構築しました。 変圧器のアーキテクチャ。彼らはこのテクノロジーを、人間の言葉ではなく DNA の言語とそのメチル化シグナルを理解するために再利用しました。読み取られた各配列は、モデルが腫瘍 DNA と正常 DNA の違いを研究し学習するための短い「文」として機能しました。
研究者らは MmethylBERT を 2 段階で訓練しました。まず、彼らはそれを人間の DNA のテンプレート データセットに公開しました。 ヒト参照ゲノム。彼らはこのデータセットを使用して、メチル化や病気に関する情報がなくても、DNA 配列のパターンを認識するようにモデルを学習させました。それは、追加の文脈を持たずに、単語を構成するアルファベットだけを使って読むように生徒に教えるようなものです。このシステムは、さまざまな 3 文字の DNA の組み合わせを区別することを学習し、一部の塩基、特に ATCG の C と G が特定のパターンで発生することを認識しました。研究者らは、この事前トレーニングステップをスキップすると、モデルが癌細胞と正常細胞を正確に分類できなくなるため、この事前トレーニングステップが不可欠であることを発見しました。
次に、実際のがんサンプルと健康なサンプルからの DNA 配列を使用して事前トレーニング済みモデルを微調整し、既知の腫瘍固有のメチル化パターンを認識するようにモデルに学習させました。この戦略は、単語に文脈や意味を追加するために、句読点やイディオムなどの他の文法要素を生徒に教えるのと似ています。このモデルは、DNA の一部の領域では腫瘍では高レベルのメチル化があり、正常細胞では低レベルまたはゼロのメチル化があり、その逆も同様であることを学習しました。研究者らは、各 DNA 断片が腫瘍または正常組織に由来する可能性を示す確率スコアを出力するシステムを設計しました。
チームは、さまざまなレベルの複雑さでシミュレートされた DNA 配列データを使用して、既存の方法に対して MmethylBERT をテストしました。彼らは、従来の方法では困難であったのに対し、ゲノム内の配列読み取りがわずかしかない位置の DNA 断片を分析する場合でも、彼らの方法は癌 DNA を検出するのに非常に正確であることを実証しました。また、結腸直腸がんおよび膵臓がん患者の血液中の非常に微量の腫瘍 DNA を検出することもでき、非外科的がん検出における潜在的な使用をさらに実証しました。
科学者らは、モデルがヒトゲノムデータでトレーニングされるのに長い時間がかかることを発見したため、マウスゲノムで事前トレーニングされたモデルがヒトのがんサンプルも分析できるかどうかをテストしました。彼らは、マウスで訓練されたモデルがヒトのがんデータに適用された場合、人間で訓練されたモデルとほぼ同じパフォーマンスを示し、確率分布にわずかな差しか生じないことを発見しました。彼らは、この観察は、DNA が哺乳類全体で一貫して組織化されており、モデルがある生物から学んだ知識を別の生物に適用できるという考えによるものであると考えました。
研究者らは、メチル化シグナルの複雑さやサンプル中の腫瘍 DNA のサイズに関係なく、MeticBERT はあらゆるシーケンス プラットフォームから取得した DNA 配列データ内のがん DNA を識別できると結論付けました。彼らはまた、MmethylBERT の現在のバージョンではトレーニングと使用に大規模な計算リソースが必要なため、より効率的なバージョンの開発にすでに着手していることにも言及しました。
投稿の閲覧数: 31
1770898316
#複雑な組織の混合物からがん細胞を見つける #Sciworthy
2026-02-12 12:00:00