日本語版
最新ニュース
科学&テクノロジー

生成AIを使用すると、MIT化学者は3Dゲノム構造をすばやく計算します| MITニュース

体内のすべての細胞には同じ遺伝的配列が含まれていますが、各細胞はそれらの遺伝子のサブセットのみを発現します。脳細胞が皮膚細胞とは異なることを保証するこれらの細胞特異的遺伝子発現パターンは、各遺伝子のアクセシビリティを制御する遺伝物質の3次元構造によって部分的に決定されます。MIT化学者は、生成的人工知能を使用して、これらの3Dゲノム構造を決定する新しい方法を考え出しました。それらの手法は、わずか数分で数千の構造を予測することができ、構造を分析するための既存の実験方法よりもはるかに速くなります。この手法を使用して、研究者は、ゲノムの3D組織が個々の細胞の遺伝子発現パターンと機能にどのように影響するかをより簡単に研究できます。「私たちの目標は、基礎となるDNA配列から3次元ゲノム構造を予測しようとすることでした」と、化学の准教授であり研究の上級著者であるBin Zhang氏は述べています。 「これができるので、この手法を最先端の実験技術と同等にしているので、多くの興味深い機会を本当に開くことができます。」MITの大学院生であるグレッグ・シューエットとZhuohan Laoは、この論文の主任著者です。 今日に登場します 科学の進歩。シーケンスから構造へ細胞核内では、DNAとタンパク質がクロマチンと呼ばれる複合体を形成し、いくつかのレベルの組織を持つため、細胞は直径が100分の1の100分の1のDNAに2メートルのDNAを詰め込みます。ヒストンと呼ばれるタンパク質の周りのDNA風の長い鎖は、弦のビーズのような構造を生み出します。エピジェネティックな修飾として知られる化学タグは、特定の場所でDNAに取り付けることができ、細胞型によって異なるこれらのタグは、クロマチンの折りたたみと近くの遺伝子のアクセシビリティに影響します。クロマチン立体構造のこれらの違いは、異なる細胞タイプで、または特定の細胞内の異なる時期にどの遺伝子が発現するかを決定するのに役立ちます。過去20年間、科学者はクロマチン構造を決定するための実験的手法を開発してきました。 Hi-Cとして知られる広く使用されている1つの技術は、細胞の核内の隣接するDNA鎖を結びつけることで機能します。その後、研究者は、DNAを多くの小さな断片に細断してシーケンスすることにより、どのセグメントが互いに近くに配置されているかを決定できます。この方法は、細胞の大部分を使用して、クロマチンのセクションの平均構造を計算するか、単一の細胞でその特定の細胞内の構造を決定することができます。ただし、HI-Cおよび同様の手法は労働集約的であり、1つのセルからデータを生成するのに約1週間かかる場合があります。これらの制限を克服するために、Zhangと彼の学生は、生成AIの最近の進歩を利用して、単一細胞のクロマチン構造を予測する高速で正確な方法を作成するモデルを開発しました。彼らが設計したAIモデルは、DNA配列を迅速に分析し、それらの配列が細胞で生成する可能性のあるクロマチン構造を予測できます。「ディープラーニングはパターン認識が得意です」とZhang氏は言います。 「これにより、非常に長いDNAセグメント、数千の塩基対を分析し、それらのDNA塩基対でエンコードされた重要な情報を把握することができます。」研究者が作成したモデルであるChromogenには、2つのコンポーネントがあります。最初のコンポーネントであるディープラーニングモデルは、ゲノムを「読み取る」ことを教えられ、基礎となるDNA配列とクロマチンアクセシビリティデータにエンコードされた情報を分析します。後者は広く利用可能で、細胞型固有です。2番目のコンポーネントは、1100万件以上のクロマチン立体構造で訓練された物理的に正確なクロマチン立体構造を予測する生成AIモデルです。これらのデータは、ヒトBリンパ球のラインから16の細胞にDIP-C(HI-Cのバリアント)を使用した実験から生成されました。統合されると、最初のコンポーネントは生成モデルに、細胞型固有の環境が異なるクロマチン構造の形成にどのように影響するかを通知し、このスキームはシーケンス構造の関係を効果的にキャプチャします。各シーケンスについて、研究者はモデルを使用して多くの可能な構造を生成します。これは、DNAが非常に障害のある分子であるため、単一のDNA配列が多くの異なる可能性のある立体構造を引き起こす可能性があるためです。「ゲノムの構造を予測する主な複雑な要因は、私たちが目指している単一の解決策がないということです。あなたが見ているゲノムのどの部分に関係なく、構造の分布があります。非常に複雑で高次元の統計的分布が非常に困難なことを予測することは、非常に挑戦的なことです」とSchuette氏は言います。迅速な分析訓練されると、モデルはHI-Cや他の実験技術よりもはるかに速いタイムスケールで予測を生成できます。「特定の細胞型で数十構造を取得するために実験を実行する6か月を費やすかもしれませんが、1つのGPUで20分でモデルで特定の領域で1000の構造を生成できます」とSchuette氏は言います。モデルをトレーニングした後、研究者はそれを使用して2,000を超えるDNA配列の構造予測を生成し、それらをそれらの配列の実験的に決定した構造と比較しました。彼らは、モデルによって生成された構造が、実験データで見られるものと同じまたは非常に類似していることを発見しました。「私たちは通常、各シーケンスについて数百または数千の立体配座を見ています。それは、特定の領域が持つことができる構造の多様性の合理的な表現をあなたに与えます」とZhang氏は言います。 「異なるセルで実験を複数回繰り返すと、非常に異なる立体構造になりそうです。それが私たちのモデルが予測しようとしていることです。」また、研究者は、モデルが訓練されたもの以外の細胞型からのデータを正確に予測できることを発見しました。これは、このモデルが、クロマチン構造が細胞型間でどのように異なるか、およびそれらの違いがその機能にどのように影響するかを分析するのに役立つ可能性があることを示唆しています。このモデルを使用して、単一の細胞内に存在する可能性のあるさまざまなクロマチン状態、およびそれらの変化が遺伝子発現にどのように影響するかを探索することもできます。別の可能な用途は、特定のDNA配列の変異がクロマチンの立体構造をどのように変化させるかを調査することです。「このタイプのモデルで対処できると思う興味深い質問がたくさんあります」とZhang氏は言います。研究者はすべてのデータとモデルを作成しました 利用可能 それを使いたい他の人に。この研究は、国立衛生研究所によって資金提供されました。 #生成AIを使用するとMIT化学者は3Dゲノム構造をすばやく計算します #MITニュース

生成AIを使用すると、MIT化学者は3Dゲノム構造をすばやく計算します| MITニュース

1738508973
2025-01-31 19:00:00

体内のすべての細胞には同じ遺伝的配列が含まれていますが、各細胞はそれらの遺伝子のサブセットのみを発現します。脳細胞が皮膚細胞とは異なることを保証するこれらの細胞特異的遺伝子発現パターンは、各遺伝子のアクセシビリティを制御する遺伝物質の3次元構造によって部分的に決定されます。

MIT化学者は、生成的人工知能を使用して、これらの3Dゲノム構造を決定する新しい方法を考え出しました。それらの手法は、わずか数分で数千の構造を予測することができ、構造を分析するための既存の実験方法よりもはるかに速くなります。

この手法を使用して、研究者は、ゲノムの3D組織が個々の細胞の遺伝子発現パターンと機能にどのように影響するかをより簡単に研究できます。

「私たちの目標は、基礎となるDNA配列から3次元ゲノム構造を予測しようとすることでした」と、化学の准教授であり研究の上級著者であるBin Zhang氏は述べています。 「これができるので、この手法を最先端の実験技術と同等にしているので、多くの興味深い機会を本当に開くことができます。」

MITの大学院生であるグレッグ・シューエットとZhuohan Laoは、この論文の主任著者です。 今日に登場します 科学の進歩

シーケンスから構造へ

細胞核内では、DNAとタンパク質がクロマチンと呼ばれる複合体を形成し、いくつかのレベルの組織を持つため、細胞は直径が100分の1の100分の1のDNAに2メートルのDNAを詰め込みます。ヒストンと呼ばれるタンパク質の周りのDNA風の長い鎖は、弦のビーズのような構造を生み出します。

エピジェネティックな修飾として知られる化学タグは、特定の場所でDNAに取り付けることができ、細胞型によって異なるこれらのタグは、クロマチンの折りたたみと近くの遺伝子のアクセシビリティに影響します。クロマチン立体構造のこれらの違いは、異なる細胞タイプで、または特定の細胞内の異なる時期にどの遺伝子が発現するかを決定するのに役立ちます。

過去20年間、科学者はクロマチン構造を決定するための実験的手法を開発してきました。 Hi-Cとして知られる広く使用されている1つの技術は、細胞の核内の隣接するDNA鎖を結びつけることで機能します。その後、研究者は、DNAを多くの小さな断片に細断してシーケンスすることにより、どのセグメントが互いに近くに配置されているかを決定できます。

この方法は、細胞の大部分を使用して、クロマチンのセクションの平均構造を計算するか、単一の細胞でその特定の細胞内の構造を決定することができます。ただし、HI-Cおよび同様の手法は労働集約的であり、1つのセルからデータを生成するのに約1週間かかる場合があります。

これらの制限を克服するために、Zhangと彼の学生は、生成AIの最近の進歩を利用して、単一細胞のクロマチン構造を予測する高速で正確な方法を作成するモデルを開発しました。彼らが設計したAIモデルは、DNA配列を迅速に分析し、それらの配列が細胞で生成する可能性のあるクロマチン構造を予測できます。

「ディープラーニングはパターン認識が得意です」とZhang氏は言います。 「これにより、非常に長いDNAセグメント、数千の塩基対を分析し、それらのDNA塩基対でエンコードされた重要な情報を把握することができます。」

研究者が作成したモデルであるChromogenには、2つのコンポーネントがあります。最初のコンポーネントであるディープラーニングモデルは、ゲノムを「読み取る」ことを教えられ、基礎となるDNA配列とクロマチンアクセシビリティデータにエンコードされた情報を分析します。後者は広く利用可能で、細胞型固有です。

2番目のコンポーネントは、1100万件以上のクロマチン立体構造で訓練された物理的に正確なクロマチン立体構造を予測する生成AIモデルです。これらのデータは、ヒトBリンパ球のラインから16の細胞にDIP-C(HI-Cのバリアント)を使用した実験から生成されました。

統合されると、最初のコンポーネントは生成モデルに、細胞型固有の環境が異なるクロマチン構造の形成にどのように影響するかを通知し、このスキームはシーケンス構造の関係を効果的にキャプチャします。各シーケンスについて、研究者はモデルを使用して多くの可能な構造を生成します。これは、DNAが非常に障害のある分子であるため、単一のDNA配列が多くの異なる可能性のある立体構造を引き起こす可能性があるためです。

「ゲノムの構造を予測する主な複雑な要因は、私たちが目指している単一の解決策がないということです。あなたが見ているゲノムのどの部分に関係なく、構造の分布があります。非常に複雑で高次元の統計的分布が非常に困難なことを予測することは、非常に挑戦的なことです」とSchuette氏は言います。

迅速な分析

訓練されると、モデルはHI-Cや他の実験技術よりもはるかに速いタイムスケールで予測を生成できます。

「特定の細胞型で数十構造を取得するために実験を実行する6か月を費やすかもしれませんが、1つのGPUで20分でモデルで特定の領域で1000の構造を生成できます」とSchuette氏は言います。

モデルをトレーニングした後、研究者はそれを使用して2,000を超えるDNA配列の構造予測を生成し、それらをそれらの配列の実験的に決定した構造と比較しました。彼らは、モデルによって生成された構造が、実験データで見られるものと同じまたは非常に類似していることを発見しました。

「私たちは通常、各シーケンスについて数百または数千の立体配座を見ています。それは、特定の領域が持つことができる構造の多様性の合理的な表現をあなたに与えます」とZhang氏は言います。 「異なるセルで実験を複数回繰り返すと、非常に異なる立体構造になりそうです。それが私たちのモデルが予測しようとしていることです。」

また、研究者は、モデルが訓練されたもの以外の細胞型からのデータを正確に予測できることを発見しました。これは、このモデルが、クロマチン構造が細胞型間でどのように異なるか、およびそれらの違いがその機能にどのように影響するかを分析するのに役立つ可能性があることを示唆しています。このモデルを使用して、単一の細胞内に存在する可能性のあるさまざまなクロマチン状態、およびそれらの変化が遺伝子発現にどのように影響するかを探索することもできます。

別の可能な用途は、特定のDNA配列の変異がクロマチンの立体構造をどのように変化させるかを調査することです。

「このタイプのモデルで対処できると思う興味深い質問がたくさんあります」とZhang氏は言います。

研究者はすべてのデータとモデルを作成しました 利用可能 それを使いたい他の人に。

この研究は、国立衛生研究所によって資金提供されました。

#生成AIを使用するとMIT化学者は3Dゲノム構造をすばやく計算します #MITニュース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。