1738533528
2025-02-02 07:27:00
私たちの体内の各細胞には同じ遺伝的配列が含まれていますが、各細胞はこれらの遺伝子のサブセットを1つしか発現していません。脳細胞が皮膚細胞と異なることを保証する遺伝子発現の各細胞標準のこれらの詳細は、各遺伝子のアクセシビリティを制御する遺伝物質の3次元構造によって部分的に決定されます。
彼の化学者 mit 生産性を使用して、これら3つの次元ゲノム構造を特定する新しい方法を考え出しました 人工知能。彼らのテクニック 数分で数千の構造を予測できます、構造を分析する既存の実験方法よりもはるかに高速になります。
この手法を使用して、 研究者 彼らは、3次元ゲノム組織が個々の細胞の遺伝子発現のパターンと機能にどのように影響するかをより簡単に研究できます。
«私たちの目標は、基礎となるDNA配列から3次元ゲノム構造を予測しようとすることでした「、化学の准教授であり、研究の主な著者であるビン・チャンは言う。 「これを行うことができたので、このテクニックをピークの実験技術と同じレベルに置くことは、多くの興味深い見通しを本当に開くことができます»。
細胞カーネルの内部では、DNAとタンパク質がクロマチンと呼ばれるクラスターを形成します。 直径1 cmのコアに細胞が2メートルのDNAを収めることができます。長いDNA鎖は、組織と呼ばれるタンパク質に包まれており、コードのビーズのように見える構造を作成します。
エピジェネティックな修飾として知られる化学ラベルは、DNAに特定の位置に結合することができ、これらのラベルは細胞型によって異なり、クロマチンの折りたたみと近くの遺伝子のアクセシビリティに影響します。クロマチン構成のこれらの違いは、異なる細胞タイプまたは特定の細胞内の異なる時期に発現する遺伝子の測定に寄与します。
過去20年間で、科学者はクロマチン構造を決定するための実験技術を開発しました。広く使用されているテクニック、 hi-cとして知られています、隣接するDNA鎖を細胞の核に接続することにより動作します。その後、研究者は、どの部分が互いに近くにあるかを決定し、DNAを多くの小さな部分にカットし、そのシーケンスを分析できます。
この方法は、大きな細胞集団で使用して、クロマチンの一部の平均構造または個々の細胞の平均構造を計算して、特定の細胞内の構造を決定できます。しかし、 HI-Cおよび同様の手法は、セルからデータを作成するのに約1週間かかる場合があります。
これらの制限を克服するために、 チャン そして彼の学生は、最近の開発を活用するモデルを開発しました 生産的なAI 個々の細胞のクロマチン構造を予測する迅速かつ正確な方法を作成する。彼らが設計したAIモデルは、DNA配列を迅速に分析し、これらの配列が細胞内で生成できるクロマチン構造を予測することができます。
深い学習は、パターンを認識するのに本当に良いです。これにより、非常に大きなDNAセグメント、数千の塩基を分析し、これらのDNAベースで重要な情報がどのようなものであるかを理解することができます。
クロモゲン、研究者によって作成されたモデルがあります 2つのコンポーネント。または 初め 1つです ディープラーニングモデル ゲノムを「読み取る」ように教えられ、基礎となるDNA配列でコード化された情報とクロマチンのアクセシビリティデータを分析します。後者は広く利用可能で、特定の細胞タイプに関連しています。
または 2番目のコンポーネント 1つです 生産モデルAI これは、自然に正確な構成を予測します クロマチン、持っている 1100万件以上の構成でトレーニングされています 彼女。これらのデータは、一連のヒトBリンパ球の16細胞にDIP-C(Hi-Cバリアント)を使用した実験から得られました。
組み込まれると、最初のコンポーネントは、環境関連の環境がさまざまなクロマチン構造の形成にどのように影響するかの生産的なモデルを通知し、この形状はシーケンス構造の関係を効果的にキャプチャします。各シーケンスについて、研究者はモデルを使用して多くの可能な構造を作成します。これは、DNAが非常に障害のある分子であるため、単一のDNA配列が多くの異なる可能な構成を引き起こす可能性があるためです。
«ゲノム構造の予測を複雑にする重要な要素は、ターゲットにしている単一の解決策がないことです。私たちが考慮するゲノムの一部に関係なく、構造の分布があります。この非常に複雑で多次元統計的分布の予測は、信じられないほどの課題であるものです“、メモ グレッグ・シューエット。
訓練されると、このモデルは、HI-Cや他の実験技術よりもはるかに高速な時間スケールで予測を生成できます。
«特定のタイプのセルで数十個の構造を見つけるために実験することで6か月を費やすことができますが、1つのGPUで20分でモデルで特定の領域に1000の構造を作成できます。「、 スクエット。
彼らのモデルをトレーニングした後、 研究者はそれを使用して、2,000を超えるDNAシーケンスの構造予測を作成します そして、これらのシーケンスについて実験的に識別された構造と比較しました。 彼らは見つけました 生産した構造 モデル だった 実験データで観察されたものと同じまたは非常によく似ています。
«私たちは通常、各シーケンスの数百または数千の構成を見ていますが、これにより、特定の領域が持つ可能性のある構造の多様性の論理的表現が得られます。「Zhangは言う。 「さまざまなセルで実験を何度も繰り返すと、非常に異なる構成を思いつく可能性が非常に高くなります。これは私たちのモデルを予測しようとしています»。
また、研究者は、モデルが訓練されたもの以外の細胞タイプからのデータを正確に予測できることを発見しました。これは、このモデルが、クロマチン構造が細胞タイプ間で異なる方法と、これらの違いがその機能にどのように影響するかを分析するのに役立つ可能性があることを示唆しています。このモデルを使用して、単一の細胞に存在する可能性のあるさまざまなクロマチン条件と、これらの変化が遺伝子発現にどのように影響するかを調査することもできます。
別の可能な用途は、特定のDNA配列の変異がクロマチン構成を変化させる方法を調査することです。これらの変異が疾患を引き起こす可能性のある方法に光を当てる可能性があります(例:がん)。
研究者は、すべてのデータとモデルを使用したい他のデータとモデルを割り当てています。
MITの大学院生、 グレッグ・シューエット そして Zhuohan Lao 彼らは科学の進歩に掲載された作品の主要な著者です。
[via]
#前例のない速度で3Dゲノム構造を予測するAI