日本語版
最新ニュース
世界

InstaDeep オープンソースのゲノミクス AI モデルヌクレオチドトランスフォーマー

からの研究者 インスタディープ そして エヌビディア オープンソース化している ヌクレオチドトランスフォーマー (NT)、ゲノミクス データの基礎モデルのセット。最大の NT モデルには 25 億のパラメーターがあり、850 種の遺伝子配列データに基づいてトレーニングされました。いくつかのゲノミクスベンチマークにおいて、他の最先端のゲノミクス基盤モデルよりも優れたパフォーマンスを発揮します。 インスタディープが公開したのは、 モデルの技術的な説明 で 自然。 NT はエンコーダ専用の Transformer アーキテクチャを使用しており、NT と同じマスクされた言語モデル目標を使用して事前トレーニングされています。 バート。事前トレーニングされた NT モデルは 2 つの方法で使用できます。1 つは小規模なモデルの特徴として使用するためのエンベディングを生成するため、もう 1 つは言語モデルのヘッドを置き換えるタスク固有のヘッドで微調整するためです。 InstaDeep は NT を評価しました 18の下流タスクエピジェネティックマーク予測やプロモーター配列予測など、 3 つのベースライン モデルと比較した。…

InstaDeep オープンソースのゲノミクス AI モデルヌクレオチドトランスフォーマー

1735655885
2024-12-31 14:00:00

からの研究者 インスタディープ そして エヌビディア オープンソース化している ヌクレオチドトランスフォーマー (NT)、ゲノミクス データの基礎モデルのセット。最大の NT モデルには 25 億のパラメーターがあり、850 種の遺伝子配列データに基づいてトレーニングされました。いくつかのゲノミクスベンチマークにおいて、他の最先端のゲノミクス基盤モデルよりも優れたパフォーマンスを発揮します。

インスタディープが公開したのは、 モデルの技術的な説明自然。 NT はエンコーダ専用の Transformer アーキテクチャを使用しており、NT と同じマスクされた言語モデル目標を使用して事前トレーニングされています。 バート。事前トレーニングされた NT モデルは 2 つの方法で使用できます。1 つは小規模なモデルの特徴として使用するためのエンベディングを生成するため、もう 1 つは言語モデルのヘッドを置き換えるタスク固有のヘッドで微調整するためです。 InstaDeep は NT を評価しました 18の下流タスクエピジェネティックマーク予測やプロモーター配列予測など、 3 つのベースライン モデルと比較した。 NT は「タスク全体で最高の総合パフォーマンス」を達成し、プロモーターおよびスプライシング タスクにおいて他のすべてのモデルを上回りました。インスタディープによると:

ヌクレオチドトランスフォーマーは、ゲノミクスにおける新たな応用への扉を開きます。興味深いことに、トレーニング中の監視がないにもかかわらず、中間層を精査するだけでも、プロモーターやエンハンサーなどの主要なゲノム特徴を捕捉する豊富なコンテキストの埋め込みが明らかになります。 [We] NT のゼロショット学習機能が有効であることを示します。 [predicting] 遺伝子変異の影響を明らかにし、病気のメカニズムを理解するための新しいツールとなる可能性を提供します。

最もパフォーマンスの高い NT モデルである Multispecies 2.5B には 25 億のパラメーターが含まれており、細菌、真菌、無脊椎動物、およびマウスや人間などの哺乳類を含む 850 種の「多様な門」からのデータに基づいてトレーニングされました。このモデルは、ヒトのデータのみでトレーニングされた 2.5B パラメーターの NT モデルよりも優れたパフォーマンスを示したため、InstaDeep は、複数種のデータが「ヒトゲノムの理解を向上させる鍵」であると述べています。

InstaDeep は、Multispecies 2.5B のパフォーマンスを他の 3 つのゲノミクス基礎モデルと比較しました。 密告者ハイエナのDNA、 そして ダナバート-2。すべてのモデルは、18 の下流タスクのそれぞれに合わせて微調整されました。 Enformer はエンハンサー予測と「一部の」クロマチン タスクでは最高のパフォーマンスを示しましたが、全体的には NT が最高でした。 HyenaDNA は「ヒト参照ゲノム」でトレーニングされたにもかかわらず、すべてのタスクで HyenaDNA を上回りました。

InstaDeep は、下流のタスクでの使用に加えて、遺伝子変異の重症度を予測するモデルの能力も調査しました。これは、埋め込み空間のコサイン距離を使用して計算されたシーケンスの「ゼロショット スコア」を使用して行われました。研究者らは、このスコアは重症度と「中程度の」相関関係を示したと指摘した。

[Y]「ヒト RNA 配列 @myseq.fna の分解率を -5 から 5 のスケールで求めてください。」のような自然言語の質問をすることができます。 ChatNT は、「このシーケンスの劣化率は 1.83 です。」と応答します。

別のユーザーはこう言いました。

私は職場でこれらのモデルをいくつか試してきました。彼らは基本的に、DNA のどこに重要な機能があるのか、そしてそれらの機能は何なのかを学びます。これは非常に近似的ですが、これまではシーケンスのみで他のデータからそれを行うのは非常に困難でした。

ヌクレオチドトランスフォーマー コード GitHub で入手できます。の モデルファイル ハギングフェイスからダウンロードできます。

#InstaDeep #オープンソースのゲノミクス #モデルヌクレオチドトランスフォーマー

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。