1763810845
2025-11-21 21:26:00
研究者らは、この設定によりEvoは「ヌクレオチドレベルのパターンをキロベーススケールのゲノムコンテキストに結び付ける」ことができると主張している。言い換えれば、ゲノム DNA の大きな塊を使用してプロンプトを送信すると、LLM がクエリを解釈し、ゲノムの意味でその解釈に適切な出力を生成するのと同じように、Evo はそれを解釈できます。
研究者らは、細菌のゲノムに関するトレーニングを考慮すると、既知の遺伝子をプロンプトとして使用できるため、Evo は関連する機能を持つタンパク質をコードする領域を含む出力を生成するはずだと推論しました。重要な問題は、すでにわかっているタンパク質の配列を単に出力するだけなのか、それとも予測不可能な出力を思いつくのかということです。
新規タンパク質
システムのテストを開始するために、研究者らは既知のタンパク質の遺伝子の断片をシステムに入力させ、Evo がそれらを完成できるかどうかを判断しました。ある例では、既知のタンパク質の遺伝子配列の 30 パーセントが与えられた場合、Evo は残りの 85 パーセントを出力できました。シーケンスの 80% を要求された場合、欠落しているシーケンスをすべて返す可能性があります。機能クラスターから単一の遺伝子が削除された場合、Evo は欠落している遺伝子を正確に特定して復元することもできました。
また、大量のトレーニング データにより、Evo はタンパク質の最も重要な領域を正確に特定しました。配列に変更が加えられた場合、それらは通常、変動が許容されるタンパク質の領域に存在します。言い換えれば、その訓練により、システムが既知の遺伝子の変化に対する進化的限界の規則を組み込むことが可能になったのです。
そこで研究者らは、Evo に何か新しいものを出力するように依頼したときに何が起こるかをテストすることにしました。これを行うために、彼らは細菌毒素を使用しました。細菌毒素は通常、遺伝子を活性化するたびに細胞が自ら死滅するのを防ぐ抗毒素と一緒にコードされています。これらの例は数多くあり、細菌とその競合他社との間の軍拡競争の一環として急速に進化する傾向があります。そこでチームは、既知の毒素とわずかに関連するだけで、既知の抗毒素を持たない毒素を開発し、その配列をプロンプトとして Evo に供給しました。そして今回は、既知の抗毒素遺伝子と類似していると思われる反応をすべて除外しました。
#細菌ゲノムで訓練された #がこれまでに見たことのないタンパク質を生成