1771558366
2026-02-20 02:58:00
タンパク質工学の検索領域は、複雑さとともに指数関数的に増大しています。わずか 100 個のアミノ酸からなるタンパク質には 20^100 の可能なバリアントがあり、これは観測可能な宇宙の原子よりも多い組み合わせです。従来のエンジニアリング手法では、何百ものバリアントをテストできますが、探索は配列空間の狭い領域に限定されます。最近の機械学習アプローチにより、計算によるスクリーニングを通じてより広範な検索が可能になります。ただし、これらのアプローチでは依然として数万回の測定または 5 ~ 10 回の反復ラウンドが必要です。
これらの基礎的なタンパク質モデルの出現により、タンパク質工学のボトルネックは研究室に戻りました。単一のタンパク質工学キャンペーンでは、数百のバリアントを効率的に構築してテストすることしかできません。機能が大幅に向上した進化したタンパク質を最も効果的に発見するには、それらの数百を選択する最善の方法は何でしょうか?この問題に対処するために、私たちは効率的なタンパク質進化のためのフレームワークである MULTI-evolve を開発しました。これは、特に機能強化変異のペアに焦点を当てた約 200 のバリアントのデータセットでトレーニングされた機械学習モデルを適用します。
本日公開されたのは、 科学、この研究は、Arc Institute の生物学的設計のための最初のラボインザループ フレームワークを表しており、計算による予測と実験計画が最初から緊密に統合されており、AI 誘導研究への広範な投資を反映しています。
ペアワイズインタラクションから学ぶ
タンパク質の進化には、有益な変異を見つけて、それらを相乗的に組み合わせるという 2 つの基本的なステップが含まれます。このアプローチの開発の初期段階で、単一変異データのみでトレーニングされたニューラル ネットワークでは、どの複数変異の組み合わせが機能するかを確実に予測できないことに私たちは気づきました。これらのモデルには、変異がどのように相互作用するかについての情報が不足しており、ランダム変異体のほとんどの大規模なデータセットは、変異の大部分が機能を強化しないため役に立たないため、何千ものランダム変異体をテストすることで、何が機能しないのかをモデルにほとんど教えることができます。
私たちの洞察は、量よりも質に焦点を当てることでした。まず、(タンパク質言語モデルまたは実験的スクリーニングを使用して)約 15 ~ 20 個の機能強化変異を特定し、次にそれらの有益な変異のすべてのペアの組み合わせを体系的にテストします。これにより、約 100 ~ 200 の測定値が生成され、そのすべてが有益なエピスタティック相互作用を学習するのに役立ちます。
私たちは、公開された研究からの 12 の既存のタンパク質データセットを使用して、これを計算的に検証しました。単一変異体と二重変異体のみでニューラル ネットワークをトレーニングしたところ、モデルが 12 の多様なタンパク質ファミリーすべてにわたる複雑な多重変異体 (3 ~ 12 個の変異を持つ変異体) を正確に予測できることがわかりました。この結果は、トレーニング データを利用可能なデータのわずか 10% に減らした場合でも当てはまりました。
二重変異体に対するトレーニングは、エピスタシスを明らかにするため機能します。二重変異体は、その部分の合計よりも優れたパフォーマンスを発揮する場合 (相乗効果)、予想よりも悪いパフォーマンスを発揮する場合 (拮抗作用)、または正確に予想どおりのパフォーマンスを発揮する場合 (相加性) がある場合があります。これらのペアごとの相互作用パターンは、突然変異がどのように結合するかのルールをモデルに教え、5、6、または 7 のどの突然変異の組み合わせが相乗的に機能するかを推定することを可能にします。
次に、MULTI-evolve を 3 つの新しいタンパク質に適用しました。APEX (野生型と比較して最大 256 倍の改善、既に最適化された APEX2 の 4.8 倍)、トランス スプライシング用の dCasRx (最大 9.8 倍の改善)、および抗 CD122 抗体 (1.0 nM までの結合の 2.7 倍の改善、発現の 6.5 倍の増加)。 dCasRx については、11,000 を超える変異の詳細な変異スキャンから開始し、機能を強化する変異のみを抽出し、それらのペアごとの組み合わせをテストしました。これは、効率的なエンジニアリングのための戦略的データ キュレーションの価値を実証しました。
それぞれ、複雑な多重変異体を正確に予測するモデルをトレーニングするために、1 ラウンドでわずか約 100 ~ 200 個の変異体を実験的にテストする必要があり、従来は何ヶ月にもわたって 5 ~ 10 回の反復サイクルを要していたものを数週間に圧縮しました。
MULTI進化ループ
MULTI-evolve は、3 つのイノベーションをエンドツーエンドのフレームワークに統合します。
1. タンパク質言語モデルを組み合わせることで効率的な変異発見が可能
単一の変異でもタンパク質の機能を改善できますが、機能を大幅に改善するには、いくつかの変異を組み合わせる必要があります。これまでの研究では、どの変異が機能を改善する可能性があるかを予測するタンパク質言語モデルのゼロショット手法の能力が実証されてきましたが、個々の手法では、高次の組み合わせ変異体を生成するための変異はほとんど識別されません。
多くの機能強化変異を特定するために、私たちの解決策は、タンパク質配列の分析と 3D 構造の分析など、いくつかの異なるモデルからの予測を 2 つのスコアリング方法と組み合わせることでした。これを 73 の多様なタンパク質データセットにわたってテストしたところ、単一モデルでは約 11 個であるのに対し、私たちのアプローチでは平均約 20 個の有益な変異が特定されたことがわかりました。
これを APEX に適用したところ、活性が 53 倍向上する A134P 変異が特定されました。標準的なタンパク質言語モデルに基づく手法は、プロリン置換にペナルティを課すため、体系的にこの問題を見逃していました。私たちのアンサンブル スコアリング戦略の 1 つは、プロリン置換に対するバイアスなどのアミノ酸固有のバイアスを正規化することにより、A134P が見過ごされていた場合に候補として浮上することを可能にします。
2. ニューラル ネットワークはどの組み合わせが最も効果的かを予測します
私たちの次のステップは、一連の有益な単一変異体とペアワイズ二重変異体を使用して、それらを最大 7 つの変異を持つ多重変異体バリアントに組み合わせる最も効果的な方法を決定することでした。
計算ベンチマークを通じて、完全に接続されたニューラル ネットワークが、主に単一変異体と二重変異体でトレーニングすることにより、複数変異体の活動を確実に予測できることを実証します。 12 の多様なタンパク質データセットにわたって、私たちのモデルは半分以上の時間でトップパフォーマーを正確に特定しました。
実際に、MULTI-evolve が 3 つの異なるタンパク質にわたって最大 7 つの変異を持つ過剰活性バリアントを識別できることを実証します。私たちは、1 ラウンドの機械学習で複数の変異バリアントを設計します。モデルは、約 200 個の戦略的バリアントからなるコンパクトなトレーニング セットでトレーニングされ、提案された候補はわずか 9 個で実験的にテストされます。
3. MULTIアセンブリ法により迅速な合成が可能
もう 1 つのボトルネックは、予測されたバリアントの構築とテストです。商業的な DNA 合成は、特に複雑な多重変異体の場合、高価で時間がかかります。多部位突然変異誘発のための既存の実験室法は効率が低く、オリゴ設計が主観的であるため、結果の信頼性が低くなる可能性があります。
これに対処するために、複雑なバリアントを効率的に構築するマルチサイト突然変異誘発法である MULTI アセンブリを開発しました。反応条件、オリゴヌクレオチド設計、およびアセンブリパラメーターを体系的に最適化することにより、数キロベースにわたる最大 9 個の変異を持つバリアントのアセンブリ効率 40 ~ 70% を達成しました。また、標的変異を入力として受け取り、効率的なアセンブリのために最適化されたプライマーを出力する計算オリゴデザイナーも開発しました。これらはすべて、数週間ではなく数日で完了できます。
あなたもMULTI進化してみませんか
MULTI-evolve フレームワークはモジュール式であり、分野の進歩に応じて改善されます。より優れたタンパク質言語モデルにより、変異の発見が強化され、このアプローチは他の設計ツールと自然に統合され、計算によって設計されたタンパク質を改良したり、治療候補を最適化したりできます。
MULTI-evolve を、タンパク質言語モデル予測、ニューラル ネットワーク トレーニング、および MULTI アセンブリ オリゴ設計を処理するオープンソース ツールとして利用できるようにしました。酵素、ゲノムエディター、または治療用タンパク質のいずれに取り組んでいる場合でも、このフレームワークは、初期変異から最適化された多重変異体までの体系的なパスを提供します。
私たちは、コミュニティがタンパク質工学の課題に MULTI-evolve をどのように適用するかを見るのを楽しみにしています。これを自分の仕事に適用することについて質問がある場合は、お問い合わせください。
ソース:
参考雑誌:
#MULTIevolve #は機械学習を使用してタンパク質エンジニアリングを加速します