1719066477
2024-06-17 00:00:00
AlphaFold2はタンパク質構造の予測に非常に有用であるにもかかわらず、公式実装ではトレーニング手順のコードとそれに関連する必要なデータが除外されています。そのため、モデルの学習動作を研究したり、新しいタスクを実行できるバリアントを作成したりすることが困難です。 ネイチャーメソッドAlQuraishi 氏とその同僚は、AlphaFold2 の学習メカニズムと一般化能力に関する洞察を提供する、トレーニング可能なオープンソース実装である OpenFold を報告しました。
OpenFold は、OpenProteinSet (AlphaFold2 のトレーニング データセットのオープンソース複製) を使用して最初からトレーニングされ、精度において AlphaFold2 に匹敵することが示されました。アーキテクチャの特定の特性 (データ効率など) を理解するために、著者らは、徐々にデータ数を減らす一連の実行で OpenFold をトレーニングしました。これにより、1,000 個のタンパク質鎖ほどの小さなデータセットを使用しても高い精度を達成できることが示されました。次に、OpenFold は、一般化の能力を評価するために分布外データでトレーニングされ、モデルがグローバル フォールド レベルのパターンからではなく、複数の配列アラインメントや配列と構造の相関関係のローカル パターンから学習することが明らかになりました。中間構造の分析により、モデルは最終的にグローバル構造をローカル構造とほぼ同じ精度で予測しますが、モデルは後者の学習から始まることがさらに明らかになりました。
#OpenFoldはAlphaFold2の学習行動に関する洞察を提供します