日本語版
最新ニュース
世界

AI時代のスーパーコンピューティングがタンパク質構造予測を加速

APACE のテストに使用されたタンパク質構造: セロトニントランスポーター (PDB アクセッション番号: 6AWO、略称 SERT)。左のパネルは、100 個の SERT 予測コンフォメーション アンサンブルを重ねたもので、実際の SERT とよく一致しています。右のパネルは、変異の多い膜貫通ドメイン (シアン色で表示) で、二乗平均平方根変動を重ねて計算されています。クレジット: Proceedings of the National Academy of Sciences (2024)。DOI: 10.1073/pnas.2311888121 研究者にとって、高性能コンピュータの使用は少々怖いかもしれません。最適なインターフェースの理解、ソフトウェアの拡張方法、膨大なデータセットの操作には、独自の専門知識が必要です。 幸いなことに、NCSAはこれらの強力なシステムの導入と運用だけにとどまりません。このセンターには、 科学およびエンジニアリングアプリケーションのサポート (SEAS) チームは、研究者が NCSA で利用可能なハードウェアおよびソフトウェア リソースを効率的に使用できるようにします。 SEASを利用することで、研究者はPythonパッケージのインストールの支援を受けたり、プロジェクトに最適な並列計算エンジンの選択方法を学ぶことができます。また、画期的な研究のおかげで、 出版された PNAS 誌に掲載されたこの論文では、人工知能モデルをうまく展開する方法を学びます。論文のタイトルは「APACE: 生物物理学における発見を加速するサービスとしての AlphaFold2…

AI時代のスーパーコンピューティングがタンパク質構造予測を加速

1719568894
2024-06-28 09:43:16

APACE のテストに使用されたタンパク質構造: セロトニントランスポーター (PDB アクセッション番号: 6AWO、略称 SERT)。左のパネルは、100 個の SERT 予測コンフォメーション アンサンブルを重ねたもので、実際の SERT とよく一致しています。右のパネルは、変異の多い膜貫通ドメイン (シアン色で表示) で、二乗平均平方根変動を重ねて計算されています。クレジット: Proceedings of the National Academy of Sciences (2024)。DOI: 10.1073/pnas.2311888121

研究者にとって、高性能コンピュータの使用は少々怖いかもしれません。最適なインターフェースの理解、ソフトウェアの拡張方法、膨大なデータセットの操作には、独自の専門知識が必要です。

幸いなことに、NCSAはこれらの強力なシステムの導入と運用だけにとどまりません。このセンターには、 科学およびエンジニアリングアプリケーションのサポート (SEAS) チームは、研究者が NCSA で利用可能なハードウェアおよびソフトウェア リソースを効率的に使用できるようにします。

SEASを利用することで、研究者はPythonパッケージのインストールの支援を受けたり、プロジェクトに最適な並列計算エンジンの選択方法を学ぶことができます。また、画期的な研究のおかげで、 出版された PNAS 誌に掲載されたこの論文では、人工知能モデルをうまく展開する方法を学びます。論文のタイトルは「APACE: 生物物理学における発見を加速するサービスとしての AlphaFold2 と高度なコンピューティング」です。

PNAS の研究論文は、SEAS グループの上級研究プログラマーである Roland Haas 氏、米国エネルギー省 (DOE) アルゴンヌ国立研究所のトランスレーショナル AI のリーダーでありシカゴ大学の CASE 上級科学者である Eliu Huerta 氏、当時イリノイ大学の生物物理学の博士課程の学生であった Hyun Park 氏、および NCSA 大学院研究助手である Parth Patel 氏によって執筆され、AI ツールとアルゴリズムを使用して 3 次元タンパク質構造を理解するプロセスを簡素化および高速化する新しい計算フレームワークについて説明しています。

このフレームワークは、タンパク質の構造の多様性も予測します。タンパク質は、機能を果たすために異なる構造を切り替えることができる柔軟な構造であるため、これは重要な特性です。

チームは、高性能コンピューティングシステム上でタンパク質構造を予測するAIプログラムであるAlphaFold2を効果的に処理する計算ツールAPACEを開発した。彼らはAPACEを デルタ NCSA のスーパーコンピューターを使用して、4 つの代表的なタンパク質の構造予測のパフォーマンスを測定しました。

300 個の NVIDIA A100 GPU に分散された最大 300 個のアンサンブルを使用して、APACE は既製の AlphaFold2 実装よりも最大 2 桁高速であることがわかりました。

さらに、同じアプローチはさまざまな科学分野で使用でき、ロボット工学研究室と連携して科学的発見を自動化し、加速させることもできる。チームは後に、 ポラリス DOE 科学局のユーザー施設であるアルゴンヌ リーダーシップ コンピューティング施設のスーパーコンピューター。

「基盤となる AI モデルは、より広範な科学コミュニティによって検索可能で、アクセス可能であり、すぐに使用できるものであれば、科学の実践を変革する可能性を秘めています」と Huerta 氏は述べています。「このプロジェクトは、最先端の AI を真に民主化し、最新のコンピューティング環境を活用して科学の範囲を最大化するために必要な科学データ インフラストラクチャを作成して共有する方法を示しています。」

生物医学研究者は、幅広い生物学的機能を理解するためにタンパク質を研究しています。タンパク質は、 アミノ酸 そして、それらの 3D 構造への配列が生物学的機能を決定します。

タンパク質がどのように形成されるか(タンパク質フォールディングと呼ばれる、アミノ酸が特定の機能を果たす構造化された鎖に集まるプロセス)を理解することは、正常な生物学的機能を理解するだけでなく、フォールディングの誤りが深刻な病気につながる理由を理解する上でも重要です。

典型的なタンパク質には数百のアミノ酸と、さまざまな方法で結合する可能性のある数千の細胞が含まれる可能性があるため、タンパク質の折り畳みを予測することは、非常に計算集約的です。

タンパク質の構造を研究するための通常の方法は、結晶の原子および分子の構造を決定するツールであるX線結晶構造解析と、分子を液体窒素で瞬間冷凍し、電子を照射して特殊なカメラで画像を撮影するクライオ電子顕微鏡法です。

アルファフォールド AlphaFold2 は、AI ソフトウェアがアミノ酸配列からタンパク質の構造を正確かつ迅速に予測できることを示しており、APACE の開発はこの画期的な成果に基づいています。

APACE は、AlphaFold2 を高性能コンピューティング プラットフォームで大規模に実行できるように最適化し、数テラバイトのタンパク質データベースを効果的に処理します。この研究は、大規模な AI モデルを高性能コンピューティングのパワーと組み合わせることで、科学者が複数のタンパク質複合体を研究し、結果を迅速かつ正確に、高解像度で取得できることを示しています。これらはすべて、タンパク質構造のより完全な理解につながり、多くの疾患を治療できる新薬の開発を促進する可能性があります。

「新薬の研究は極めて時間がかかり、研究室でその医学的効果をテストするためにさまざまな候補化合物を合成する必要があることがボトルネックとなっている」とハース氏は語った。

APACE により、薬剤研究者は潜在的な候補化合物を選別するのに必要な時間を大幅に短縮し、最も有望な物質に集中することができます。これにより、より多くの化合物をテストでき、特定のウイルス株に合わせた新薬などの開発時間を短縮できます。

APACEの主な特徴は、データ管理の改善です。これは、スーパーコンピューター上でAlphaFold2のマルチテラバイトモデルとデータベースをホストすることで実現され、フレームワークのニューラルネットワークはそこからデータに容易にアクセスできます。その他の改善点には、CPU最適化とGPU最適化があり、GPU集約型ニューラルネットワークを並列化します。 タンパク質構造 予測手順。

「AIモデルを使用する上での最初の問題は、データの保存だ」と、APACEの研究が行われていた当時、パテル氏と同様にアルゴンヌ国立研究所でインターンシップをしていたパーク氏は述べた。

「配列から構造予測までの計算に加え、2.6テラバイト(AlphaFold2データベースのサイズ)を渡す必要があります。一部の大学の研究室ではそれができるかもしれませんが、重要なのは、世界中の科学者が使用できるように規模を拡大することです。」

パテル氏はさらに、「だからこそ、HPC の利用は重要であり、特に AI モデルでは重要です。HPC システムにアクセスできる人なら誰でも、データと実際の AI モデル計算を実行する計算能力の両方にアクセスできます。言うまでもなく、速度が大幅に向上します」と付け加えました。

ウエルタ氏は、チームがAlphaFold2を使用することを選んだのは、生物物理学、化学、医薬品の設計と発見など、さまざまな研究コミュニティで広く使用されているためだと述べた。

「APACEは、オリジナルのAlphaFold2モデルのすべての機能を提供し、研究者がスーパーコンピュータを活用して解決までの時間を短縮し、このツールを自動運転ラボに接続して発見を自動化および加速できるようにする」と彼は述べた。

Huerta 氏は、チームは HPC プラットフォームでの AI モデルの使いやすさを最大化するために、APACE ユーザーのコミュニティを構築し続けると述べました。Haas 氏は、チームは現在、システムの残りのボトルネックを解消して速度をさらに向上させることに注力していると述べました。また、より多くの科学者が APACE を利用できるように、より多くのコンピューティング クラスターで APACE を利用できるようにしたいと考えています。

「我々は、一般的なデスクトップ ワークステーションでは簡単に使用するには複雑すぎる他の基礎的な機械学習モデルで Alphafold2 を高速化するために開発した手法を使用することも検討したいと考えています」と Haas 氏は語ります。「最高のツールをできるだけ簡単に利用できるようにすることがすべてです。」

詳しくは:
Hyun Park 他、「APACE: 生物物理学における発見を加速するサービスとしての AlphaFold2 と高度なコンピューティング」、米国科学アカデミー紀要 (2024)。 翻訳: 10.1073/pnas.2311888121

国立スーパーコンピューティング応用センター提供

引用: AI時代のスーパーコンピューティングがタンパク質構造予測を加速 (2024年6月28日) 2024年6月28日にhttps://phys.org/news/2024-06-supercomputing-age-ai-protein.htmlから取得

この文書は著作権の対象です。個人的な学習や研究を目的とした公正な取り扱いを除き、書面による許可なしに複製することはできません。コンテンツは情報提供のみを目的として提供されています。

#AI時代のスーパーコンピューティングがタンパク質構造予測を加速

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。