日本語版
最新ニュース
世界

研究者は、タンパク質言語モデルの内部の仕組みを垣間見る

クレジット:CC0パブリックドメイン 過去数年以内に、タンパク質の構造または機能を予測できるモデルは、薬物標的の特定や新しい治療抗体の設計など、さまざまな生物学的応用に広く使用されています。 これらのモデルは、大規模な言語モデル(LLM)に基づいており、特定のアプリケーションに対するタンパク質の適合性を非常に正確に予測できます。ただし、これらのモデルがどのように予測を行うか、どのタンパク質の特徴がこれらの決定において最も重要な役割を果たすかを判断する方法はありません。 新しい研究では、MITの研究者は新しいテクニックを使用して、その「ブラックボックス」を開き、予測を行う際にタンパク質言語モデルが考慮に入れる機能を決定できるようにしました。そのブラックボックス内で何が起こっているかを理解することは、研究者が特定のタスクのより良いモデルを選択するのに役立ち、新薬やワクチンの標的を特定するプロセスを合理化するのに役立ちます。 「私たちの仕事は、これらの表現に依存する下流のタスクでの説明可能性の向上に幅広い意味を持っています」と、MITのコンピューターサイエンスおよび人工知能研究所の計算および生物学グループの責任者、および研究の上級著者である数学の責任者であるボニー・バーガーは言います。 「さらに、Protein Language Modelsが追跡する機能を特定することは、これらの表現から新しい生物学的洞察を明らかにする可能性があります。」 MITの大学院生であるOnkar Gujralは、今週登場する研究の主執筆者です。 国立科学アカデミーの議事録。 MITの大学院生であるMihir Bafnaと生物工学のMIT教授であるEric Almもこの論文の著者です。 ブラックボックスを開きます 2018年、バーガーと元MITの大学院生Tristan Bepler、Ph.D。最初のタンパク質言語モデルを導入しました。 ESM2やOmegaFoldなどのAlphaFoldの発達を加速した後続のタンパク質モデルのように、彼らのモデルはLLMSに基づいていました。 ChatGptを含むこれらのモデルは、膨大な量のテキストを分析し、どの単語が一緒に表示される可能性が最も高いかを把握できます。 タンパク質言語モデルは同様のアプローチを使用しますが、単語を分析する代わりに、アミノ酸配列を分析します。研究者は、これらのモデルを使用して、タンパク質の構造と機能を予測し、特定の薬物に結合する可能性のあるタンパク質を特定するなどの用途向けです。 2021年の研究では、バーガーと同僚はタンパク質言語モデルを使用して、ウイルス表面タンパク質のどのセクションがウイルスの脱出を可能にする方法で変異する可能性が低いかを予測しました。これにより、インフルエンザ、HIV、およびSARS-COV-2に対するワクチンの可能な標的を特定することができました。 しかし、これらのすべての研究では、モデルがどのように予測を行っているかを知ることは不可能でした。 「最後にいくつかの予測を出しますが、このブラックボックスの個々のコンポーネントで何が起こっているのか全くわかりませんでした」とBerger氏は言います。 新しい研究では、研究者は、タンパク質言語モデルがどのように予測するかを掘り下げたいと考えていました。 LLMSと同様に、タンパク質言語モデルは、情報をニューラルネットワーク内の異なる「ノード」の活性化パターンで構成される表現としてエンコードします。これらのノードは、脳内に記憶やその他の情報を保存するニューロンのネットワークに類似しています。 最新の科学、技術、スペースを発見してください 100,000人の加入者 毎日の洞察をPhys.orgに頼っている人。無料のニュースレターにサインアップし、問題が重要なブレークスルー、イノベーション、研究の最新情報を入手してください。毎日または毎週。 LLMSの内側の仕組みは解釈するのは容易ではありませんが、過去数年以内に、研究者はスパースオートエンコーダーとして知られるタイプのアルゴリズムを使用して、それらのモデルがどのように予測するかについての光を当てるのに役立ちました。 Berger's Labの新しい研究は、タンパク質言語モデルでこのアルゴリズムを使用した最初の研究です。 スパース自動エンコーダーは、タンパク質がニューラルネットワーク内でどのように表現されるかを調整することにより機能します。通常、特定のタンパク質は、たとえば480の制約された数のニューロンの活性化パターンによって表されます。スパース自動エンコーダーは、その表現をはるかに多くのノードに拡張します。たとえば20,000です。 タンパク質に関する情報が480個のニューロンのみでエンコードされると、各ノードが複数の機能に合わせて点灯し、各ノードがエンコードしている機能を知ることは非常に困難です。ただし、ニューラルネットワークが20,000ノードに拡張されると、この余分なスペースとスパース性の制約により、情報室が「広がり」になります。これで、以前に複数のノードによってエンコードされていたタンパク質の特徴は、単一のノードを占めることができます。 「まばらな表現では、ニューロンの照明はより意味のある方法でそうしています」とグジャルは言います。 「スパース表現が作成される前に、ネットワークは情報を非常にしっかりと詰め込んでいるため、ニューロンを解釈するのは困難です。」 解釈可能なモデル 研究者が多くのタンパク質のまばらな表現を取得すると、表現を分析するために、Claude(同じ名前の人気の人類チャットボットに関連)と呼ばれるAIアシスタントを使用しました。この場合、彼らはクロードに、分子機能、タンパク質ファミリー、細胞内の位置など、スパース表現と各タンパク質の既知の特徴を比較するように依頼しました。 数千の表現を分析することにより、Claudeは特定のタンパク質の特徴に対応するノードを決定し、それらを平易な英語で説明できます。たとえば、アルゴリズムには、「このニューロンは、イオンまたはアミノ酸の膜貫通輸送、特に原形質膜にあるタンパク質に関与するタンパク質を検出しているように見える」と言うかもしれません。…

研究者は、タンパク質言語モデルの内部の仕組みを垣間見る

1755585203
2025-08-19 06:30:00

クレジット:CC0パブリックドメイン

過去数年以内に、タンパク質の構造または機能を予測できるモデルは、薬物標的の特定や新しい治療抗体の設計など、さまざまな生物学的応用に広く使用されています。

これらのモデルは、大規模な言語モデル(LLM)に基づいており、特定のアプリケーションに対するタンパク質の適合性を非常に正確に予測できます。ただし、これらのモデルがどのように予測を行うか、どのタンパク質の特徴がこれらの決定において最も重要な役割を果たすかを判断する方法はありません。

新しい研究では、MITの研究者は新しいテクニックを使用して、その「ブラックボックス」を開き、予測を行う際にタンパク質言語モデルが考慮に入れる機能を決定できるようにしました。そのブラックボックス内で何が起こっているかを理解することは、研究者が特定のタスクのより良いモデルを選択するのに役立ち、新薬やワクチンの標的を特定するプロセスを合理化するのに役立ちます。

「私たちの仕事は、これらの表現に依存する下流のタスクでの説明可能性の向上に幅広い意味を持っています」と、MITのコンピューターサイエンスおよび人工知能研究所の計算および生物学グループの責任者、および研究の上級著者である数学の責任者であるボニー・バーガーは言います。 「さらに、Protein Language Modelsが追跡する機能を特定することは、これらの表現から新しい生物学的洞察を明らかにする可能性があります。」

MITの大学院生であるOnkar Gujralは、今週登場する研究の主執筆者です。 国立科学アカデミーの議事録。 MITの大学院生であるMihir Bafnaと生物工学のMIT教授であるEric Almもこの論文の著者です。

ブラックボックスを開きます

2018年、バーガーと元MITの大学院生Tristan Bepler、Ph.D。最初のタンパク質言語モデルを導入しました。 ESM2やOmegaFoldなどのAlphaFoldの発達を加速した後続のタンパク質モデルのように、彼らのモデルはLLMSに基づいていました。 ChatGptを含むこれらのモデルは、膨大な量のテキストを分析し、どの単語が一緒に表示される可能性が最も高いかを把握できます。

タンパク質言語モデルは同様のアプローチを使用しますが、単語を分析する代わりに、アミノ酸配列を分析します。研究者は、これらのモデルを使用して、タンパク質の構造と機能を予測し、特定の薬物に結合する可能性のあるタンパク質を特定するなどの用途向けです。

2021年の研究では、バーガーと同僚はタンパク質言語モデルを使用して、ウイルス表面タンパク質のどのセクションがウイルスの脱出を可能にする方法で変異する可能性が低いかを予測しました。これにより、インフルエンザ、HIV、およびSARS-COV-2に対するワクチンの可能な標的を特定することができました。

しかし、これらのすべての研究では、モデルがどのように予測を行っているかを知ることは不可能でした。

「最後にいくつかの予測を出しますが、このブラックボックスの個々のコンポーネントで何が起こっているのか全くわかりませんでした」とBerger氏は言います。

新しい研究では、研究者は、タンパク質言語モデルがどのように予測するかを掘り下げたいと考えていました。 LLMSと同様に、タンパク質言語モデルは、情報をニューラルネットワーク内の異なる「ノード」の活性化パターンで構成される表現としてエンコードします。これらのノードは、脳内に記憶やその他の情報を保存するニューロンのネットワークに類似しています。

LLMSの内側の仕組みは解釈するのは容易ではありませんが、過去数年以内に、研究者はスパースオートエンコーダーとして知られるタイプのアルゴリズムを使用して、それらのモデルがどのように予測するかについての光を当てるのに役立ちました。 Berger’s Labの新しい研究は、タンパク質言語モデルでこのアルゴリズムを使用した最初の研究です。

スパース自動エンコーダーは、タンパク質がニューラルネットワーク内でどのように表現されるかを調整することにより機能します。通常、特定のタンパク質は、たとえば480の制約された数のニューロンの活性化パターンによって表されます。スパース自動エンコーダーは、その表現をはるかに多くのノードに拡張します。たとえば20,000です。

タンパク質に関する情報が480個のニューロンのみでエンコードされると、各ノードが複数の機能に合わせて点灯し、各ノードがエンコードしている機能を知ることは非常に困難です。ただし、ニューラルネットワークが20,000ノードに拡張されると、この余分なスペースとスパース性の制約により、情報室が「広がり」になります。これで、以前に複数のノードによってエンコードされていたタンパク質の特徴は、単一のノードを占めることができます。

「まばらな表現では、ニューロンの照明はより意味のある方法でそうしています」とグジャルは言います。 「スパース表現が作成される前に、ネットワークは情報を非常にしっかりと詰め込んでいるため、ニューロンを解釈するのは困難です。」

解釈可能なモデル

研究者が多くのタンパク質のまばらな表現を取得すると、表現を分析するために、Claude(同じ名前の人気の人類チャットボットに関連)と呼ばれるAIアシスタントを使用しました。この場合、彼らはクロードに、分子機能、タンパク質ファミリー、細胞内の位置など、スパース表現と各タンパク質の既知の特徴を比較するように依頼しました。

数千の表現を分析することにより、Claudeは特定のタンパク質の特徴に対応するノードを決定し、それらを平易な英語で説明できます。たとえば、アルゴリズムには、「このニューロンは、イオンまたはアミノ酸の膜貫通輸送、特に原形質膜にあるタンパク質に関与するタンパク質を検出しているように見える」と言うかもしれません。

このプロセスにより、ノードがはるかに「解釈可能」になります。つまり、研究者は各ノードがエンコードしているものを知ることができます。彼らは、これらのノードによってエンコードされる可能性が最も高い特徴は、いくつかの異なる代謝および生合成プロセスを含む特定の機能であることを発見しました。

「まばらな自動エンコーダーを訓練するとき、あなたはそれを解釈できるように訓練することはできませんが、表現を本当にまばらであるように奨励することで、それは解釈可能性をもたらすことがわかります」とグジャルは言います。

特定のタンパク質モデルがエンコードしているものを理解することで、研究者が特定のタスクに適したモデルを選択したり、モデルに与える入力のタイプを調整して、最良の結果を生成するのに役立ちます。さらに、モデルがエンコードする機能を分析すると、いつか生物学者が研究しているタンパク質についてさらに学ぶのに役立ちます。

「モデルがはるかに強力になったある時点で、モデルを開くことから、すでに知っているよりも多くの生物学を学ぶことができます」とグジャルは言います。

詳細:
Berger、Bonnie、Sparse Autoencodersは、タンパク質言語モデルの表現における生物学的に解釈可能な特徴を明らかにします。 国立科学アカデミーの議事録 (2025)。 doi:10.1073/pnas.2506316122。 doi.org/10.1073/pnas.2506316122

マサチューセッツ工科大学

このストーリーは、MITの研究、革新、教育に関するニュースをカバーする人気のあるサイトであるMIT News(web.mit.edu/newsoffice/)の好意により再発行されています。

引用:研究者は、タンパク質言語モデルの内部の仕組みを垣間見る(2025年、8月19日)2025年8月19日https://phys.org/news/2025-08-Glimpse-protein-language.htmlから取得

このドキュメントは著作権の対象となります。私的な研究や研究の目的のための公正な取引とは別に、書面による許可なしに再現される部分はありません。コンテンツは情報のみで提供されます。

#研究者はタンパク質言語モデルの内部の仕組みを垣間見る

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。