日本語版
最新ニュース
企業

新しいAIモデルはタンパク質医薬品の開発コストを削減できる可能性がある

工業用酵母はタンパク質生産の原動力であり、ワクチン、生物医薬品、その他の有用な化合物の製造に使用されます。新しい研究では、マサチューセッツ工科大学の化学技術者が人工知能を利用して新しいタンパク質製造プロセスの開発を最適化し、これによりこれらの医薬品の開発と製造の全体的なコストを削減できる可能性があります。 MIT チームは、大規模言語モデル (LLM) を使用して、工業用酵母であるコマガタエラ・ファフィイの遺伝コード、特にそれが使用するコドンを分析しました。特定のアミノ酸をコードするために使用できるコドン、つまり 3 文字の DNA 配列が複数存在し、コドンの使用パターンは生物ごとに異なります。 新しい MIT モデルは、K. phaffii のこれらのパターンを学習し、それを使用して、特定のタンパク質の製造に最適なコドンを予測しました。これにより研究者らは、ヒト成長ホルモンやがんの治療に使用されるモノクローナル抗体など、酵母による6種類の異なるタンパク質の生産効率を高めることができた。 「アイデアを思いついてから製品化するまでの時間を短縮するには、常に適切に機能する予測ツールを使用することが非常に重要です。不確実性を取り除くことで、最終的には時間とコストを節約できます」と、MIT のレイモンド A. およびヘレン E. セントローラン化学工学教授であり、コッホ統合がん研究研究所のメンバーであり、MIT 新しい製造イニシアチブ (MIT INM) の教員共同ディレクターである J. クリストファー ラブ氏は述べています。 ラブ氏は、今週米国科学アカデミー紀要に掲載される新しい研究の主任著者である。元MIT博士研究員ハリニ・ナラヤナン氏がこの論文の筆頭著者である。 K. phaffii や Saccharomyces cerevisiae (パン酵母) などの酵母はバイオ医薬品産業の主力であり、毎年何十億ドルものタンパク質医薬品やワクチンを生産しています。 工業用タンパク質生産用に酵母を操作するには、研究者はインスリン遺伝子などの遺伝子を別の生物から取得し、微生物がそれを大量に生産できるように改変します。これには、酵母細胞に最適な DNA 配列を考え出し、それを酵母のゲノムに組み込み、その…

1773621708
2026-02-25 09:00:00

工業用酵母はタンパク質生産の原動力であり、ワクチン、生物医薬品、その他の有用な化合物の製造に使用されます。新しい研究では、マサチューセッツ工科大学の化学技術者が人工知能を利用して新しいタンパク質製造プロセスの開発を最適化し、これによりこれらの医薬品の開発と製造の全体的なコストを削減できる可能性があります。

MIT チームは、大規模言語モデル (LLM) を使用して、工業用酵母であるコマガタエラ・ファフィイの遺伝コード、特にそれが使用するコドンを分析しました。特定のアミノ酸をコードするために使用できるコドン、つまり 3 文字の DNA 配列が複数存在し、コドンの使用パターンは生物ごとに異なります。

新しい MIT モデルは、K. phaffii のこれらのパターンを学習し、それを使用して、特定のタンパク質の製造に最適なコドンを予測しました。これにより研究者らは、ヒト成長ホルモンやがんの治療に使用されるモノクローナル抗体など、酵母による6種類の異なるタンパク質の生産効率を高めることができた。

「アイデアを思いついてから製品化するまでの時間を短縮するには、常に適切に機能する予測ツールを使用することが非常に重要です。不確実性を取り除くことで、最終的には時間とコストを節約できます」と、MIT のレイモンド A. およびヘレン E. セントローラン化学工学教授であり、コッホ統合がん研究研究所のメンバーであり、MIT 新しい製造イニシアチブ (MIT INM) の教員共同ディレクターである J. クリストファー ラブ氏は述べています。

ラブ氏は、今週米国科学アカデミー紀要に掲載される新しい研究の主任著者である。元MIT博士研究員ハリニ・ナラヤナン氏がこの論文の筆頭著者である。

K. phaffii や Saccharomyces cerevisiae (パン酵母) などの酵母はバイオ医薬品産業の主力であり、毎年何十億ドルものタンパク質医薬品やワクチンを生産しています。

工業用タンパク質生産用に酵母を操作するには、研究者はインスリン遺伝子などの遺伝子を別の生物から取得し、微生物がそれを大量に生産できるように改変します。これには、酵母細胞に最適な DNA 配列を考え出し、それを酵母のゲノムに組み込み、その DNA に有利な増殖条件を考案し、最終的に最終生成物を精製する必要があります。

新しい生物学的医薬品(生物によって生産される大規模で複雑な医薬品)の場合、この開発プロセスは医薬品の商品化にかかる総コストの 15 ~ 20 パーセントを占める可能性があります。

「現在、これらのステップはすべて非常に骨の折れる実験的な作業によって行われています」とラブ氏は言う。 「私たちは、機械学習で生まれつつある概念の一部をどこに取り入れて、プロセスのさまざまな側面をより信頼性が高く、予測を容易にするために適用できるかという問題を検討してきました。」

この研究では、研究者らは、対象のタンパク質の遺伝子を構成する DNA コドンの配列を最適化したいと考えました。天然に存在するアミノ酸は 20 個ありますが、可能なコドン配列は 64 個あるため、これらのアミノ酸のほとんどは複数のコドンでコード化できます。各コドンは固有のトランスファー RNA (tRNA) 分子に対応し、この分子が正しいアミノ酸をリボソームに運び、そこでアミノ酸がつながってタンパク質になります。

生物によってこれらの各コドンの使用率は異なるため、人工タンパク質の設計者は、宿主生物内で最も頻繁に発生するコドンを選択することによってタンパク質の生産を最適化することがよくあります。ただし、これが必ずしも最良の結果をもたらすとは限りません。たとえば、アルギニンをコードするために常に同じコドンが使用されている場合、細胞内のそのコドンに対応する tRNA 分子が不足する可能性があります。

より微妙なアプローチを取るために、MIT チームはエンコーダー/デコーダーとして知られる一種の大規模言語モデルを導入しました。研究者らはテキストを分析する代わりに、それを使って DNA 配列を分析し、特定の遺伝子で使用されているコドン間の関係を学習しました。

彼らのトレーニング データは、国立バイオテクノロジー情報センターから公開されているデータセットから取得したもので、K. phaffii によって自然に生成される約 5,000 個のタンパク質すべてのアミノ酸配列と対応する DNA 配列で構成されていました。

「モデルは、これらのコドンがどのように使用されるかという構文や言語を学習します」とラブ氏は言います。 「コドンがどのように隣り合って配置されているか、そしてそれらの間の遠距離関係も考慮に入れられます。」

モデルがトレーニングされると、研究者らはモデルに、ヒト成長ホルモン、ヒト血清アルブミン、がんの治療に使用されるモノクローナル抗体であるトラスツズマブを含む 6 つの異なるタンパク質のコドン配列を最適化するよう依頼しました。

彼らはまた、4 つの市販のコドン最適化ツールを使用して、これらのタンパク質の最適化された配列を生成しました。研究者らは、これらの各配列を K. phaffii 細胞に挿入し、各配列が生成する標的タンパク質の量を測定しました。 6 つのタンパク質のうち 5 つについては、新しい MIT モデルの配列が最もよく機能し、6 つについては 2 番目にうまく機能しました。

「私たちはコドン最適化を行う際のさまざまな哲学を確実に取り上げ、それらを私たちのアプローチに対してベンチマークするようにしました」とナラヤナン氏は言います。 「私たちはこれらのアプローチを実験的に比較し、私たちのアプローチが他のアプローチよりも優れていることを示しました。」

以前は Pichia pastoris として知られていた K. phaffii は、インスリン、B 型肝炎ワクチン、慢性片頭痛の治療に使用されるモノクローナル抗体など、数十の商品の製造に使用されています。ヘモグロビンなど、食品に添加される栄養素の製造にも使用されます。

ラブ氏の研究室の研究者らは、K. phaffii の対象タンパク質を最適化するために新しいモデルの使用を開始し、K. phaffii やその他の生物にそのコードを使用したい他の研究者がそのコードを利用できるようにしました。

研究者らはまた、人間や牛を含むさまざまな生物のデータセットに対してこのアプローチをテストしました。結果として得られた各モデルは異なる予測を生成し、標的タンパク質のコドンを最適化するには種特異的なモデルが必要であることを示唆しています。

研究者らは、モデルの内部構造を調べることで、モデルがゲノムの仕組みに関する生物学的原理の一部を学習しているようであることを発見しました。これには、研究者たちが教えていないことも含まれます。たとえば、近くの遺伝子の発現を阻害する可能性のある DNA 配列であるネガティブ リピート要素を含めないようにすることがわかりました。このモデルは、疎水性や親水性などの特性に基づいてアミノ酸を分類することも学習しました。

「この言語を学習するだけでなく、生物物理学的および生化学的特徴の側面を通じて言語を文脈化することもできました。これにより、言語が単に与えられたタスクの最適化ではなく、実際に意味のあるものを学習しているというさらなる自信が得られます」とラブ氏は言います。

ナラヤナン H、JC を愛しています。
Pichia-CLM:Komagataella phaffii 用の言語モデルベースのコドン最適化パイプライン。
Proc Natl Acad Sci US A. 2026 2 24;123(8):e2522052123。土井: 10.1073/pnas.2522052123

#新しいAIモデルはタンパク質医薬品の開発コストを削減できる可能性がある

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。