公共データに埋もれていたウイルスをすばやく識別する
入力 2024.10.14 06:50
入力 2024.10.14 06:50修正 2024.10.13 21:47
景色3
複雑な遺伝子情報を含む膨大な量の遺伝子配列データを計算するディープラーニングアルゴリズムであるLucaProt(LucaProt)を構築し、最大4万7250個のヌクレオチドからなる長いウイルス遺伝子と16万1973個のRNAウイルスを発見した。直接関係のない資料写真) [사진= 게티이미지뱅크]人工知能(AI)が16万個を超える新しいRNAウイルスを発見した。歴代最大規模の今回のウイルス発見は、ウイルス多様性に関する知識を大きく拡張したという評価を受けている。
「Cell」に発表された研究によると、オーストラリアのシドニー大学研究者は、複雑な誘電体情報を含む膨大な量の遺伝子配列データを計算するディープラーニングアルゴリズムであるルカプロット(LucaProt)を構築し、最大4万7250個のヌクレオチドで構成されています。長いウイルス遺伝体と16万1973個のRNAウイルスを発見した。
一般に、ヒト疾患に関連するRNAウイルスは、世界中の極端な環境でも見られます。研究者のエドワーズ・ホームズ教授は「これらのウイルスの大部分はすでにシーケンシングが完了して公共データベースにあったが、あまりにも多様で誰も何なのか分からなかった」とし「彼らはしばしば「暗黒物質」シーケンスと呼ばれるものを構成したが、ルカフロートはこのすべての異質な情報をまとめて分類し、この暗黒物質の意味に初めて光を照らすことができた」と説明した。
ルカフロートはシーケンス情報と予測された構造情報の両方を統合し、RNA依存性RNA重合(RdRP)シーケンスを正確に検出することができた。発見されたウイルスには以前に十分に研究されていなかったグループが多く含まれており、例外的に長い(最大47,250ヌクレオチド)長さとゲノム複雑性を持つRNAウイルスゲノムも含まれた。研究者は、「ルカプトは暗黒物質を計算し、すべてのRNAウイルスが複製に使用するタンパク質のシーケンスと二次構造に基づいてウイルスを識別するように訓練された」とし、「既存の方法を使用した場合、多くの時間がかかったウイルス発見をかなり早く進めることができた」と話した。
新たに発見されたRNAウイルスは、空気、温泉、熱水噴出口など様々な環境に存在し、生態系によってウイルスの多様性と豊富さがかなり異なっていた。研究者であるエドワーズ・ホームズ教授は「極限の環境がこのように多くの種類のウイルスを保有しているということは、ウイルスが膨大な多様性を持っており、最も過酷な環境でも生き残ることができる粘りを持っているというもう一つの事例に過ぎない」とし「ウイルスそして他の基本的な生命体がどのように生まれたかについての手がかりを提供する可能性がある」と述べた。
著作権ⓒ健康のための正直な知識。コメディドットコムkormedi.com /無断転載 – 再配布、AI学習および活用禁止
#過酷な環境で生き残る新しいウイルス16万個AIが発見