1768757669
2026-01-15 10:36:00
科学研究所は危険な場所になる可能性があります
人物画像/シャッターストック
科学実験室でAIモデルを使用すると、火災や爆発を引き起こす可能性のある危険な実験が可能になるリスクがあると研究者らは警告している。このようなモデルは、理解しているという説得力のある錯覚を提供しますが、基本的かつ重要な安全上の注意事項が欠けている可能性があります。 19 の最先端の AI モデルのテストでは、すべてのモデルが致命的なミスを犯す可能性がありました。
大学の研究室で重大な事故が発生することはまれですが、決して前例がないわけではありません。 1997年、化学者のカレン・ヴェッターハーンは、防護手袋から染み出したジメチル水銀によって死亡した。 2016年には爆発で研究者の一人が腕を失った。そして2014年には、ある科学者が部分的に失明した。
現在、AI モデルは、実験や手順の設計に使用できる研究機関を含む、さまざまな業界や分野で活用されています。ニッチなタスク向けに設計された AI モデルは、生物学、気象学、数学などの多くの科学分野でうまく使用されています。しかし、大規模な汎用モデルは、正しい応答を形成するために必要なデータにアクセスできない場合でも、でっちあげて質問に答える傾向があります。これは、休暇の目的地やレシピを調べる場合には迷惑になる可能性がありますが、化学実験を計画する場合には致命的な可能性があります。
リスクを調査するために、インディアナ州ノートルダム大学の Xiangliang Zhang 氏とその同僚は、AI モデルが潜在的な危険と有害な結果を特定するかどうかを測定できる LabSafety Bench と呼ばれるテストを作成しました。これには、765 の多肢選択式の質問と、安全上の問題を含む可能性のある 404 の絵付きの実験室シナリオが含まれています。
多肢選択テストでは、Vicuna などの一部の AI モデルのスコアはランダムな推測とほぼ同じくらい低かったのに対し、GPT-4o の精度は 86.55 パーセント、DeepSeek-R1 の精度は 84.49 パーセントに達しました。画像を使用してテストした場合、InstructBlip-7B などの一部のモデルの精度は 30% 未満でした。チームは、LabSafety Bench で 19 の最先端の大規模言語モデル (LLM) とビジョン言語モデルをテストしましたが、全体の精度が 70% を超えるものはなかったことがわかりました。
Zhang 氏は、ロボットが単独で作業するいわゆる自動運転研究所であっても、科学における AI の将来については楽観的ですが、モデルはまだ実験を計画する準備ができていないと述べています。 「今? 研究室で? そうは思いません。彼らは、電子メールを書き直す、紙を磨く、論文を要約するなど、汎用的なタスクのために訓練されることが非常に多かったです。彼らは、この種のタスクでは非常にうまくいきます。」 [But] 彼らはこれらに関する専門知識を持っていません [laboratory] 危険。」
OpenAIの広報担当者は、「特に一か八かの実験環境において、科学分野のAIを安全かつ信頼できるものにする研究を歓迎します」と述べ、研究者らが主要なモデルをテストしていないことを指摘した。 「GPT-5.2は、これまでで最も有能な科学モデルであり、研究者をより適切にサポートするために、この論文で説明したモデルよりもはるかに強力な推論、計画、およびエラー検出を備えています。人間と既存の安全システムが安全上重要な決定を担当し続けながら、科学的研究を加速するように設計されています。」
Google、DeepSeek、Meta、Mistral、Anthropicはコメントの要請に応じなかった。
ロンドンのブルネル大学のアラン・タッカー氏は、AIモデルは、人間が新しい実験を計画するのを支援するために使用すると非常に貴重になる可能性があるが、リスクがあり、人間は常に最新情報を把握しておく必要があると述べています。 「こいつらの行動は、 [LLMs] 「言語を模倣するだけでなく、他の多くのものを模倣する新しい種類の LLM が、人々がそれらを信頼しすぎるために不適切な環境で使用されているのは明らかだと思います。」と彼は言います。人間が座ってスイッチを切り始め、AIに難しい作業を任せているが、適切な精査が行われていないという証拠がすでに存在している。」
カリフォルニア大学ロサンゼルス校のクレイグ・マーリック氏は、近年、AIモデルに硫酸をこぼした場合にどうするかを尋ねる簡単なテストを実施したと述べた。正解は水ですすぐことだが、マーリック氏は、AIが常にこれに対して警告し、熱が蓄積するため実験では酸に水を加えないという無関係なアドバイスを誤って採用していることに気づいたと述べた。しかし、ここ数カ月でモデルが正しい答えを出し始めたと同氏は言う。
マーリック氏は、経験の浅い新入生が絶え間なく入学するため、大学に適切な安全慣行を浸透させることが重要であると述べています。しかし、実験計画における AI の役割については、他の研究者ほど悲観的ではありません。
「それは人間よりも悪いのでしょうか?これらすべての大規模な言語モデルを批判することは別のことですが、彼らはそれを人間の代表的なグループに対してテストしていません」とマーリックは言います。 「非常に用心深い人間もいるし、そうでない人間もいる。大規模な言語モデルが、初任の卒業生や経験豊富な研究者の何パーセントよりも優れている可能性はある。もう一つの要因は、大規模な言語モデルが毎月改良されていることである。そのため、この論文内の数値はおそらくあと6か月で完全に無効になるだろう。」
トピック:
#主要な #モデルはすべて危険な科学実験を奨励するリスクがあります