日本語版
最新ニュース
世界

AIモデルには、AGIに必要な推論機能がありません

人工的な一般情報を開発するための競争(AGI)は、主要なAIモデルが依然として困難な理由であることを発見したAppleの研究者によると、まだ長い道のりを持っています。 OpenaiのChatGPTやAnthropicのクロードなどの主要なAI大手言語モデル(LLM)の最近の更新には、大きな推論モデル(LRMS)が含まれていますが、その基本的な能力、スケーリングプロパティ、および制限は「まだ理解されていない」と6月のApple研究者は述べています。 紙 「思考の幻想」と呼ばれます。 彼らは、現在の評価は、主に確立された数学とコーディングのベンチマークに焦点を当てており、「最終的な答えの精度を強調する」ことに焦点を当てていると述べました。 ただし、この評価は、AIモデルの推論能力に関する洞察を提供しないと彼らは述べた。 この研究は、人工的な一般情報が数年先にあるという期待とは対照的です。 Appleの研究者は、「思考」AIモデルをテストします研究者は、さまざまなパズルゲームを考案して、Claude Sonnet、OpenaiのO3-MiniおよびO1、Deepseek-R1およびV3チャットボットの「思考」および「非思考」バリアントを標準的な数学ベンチマークを超えてテストしました。 彼らは、「フロンティアLRMSが特定の複雑さを超えて完全な精度の崩壊に直面している」ことを発見しました。AGI能力への期待に反して、推論を効果的に一般化しないでください。「LRMが正確な計算に制限があることを発見しました。それらは、パズル全体で明示的なアルゴリズムや理由を一貫して使用しないことを発見しました。」最終的な回答と中間推論の痕跡(上部チャート)の検証、および非思考モデルを示すチャートは、低い複雑さ(下のチャート)でより正確です。ソース: Apple Machine Learning Research AIチャットボットは考えすぎています、と研究者は言います彼らはモデルと一貫性のない浅い推論を見つけ、また考え過ぎを観察し、AIチャットボットは早期に正解を生成し、その後誤った推論にさまよう。研究者は、LRMSがそれらを真に内面化または一般化することなく、推論パターンを模倣すると結論付けました。「これらの洞察は、LRM能力に関する一般的な仮定に挑戦し、現在のアプローチが一般化可能な推論に対する根本的な障壁に遭遇している可能性があることを示唆しています。」4つのパズル環境のイラスト。出典:AppleAGIを開発するための競争AGIはAI開発の聖杯であり、機械が人間のように考えることができる状態であり、人間の知性と同等です。 1月、Openai CEOのSam Altmanは、同社はこれまで以上にAGIの構築に近づいていると述べました。 「私たちは今、私たちが伝統的にそれを理解していたように、AGIを構築する方法を知っていると確信しています」と彼は当時言った。 11月、人類のCEOであるDario Amodeiは、AGIが来年か2年で人間の能力を超えると述べました。 「これらの機能が増加している速度を眼球にした場合、2026年または2027年までにそこにたどり着くと思います」と彼は言いました。 雑誌: AIジョブドゥーマーを無視してください、AIは雇用に適していますPWC:AI Eyeは言います #AIモデルにはAGIに必要な推論機能がありません

AIモデルには、AGIに必要な推論機能がありません

1749445883
2025-06-09 04:31:00

人工的な一般情報を開発するための競争(AGI)は、主要なAIモデルが依然として困難な理由であることを発見したAppleの研究者によると、まだ長い道のりを持っています。

OpenaiのChatGPTやAnthropicのクロードなどの主要なAI大手言語モデル(LLM)の最近の更新には、大きな推論モデル(LRMS)が含まれていますが、その基本的な能力、スケーリングプロパティ、および制限は「まだ理解されていない」と6月のApple研究者は述べています。 「思考の幻想」と呼ばれます。

彼らは、現在の評価は、主に確立された数学とコーディングのベンチマークに焦点を当てており、「最終的な答えの精度を強調する」ことに焦点を当てていると述べました。

ただし、この評価は、AIモデルの推論能力に関する洞察を提供しないと彼らは述べた。

この研究は、人工的な一般情報が数年先にあるという期待とは対照的です。

Appleの研究者は、「思考」AIモデルをテストします

研究者は、さまざまなパズルゲームを考案して、Claude Sonnet、OpenaiのO3-MiniおよびO1、Deepseek-R1およびV3チャットボットの「思考」および「非思考」バリアントを標準的な数学ベンチマークを超えてテストしました。

彼らは、「フロンティアLRMSが特定の複雑さを超えて完全な精度の崩壊に直面している」ことを発見しました。AGI能力への期待に反して、推論を効果的に一般化しないでください。

「LRMが正確な計算に制限があることを発見しました。それらは、パズル全体で明示的なアルゴリズムや理由を一貫して使用しないことを発見しました。」最終的な回答と中間推論の痕跡(上部チャート)の検証、および非思考モデルを示すチャートは、低い複雑さ(下のチャート)でより正確です。ソース: Apple Machine Learning Research

AIチャットボットは考えすぎています、と研究者は言います

彼らはモデルと一貫性のない浅い推論を見つけ、また考え過ぎを観察し、AIチャットボットは早期に正解を生成し、その後誤った推論にさまよう。

研究者は、LRMSがそれらを真に内面化または一般化することなく、推論パターンを模倣すると結論付けました。

「これらの洞察は、LRM能力に関する一般的な仮定に挑戦し、現在のアプローチが一般化可能な推論に対する根本的な障壁に遭遇している可能性があることを示唆しています。」りんご4つのパズル環境のイラスト。出典:Apple

AGIを開発するための競争

AGIはAI開発の聖杯であり、機械が人間のように考えることができる状態であり、人間の知性と同等です。

1月、Openai CEOのSam Altmanは、同社はこれまで以上にAGIの構築に近づいていると述べました。 「私たちは今、私たちが伝統的にそれを理解していたように、AGIを構築する方法を知っていると確信しています」と彼は当時言った。

11月、人類のCEOであるDario Amodeiは、AGIが来年か2年で人間の能力を超えると述べました。 「これらの機能が増加している速度を眼球にした場合、2026年または2027年までにそこにたどり着くと思います」と彼は言いました。

雑誌: AIジョブドゥーマーを無視してください、AIは雇用に適していますPWC:AI Eyeは言います

#AIモデルにはAGIに必要な推論機能がありません

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。