1749492945
2025-06-09 10:16:00
マドリッド、6月9日(ポータルティック/EP) –
からの研究者 りんご 彼らは、大規模な人工知能推論モデル(LRM)にはスケーリング機能が限られており、一定レベルの複雑さを必要とするアプリケーションを考慮して、崩壊して、より正確な結果を生成できると結論付けています。
Openai ChatGpt、Claude de Anthropic、Google、またはDeepseek Geminiの場合と同様に、主要な現在の言語モデルの一部 彼らは追加しています LRM推論モデル、直面 あなたの能力を向上させます アプリケーションを解決するとき、作成 回答を提供する前に、詳細な思考プロセス。
これは、大規模な言語モデル(LLM)とは異なり、これらのモデルが 論理的推論と複雑なタスク解像度に焦点を当てますテキストを制限する代わりに。
これらのモデルはパフォーマンスの改善を実証していますが、Appleはその基本的な能力、スケールプロパティ、制限が「まだ十分に理解されていない」と考えているため、それらをテストするための調査を実施しました。特定の複雑さを超えた精度の完全な崩壊。 「
これは、「思考の幻想:問題の複雑さのレンズによる推論モデルの強みと限界を理解する」というタイトルの文書でTechnologicalによって収集されています。 あなたのウェブサイトで共有されています、 そのようなモデルで見つかった制限を詳述した場合 o3-mini de openai、deepseek-r1 de deepseek、gemini thinking de google y y claude-3.7-sonnet-schinkingde人類的。
この分析は、説明されているように、モデルの現在の評価が主に数学またはコーディングスコアに焦点を当てているため、最終的な応答の精度に言及しているため、モデルの推論能力に関する具体的な情報を提供しないためです。
ただし、この研究はに基づいています 制御可能なパズル環境一貫した論理構造を維持しながら、課題の複雑さを正確に操作できるようにするトーレデハノイタワーのパズルなど。したがって、それはそれを可能にします 内部の推論ではないにしても、最終的な回答だけでなく、LRMの考え方を分析します。
これらの制御された課題にさらされると、AppleはLRMが存在することを保証しました あなたの推論の質の欠陥 彼らは崩壊し、問題のタスクを解決するためのショートカットを探しているため、複雑な問題に直面しています。
具体的には、技術的なものは、LRMが低い複雑さ、中程度および高複雑さの複雑さのLLMと比較されたさまざまなパズルを使用した幅広い実験の後、それが示されていることを示しています。 LRMには「カウンターインチ」スケーリング制限があります。
これは、モデルの推論の努力が問題の複雑さとともに増加するが、それはある程度に到達するだけであることを意味します。 十分なトークンの予算を持っているにもかかわらず、減少し始めます。
つまり、パズルが難しいほど、モデルが複雑さをある程度コンピューティングと推論の取り組みを実行すると、問題を解決するためのショートカットを探して崩壊すると、正確な結果が得られません。
「LRMは持っています 正確な計算の制限」 このテクノロジーは明確になりましたが、明示的なアルゴリズムと使用していないことに注意してください。彼らはなぞなぞの間で一貫して推論します。 「
ただし、Appleは、複雑さの低いタスクでは、標準モデルがLRMを超えることを指定しています。ただし、のタスクで LRMの平均的な複雑さの追加思考は、利点を示しています そして最後に、高い複雑さで「両方のモデルが完全な崩壊を経験します」。
#Appleの研究では推論モデルが崩壊し複雑な問題を解決するのが正確ではないと指摘しています