AI に銀行口座の処理やビジネスの運営を任せることはできません…プリンストン大学の新しい論文では、AI エージェントが精度のベンチマークを押し上げているものの、実際の信頼性では完全に失敗していることが明らかになりました (最初のコメントにある論文へのリンク)。 「AI エージェントの信頼性の科学に向けて」では、研究者は 500 回のベンチマーク実行にわたって 14 の異なるモデルをテストし、プレッシャー下でのパフォーマンスを厳密に測定しました。これらのツールは実際のところ、現時点で重大なタスクを単独で処理するにはあまりにも予測不可能であるため、今日多くの人が推し進めている「エージェント時代」の物語に疑問を呈しているという調査結果が明らかになりました。研究者らは航空工学の原則を借用して、真の信頼性を一貫性、堅牢性、予測可能性、安全性に分類しました。一貫性とは、モデルがタスクを試行するたびに、まったく同じ正しい結果を生成することを意味します。堅牢性は、軽微な技術的不具合やプロンプトのわずかな言い換えにシステムが耐えられるかどうかを測定します。予測可能性は、自信を持って推測するのではなく、エージェントが混乱したときを実際に知っているかどうかをチェックします。テストの結果、予測可能性がすべての最新の言語モデルにわたって圧倒的に最も弱い部分であることが判明しました。彼らは、より大きなモデルを構築するだけでは、これらの大規模な信頼性の障害が自動的に解決されないことを発見しました。これは、ビジネスにおける LLM の実用化への取り組み方や、組織に組み込まれたエージェント AI チェーンの計画の変更に影響しますか?
#に銀行口座の処理やビジネスの運営を任せることはできません…プリンストン大学の新しい論文はAI #エージェントが精度のベンチマークを押し上げているものの実際のパフォーマンスでは完全に失敗していることを明らかにしています..