1729647868
2024-10-22 15:00:00
AI エージェントのデモは素晴らしいように思えるかもしれませんが、現実の環境で煩わしい (またはコストのかかる) エラーを発生させずにテクノロジーを確実に実行させるのは困難な場合があります。現在のモデルは、ほぼ人間のようなスキルで質問に答えたり会話したりすることができ、OpenAI の ChatGPT や Google の Gemini などのチャットボットのバックボーンとなっています。また、コンピュータ画面やキーボードやトラックパッドなどの入力デバイスにアクセスすることによって、または低レベルのソフトウェア インターフェイスを通じて簡単なコマンドが与えられると、コンピュータ上でタスクを実行することもできます。
Anthropic は、Claude が以下のようないくつかの主要なベンチマークで他の AI エージェントよりも優れていると述べています。 SWEベンチ、エージェントのソフトウェア開発スキルを測定します。 OSワールド、コンピュータのオペレーティング システムを使用するエージェントの能力を測定します。これらの主張はまだ独立して検証されていません。 Anthropic 氏によると、クロードは OSWorld でのタスクを 14.9% の確率で正しく実行します。これは、通常約 75% のスコアを獲得する人間よりもはるかに低いですが、約 7.7% の確率で成功する OpenAI の GPT-4 を含む、現在最高のエージェントよりもかなり高いです。
Anthropic 社は、いくつかの企業がすでに Claude のエージェント版をテストしていると主張しています。これには以下が含まれます カンバ、デザインと編集タスクを自動化するためにそれを使用しています、そして リプリット、コーディング作業にモデルを使用します。他の初期ユーザーには以下が含まれます ブラウザ会社、 アーサナ、 そして 概念。
プレスについてSWEベンチの開発に貢献したプリンストン大学の博士研究員である同氏は、エージェントAIははるか先を計画する能力に欠ける傾向があり、エラーからの回復に苦労することが多いと述べている。 「便利であることを示すためには、厳しい現実的なベンチマークで優れたパフォーマンスを獲得する必要があります」と彼は言います。たとえば、ユーザーの幅広い旅行を確実に計画し、必要なチケットをすべて予約するなどです。
Kaplan 氏は、Claude はすでにいくつかのエラーを驚くほどうまくトラブルシューティングできると述べています。たとえば、Web サーバーを起動しようとしたときに端末エラーが発生した場合、モデルはコマンドを修正して修正する方法を知っていました。また、Web の閲覧が行き詰まった場合には、ポップアップを有効にする必要があることもわかりました。
多くのテクノロジー企業は現在、市場シェアと知名度を追い求めて AI エージェントの開発を競っています。実際、多くのユーザーがすぐにエージェントを利用できるようになるまで、そう長くはかからないかもしれません。 OpenAIに130億ドル以上をつぎ込んだMicrosoftは、 Windows コンピュータを使用できるエージェントのテスト。アンスロピックに多額の投資を行っているアマゾンは、 エージェントが商品を推奨し、最終的に購入する方法を検討する 顧客のために。
ベンチャー企業セコイアのパートナーでAI企業に注力しているソーニャ・ファン氏は、AIエージェントをめぐる興奮とは裏腹に、ほとんどの企業は実際にはAIを活用したツールのブランドを変更しているだけだと語る。 Anthropic ニュースに先立って『WIRED』のインタビューに応じた彼女は、このテクノロジーは現時点ではコーディング関連の作業などの狭い領域に適用された場合に最も効果を発揮すると語った。 「モデルが失敗しても問題ない問題空間を選択する必要があります」と彼女は言います。 「これらは、真のエージェントネイティブ企業が誕生する問題領域です。」
エージェント AI の主な課題は、チャットボットの文字化け応答よりもエラーの方がはるかに問題になる可能性があることです。 Anthropic は、Claude ができることに対して特定の制約を課しています。たとえば、個人のクレジット カードを使用して物を購入する機能を制限しています。
プリンストン大学のプレス氏は、エラーを十分に回避できれば、ユーザーは AI とコンピューターをまったく新しい方法で見ることができるようになるかもしれないと述べています。 「この新しい時代にとても興奮しています」と彼は言います。
#Anthropic #は #エージェントにコンピューターを制御してもらいたい