1739495261
2025-02-13 14:00:00
Generative AI BoomがCHATGPTの発売から実際に始まってから2年後、Webブラウザや電話にぶら下がっている驚異的な役立つAIアシスタントがいることは、それほどエキサイティングではなく、質問をするのを待っています。 AIの次の大きな推進は、あなたに代わって行動を起こすことができるAIエージェントのためです。しかし、エージェントAIはすでにコーダーのようなパワーユーザーのために到着していますが、日常の消費者はまだこの種のAIアシスタントを持っていません。
それはすぐに変わります。 Anthropic、Google DeepMind、およびOpenaiには、情報のためにWebの検索、フォームの記入、ボタンのクリックを検索することができるように、コンピューターを使用できるすべての最近発表された実験モデルがあります。人間のユーザーからの少しのガイダンスにより、彼らは注文の食料品のような考えたり、Uberを呼んだり、製品の最高の価格を探したり、次の休暇のためのフライトを見つけたりすることができます。そして、これらの初期のモデルには能力が限られており、まだ広く利用可能ではありませんが、AIが進んでいる方向を示しています。
「これはAIをクリックするだけです」と、オペレーターと呼ばれるOpenaiエージェントを見て、オペレーターを見て、オペンテーブルに移動し、サンフランシスコレストランを検索し、午後7時にテーブルをチェックするのを見て、DemoビデオでSam Altmanが述べました。
カーネギーメロン大学の機械学習の准教授であるZachary Liptonは、AIエージェントがすでに営業担当者、医師、弁護士などのさまざまなタイプの企業顧客向けの専門ソフトウェアに組み込まれていると指摘しています。しかし、これまで、「ラップトップで日常的なものをすることができるAIエージェントを見たことがありません」と彼は言います。 「ここで興味をそそられるのは私ですs人々が鍵を渡し始めた可能性。」
人類、Google Deepmind、およびOpenaiのAIエージェント
人類がこの新しい機能を発表した最初の人物であり、10月にクロードチャットボットが「人間のようにコンピューターを使用する」ことができると発表しました。同社は、モデルにパブリックベータテストとしてこの機能を提供しており、人類の大手言語モデルの上にツールや製品を構築している開発者のみが利用できると強調しました。 Claudeは、ユーザーが見ているもののスクリーンショットを表示し、クリックするためにカーソルを特定のスポットに移動するために必要なピクセルをカウントすることでナビゲートします。人類の広報担当者は、Claudeがこの作業を任意のコンピューターおよびデスクトップアプリケーション内で行うことができると述べています。
ゲートから次に、GoogleのGemini 2 Languageモデルの上に構築されたProject MarinerのGoogle Deepmindがありました。同社は12月にマリナーを見せたが、それを「初期の研究プロトタイプ」と呼び、今のところ「信頼できるテスター」がツールを利用できるようにしていると述べた。別の予防策として、マリナーは現在、Chromeブラウザ内でのみ動作し、アクティブなタブ内でのみ動作します。つまり、他のタスクで作業している間はバックグラウンドで実行されません。この要件は、時間を節約するAIヘルパーを持つという目的を多少打ち負かすように思われますが、この開発の初期段階の一時的な条件にすぎない可能性があります。
最後に、1月にOpenaiはオペレーターと呼ばれるコンピューター使用エージェント(CUA)を立ち上げました。 Openaiはそれを「Research Preview」と呼び、Openaiのプレミアムサービスに月額200米ドルを支払うユーザーのみが利用できるようにしましたが、同社はより広範なリリースに向けて取り組んでいると述べています。オペレーターチームのエンジニアであるYash Kumarは、このツールは本質的にあらゆるWebサイトで動作できると言います。 「私たちはブラウザから始めています。なぜなら、これが作業の大部分が起こる場所だからです」とクマールは言います。しかし、彼は、「CUAモデルもコンピューターを使用するようにトレーニングされているため、拡張できる可能性がある」と述べています。
他の人と同様に、オペレーターは依存しています 指示を取り、それらを完了できる一連のタスクに分解するという考え方の推論。たとえば、赤や黄色の玉ねぎを購入することを好む場合など、タスクを完了するためにさらに情報が必要な場合は、一時停止して入力を求めます。また、レストランのテーブルを予約したり、食料品の注文をしたりするなど、最終的なステップを踏む前に確認を求めます。
コンピューター使用エージェントの安全上の懸念
コンピューター使用エージェントがまだできないことを次に示します。サイトにログインし、利用規約に同意し、Captchasを解決し、クレジットカードやその他の支払いの詳細を入力します。エージェントがこれらの障害物のいずれかに対して登場すると、ステアリングホイールを人間のユーザーに渡します。 OpenAIは、ユーザーがログインまたは支払い情報を入力している間、オペレーターがブラウザのスクリーンショットを撮影しないことに注意してください。
3つの企業は全員、コンピューターを担当するAIを置くと安全リスクをもたらす可能性があることに注目しています。人類は、迅速な注射攻撃の懸念、または悪意のある俳優がユーザーのプロンプトに何かを追加してモデルに予期しないアクションを実行できるようにする方法を特に提起しました。 「クロードはインターネットに接続されたコンピューターからのスクリーンショットを解釈できるため、迅速な噴射攻撃を含むコンテンツにさらされる可能性があります」と人類はブログ投稿に書いています。
CMUのリプトンは、企業はコンピューター使用エージェントとその仕組みに関する多くの情報を明らかにしていないため、リスクを評価するのは難しいと述べています。 「誰かがあなたのコンピューターオペレーターに不気味なことをさせてもらうと、それは彼らがすでにあなたのコンピューターにアクセスできることを意味しますか?」彼は不思議に思っていますが、もしそうなら、なぜ悪党は直接行動を起こさないのでしょうか?
それでも、リプトンは、私たちが取るすべてのアクションとオンラインでの購入で、「ユーザーをピクルスにするアクションを想像するために想像力の大騒ぎを必要としない」と言います。たとえば、彼は言います。 [agent] 車を買ってくれましたか?」
コンピューター使用エージェントの未来
いずれの企業も、コンピューター使用エージェントを広く利用できるようにするためのタイムラインを明らかにしていませんが、今年は消費者が大手AI企業やスタートアップを通じてより安価な模造品を作成することを開始する可能性があります。
OpenaiのKumarは、それはエキサイティングな時期であり、そのオペレーターは人間とAIのより協調的な未来への一歩を示していると言います。 「それは私たちのAGIへの道の足がかりです」と彼は言い、長年にわたる夢/人工的な一般情報の悪夢に言及しています。 「人間が日常的に相互作用するのと同じインターフェイスとツールを使用する能力は、AIの有用性を広げ、人々が日常のタスクで時間を節約するのを助けます。」
2013年の先見の明のある映画を覚えているなら 彼女、蒸し暑いサマンサが主人公の耳に話しかける前に、映画の冒頭に存在していた世界に向かって縁取られているようです。それは、誰もがメッセージを読んで応答し、他のありふれたタスクの世話をするのに役立つ退屈でニュートラルなAIを持っている世界です。 AI企業がその目標をしっかりと達成すると、彼らは間違いなくサマンサに取り組み始めるでしょう。
サイトの記事から
ウェブ上の関連記事
#AIエージェントはコントロールを取りますコンピューター使用エージェントの探索