日本語版
最新ニュース
世界

Google は Gemini にブラウザへのアクセスを許可する予定である • –

Google は、マルチモーダルなラージ言語モデル (LLM) にブラウザの制御を任せることで、AI 主導の自動化の複雑さを回避しようとしていると伝えられています。 が発表した最近のレポートによると、 情報、複数の匿名情報筋の話として、「プロジェクト・ジャービス」は早ければ12月にもプレビューで利用可能となり、モデルがウェブブラウザを利用して「リサーチの収集、製品の購入、航空券の予約」ができるようになる可能性があると述べた。 このサービスは明らかに Chrome に限定されるようで、私たちが収集した情報によると、Gemini の視覚データと書き言葉を解析する機能を利用して、ユーザーに代わってテキストを入力したり Web ページをナビゲートしたりするようです。 これは、Anthropic が行っていることに比べて、Project Jarvis の能力の範囲を制限することになります。先週、この AI スタートアップ企業は、Claude 3.5 Sonnet モデルがコンピュータを使用してアプリケーションを実行し、情報を収集および処理し、テキスト プロンプトに基づいてタスクを実行できるようになった方法を詳しく説明しました。 その主張は、「膨大な量の現代の仕事はコンピューターを介して行われている」というもので、LLM が人間と同じように既存のソフトウェアを活用できるようにすることで、「現世代の AI アシスタントでは不可能な広範なアプリケーションのロックが解除されることになる」というものです。 」 Anthropic は最近のブログ投稿で説明しました。 この種の自動化は、以前から Puppeteer、Playwright、LangChain などの既存のツールを使用して可能でした。今月初め、AIインフルエンサーのサイモン・ウィリソン氏がレポートを発表した。 詳細 Google の AI Studio…

Google は Gemini にブラウザへのアクセスを許可する予定である • –

1730145583
2024-10-28 19:15:00

Google は、マルチモーダルなラージ言語モデル (LLM) にブラウザの制御を任せることで、AI 主導の自動化の複雑さを回避しようとしていると伝えられています。

が発表した最近のレポートによると、 情報、複数の匿名情報筋の話として、「プロジェクト・ジャービス」は早ければ12月にもプレビューで利用可能となり、モデルがウェブブラウザを利用して「リサーチの収集、製品の購入、航空券の予約」ができるようになる可能性があると述べた。

このサービスは明らかに Chrome に限定されるようで、私たちが収集した情報によると、Gemini の視覚データと書き言葉を解析する機能を利用して、ユーザーに代わってテキストを入力したり Web ページをナビゲートしたりするようです。

これは、Anthropic が行っていることに比べて、Project Jarvis の能力の範囲を制限することになります。先週、この AI スタートアップ企業は、Claude 3.5 Sonnet モデルがコンピュータを使用してアプリケーションを実行し、情報を収集および処理し、テキスト プロンプトに基づいてタスクを実行できるようになった方法を詳しく説明しました。

その主張は、「膨大な量の現代の仕事はコンピューターを介して行われている」というもので、LLM が人間と同じように既存のソフトウェアを活用できるようにすることで、「現世代の AI アシスタントでは不可能な広範なアプリケーションのロックが解除されることになる」というものです。 」 Anthropic は最近のブログ投稿で説明しました。

この種の自動化は、以前から Puppeteer、Playwright、LangChain などの既存のツールを使用して可能でした。今月初め、AIインフルエンサーのサイモン・ウィリソン氏がレポートを発表した。 詳細 Google の AI Studio を使用してディスプレイをスクレイピングし、電子メールから数値を抽出した経験。

もちろん、モデルのビジョン能力は完璧ではなく、推論に関してつまずくことがよくあります。私たちは最近、Meta の Llama 3.2 11B 視覚モデルがさまざまなタスクでどのように動作するかを調査し、多くの奇妙な動作と幻覚の傾向を明らかにしました。確かに、Anthropic モデルと Google の Claude モデルと Gemini モデルはかなり大きく、間違いなくこの動作の傾向が低いです。

ただし、特にインターネットにアクセスできる場合は、折れ線グラフの誤解は実際にはほとんど心配する必要はありません。 Anthropic がすぐに警告したように、これらの機能はプロンプト インジェクション スキームによってハイジャックされ、モデルの動作をオーバーライドする命令を Web ページに隠してしまう可能性があります。

AI エージェントがどのように誤動作するかについての別の例として、Redwood Research CEO のバック・シュレゲリス氏は最近、バックエンドで Python と Claude を組み合わせて構築された AI エージェントがどのように誤動作したかを共有しました。

このエージェントは、ネットワークをスキャンし、コンピュータを識別して、それに接続するように設計されています。残念ながら、モデルがシステムに接続するとすぐにマシンを停止させる更新のプルを開始したため、プロジェクト全体が少し狂いました。

レジスター Google にコメントを求めたが、記事公開時点では返答はなかった。 ®

#Google #は #Gemini #にブラウザへのアクセスを許可する予定である #Register

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。