1770405826
2026-02-06 19:01:00
Google は Gemini 3 Flash にエージェント ビジョンを追加しました、視覚的な推論とコードの実行を組み合わせて、「視覚的な証拠で答えを根拠付ける」ことができます。 Google によると、これにより精度が向上するだけでなく、さらに重要なことに、まったく新しい AI 主導の動作が可能になります。
簡単に言うと、Gemini 3 Flash は、シングル パスで画像を分析するのではなく、エージェントのような調査として視覚にアプローチするようになりました。手順を計画し、画像を操作し、回答する前にコードを使用して詳細を確認します。
これにより、「考える -> 行動する -> 観察」のループが発生します。このループでは、モデルはまずプロンプトとイメージを分析して、複数ステップのアプローチを計画します。次に、Python コードを生成して実行して画像を操作し、トリミング、ズーム、注釈付け、計算などの追加情報を画像から抽出します。そして最後に、新しい答えを生成する前に、変換された画像をコンテキストに追加します。
Google によると、このアプローチにより、2 つの主要な要因により、ほとんどの視覚ベンチマークにおいて視覚タスクの精度が 5 ~ 10% 向上します。
まず、コードを実行すると、推測に頼るのではなく、小さなテキストなどの小さな視覚要素にズームインすることで、画像の詳細をきめ細かく検査できるようになります。 Gemini は、境界ボックスやラベルを描画して画像に注釈を付けることもでき、オブジェクトを正確に数えるなど、視覚的な推論を強化することもできます。 Google は、このような注釈を使用して、手の桁を数えるという悪名高い「難しい問題」を解決したと主張しています。
2 つ目は、視覚的な算術演算とデータの視覚化を、Matplotlib を使用して Python で記述された決定論的コードにオフロードできるため、複雑な画像ベースの数学における幻覚を軽減できます。
Googleの発表に反応、XユーザーKanika 観察された:
これがもたらす影響は極めて大きい。基本的に、彼らは AI を実際の物理的なロボットに実装するための視覚的推論を解き放ちました。ロボットは、より多くのコンテキスト認識機能とエージェント機能を備えます。
他のredditorは次のように指摘しました ChatGPT は、コード インタプリタを介して同様のアプローチをかなり長い間採用してきました。;それにもかかわらず、それはまだ 手の数字を確実に数えることができないようです。
Google のエージェント ビジョンのロードマップには、明示的なプロンプトなしでズーム、回転、その他のアクションを自動的にトリガーするなど、より暗黙的な動作が含まれています。 Web 検索や逆画像検索などの新しいツールを追加して、モデルで利用できる証拠を強化します。さらに、Flash を超えて Gemini ファミリの他のモデルにもサポートを拡張します。
Agentic Vision は、Google AI Studio および Vertex AI の Gemini API を通じてアクセスでき、Thinking モードの Gemini アプリでの展開が開始されています。
#Google #が #Gemini #Flash #を #Agentic #Vision #で強化