1744860269
2025-04-16 16:21:00
今後数年間、 エージェント コンピューターやスマートフォンを使用するなど、人間に代わってますます多くの雑用を引き継ぐことが広く期待されています。しかし今のところ、 それらはあまりにもエラーが発生しやすいです 多くの用途があります。
Startup Simular AIによって作成されたS2と呼ばれる新しいエージェントは、フロンティアモデルとコンピューターの使用に特化したモデルを組み合わせています。エージェントは、アプリの使用やファイルの操作などのタスクで最先端のパフォーマンスを達成し、さまざまな状況で異なるモデルに頼ることがエージェントの前進に役立つ可能性があることを示唆しています。
「コンピューター使用エージェントは、大規模な言語モデルとは異なり、コーディングとは異なります」とSimularの共同設立者兼CEOであるAng Li氏は述べています。 「それは別のタイプの問題です。」
Simularのアプローチでは、OpenaiのGPT-4OやAnthropicのClaude 3.7のような強力な汎用AIモデルは、手元のタスクを完了する最善の方法について推論するために使用されます。
2023年にSimularを設立する前にGoogle Deepmindの研究者であったLiは、大規模な言語モデルが計画に優れているが、グラフィカルユーザーインターフェイスの要素を認識するのには上手ではないと説明しています。
S2は、アクションとユーザーフィードバックを記録し、それらの録音を使用して将来のアクションを改善する外部メモリモジュールの経験から学習するように設計されています。
特に複雑なタスクでは、S2は他のどのモデルよりも優れたパフォーマンスを発揮します Osworld、コンピューターオペレーティングシステムを使用するエージェントの能力を測定するベンチマーク。
たとえば、S2は50のステップを伴うタスクの34.5%を完了し、beat打 Openaiのオペレーター、32%を完了することができます。同様に、S2はAndroidWorldで50%を獲得しました。AndroidWorldは、スマートフォン使用エージェントのベンチマークであり、次のベストエージェントは46%を獲得します。
カナダのウォータールー大学のコンピューター科学者であり、Osworldの作成者の1人であるVictor Zhongは、将来の大きなAIモデルが視覚的な世界を理解し、グラフィカルなユーザーインターフェイスを理解するのに役立つトレーニングデータを組み込んでいると考えています。
「これは、エージェントがはるかに高い精度でGUIをナビゲートするのに役立ちます」とZhong氏は言います。 「その間、このような基本的なブレークスルーの前に、最先端のシステムは複数のモデルを組み合わせて単一モデルの制限にパッチを当てているという点で同時に似ていると思います。」
このコラムの準備のために、私はSimularを使用してフライトを予約し、Amazonを取引に精査しました。 自動生成 そして vimgpt。
しかし、最も賢いAIエージェントでさえ、エッジのケースにまだ悩まされており、時々奇妙な行動を示すようです。ある例では、S2にOsworldの背後にある研究者の連絡先情報を見つけるのに役立つように依頼したとき、エージェントはプロジェクトページとOsworldのDiscordのログインの間にループホッピングに巻き込まれました。
Osworldのベンチマークは、なぜエージェントが現実よりも誇大宣伝をしているのかを示しています。人間はOsworldタスクの72%を完了することができますが、エージェントは複雑なタスクで38%の時間を失っています。とはいえ、2024年4月にベンチマークが導入されたとき、最高のエージェントはタスクの12%しか完了できませんでした。
#複数のパーソナリティでAIエージェントに会います