1767263421
2025-08-22 23:25:00
研究者による新しいフレームワーク 香港大学 (HKU) と協力機関は、コンピューターを操作できる堅牢な AI エージェントを作成するためのオープンソース基盤を提供します。と呼ばれるフレームワーク OpenCUAには、コンピューター使用エージェント (CUA) の開発を拡張するためのツール、データ、レシピが含まれています。
このフレームワークを使用してトレーニングされたモデルは、CUA ベンチマークで優れたパフォーマンスを示し、既存のオープンソース モデルを上回り、OpenAI や Anthropic などの主要な AI ラボのクローズド エージェントと緊密に競合します。
コンピュータ用エージェント構築の課題
パソコン利用代理店 Web サイトのナビゲーションから複雑なソフトウェアの操作に至るまで、コンピュータ上でタスクを自律的に実行できるように設計されています。また、企業内のワークフローの自動化にも役立ちます。ただし、最も有能な CUA システムは独自のものであり、そのトレーニング データ、アーキテクチャ、開発プロセスに関する重要な詳細は非公開に保たれています。
「透明性の欠如が技術の進歩を制限し、安全性への懸念を引き起こすため、研究コミュニティはその能力、限界、リスクを研究するための真にオープンなCUAフレームワークを必要としています」と研究者らは論文で述べている。 彼らの論文。
同時に、オープンソースへの取り組みは独自のハードルに直面しています。これらのエージェントのトレーニングに必要な多様で大規模なデータを収集するためのスケーラブルなインフラストラクチャがありませんでした。グラフィカル ユーザー インターフェイス (GUI) 用の既存のオープンソース データセットにはデータが限られており、多くの研究プロジェクトではその手法に関する詳細が不十分であるため、他の人がその研究を複製することが困難になっています。
論文によると、「これらの制限は総合的に汎用 CUA の進歩を妨げ、そのスケーラビリティ、汎用性、および潜在的な学習アプローチの有意義な探求を制限します。」
OpenCUA の紹介
OpenCUA フィールドワーク: XLANG Lab と HU
OpenCUA は、データ収集とモデル自体の両方をスケーリングすることでこれらの課題に対処するように設計されたオープン ソース フレームワークです。その中心となるのは、さまざまなオペレーティング システム上でのコンピュータ タスクの人間によるデモンストレーションを記録するための AgentNet ツールです。
このツールは、アノテーターのパーソナル コンピュータのバックグラウンドで実行され、画面ビデオ、マウスとキーボードの入力、および画面上の要素に関する構造化された情報を提供する基盤となるアクセシビリティ ツリーをキャプチャすることで、データ収集を効率化します。この生データは、コンピュータのスクリーンショット (状態) とユーザーの対応するアクション (クリック、キーの押下など) を組み合わせた「状態-アクションの軌跡」に処理されます。アノテーターは、これらのデモンストレーションをレビュー、編集、送信できます。

エージェント
このツールを使用して、研究者らは AgentNet データセットを収集しました。このデータセットには、Windows、macOS、Ubuntu にわたる 22,600 以上のタスク デモンストレーションが含まれており、200 以上のアプリケーションと Web サイトにまたがっています。 「このデータセットは、ユーザーの個人的なコンピューティング環境から、人間の行動と環境のダイナミクスの複雑さを正確に捉えています」と論文では述べられています。
画面録画ツールが企業にとってデータ プライバシーに関する重大な懸念を引き起こすことを認識し、研究者らはセキュリティを念頭に置いて AgentNet ツールを設計しました。この論文の共著者で香港大学の博士課程学生である Xinyuan Wang 氏は、多層のプライバシー保護フレームワークを実装していると説明しました。 「まず、アノテーター自身が、生成したデータを十分に観察してから、送信するかどうかを決定できます」と同氏は VentureBeat に語った。その後、データはプライバシー問題について手動で検証され、リリース前に残っている機密コンテンツを検出するために大規模モデルによる自動スキャンが行われます。 「この階層化されたプロセスにより、機密性の高い顧客データや財務データを扱う環境に対してエンタープライズ グレードの堅牢性が保証されます」と Wang 氏は付け加えました。
評価を加速するために、チームは AgentNetBench も厳選しました。これは、各ステップで複数の正しいアクションを提供し、エージェントのパフォーマンスを測定するより効率的な方法を提供するオフライン ベンチマークです。
エージェントをトレーニングするための新しいレシピ
OpenCUA フレームワークは、データを処理し、コンピューター使用エージェントをトレーニングするための新しいパイプラインを導入します。最初のステップでは、生の人間のデモンストレーションをトレーニングに適したクリーンな状態とアクションのペアに変換します。 視覚言語モデル (VLM)。しかし、研究者らは、これらのペアでモデルをトレーニングするだけでは、たとえ大量のデータがあってもパフォーマンスの向上が限られていることを発見しました。

OpenCUA 思考連鎖パイプライン 出典: HKU の XLang Lab
重要な洞察は、これらの軌道を次のように強化することでした。 思考の連鎖 (CoT) 推論。このプロセスにより、計画、記憶、反省を含む各行動の詳細な「内なる独白」が生成されます。この構造化された推論は、画面の高レベルの観察、状況を分析して次のステップを計画する内省的思考、そして最後に簡潔で実行可能なアクションの 3 つのレベルで構成されます。このアプローチは、エージェントがタスクをより深く理解するのに役立ちます。
「私たちは、自然言語推論が一般化可能なコンピューター利用の基礎モデルにとって重要であり、CUAが認知能力を内面化するのに役立つことを発見しました」と研究者らは書いている。
このデータ合成パイプラインは、企業が独自の内部ツールでエージェントをトレーニングするために適用できる一般的なフレームワークです。 Wang 氏によると、企業は独自のワークフローのデモンストレーションを記録し、同じ「リフレクター」と「ジェネレーター」パイプラインを使用して必要なトレーニング データを作成できます。 「これにより、推論トレースを手動で作成する必要がなく、内部ツールに合わせて高性能のエージェントをブートストラップできるようになります」と彼は説明しました。
OpenCUA をテストする
研究者らは、OpenCUA フレームワークを適用して、Qwen や Kim-VL の亜種を含む、パラメーター サイズが 30 億から 320 億の範囲のオープンソース VLM をトレーニングしました。モデルは、タスクを実行し、GUI を理解する能力をテストする一連のオンラインおよびオフラインのベンチマークで評価されました。
320 億のパラメータ モデルである OpenCUA-32B は、OSWorld-Verified ベンチマークにおけるオープン ソース モデルの中で新たな最先端の成功率を確立しました。 OpenAIも上回った GPT-4oベースのCUA そして、Anthropic の主要な独自モデルとのパフォーマンスの差を大幅に縮めました。

OpenCUA は、主要な CUA モデル (右) と競合しながら、基本モデル (左) に対して大幅な改善を示しています。出典: XLANG Lab at HKU
この調査は、企業の開発者や製品リーダーにとって、いくつかの重要な発見を提供します。 OpenCUA メソッドは幅広く適用可能で、さまざまなアーキテクチャ (高密度と高密度の両方) のモデルのパフォーマンスを向上させます。 専門家の混合)とサイズ。訓練を受けたエージェントは強力な汎用性も示し、さまざまなタスクやオペレーティング システムにわたって優れたパフォーマンスを発揮します。
Wang 氏によると、このフレームワークは、反復的で労働集約的な企業ワークフローの自動化に特に適しています。 「たとえば、AgentNet データセットでは、Amazon AWS での EC2 インスタンスの起動と MTurk でのアノテーション パラメータの構成のデモをすでにいくつかキャプチャしています」と同氏は VentureBeat に語った。 「これらのタスクには多くの一連のステップが含まれますが、反復可能なパターンに従っています。」
ただし、Wang 氏は、実際の導入までのギャップを埋めるには、安全性と信頼性に関する主要な課題に対処する必要があると指摘しました。 「実際の導入における最大の課題は、安全性と信頼性です。エージェントは、システム設定を不用意に変更したり、意図したタスクを超えて有害な副作用を引き起こしたりする可能性のある間違いを回避する必要があります。」と同氏は述べています。
研究者らが発表したのは、 コード、 データセット、 そして 重み 彼らのモデルのために。
OpenCUA のようなフレームワークに基づいて構築されたオープンソース エージェントの機能が向上するにつれて、ナレッジ ワーカーとそのコンピュータとの関係が根本的に進化する可能性があります。ワン氏は、複雑なソフトウェアの習熟度よりも、AI エージェントに目標を明確に伝える能力が重要になる未来を思い描いています。
彼は 2 つの主要な作業モードについて説明しました。「オフライン オートメーションでは、エージェントが幅広いソフトウェア知識を活用してエンドツーエンドでタスクを遂行します」、もう 1 つは「オンライン コラボレーションでは、エージェントがリアルタイムで応答し、同僚のように人間と並んで作業します」。基本的に、人間は戦略的な「何を」を提供し、ますます高度化する AI エージェントが運用上の「どのように」を処理します。
#OpenCUA #のオープンソース #コンピュータ使用エージェントはOpenAI #や #Anthropic #の独自モデルに匹敵します