日本語版
最新ニュース
科学&テクノロジー

AIエージェントは人間のコンサルタントに取って代わることはできないが、近いうちに代替できるようになる:Mercor CEO

新しい研究は、少なくとも現時点では、AI エージェントが人間のコンサルタントを完全に置き換えることはできないことを示唆しています。Mercor、AI トレーニングの巨人は、AI モデルがエージェントとして機能し、現実世界のコンサルティング、銀行業務、法務業務をどの程度うまく実行できるかをテストしました。 モデルはほとんどの場合失敗したが、Mercor の CEO、Brendan Foody 氏は Business Insider に対し、この結果は物語の一部に過ぎないと語った。コンサルティング業務は、 Mercor の APEX エージェント ベンチマークは、専門家による調査と、マッキンゼー、BCG、デロイト、アクセンチュア、EY のコンサルタントからの意見に基づいて、実際の経営コンサルティング業務をシミュレートするように設計されました。すべてのタスク カテゴリにわたって、 AIエージェント 最初の試行でタスクを正常に完了した時間は 25% 未満でした。 8 回試行しても、エージェントはタスクの 40% しか完了できませんでした。管理コンサルティング タスクに関しては、OpenAI の GPT 5.2 が当初最高のパフォーマンスを発揮し、最初の試行でタスクの約 23% を完了しました。今週リリースされた Anthropic の Opus 4.6…

AIエージェントは人間のコンサルタントに取って代わることはできないが、近いうちに代替できるようになる:Mercor CEO

1770632507
2026-02-09 10:15:00

新しい研究は、少なくとも現時点では、AI エージェントが人間のコンサルタントを完全に置き換えることはできないことを示唆しています。

Mercor、AI トレーニングの巨人は、AI モデルがエージェントとして機能し、現実世界のコンサルティング、銀行業務、法務業務をどの程度うまく実行できるかをテストしました。

モデルはほとんどの場合失敗したが、Mercor の CEO、Brendan Foody 氏は Business Insider に対し、この結果は物語の一部に過ぎないと語った。

コンサルティング業務は、 Mercor の APEX エージェント ベンチマークは、専門家による調査と、マッキンゼー、BCG、デロイト、アクセンチュア、EY のコンサルタントからの意見に基づいて、実際の経営コンサルティング業務をシミュレートするように設計されました。

すべてのタスク カテゴリにわたって、 AIエージェント 最初の試行でタスクを正常に完了した時間は 25% 未満でした。 8 回試行しても、エージェントはタスクの 40% しか完了できませんでした。管理コンサルティング タスクに関しては、OpenAI の GPT 5.2 が当初最高のパフォーマンスを発揮し、最初の試行でタスクの約 23% を完了しました。今週リリースされた Anthropic の Opus 4.6 はさらに優れたパフォーマンスを示し、33% 近くを記録しました。

多くのタスクは完了していませんが、GPT 5.2 の成功率が 23% だったのに対し、GPT 3 の成功率はわずか 3% だったと Foody 氏は述べています。 Anthropic のモデルでは、数か月のうちにコンサルティング タスクの割合が 13% から 33% に増加しました。フーディ氏は、モデルの成功率が年末までに50%近くになると予想していると語った。

「これらは人々がコンサルティング会社に何百万ドルも払って実行する経済界で最も困難なタスクの一部だが、モデルはようやく信じられないほどの進歩でそれらを実行できるようになってきた」とフーディ氏は語った。

AIはすでに コンサルティング業界に変革をもたらした、企業の雇用と収益の方法が変化していますが、モデルが改善され続けるにつれて、エージェントがコンサルタントに取って代わる可能性が高まります。

マッキンゼーのチーフ ボブ・スターンフェルズ 最近、この有名な経営コンサルティング会社には 60,000 人の従業員がおり、そのうち 25,000 人が AI エージェントであると発表されました。

スターンフェルス氏は最近、マッキンゼーの歴史の中で従業員数を増やさずに会社が成長できたのは初めてだと述べた。

AI エージェントがコンサルティング業務で失敗する場所

フロンティアモデル Mercor のテストには、特に OpenAI、Google、Anthropic のものが含まれていました。

コンサルティング タスクの例では、AI エージェントに「PureLife のポートフォリオ戦略のカテゴリー浸透スコア手法を使用してカテゴリーの消費パターンと市場浸透度を分析する」よう指示し、それに応じていくつかの具体的な出力を求めました。 AI エージェントは正確な応答を生成できませんでした。

「プロ仕様のエンドツーエンドモデルに代わる準備ができているモデルは存在しない」と調査結果は結論付けています。

メルコールは、AI エージェントが研究に優れており、非常に優れていることを発見しました。 データ分析とフーディさんは語った。

彼らが常につまずいていたのは、より長期的なタスクでした。人間がタスクを完了するまでにかかる時間が長くなったり、必要な手順が多ければ多いほど、モデルが苦労する可能性がある最大の指標でした。

Foody氏によると、人間とは異なり、モデルは特定のファイルシステムのどこで正しい情報を探すべきかを理解するのに苦労するため、間違ったファイルを見てしまうことが多いという。彼らは、複数のツールを使用して同時にファイルを相互参照する方法を見つけるという計画面で苦労しています。

1 時間以内に実行できるタスク、または 1 つのツールの使用のみを必要とするタスクの場合、モデルは比較的良好にパフォーマンスを発揮します。

Foody 氏は、エージェントはほぼインターンのようなもので、合格率は 50% になる可能性があり、パートナーはまだ業務上多くの問題に気づいていると述べました。

元KPMGコンサルタントで、現在はメルコー社の専門請負業者として働いているフランク・ジョーンズ氏は、AIのトレーニングの経験から、特定のタスクではモデルがそれに近づくことができるが、多くの場合人間による改良が必要であることがわかったと述べた。

同氏はまた、モデルは「クライアントの準備ができている」など、コンサルティングにおける一般的な期待やフレーズを必ずしも理解できるわけではないため、モデルには非常に具体的なプロンプトが必要だと述べた。

「ほとんどのコンサルタントは、それが何を意味するのかを知っています。しかし、AIの場合、それには多くのニュアンスがあると思います」と彼は言いました。

AI モデルは急速に改善されています

Foody 氏によると、モデルの改善を続けるのに画期的な進歩は必要ありません。より多くの、より優れたトレーニングが必要であり、フロンティア ラボは既にそのトレーニングに多額の投資を行っています。

同氏は「だからこそ、われわれはこれほど多くの収益を得ているのだ」と述べ、「われわれは人間の判断を置き換えるビジネスをしているのだ」と付け加えた。

OpenAI、Anthropic、Metaなどを顧客に持つMercorは、秋に同社の評価額を100億ドルとする資金調達契約を締結した。 Mercor は世界中で 30,000 人以上の請負業者を雇用しており、 AI モデルをトレーニングする チャットボットの応答を書き換えるなどのタスクを通じて。 Foodyは以前、同社の2025年の収益は4,658%増加すると述べた。

フーディ氏は、コンサルティング、特に下位レベルの役割は、AI に取って代わられると確信している仕事の 1 つであると述べた。同氏は、AIエージェントベンチマークの次期バージョンは、プロフェッショナルサービス企業のバリューチェーン全体を評価するよう拡張される予定で、「アナリストを評価するのではなく、マッキンゼー自体を評価している」と述べた。

現時点では、Mercor の AI エージェント ベンチマークが魅力的な物語を語っていると彼は言います マッキンゼーにとってなぜなら、同社はAIを利用して価値を付加できるが、人間に取って代わることはできないことを示していると言えるからだ。

同氏は「APEXの次期バージョンはマッキンゼーにとって非常に恐ろしい物語を伝えるものだ」と述べ、「今後2年間で最高のコンサルティング会社と同等のチャットボットを手に入れることになるだろう」と付け加えた。

#AIエージェントは人間のコンサルタントに取って代わることはできないが近いうちに代替できるようになるMercor #CEO

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。