1748248439
2025-05-22 16:45:00
Claude 3.7 Sonnetがゲームをプレイしたとき、それはいくつかの課題に遭遇しました:それは「費やしました」数十時間」1つの都市で立ち往生し、ゲームの進捗状況を大幅に発育させた非プレイヤーキャラクターを特定するのに苦労しました。クロード4オーパスで、ハーシーはクロードの長期的な記憶と計画能力の改善に気づきました。即時のフィードバックなしで、推論は新しいレベルの一貫性を示しています。つまり、モデルの順調な能力がより良い能力を持っています。
「これはモデルを知るための私のお気に入りの方法の1つです。これは、その強みが何であるか、その弱点が何であるかを理解する方法です」とハーシーは言います。 「私たちが出そうとしているこの新しいモデルを把握するのは私の方法であり、それとどのように協力するかです。」
誰もがエージェントを望んでいます
人類のポケモン研究は、既存の問題に取り組むための斬新なアプローチです。複雑なタスクに近づいているときにAIがどのような決定を下しているかをどのように理解し、正しい方向に微調整しますか?
その質問への答えは、業界の大いに促進されたAIエージェントを前進させるために不可欠です。ポケモンでは、モデルがコンテキストを失ったり、手元のタスクを「忘れて」いないことが重要です。これは、ワークフローを自動化するように求められたAIエージェントにも当てはまります。これは、数百時間かかるものでもあります。
「タスクが5分間のタスクから30分間のタスクになると、モデルが一貫性を保ち、達成する必要があるすべてのことを覚えておく能力を確認できます。 [the task] 時間の経過とともにうまく悪化します」とハーシーは言います。
人類、 他の多くのAIラボと同様、消費者向けの製品として販売する強力なエージェントを作成したいと考えています。クリーガーは、今年の人類の「最高の目的」は「あなたのために何時間もの仕事をする」ことだと言います。
「このモデルは現在それを提供しています。早期アクセスの顧客の1人がモデルを7時間オフにして大きなリファクタリングを行うのを見ました」と、Krieger氏は言います。
これは、GoogleやOpenaiのような企業が向かっている未来です。今週初めに、GoogleはMarinerをリリースしました。 Chromeに組み込まれたAIエージェント これは、食料品を購入するなどのタスクを実行できます(月額249.99ドル)。最近Openai コーディングエージェントをリリースしました、そして数ヶ月前 オペレーターを起動しました、ユーザーに代わってWebを閲覧できるエージェント。
競合他社と比較して、人類はしばしばより慎重な動きと見なされ、研究で速く進んでいますが、展開は遅くなります。そして、強力なAIでは、それはおそらくポジティブです。ユーザーの受信トレイや銀行のログインなどの機密情報にアクセスできるエージェントに問題がある可能性があります。木曜日のブログ投稿で、人類は次のように述べています。同社はまた、Claude 4 OpusとClaude Sonnet 4の両方が、少なくとも特定のコーディングタスクでは、以前のモデルよりも報酬ハッキングとして知られるこの動作に従事する可能性が65%低いと述べています。
#人類の新しいモデルは推論と計画に優れておりそれを証明するポケモンのスキルを持っています