日本語版
最新ニュース
科学&テクノロジー

人類のクロード3.7ソネットは、AIの次の大きな戦いでOpenaiとDeepseekを狙っています

業界をリードするAIカバレッジに関する最新のアップデートと排他的なコンテンツについては、毎日および毎週のニュースレターに参加してください。 もっと詳しく知る 人類 警告ショットを発射しました Openai、 deepseek そして、AI業界全体が発売されました クロード 3.7 ソネット、AIがどのくらいの時間を費やすかについて、ユーザーに前例のない制御を与えるモデル「考え」応答を生成する前。リリースは、のデビューとともに クロード コード、コマンドラインAIコーディングエージェントは、人類のエンタープライズAI市場への積極的なプッシュをシグナルにします。 利害関係は高くなることはありません。先月、Deepseekは、米国システムの機能に一致するAIモデルでハイテクの世界を驚かせました。 コストの割合、nvidiaの送信 在庫17% アメリカのAIリーダーシップについて警告を発します。現在、人類は、生の速度やコスト削減だけでなく、AI推論を正確に制御することで、それを優位にすることを賭けています。 Claude 3.7 Sonnetは「思考モード」トグルを導入し、ユーザーがタスクの複雑さに基づいてAIの応答時間を最適化できるようにします。 (クレジット:人類) 「推論は、アクセスするために個別に支払う必要がある別のものではなく、AIのコア部分とコアコンポーネントであると信じています」と、人類の研究のための製品管理を率いているDianne Penn氏は、VentureBeatとのインタビューで述べています。 。 「人間と同じように、AIは迅速な反応と複雑な思考の両方を処理する必要があります。 「何時ですか?」のような簡単な質問のために、すぐに答える必要があります。しかし、グルテンフリーの食事のニーズに対応しながら2週間のイタリア旅行を計画するなど、複雑なタスクの場合、より広範な処理時間が必要です。」 「推論、計画、自己修正は個別の能力とは見ていません」と彼女は付け加えました。 「これは本質的に、哲学的な違いを表現する方法です。理想的には、モデル自体は、ユーザーが異なる推論モードを明示的に選択することを要求するのではなく、より集中的な思考と調整を必要とするときにモデル自体を認識する必要があります。」 AIモデルの比較は、さまざまなタスクにわたるClaude 3.7 Sonnetのパフォーマンスを示しており、前任者と比較して拡張思考機能が顕著に向上しています。 (クレジット:人類) ベンチマークデータは、人類の野心的なビジョンをバックアップします。拡張思考モードでは、Claude 3.7 Sonnetが達成します 78.2%の精度 大学院レベルの推論タスク、Openaiの最新モデルに挑戦し、DeepSeek-R1を上回る。 しかし、より明確なメトリックは、実際のアプリケーションから得られます。モデルスコア 小売中心のツールの使用で81.2%…

人類のクロード3.7ソネットは、AIの次の大きな戦いでOpenaiとDeepseekを狙っています
1740462359 2025-02-24 18:30:00

業界をリードするAIカバレッジに関する最新のアップデートと排他的なコンテンツについては、毎日および毎週のニュースレターに参加してください。 もっと詳しく知る


人類 警告ショットを発射しました Openaideepseek そして、AI業界全体が発売されました クロード 3.7 ソネット、AIがどのくらいの時間を費やすかについて、ユーザーに前例のない制御を与えるモデル「考え」応答を生成する前。リリースは、のデビューとともに クロード コード、コマンドラインAIコーディングエージェントは、人類のエンタープライズAI市場への積極的なプッシュをシグナルにします。

利害関係は高くなることはありません。先月、Deepseekは、米国システムの機能に一致するAIモデルでハイテクの世界を驚かせました。 コストの割合、nvidiaの送信 在庫17% アメリカのAIリーダーシップについて警告を発します。現在、人類は、生の速度やコスト削減だけでなく、AI推論を正確に制御することで、それを優位にすることを賭けています。

Claude 3.7 Sonnetは「思考モード」トグルを導入し、ユーザーがタスクの複雑さに基づいてAIの応答時間を最適化できるようにします。 (クレジット:人類)

「推論は、アクセスするために個別に支払う必要がある別のものではなく、AIのコア部分とコアコンポーネントであると信じています」と、人類の研究のための製品管理を率いているDianne Penn氏は、VentureBeatとのインタビューで述べています。 。 「人間と同じように、AIは迅速な反応と複雑な思考の両方を処理する必要があります。 「何時ですか?」のような簡単な質問のために、すぐに答える必要があります。しかし、グルテンフリーの食事のニーズに対応しながら2週間のイタリア旅行を計画するなど、複雑なタスクの場合、より広範な処理時間が必要です。」

「推論、計画、自己修正は個別の能力とは見ていません」と彼女は付け加えました。 「これは本質的に、哲学的な違いを表現する方法です。理想的には、モデル自体は、ユーザーが異なる推論モードを明示的に選択することを要求するのではなく、より集中的な思考と調整を必要とするときにモデル自体を認識する必要があります。」

AIモデルの比較は、さまざまなタスクにわたるClaude 3.7 Sonnetのパフォーマンスを示しており、前任者と比較して拡張思考機能が顕著に向上しています。 (クレジット:人類)

ベンチマークデータは、人類の野心的なビジョンをバックアップします。拡張思考モードでは、Claude 3.7 Sonnetが達成します 78.2%の精度 大学院レベルの推論タスク、Openaiの最新モデルに挑戦し、DeepSeek-R1を上回る。

しかし、より明確なメトリックは、実際のアプリケーションから得られます。モデルスコア 小売中心のツールの使用で81.2% 著しい改善を示しています 指導公開(93.2%) – 競合他社が苦労しているか、結果を公開していない分野。

DeepseekとOpenaiがリードしている間 従来の数学ベンチマーク、Claude 3.7の統一アプローチは、単一のモデルが迅速な応答と深い分析を効果的に切り替えることができることを示しており、さまざまなタイプのタスクに対して企業が個別のAIシステムを維持する必要性を排除する可能性があることを示しています。

AnthropicのハイブリッドAIがエンタープライズコンピューティングを再構築する方法

リリースのタイミングは非常に重要です。先月のDeepseekの出現 衝撃波 シリコンバレーを通じて、洗練されたAIの推論がで達成できることを実証します はるかに少ないコンピューティングパワー 以前に考えられていたよりも。これは、AI開発コストとインフラストラクチャの要件に関する基本的な仮定に挑戦しました。 Deepseekが結果を公開したとき、Nvidiaの株 17%を落とした 1日のうちに、投資家は高価なチップが高度なAIに本当に不可欠であるかどうかを突然疑問視しました。

企業にとって、利害関係は高くなることはありません。企業はそうです 数百万を費やしています AIを操作に統合し、どのアプローチが支配するかを賭けます。 Anthropicのハイブリッドモデルは、魅力的なミドルパスを提供します。これは、即時カスタマーサービスの回答から複雑な財務分析まで、目前のタスクに基づいてAIパフォーマンスを微調整する能力です。システムは人類のものを維持します 以前の価格設定 100万ドルあたり3ドルの入力トークン、100万ドルの出力トークンが追加されていても、推論機能が追加されていても。

Claude 3.7 Sonnetは「思考モード」トグルを導入し、ユーザーがタスクの複雑さに基づいてAIの応答時間を最適化できるようにします。 (クレジット:人類)

「顧客は顧客の結果を達成しようとしています」と、人類のプラットフォーム責任者であるマイケル・ガーステンハーバーは説明しました。 「同じモデルを使用して、同じモデルをさまざまな方法でプロンプトすることで、誰かが トンプソン・ロイター 法的調査を行うには、コーディングパートナーのようなものを許可します カーソル または ギルブ アプリケーションを開発し、それらの目標を達成できるようにする。」

人類のハイブリッドアプローチは、技術的な進化と戦略的ギャンビットの両方を表しています。 Openaiが維持している間 さまざまな機能の個別のモデル Deepseekは焦点を当てています コスト効率、人類は、日常的なタスクと複雑な推論の両方を処理できる統一されたシステムを追求しています。これは、企業がAIを展開する方法を再構築し、複数の専門モデルをジャグリングする必要性を排除する哲学です。

Claude Code:AIの新しい開発者アシスタントに会います

今日の人類も発表されました クロード コード、開発者が複雑なエンジニアリングタスクをAIに直接委任できるようにするコマンドラインツール。このシステムは、コードの変更をコミットする前に人間の承認を必要とし、責任あるAI開発に成長する業界の焦点を反映しています。

Anthropicの新しい開発者ツールスイートの一部であるClaude Codeの端末インターフェイスは、シンプルさと直接的な相互作用を強調しています。 (クレジット:人類)

「実際には、クロードが行った変更を受け入れる必要があります。あなたは実践的なレビュアーです [the] ホイール」とペンは指摘した。 「本質的に、モデルが特定のアクションを実行するために本質的に受け入れる必要がある一種のチェックリストがあります。」

発表は、AI開発における激しい競争の中でもたらされます。 スタンフォード大学の研究者 最近作成しました オープンソースの推論モデル 50ドル未満で、Microsoftはちょうど統合されました OpenaiのO3-MINIモデル azureに。 Deepseekの成功はまた、AI開発への新しいアプローチを促進しており、一部の企業はコストをさらに削減できるモデル蒸留技術を探求しています。

Claudeコードのコマンドラインインターフェイスにより、開発者は人間の監視を維持しながら複雑なエンジニアリングタスクを委任できます。 (クレジット:人類)

ポケモンからエンタープライズまで:AIの新しいインテリジェンスのテスト

ペンは、予想外の例でAI機能の劇的な進歩を示しました。 バーミリオンシティ、複数のポケモンを捕獲し、さらにはレベルアップに粉砕しました。ライバルと戦うのにふさわしいポケモンを持っています。」

「私たちは、推論の質を革新し、推進し続け、ダイナミックな推論のようなものに向かってプッシュし続けると思います」とペンは説明しました。 「私たちは、それを常に別々のものではなく、知性の核となる部分だと考えてきました。」

人類のアプローチの実際のテストは、エンタープライズの採用によるものです。ポケモンをプレイすることは些細なように見えるかもしれませんが、それは、特殊なモデルを切り替えることなく、日常的な操作と複雑な戦略的決定の両方を処理できるAI:AIの種類を示しています。クロードの以前のバージョンは、ゲームの最初の町を超えてナビゲートできませんでした。最新バージョンは、戦略を構築し、リソースを管理し、戦術的な意思決定を行います。これは、実際のビジネス上の課題の複雑さを反映する機能です。

エンタープライズの顧客にとって、これは、さまざまなタスクに複数のAIシステムを維持することと、単一のより有能なソリューションを展開することとの違いを意味する可能性があります。次の数ヶ月で、統一されたAI推論に対する人類の賭けがエンタープライズ市場を再構築するのか、それとも業界の急速な進化における別の実験になるかどうかを明らかにします。

#人類のクロード3.7ソネットはAIの次の大きな戦いでOpenaiとDeepseekを狙っています
執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。