日本語版
最新ニュース
世界

Anthropic が Claude 3.5 Sonnet を発表、ベンチマークでは GPT-4o に匹敵

アントロピック / ベンジ・エドワーズ 木曜日、Anthropic は Claude 3.5 Sonnet を発表しました。これは最新の AI 言語モデルであり、3 月にリリースされた Claude 3 をベースにした新しい「3.5」モデル シリーズの最初のものです。Claude 3.5 は、テキストの作成、データの分析、コードの記述が可能です。200,000 トークンのコンテキスト ウィンドウを備え、Claude の Web サイトおよび API を通じて現在利用可能です。Anthropic は、関連する作業ドキュメントを専用ウィンドウに表示する Claude インターフェイスの新機能である Artifacts も発表しました。 これまでのところ、Anthropic 以外の人たちは感銘を受けているようだ。「このモデルは本当に素晴らしい」と、独立系 AI 研究者の Simon Willison 氏は X…

Anthropic が Claude 3.5 Sonnet を発表、ベンチマークでは GPT-4o に匹敵

1719186162
2024-06-20 21:04:59

アントロピック / ベンジ・エドワーズ

木曜日、Anthropic は Claude 3.5 Sonnet を発表しました。これは最新の AI 言語モデルであり、3 月にリリースされた Claude 3 をベースにした新しい「3.5」モデル シリーズの最初のものです。Claude 3.5 は、テキストの作成、データの分析、コードの記述が可能です。200,000 トークンのコンテキスト ウィンドウを備え、Claude の Web サイトおよび API を通じて現在利用可能です。Anthropic は、関連する作業ドキュメントを専用ウィンドウに表示する Claude インターフェイスの新機能である Artifacts も発表しました。

これまでのところ、Anthropic 以外の人たちは感銘を受けているようだ。「このモデルは本当に素晴らしい」と、独立系 AI 研究者の Simon Willison 氏は X に書いている。「これは総合的に見て新しい最高のモデルだと思います (そして、GPT-4 Turbo から GPT-4o への飛躍と同様に、Opus よりも高速で価格も半分です)。」

以前にも書いたように、大規模言語モデル (LLM) のベンチマークは、厳選される可能性があり、考えられるほぼすべてのトピックについて、マシンを使用して出力を生成する感覚やニュアンスを捉えられないことが多いため、厄介です。しかし、Anthropic によると、Claude 3.5 Sonnet は、MMLU (学部レベルの知識)、GSM8K (小学校の数学)、HumanEval (コーディング) などの特定のベンチマークで、GPT-4o や Gemini 1.5 Pro などの競合モデルに匹敵するか、それを上回っています。

Claude 3.5 Sonnet ベンチマークは Anthropic によって提供されています。
拡大する / Claude 3.5 Sonnet ベンチマークは Anthropic によって提供されています。

これらすべてにうんざりするかもしれませんが、それは問題ありません。研究者にとっては意味がありますが、他の人にとっては主にマーケティングです。より有用なパフォーマンス メトリックは、LMSYS の Chatbot Arena などのサイトでの競合使用によって測定される主観的で非厳密な総合的な感情である「vibemarks」(ここで最初に造語されました!) と呼ばれるものです。Claude 3.5 Sonnet モデルは現在そこで評価中ですが、それがどの程度うまくいくかを判断するのは時期尚早です。

Claude 3.5 Sonnet は、「推論」、数学スキル、一般知識、コーディング能力を測定するベンチマークでも、Anthropic の以前の最高モデル (Claude 3 Opus) を上回っています。たとえば、このモデルは内部コーディング評価で優れたパフォーマンスを示し、Claude 3 Opus が 38 % の問題を解決したのに対し、64 % の問題を解決しました。

Claude 3.5 Sonnet も、画像形式で視覚入力を受け入れるマルチモーダル AI モデルであり、この新しいモデルは一連の視覚理解テストで優れていると報告されています。

Claude 3.5 Sonnet ベンチマークは Anthropic によって提供されています。
拡大する / Claude 3.5 Sonnet ベンチマークは Anthropic によって提供されています。

大まかに言えば、ビジュアルベンチマークは、3.5 Sonnet が以前のモデルよりも画像から情報を引き出すのが優れていることを意味します。たとえば、フットボールヘルメットをかぶったウサギの写真を見せると、モデルはそれがフットボールヘルメットをかぶったウサギであることを認識して、それについて話すことができます。これは技術デモには楽しいものですが、信頼性がミッションクリティカルな技術のアプリケーションにはまだ十分な精度がありません。

#Anthropic #が #Claude #Sonnet #を発表ベンチマークでは #GPT4o #に匹敵

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。