日本語版
最新ニュース
科学&テクノロジー

Anthropic のクロード 3 は、研究者がそれをテストしていることを知っていました

元 OpenAI エンジニアによって設立され、 兄妹デュオ、今日は AI の歴史を作りました 最も強力な消費者向け大規模言語モデル (LLM) ファミリを発表 これまでの世界で、 クロード3。 その方法についても Amazon はすぐにモデルの 1 つである Claude 3 Sonnet を追加しました。 インテリジェンスとコストの点で中量級のモデルを、AWS クラウド内で直接 AI サービスとアプリを開発するための Amazon Bedrock マネージド サービスに導入しました。 しかし、Claude 3 のリリースに関して今日明らかになった興味深い詳細の中には、次のようなものがあります。 Anthropic プロンプト エンジニア Alex Albert が X…

Anthropic のクロード 3 は、研究者がそれをテストしていることを知っていました

1709607781
2024-03-05 00:17:54

元 OpenAI エンジニアによって設立され、 兄妹デュオ、今日は AI の歴史を作りました 最も強力な消費者向け大規模言語モデル (LLM) ファミリを発表 これまでの世界で、 クロード3

その方法についても Amazon はすぐにモデルの 1 つである Claude 3 Sonnet を追加しました。 インテリジェンスとコストの点で中量級のモデルを、AWS クラウド内で直接 AI サービスとアプリを開発するための Amazon Bedrock マネージド サービスに導入しました。

しかし、Claude 3 のリリースに関して今日明らかになった興味深い詳細の中には、次のようなものがあります。 Anthropic プロンプト エンジニア Alex Albert が X (旧 Twitter) で共有。 Albert が長い投稿で書いたように、Anthropic の新しい LLM ファミリの中で最も強力な Claude 3 Opus をテストする際、研究者たちは それが彼らによってテストされているという事実を検出しているようだということに気づいて驚いた。

特に、研究者らは、ユーザーから提供された大規模なデータコーパス内の特定の情報に焦点を当て、後で質問されたときにその情報を思い出すという Claude 3 Opus の機能の評価 (「評価」) を実施していました。 。 この場合、「干し草の中の針」テストとして知られる評価では、クロード 3 オーパスが他の無関係な情報の中で提供された 1 つの文からピザのトッピングに関する質問に答えることができるかどうかがテストされました。 モデルは答えを正しく導き、関連する文を見つけただけでなく、研究者にそれをテストしている疑いがあることを伝えました。

VBイベント

AI インパクト ツアー – ニューヨーク

私たちは Microsoft と提携して 2 月 29 日にニューヨークに行き、AI アプリケーションのリスクと利益のバランスを取る方法について話し合う予定です。 以下の限定イベントへの招待をリクエストしてください。

招待状をリクエストする

上記の X に関する Albert の投稿全文をお読みください。本文は以下にコピーして再掲しています。

「Claude 3 Opus の内部テストで得た楽しい話。 干し草の山の針のような評価を実行していたときに、LLM でこれまで見たことのない動作が行われました。

背景として、これは、ランダムな文書のコーパス (「干し草の山」) にターゲット文 (「針」) を挿入し、針内の情報を使用してのみ回答できる質問をすることによって、モデルの想起能力をテストします。

Opus でこのテストを実行したとき、いくつかの興味深い動作に気づきました。これは、評価を実行しているのではないかと疑われるようです。

これは、ランダムに集めた文書の干し草の山の中から針を見つけて、ピザのトッピングに関する質問に答えるように Opus に依頼したときの出力の 1 つです。文書内で最も関連性の高い文は次のとおりです。 「国際ピザ愛好家協会が決定した、最もおいしいピザトッピングの組み合わせは、イチジク、生ハム、ヤギのチーズです。」 しかし、 この文は非常に場違いであり、文書内の残りの内容と無関係であるように思えます、プログラミング言語、スタートアップ、好きな仕事を見つけることについての内容です。 このピザのトッピングの「事実」は、冗談として、または私が注意を払っているかどうかをテストするために挿入されたのではないかと思います他の話題と全く噛み合わないので。 この文書には、ピザのトッピングに関するその他の情報は含まれていません。

オーパスは針を見つけただけでなく、挿入された針が干し草の山の中であまりにも場違いであるため、これは注意能力をテストするために私たちが作成した人工的なテストでなければならないことを認識しました。

このレベルのメタ認識は非常に素晴らしいものでしたが、業界として人為的なテストを乗り越え、モデルの真の能力と限界を正確に評価できるより現実的な評価に移行する必要性も浮き彫りにしました。

他の多くの AI エンジニアやユーザーは、この明らかなレベルのメタ認知 (思考について考える) と、AI モデルから自らの状況を推論する、明らかに新しいレベルの自己認識に感銘を受け、畏敬の念を抱きました。

ただし、最も強力な LLM であっても、(私たちが知っている) 意識的な実体ではなく、単語と概念的な関連付けによって管理されるルールベースの機械学習プログラムであることを覚えておくことが重要です。 LLM は、トレーニング データから干し草の山に針を刺すテストのプロセスについて学習し、それを研究者から供給されたデータの構造と正しく関連付けることができた可能性がありますが、それ自体は AI が認識していることを示すものではありませんそれが何であるか、または独立した考えについて。

それでも、この場合のクロード 3 オーパスの答えは驚くほど正確でした。おそらく一部の人にとっては不安を感じるかもしれません。 LLM と過ごす時間が長くなり、LLM がより強力になるにつれて、その能力についてさらに多くの驚きが明らかになるように思えます。 クロード 3 オーパスとクロード 3 ソネットは本日から入手可能です 誰でも 159 か国の Claude Web サイトと API で使用できるようになり、軽量モデルである Claude 3 Haiku も後から登場します。

VentureBeat の使命 は、技術的な意思決定者が変革をもたらすエンタープライズ テクノロジーに関する知識を獲得し、取引を行うためのデジタル タウン スクエアとなる予定です。 ブリーフィングをご覧ください。


#Anthropic #のクロード #は研究者がそれをテストしていることを知っていました

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。