日本語版
最新ニュース
科学&テクノロジー

AIはブラックボックス。Anthropicは内部を見る方法を発見

昨年、研究チームはニューロンの層を 1 つだけ使う小さなモデルで実験を始めた (高度な LLM には数十の層がある)。できるだけ単純な設定で、特徴を表すパターンを発見できるのではないかと期待した。数え切れないほどの実験を行ったが、どれも成功しなかった。「いろいろなことを試したが、何もうまくいかなかった。でたらめなゴミの集まりのようだった」と、アンスロピックの技術スタッフの 1 人であるトム・ヘニガンは言う。その後、「ジョニー」と名付けられた実験 (各実験にはランダムな名前が付けられた) で、出力に現れる概念とニューラル パターンを関連付け始めた。「クリスはそれを見て、『すごい。これはすごい』と言った」と、同じく驚いていたヘニガンは言う。「私もそれを見て、『おお、すごい、ちょっと待って、これ機能してるの?』と思った」突然、研究者たちはニューロンのグループがエンコードしている特徴を特定できるようになった。彼らはブラックボックスを覗き込むことができたのだ。ヘニガン氏は、最初に調べた 5 つの特徴を特定したと語る。ニューロンの 1 つのグループはロシア語のテキストを意味していた。もう 1 つは Python コンピューター言語の数学関数に関連付けられていた。などなど。彼らができることを示したら 特徴を特定する 研究者たちは、この小さなモデルで、実物大のLLMを解読するというより困難な課題に取り組んだ。彼らは、アントロピックの現在の3つのモデルのうち中程度の強度のバージョンであるクロード・ソネットを使用した。これもうまくいった。彼らの目に留まった特徴の1つは、ゴールデンゲートブリッジに関連するものだった。彼らは、一緒に発火すると、クロードがサンフランシスコとマリン郡を結ぶ巨大な構造物について「考えていた」ことを示すニューロンのセットをマッピングした。さらに、同様のニューロンのセットが発火すると、ゴールデンゲートブリッジに隣接する主題、つまりアルカトラズ、カリフォルニア州知事ギャビン・ニューサム、ヒッチコックの映画を想起させた。 めまいはサンフランシスコを舞台にしています。チームは合計で何百万もの特徴を特定しました。これはクロードのニューラル ネットワークを解読するための一種のロゼッタ ストーンです。特徴の多くは安全に関連したもので、「何らかの隠された動機で誰かに近づく」、「生物兵器に関する議論」、「世界を征服しようとする悪党の陰謀」などがありました。アントロピック チームは次のステップに進み、その情報を使ってクロードの行動を変えられるかどうかを確認しました。彼らはニューラル ネットを操作して特定の概念を増強または縮小し始めました。これは一種の AI 脳手術で、LLM をより安全にし、特定の領域でその力を高める可能性があります。「このボードに機能があるとします。モデルをオンにすると、そのうちの 1 つが点灯し、『ああ、ゴールデン ゲート ブリッジについて考えている』とわかります」と、チームに所属するアントロピックの科学者、シャン カーターは言います。「そこで、これらすべてに小さなダイヤルを付けたらどうなるか、そのダイヤルを回したらどうなるか、と考えました」これまでのところ、その質問に対する答えは、ダイヤルを適切な量回すことが非常に重要であるということのようです。Anthropic によると、これらの特徴を抑制することで、モデルはより安全なコンピューター プログラムを生成し、偏りを減らすことができます。たとえば、チームは、安全でないコンピューター コード、詐欺メール、危険な製品の作成手順など、危険な慣行を表すいくつかの特徴を発見しました。 #AIはブラックボックスAnthropicは内部を見る方法を発見

AIはブラックボックス。Anthropicは内部を見る方法を発見

1716988352
2024-05-21 15:00:00

昨年、研究チームはニューロンの層を 1 つだけ使う小さなモデルで実験を始めた (高度な LLM には数十の層がある)。できるだけ単純な設定で、特徴を表すパターンを発見できるのではないかと期待した。数え切れないほどの実験を行ったが、どれも成功しなかった。「いろいろなことを試したが、何もうまくいかなかった。でたらめなゴミの集まりのようだった」と、アンスロピックの技術スタッフの 1 人であるトム・ヘニガンは言う。その後、「ジョニー」と名付けられた実験 (各実験にはランダムな名前が付けられた) で、出力に現れる概念とニューラル パターンを関連付け始めた。

「クリスはそれを見て、『すごい。これはすごい』と言った」と、同じく驚いていたヘニガンは言う。「私もそれを見て、『おお、すごい、ちょっと待って、これ機能してるの?』と思った」

突然、研究者たちはニューロンのグループがエンコードしている特徴を特定できるようになった。彼らはブラックボックスを覗き込むことができたのだ。ヘニガン氏は、最初に調べた 5 つの特徴を特定したと語る。ニューロンの 1 つのグループはロシア語のテキストを意味していた。もう 1 つは Python コンピューター言語の数学関数に関連付けられていた。などなど。

彼らができることを示したら 特徴を特定する 研究者たちは、この小さなモデルで、実物大のLLMを解読するというより困難な課題に取り組んだ。彼らは、アントロピックの現在の3つのモデルのうち中程度の強度のバージョンであるクロード・ソネットを使用した。これもうまくいった。彼らの目に留まった特徴の1つは、ゴールデンゲートブリッジに関連するものだった。彼らは、一緒に発火すると、クロードがサンフランシスコとマリン郡を結ぶ巨大な構造物について「考えていた」ことを示すニューロンのセットをマッピングした。さらに、同様のニューロンのセットが発火すると、ゴールデンゲートブリッジに隣接する主題、つまりアルカトラズ、カリフォルニア州知事ギャビン・ニューサム、ヒッチコックの映画を想起させた。 めまいはサンフランシスコを舞台にしています。チームは合計で何百万もの特徴を特定しました。これはクロードのニューラル ネットワークを解読するための一種のロゼッタ ストーンです。特徴の多くは安全に関連したもので、「何らかの隠された動機で誰かに近づく」、「生物兵器に関する議論」、「世界を征服しようとする悪党の陰謀」などがありました。

アントロピック チームは次のステップに進み、その情報を使ってクロードの行動を変えられるかどうかを確認しました。彼らはニューラル ネットを操作して特定の概念を増強または縮小し始めました。これは一種の AI 脳手術で、LLM をより安全にし、特定の領域でその力を高める可能性があります。「このボードに機能があるとします。モデルをオンにすると、そのうちの 1 つが点灯し、『ああ、ゴールデン ゲート ブリッジについて考えている』とわかります」と、チームに所属するアントロピックの科学者、シャン カーターは言います。「そこで、これらすべてに小さなダイヤルを付けたらどうなるか、そのダイヤルを回したらどうなるか、と考えました」

これまでのところ、その質問に対する答えは、ダイヤルを適切な量回すことが非常に重要であるということのようです。Anthropic によると、これらの特徴を抑制することで、モデルはより安全なコンピューター プログラムを生成し、偏りを減らすことができます。たとえば、チームは、安全でないコンピューター コード、詐欺メール、危険な製品の作成手順など、危険な慣行を表すいくつかの特徴を発見しました。

#AIはブラックボックスAnthropicは内部を見る方法を発見

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。