日本語版
最新ニュース
世界

Google、LLM の動作への理解を深めるために Gemma Scope 2 をリリース

Gemma Scope 2 は、Gemini 3 モデルの動作を解釈するために設計されたツール スイートです。これにより、研究者は、新たなモデルの動作を分析し、AI エージェントを監査およびデバッグし、脱獄、幻覚、お調子者などのセキュリティ問題に対する緩和戦略を考案できるようになります。 解釈可能性の研究は、AI モデルの内部動作と学習されたアルゴリズムを理解することを目的としています。 AI がますます高機能かつ複雑になるにつれ、安全で信頼性の高い AI を構築するには解釈可能性が重要になります。 Google は Gemma Scope を次のように説明しています。 顕微鏡 LLM の場合。スパース オートエンコーダ (SAE) とトランスコーダを組み合わせて、研究者がモデルの内部表現を検査し、モデルが何を「考えているか」を調べ、それらの内部状態がモデルの動作をどのように形成するかを理解できるようにします。重要な使用例の 1 つは、モデルの出力と内部状態の間の不一致を検査することであり、これは安全性リスクを表面化するのに役立つ可能性があると Google は述べています。 Gemma Scope 2 は、Gemma 2 ファミリを対象とした元の Gemma Scope をいくつかの方法で拡張します。最も注目に値するのは、Gemma…

Google、LLM の動作への理解を深めるために Gemma Scope 2 をリリース

1768213511
2026-01-12 10:01:00

Gemma Scope 2 は、Gemini 3 モデルの動作を解釈するために設計されたツール スイートです。これにより、研究者は、新たなモデルの動作を分析し、AI エージェントを監査およびデバッグし、脱獄、幻覚、お調子者などのセキュリティ問題に対する緩和戦略を考案できるようになります。

解釈可能性の研究は、AI モデルの内部動作と学習されたアルゴリズムを理解することを目的としています。 AI がますます高機能かつ複雑になるにつれ、安全で信頼性の高い AI を構築するには解釈可能性が重要になります。

Google は Gemma Scope を次のように説明しています。 顕微鏡 LLM の場合。スパース オートエンコーダ (SAE) とトランスコーダを組み合わせて、研究者がモデルの内部表現を検査し、モデルが何を「考えているか」を調べ、それらの内部状態がモデルの動作をどのように形成するかを理解できるようにします。重要な使用例の 1 つは、モデルの出力と内部状態の間の不一致を検査することであり、これは安全性リスクを表面化するのに役立つ可能性があると Google は述べています。

Gemma Scope 2 は、Gemma 2 ファミリを対象とした元の Gemma Scope をいくつかの方法で拡張します。最も注目に値するのは、Gemma 3 モデルのすべてのレイヤーにわたって SAE とトランスコーダーを再トレーニングしたことです。 スキップトランスコーダ そして クロスレイヤートランスコーダ、マルチステップの計算と分散アルゴリズムを解釈しやすくするように設計されています。

レイヤー数を増やすと、 Googleが解説は、コンピューティングとメモリの要件を直接的に増加させます。これには、層の数に応じて線形にスケールする複雑さを維持するために、特殊なスパース カーネルを設計する必要があります。

さらに、Google は より高度なトレーニングテクニック これにより、より有用な概念を特定する Gemma Scope 2 の機能が向上すると同時に、最初の実装でのいくつかの既知の欠陥にも対処できます。最後に、Gemma Scope 2 では、チャットボット分析に特化したツールを導入し、脱獄、拒否メカニズム、思考連鎖の忠実性など、複雑な複数段階の動作の研究を可能にします。

スパース オートエンコーダは、エンコーダ関数とデコーダ関数のペアを使用して、すべての LLM 入力を分解および再構築します。一方、トランスコーダは、多層パーセプトロン (MLP) サブレイヤの計算をまばらに再構築するようにトレーニングされます。つまり、特定の入力に対する出力を近似する方法を学習します。これにより、各レイヤーとサブレイヤーのどの部分、より正確にはどのアクティベーション パターンが個々の入力トークンやトークンのシーケンスによってトリガーされるかを識別するのに役立ちます。

セキュリティ問題への応用以外にも、 redditorのメスカリアン氏は予見 この研究により次のことが可能になると考えられます。

また、他の領域のベストプラクティスを知らせるのにも役立ち、将来的には、この技術はおそらく、よりインテリジェントな AI の内部推論を監視するために使用されるでしょう。ただし現時点では、重量の微調整やその他の変更によるステアリング機能に最も役立ちます。

Googleと同様に、AnthropicとOpenAIも、自社モデルに合わせた独自の「AI顕微鏡」をリリースした。

Googleは次の重みを発表しました。 ハグ顔のジェマスコープ2

#GoogleLLM #の動作への理解を深めるために #Gemma #Scope #をリリース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。