1761819703
2025-10-30 09:47:00
Giorgos Nikolaou と他の 5 人の著者による、「Language Models are Injective and したがって Invertible」というタイトルの論文の PDF を表示します。
抽象的な:非線形アクティベーションや正規化などのトランスフォーマー コンポーネントは本質的に非単射的であり、異なる入力が同じ出力にマッピングされ、モデルの表現からの入力の正確な回復を妨げる可能性があることを示唆しています。本稿では、この見解に異議を唱えます。まず、離散入力シーケンスを対応する連続表現シーケンスにマッピングするトランスフォーマー言語モデルは単射的であり、したがって可逆性があり、この特性は初期化時に確立され、トレーニング中に保存されることを数学的に証明します。次に、6 つの最先端の言語モデルでの数十億回の衝突テストを通じてこの結果を経験的に確認し、衝突は観察されませんでした。第三に、単射性を操作します。SipIt を導入します。これは、隠れたアクティベーションから正確な入力テキストを証明可能かつ効率的に再構築し、線形時間保証を確立し、実際に正確な可逆性を実証する最初のアルゴリズムです。全体として、私たちの研究は言語モデルの基本的かつ悪用可能な特性としての注入性を確立し、透明性、解釈可能性、安全な展開に直接的な影響を及ぼします。
投稿履歴
投稿者: アンドレア サンティリ [view email]
[v1]
2025 年 10 月 17 日金曜日 10:25:30 UTC (3,980 KB)
[v2]
2025 年 10 月 20 日 (月) 07:29:02 UTC (3,980 KB)
[v3]
2025 年 10 月 21 日火曜日 14:44:49 UTC (3,980 KB)
#言語モデルは単射的であるため可逆的です