受信トレイでよりスマートな洞察が必要ですか?毎週のニュースレターにサインアップして、エンタープライズAI、データ、セキュリティリーダーにとって重要なことのみを取得します。 今すぐ購読してください
Openai’s 新しい、強力なオープンウェイト AI大手言語モデル(LLM)ファミリー GPT-Ossは2週間前にリリースされました 寛容なApache 2.0ライセンス – 2019年のGPT-2以来の同社の最初のオープンウェイトモデルの発売 – しかし、会社の外部の開発者はすでにそれを再構築しています。
最も印象的なものの1つ 例はジャック・モリスから来ています、Cornell Tech PhDの学生、元Google Brain Resident、およびMetaの現在の研究者、 今週はGPT-OSS-20Bベースを発表しました、 Openaiの小型GPT-OSS-20Bモデルの彼自身の再加工バージョン。 モデルの「推論」動作を削除します そして、それを事前に訓練した「ベース」バージョンに戻します。これは、より速く、より自由で、より無修正で制約のない応答を提供します。
モデルは現在入手可能です 顔を抱き締める aの下 寛容なMITライセンス、両方の追加に使用できるようにします 研究および商業アプリケーション。
GPT-OSS-20Bベースは、OpenaiのGPT-OSSモデルとは異なります
モリスが何をしたかを理解するために、それは OpenaiのリリースとAIの研究者が「ベースモデル」と呼ぶものとの違い。
AIスケーリングは限界に達します
パワーキャップ、上昇するトークンコスト、および推論の遅延は、エンタープライズAIを再構築しています。排他的なサロンに参加して、トップチームがどのようになっているかを発見してください。
- エネルギーを戦略的優位性に変える
- 実際のスループットゲインのための効率的な推論をアーキテクテクティブします
- 持続可能なAIシステムで競争力のあるROIのロックを解除します
先にとどまるためにあなたの場所を確保してください: https://bit.ly/4mwgngo
Openai、Anthropic、Google、さらにはMeta、Deepseek、AlibabaのQwenチームなどのオープンソースプレーヤーなどの大手AIラボが提供するほとんどのLLMは、「訓練後」です。
これは、彼らが望ましい行動のキュレーションされた例にさらされる追加の段階を経たことを意味します。
指示調整モデルの場合、それは理想的な応答と組み合わせた指示の多くの例を与えることを意味するため、自然言語の要求にもっと役立つ、丁寧に、または安全に応答することが学びます。
8月5日に出版されたGPT-Ossモデルは、「推論が最適化された」ものでした。次の言葉を予測するだけでなく、安全で一貫した方法で指示に従うために訓練され、微調整され、最終的な答えを作成する前に構造化された「思考の連鎖」推論で問題を踏むことがよくあります。
これはトレンドです OpenaiのO1モデルに戻ります ほぼ1年前に2024年9月にリリースされましたが、現在採用されている多数の大手AIラボが採用しています。 モデルを複数のステップでより長く考え、以前に自分の作業を確認することを強制する ユーザーへの適切な応答を出力します。
そのため、コーディング、数学の問題の解決、事実の質問への回答などのタスクに適しています。また、回答がフィルタリングされ、安全でないコンテンツや望ましくないコンテンツから操縦されることも意味します。
ベースモデルは異なります。これは、推論固有のアライメントが適用される前の大規模な言語モデルの生の前のバージョンです。ベースモデルは、組み込みのガードレール、スタイルの好み、または拒否行動がなく、以前に何が来たかを考えると、次のテキストの塊を予測しようとします。
彼らは何人かの研究者によって賞賛されています より多様で制約の少ない出力を生成できます、 そして、彼らの整理されていない行動を研究することができるからです モデルがトレーニングデータから知識とパターンをどのように保存するかを明らかにします。
モリスの目標は、OpenAIのアライメントプロセスを「逆転」し、小型のGPT-OSS-20Bを元の前提条件に近いものに戻すことでした。
「基本的にLLMトレーニングのアライメント部分を逆転させたので、自然なテキストを再び作成するものがあります」と彼は書いた プロジェクトを発表するXスレッド。 「それはもうベッドに従事していません。一般的なテキストの次のトークンを予測するだけのモデルに戻っています。」
巧妙なプロンプトでモデルを脱獄しようとするのではなく、モリスが初期の実験で効果がないことが証明されたと言った – は、会話の後に別のタックを取りました 元Openaiの共同設立者、元人類の研究者と現在 思考マシン チーフサイエンティストのジョン・シュルマン。
重要なのは、アラインメントの逆転を小さな最適化の問題と考えることでした。モデルの前提条件の知識のほとんどがまだその重みに存在する場合、ベースモデルの動作に向かって微調整するには、小さな低ランクの更新のみが必要になる場合があります。
Morrisは、モデルの3層(位置7、15、および23のMLPレイヤー)にLORA(低ランクアダプター)更新を適用して、16のランクでそのアイデアを実装しました。
つまり、約6,000万のパラメーター、つまりモデルの合計210億の0.3%をトレーニングすることを意味しました。彼はFineWebデータセットから約20,000のドキュメントを使用し、フォーマットを元の事前削減(「…」スタイル)にできるだけ近い状態に保ち、モデルが新しいものを学習せず、幅広いフリーテキスト生成を再度に再度にします。
トレーニングは8つのNvidia H200 GPUで4日間かかりました。 Morrisは、Xの直接メッセージを介してVentureBeatに、学習率は2E-6、バッチサイズは16、最大シーケンス長は8,192トークンです。
その後、彼はロラのウェイトをモデルに戻し、ユーザーがスタンドアロンの完全に微調整されたアーティファクトとして実行できるようにしました。
モリスはまた、GPT-ossのような微調整された混合物(MOE)アーキテクチャのための現在のオープンツールの制限に対抗しなければなりませんでした。
Morrisは、Faceのフレームワークを抱きしめたと言いました。これは、頻繁にクラッシュし、特定のトレーニングモードのみをサポートしていると言い、頻繁にチェックポイントに自分のハーネスを書き、GPUメモリの過負荷を危険にさらすデータバッチをスキップしました。
重要なことに、XのAIコミュニティからの質問と批判に応えて、Morrisは、モデルのニューラルネットワークを構成し、その動作を支配する人工ニューロンの内部設定である基本モデルの「重み」を回復したと主張していないことを明らかにしました。
むしろ、Morrisは、彼の作業が「エラーで基本モデルの *分布 *を回復した」、つまり、モデルが使用する確率パターンは出力を生成するために使用したと言います。
新しいGPT-OSS-20Bベースモデルの動作は、GPT-OSS-20Bとどのように異なりますか
結果のGPT-OSS-20Bベースは、その出力が著しく自由です。 それはもはやデフォルトではなく、段階的に推論を説明することで、より広い範囲の応答が生成されます。 Openaiのアライメントされたモデルが与えることを拒否する指示を含める – 武器の構築、冒とくのリスト、または違法行為の計画。
短いテストでは、モリスはそれを見つけました また、著作権で保護された作品から逐語的な通路を再現することもできます、 含む 彼が試した6冊の本の抜粋のうち3つ、 いくつかの記憶された素材がまだアクセスできることを示しています。
それでも、いくつかの痕跡のアライメントが残ります。 Morrisは、モデルをアシスタントスタイルの形式(「Human:…Assistant:…」)でプロンプトすると、丁寧なチャットボットのように振る舞うことがあると指摘しました。そして 元のGPT-Ossチャットテンプレートを実行すると、推論タスクを実行できます、品質がいくらか損なわれているにもかかわらず。
フリーテキストモードで最良の結果を得るには、モデルの特別なシーケンストークンでプロンプトを準備し、チャットテンプレートを完全に回避することをお勧めします。
Openaiの大規模なGPT-Ossファミリーリリースに基づいています
GPT-Ossファミリーがデビューしました かなりの注意に。 2つのモデル(GPT-OSS-120BとGPT-OSS-20B)は、テキストのみの多言語であり、専門家の変圧器アーキテクチャで構築されています。それらは、許容されるApache 2.0ライセンスの下でリリースされ、無制限のローカル使用、微調整、および商業展開が可能になりました。
OpenAIのパフォーマンスベンチマークは、O3-MINIとの競争が小さく、推論およびツール使用タスクで、独自のO4-MINIを一致させる、またはそれを超えるより大きな120Bモデルのマッチングまたはそれを超えることを示しました。
これは6年ぶりのOpenaiの最初のオープンウェイトリリースであり、これは広く解釈されています 中国のDeepseek R1やQwen 3を含む、他のオープンウェイトプロバイダーからの競争圧力への対応。
同社は、GPT-Ossを、オープンソースモデルに匹敵した開発者を再参加する方法として、またオープンウェイトシステムの安全研究のプラットフォームとして位置付けました。
最初のGPT-OSに対する反応は混合されました
OpenaiのGPT-OSSモデルに対する開発者の反応はそうでした 頑固に混ざっています、熱狂的なものから失望するものまで、全面的に反応があります。
サポーターは、STEMベンチマークで寛容なライセンス、効率性、強力な表示を称賛しました。
抱きしめる顔のCEOであるクレム・デラングは、このリリースを「オープンエコシステムへの意味のある追加」と表現し、コミュニティに成熟する時間を与えるよう促しました。
批評家は、このモデルは合成データで重く訓練されているように見えるため、数学とコーディングで優れているが、創造的な執筆、一般的な世界知識、多言語の推論ではあまり能力がないと主張した。
一部の初期のテスターは、長引く安全フィルターと地政学的なバイアスの可能性に関する懸念も提起しました。
その背景に対して、 MorrisのGPT-OSS-20Bベースは、リリース後数日以内に野生でオープンウェイトモデルをどのように適応および再利用できるかの具体的な例として際立っています。
確かに、OpenaiのGPT-Ossの受信方法とは対照的に、私が見たMorrisの仕事に対する回答のほとんどは温かく高揚しています。として 1人のコンピューター科学者がXについて書いた:「これは私がTwitterで見た中で最もクールなものです [X] 過去数ヶ月で。」
このアプローチは、OpenAIが組み込まれた行動の多くを取り除き、モデルを生の前提型システムに近いものに戻します。これは、暗記、バイアス、またはアラインメントの影響を研究する研究者にとって価値がありますが、安全リスクが高くなります。
さらに、 モリスは言う 推論モデルを事前に訓練された非合理的なベースモデルに復元することに関する彼の研究は、Qwenが提供するような非合理モデルの抽出を比較することによって継続されます。