1726745892
2024-09-17 14:15:25
OpenAI の新しい o1 思考連鎖モデルに関するメモ
2024年9月12日
OpenAI 2つの主要な新しいプレビューモデルをリリース 今日: o1-preview そして o1-mini (あのミニは プレビューではありません) は、以前はコードネーム「ストロベリー」であると噂されていました。これらのモデルについては理解すべきことがたくさんあります。GPT-4o の次のステップほど単純ではなく、コストとパフォーマンスの面でいくつかの大きなトレードオフを導入して、「推論」機能が向上しています。
思考の連鎖を訓練する
OpenAI のエレベーター ピッチは良い出発点です。
私たちは、応答する前により多くの時間をかけて考えるように設計された新しい AI モデル シリーズを開発しました。
これらの新しいモデルを考える一つの方法は、思考を促すパターンの連鎖の特殊な拡張として考えることです。これは、私たちがAAコミュニティとしてここ数年研究してきた「段階的に考える」トリックで、最初に論文で紹介されました。 大規模言語モデルはゼロショット推論器である 2022年5月。
OpenAIの記事 LLMで推論を学ぶ 新しいモデルがどのようにトレーニングされたかを説明します。
私たちの大規模な強化学習アルゴリズムは、データ効率の高いトレーニング プロセスで、思考の連鎖を使用してモデルに生産的に考える方法を教えます。o1 のパフォーマンスは、強化学習 (トレーニング時の計算) が増え、思考に費やす時間 (テスト時の計算) が増えるにつれて、一貫して向上することがわかりました。このアプローチのスケーリングに関する制約は、LLM 事前トレーニングの制約とは大幅に異なるため、引き続き調査中です。
[…]
強化学習を通じて、o1 は思考の連鎖を磨き、使用する戦略を洗練することを学習します。間違いを認識して修正することを学習します。難しいステップをより単純なステップに分解することを学習します。現在のアプローチが機能しない場合は、別のアプローチを試すことを学習します。このプロセスにより、モデルの推論能力が劇的に向上します。
事実上、これは、良い結果を得るために次のトークンの予測だけでなく、後戻りや「思考」が必要となる、はるかに複雑なプロンプトをモデルがより適切に処理できることを意味します。
私は「推論」という用語があまり好きではありません。LLM の文脈では堅牢な定義がないと思うからです。しかし、OpenAI はここでそれを使用することを約束しており、この新しいモデルが解決しようとしている問題を適切に伝えていると思います。
APIドキュメントからの低レベルの詳細
新しいモデルとそのトレードオフに関する最も興味深い詳細は、 APIドキュメント:
画像入力、関数呼び出し、または一貫して高速な応答時間を必要とするアプリケーションの場合、GPT-4o および GPT-4o mini モデルは引き続き適切な選択です。ただし、深い推論を必要とし、より長い応答時間に対応できるアプリケーションの開発を目指している場合は、o1 モデルが最適な選択肢になる可能性があります。
ドキュメントから私が拾ったいくつかの重要なポイント:
- 新しいAPIアクセス
o1-previewそしてo1-miniモデルは現在Tier 5アカウント用に予約されています。 費やす必要があった API クレジットが少なくとも 1,000 ドル。 - システムプロンプトはサポートされていません。モデルは既存のチャット完了APIを使用しますが、送信できるのは
userそしてassistantメッセージ。 - ストリーミング、ツールの使用、バッチ呼び出し、画像入力もサポートされていません。
- 「モデルが問題を解決するために必要とする推論の量に応じて、これらのリクエストには数秒から数分かかる場合があります。」
最も興味深いのは、「推論トークン」の導入です。これは、API 応答には表示されませんが、出力トークンとして課金され、カウントされるトークンです。これらのトークンで、新しい魔法が起こります。
推論トークンの重要性のおかげで(OpenAIは、新しいモデルの恩恵を受けるプロンプトに約25,000の予算を割り当てることを提案しています)、出力トークンの許容量は劇的に増加し、32,768になりました。 o1-preview そして、より小さいと思われる65,536 o1-mini! これらは、 gpt-4o そして gpt-4o-mini どちらのモデルも、現在出力トークンの制限は 16,384 です。
API ドキュメントからの最後の興味深いヒント:
検索拡張生成 (RAG) における追加コンテキストの制限: 追加のコンテキストやドキュメントを提供する場合は、モデルが応答を過度に複雑にしないように、最も関連性の高い情報のみを含めます。
これは、RAG の通常の実装方法からの大きな変更です。RAG の通常の実装方法では、関連する可能性のあるドキュメントをできる限り多くプロンプトに詰め込むようにアドバイスされることがよくあります。
隠された推論トークン
イライラさせられるのは、これらの推論トークンがAPIで見えないままになっていることだ。つまり、課金はされるが、それが何だったのかは分からない。OpenAIはその理由を次のように説明している。 思考の鎖を隠す:
忠実で判読可能であると仮定すると、隠された思考の連鎖により、モデルの「心を読み」、その思考プロセスを理解することができます。たとえば、将来的には、ユーザーを操作している兆候がないか思考の連鎖を監視したい場合があります。ただし、これが機能するには、モデルが思考を改変されていない形で表現する自由がなければならないため、思考の連鎖にポリシーのコンプライアンスやユーザーの好みをトレーニングすることはできません。また、不整合な思考の連鎖をユーザーに直接表示することも望んでいません。
したがって、ユーザーエクスペリエンス、競争上の優位性、思考の連鎖のモニタリングを追求するオプションなど、複数の要素を検討した結果、生の思考の連鎖をユーザーに表示しないことに決定しました。
2つの重要な理由があります。1つは安全性とポリシーの遵守に関するものです。モデルがポリシーに違反する情報を含む可能性のある中間ステップを公開することなく、ポリシールールにどのように従っているかを推論できるようにしたいのです。2つ目は、 競争上の優位性これは、他のモデルが、自分たちが投資した推論作業に対してトレーニングされるのを避けたいと考えていると解釈しています。
このポリシー決定にはまったく満足していません。LLM に対して開発を行っている私にとって、解釈可能性と透明性はすべてです。複雑なプロンプトを実行しても、そのプロンプトがどのように評価されたかという重要な詳細が隠されているという考えは、大きな後退のように感じます。
例
OpenAIは、いくつかの初期例を提供している。 思考の連鎖 発表のセクションには、Bash スクリプトの生成、クロスワード パズルの解決、中程度に複雑な化学物質の溶液の pH の計算などの内容が記載されています。
これらの例は、これらのモデルのChatGPT UIバージョンを示しています する 思考の連鎖の詳細を公開します…ただし、生の推論トークンは表示されず、代わりに別のメカニズムを使用して、手順をより人間が読みやすい形式で要約します。
OpenAI には、より洗練された例を含む 2 つの新しいクックブックもありますが、理解するのは少し難しいと感じました。
私 Twitterで質問 GPT-4oでは失敗したが、GPT-4oでは機能したプロンプトの例については、 o1-preview私のお気に入りをいくつか紹介します。
-
How many words are in your response to this prompt?マシュー・バーマンモデルは、5 回の目に見えるターンにわたって 10 秒間考えた後、「この文には 7 つの単語があります」と答えます。 -
Explain this joke: “Two cows are standing in a field, one cow asks the other: “what do you think about the mad cow disease that’s going around?”. The other one says: “who cares, I’m a helicopter!”ファビアン・シュテルツァー著—説明は理にかなっています。どうやら他のモデルはここで失敗したようです。
しかし、素晴らしい例はまだあまりありません。ここに 関連メモ これらの新しいモデルの作成に取り組んだ OpenAI 研究者 Jason Wei 氏のコメント:
AIME と GPQA の結果は非常に優れていますが、それが必ずしもユーザーが実感できるものになるわけではありません。科学に携わっている人であっても、GPT-4o が失敗し、o1 が成功し、回答を採点できるプロンプトのスライスを見つけるのは簡単ではありません。しかし、そのようなプロンプトを見つけると、o1 は完全に魔法のように感じられます。私たちは皆、より難しいプロンプトを見つける必要があります。
イーサン・モリックは数週間にわたってモデルをプレビューし、 彼の第一印象彼のクロスワードの例は、次のような注釈を含む目に見える推論手順が特に興味深いです。
1 Across と 1 Down の最初の文字が一致していないことに気付きました。位置合わせを確実にするために、1 Across には「LIES」ではなく「CONS」を使用することを検討します。
これらすべての中で何が新しいのか
コミュニティがこれらのモデルをいつ、どこで適用すべきかのベストプラクティスを解明するには、しばらく時間がかかるでしょう。私は主に GPT-4o (および Claude 3.5 Sonnet) を使い続けるつもりですが、この新しいクラスのモデルを前提として、LLM を使用してどのようなタスクを解決できるかというメンタルモデルを私たちが集合的に拡張していくのを見るのは本当に興味深いでしょう。
オープン モデル ウェイト コミュニティを含む他の AI ラボが、このスタイルの思考連鎖推論を適用するように特別にトレーニングされた独自のバージョンのモデルを使用して、これらの結果の一部を再現し始めると予想されます。
#OpenAI #の新しい #思考連鎖モデルに関するメモ