1721369281
2024-07-18 15:50:51
マドリード、7月18日(Portaltic/EP) –
オープンAI は 人工知能(AI)モデルをトレーニングする新しい方法 これは、 ゲームのチェックと検証の方法論これにより、大規模言語モデル(LLM)によって生成されたテキストは、 小さなモデルであれば人間が読みやすく検証しやすい。
OpenAIは、 「ゲームの確認と検証」と呼ばれる方法に基づいたAIモデルのトレーニングの新しい方法。 これにより、結果として得られるテキストは人々にとって読みやすく、解釈しやすくなります。
サム・アルトマン率いる同社は、 ウェブサイト上の声明では、 AIモデルをトレーニングする際、 大規模モデルの問題解決プロセスを最適化する場合、 結果として得られる解決策 「理解するのがますます難しくなる可能性があります。」 これにより、人間が理解することが難しくなり、回答が正しいかどうかを評価することも難しくなります。
しかし、このテクノロジー企業の研究者は、高度な言語モデルを訓練して、弱いモデルが簡単に検証できるテキストを作成することで、AIは最終的に 人間がより効果的に評価し、より簡単に理解できる結果を開発する。
したがって、OpenAIは、 「読みやすさを向上させる」 これは一連の確認と検証のゲームに基づいています。つまり、ゲーム理論の枠組みは「「学習エージェントが検証可能な方法で意思決定の問題を解決できるように促す」 コーネル大学の機械学習研究者によって定義された。 彼らは2021年にこのシステムを発見しました。
これらのゲームには、一方では参加する人たちがいて、 チェッカーとは 解決策を生み出す人 そして、その一方で、 検証者、 何 解決策の正確性を確認するオープンAIは、 テスターは大型モデル そしてその 検証者はより小さな言語モデルである家族の大小のモデルを使用した GPT-4 「約3桁の違いがあります。」
これを念頭に置いて、研修会社が採用している制度では、 強力なモデル(証明者)は数学の問題に対して複数の解を生成する 彼は 弱いモデル(検証者)は裏付けることができる 簡単に。これらのソリューションの一部は、デモ モデルで自然に発生するエラーが原因で正しくありません。
その後、彼らは交互に数回のトレーニングを行います。 2つのフェーズ、 一方では、 (小さな)検証モデルを訓練して、テスターモデルによって生成されたソリューションの精度を予測する (大)。その一方で、彼らはテスターモデルに「役に立つ」または「偽装された」役割を果たすように教えています。
つまり、 役に立つ論文その中で あなたの答えをモデルに助けてください検証モデルに従って高いスコアを獲得した正解には報酬が与えられる。しかし、 「卑劣な」または狡猾な役割 このモデルは 検証者を騙す その場合、検証者によって高いスコアを獲得した誤った解決策には報酬が与えられます。
当初、「ステルス」モードの証明者は、検証者を納得させるような誤った解決策を生み出すことに成功しましたが、 検証者のトレーニングが継続されるにつれて、この脆弱性の説得力は薄れていきます。 後続のラウンドでは、テスターは「各ラウンドで異なる戦略を模索することを余儀なくされる」ことになります。
このように、OpenAIが説明しているように、 賢いテスターが間違った解決策を生成できなくなると、トレーニングは終了します。 検証者を納得させるもの。
これらすべてを踏まえて、同社が強調しているように、これは 新しい方法は、AIの結果が正しいことを保証し、理解しやすくするために「不可欠」である。 したがって、人間だけでなく他の AI システムによっても検証可能です。
「パフォーマンスと可読性のトレードオフを理解し、対処することで、より効果的で信頼性の高いAIアプリケーションを実現できます。 正確で明確なコミュニケーションが不可欠な幅広い分野に利益をもたらします。」 技術に判決を下した。
同様に、同社はこの方法論の重要な利点として、 読みやすさに関する人間によるデモンストレーションや判断への「依存度を軽減」します。 そのため彼らは、この方法論がより広く利用され、結果が「正しいだけでなく、透明性をもって検証可能な」AI システムの開発に利用されることを期待している。
#OpenAIは読みやすさを向上させるためにチェックと検証のゲームシステムを使用してAIモデルをトレーニングします