1720495491
2024-07-09 03:00:25
これは、ChatGPT、Gemini、Copilot などのいわゆる「生成型」人工知能 (AI) 分野で最もよく守られている秘密です。これは、これらのソフトウェア プログラムの計算能力や膨大なサイズ (数千億のパラメータ)、巧妙なコンピュータ コードの中に隠されているわけではありません。これらの側面は、もちろん成功の要因ですが、現在では多かれ少なかれ公開されています。
いいえ、この分野のリーダーである OpenAI、Anthropic、Mistral、Microsoft などがまだ明らかにしていないのは、モデルのトレーニングに使用するテキスト コレクションを作成するためのレシピです。後者は、文を完成させるのに最適な単語を可能な限り正確に予測するためにパラメーターを調整するために使用されます。数十億のテキストを取り込むことで、統計的な相関関係が特定され、ユーザーの質問に答える新しいテキストを生成することが可能になります。
これらのテキストの出所はわかっており、パブリック ドメインの書籍、研究論文、Wikipedia などがありますが、とりわけ大量の Web ページが挙げられます。この最後のソースが大部分を占めており、その扱い方が違いを生みます。
「これが問題の核心だ」Adaptive ML社の創設者であり、Webデータのトレーニングコーパスの共著者でもあるジュリアン・ローネイ氏は次のように要約している。 洗練されたウェブライトオンで働いていた頃の彼は、2022年12月にルイジアナ州ニューオーリンズで開催されたこの分野の主要な会議であるNeurIPSでの自身のプレゼンテーションが人々に驚きを与えたことを思い出します。このデータの準備に細心の注意が払われたおかげで、AIはより多様なソースからのデータで競争相手に対抗することができました。
80,000時間の計算
このカンファレンスに出席していた、オープンソースのモデルとコーパスを提供するフランスとアメリカのプラットフォームである Hugging Face の共同設立者である Thomas Wolf 氏は、Julien Launay 氏のチームを自社に招待しました。
メンバーの一人である Guilherme Penedo 氏は、RefinedWeb よりもさらに大規模なコーパスを公開するというアイデアに動機づけられ、この提案を受け入れました。 「10日で到着できると思っていた」トーマス・ウルフは思い出す。15倍かかるだろう。4月21日は 出た FineWebは、40テラバイト(TB)の容量を持つモンスターで、15兆円の トークン3文字または4文字のトークン、一種の音節。無料でダウンロードでき、従来のものよりも優れたモデルを作成できます。 その他の公開コーパス。
このようなオブジェクトを構築するのは困難です。NvidiaのH100グラフィックカードを使用した8万時間の計算が必要で、これは優れたAIモデルをトレーニングするのに必要な時間と同等です。まず、データを取得する必要があります。2007年以来、財団は コモンクロール数十億のウェブページを定期的に収集します。しかし、言語モデルに役立てるには、この大量の情報からテキストのみを抽出する必要があります。 「これはプロセスの中で最も長いステップの1つであり、おそらく計算時間の80%を占めており、2023年11月に開始されました。」Guilherme Penedo 氏はこう述べています。Common Crawl で約 15 年間にわたって収集された 96 個のパッケージが、約 5,354 TB の容量に使用されました。
この記事の残り 48.99% を読むことができます。残りは購読者向けに予約されています。
#ジェネレーティブ #の誕生秘話