1713403547
2024-04-17 19:45:03
企業がどのように責任を持って AI を本番環境に統合しているかをご覧ください。 SF で開催されるこの招待者限定のイベントでは、テクノロジーとビジネスの交差点を探ります。 参加方法については、こちらをご覧ください。
水曜日、アレン AI 研究所 (AI2) は、70 億パラメータのオープン言語モデルのアップデートである OLMo 1.7-7B を発表しました。 AI は、より広範で多様な Dolma データセットを使用し、教育プロセスが改善されました。
2 月に初めてリリースされた OLMo は、「真のオープンソース、最先端の大規模言語モデル」と説明されています。 そのフレームワークには、完全な事前トレーニング データ、トレーニング コード、モデルの重み、および評価が含まれています。
ドルマ 1.5 ~ 1.7
本日のアップデートにより、OLMo 1.7-7B は、トレーニング手順とアーキテクチャの改善により、より長いコンテキスト長 (2,048 から 4,096 トークンまで) とより優れたパフォーマンスをサポートすることになります。 データセットとして、AI2 は、Dolma CC、Refined Web、StarCoder、C4、Stack Exchange、OpenWebMath、Project Gutenberg、Wikipedia などの幅広いソースからの 2 兆 3000 億のトークンを特徴とする Dolma 1.7 を開発しました。
OLMo は以前 Dolma 1.5 を使用していましたが、これには主に Web データが含まれていました。 Dolma 1.7 では、AI2 はソースの混合を多様化し、専門知識、複雑な推論、コーディングを必要とするタスクを処理するためにコンテンツを抽出しました。 さらに、新しいデータセットはより優れた重複排除を提供し、「文書レベルの重複スコアが、段落レベルの重複スコアの長さ正規化平均として計算されるしきい値 α を超える」文書全体を削除します。
VBイベント
AI インパクト ツアー – サンフランシスコ
招待状をリクエストする
Dolma 1.7 では、品質の向上したフィルタリングも備えています。 FastText 分類子は、高品質テキスト (適切にフォーマットされ、言語モデルのトレーニングに使用される幅広い有用なドメインをカバーする文書) と低品質テキストに基づいて文書を分類します。 前者の例には、Wikipedia、Small Web RSS フィード、Semantic Scholar などがあります。 低品質のサブセットには、アダルト エンターテイメントやフェイク ニュース Web サイトが含まれます。 AI2 によれば、この分類器は約 25 GB のデータでトレーニングされているという。
進化したトレーニング
以前のバージョンとは異なり、OLMo 1.7 では 2 段階のカリキュラムが使用されます。 最初の段階では、研究者はモデルをゼロからトレーニングします。 第 2 段階では、「学習率を 0 まで直線的に減衰させながら」、さらに 500 億トークン分の Dolma 1.7 の厳選されたサブセットを使用してデータがトレーニングされます。 AI2 は、「この高品質のサブセットを、(1) 利用可能なすべての Wikipedia、OpenWebMath、および Flan データを使用し、(2) Dolma CC、CC News、および Megawika を削除し、(3) 残りのソースのバランスを調整して、ほぼ同じ比率を達成することによって厳選している」と述べています。それぞれ。
AI2 は、これらのアップデートのおかげで、OLMo 1.7-7B は MMLU の Llama 2-7B と GSM8K の Llama-2-13B の両方を上回っていると主張しています。
更新された OLMo モデルは Apache 2.0 でライセンスされていますが、Dolma 1.7 は ODC-BY でライセンスされています。 どちらも現在、Hugging Face で入手可能です。
#AI2 #がより広範なデータセットとより優れたトレーニングを備えた #OLMo #アップデートをリリース