日本語版
最新ニュース
世界

AI2 が、より広範なデータセットとより優れたトレーニングを備えた OLMo アップデートをリリース

企業がどのように責任を持って AI を本番環境に統合しているかをご覧ください。 SF で開催されるこの招待者限定のイベントでは、テクノロジーとビジネスの交差点を探ります。 参加方法については、こちらをご覧ください。 水曜日、アレン AI 研究所 (AI2) は、70 億パラメータのオープン言語モデルのアップデートである OLMo 1.7-7B を発表しました。 AI は、より広範で多様な Dolma データセットを使用し、教育プロセスが改善されました。 2 月に初めてリリースされた OLMo は、「真のオープンソース、最先端の大規模言語モデル」と説明されています。 そのフレームワークには、完全な事前トレーニング データ、トレーニング コード、モデルの重み、および評価が含まれています。 ドルマ 1.5 ~ 1.7 本日のアップデートにより、OLMo 1.7-7B は、トレーニング手順とアーキテクチャの改善により、より長いコンテキスト長 (2,048 から 4,096 トークンまで) とより優れたパフォーマンスをサポートすることになります。…

AI2 が、より広範なデータセットとより優れたトレーニングを備えた OLMo アップデートをリリース

1713403547
2024-04-17 19:45:03

企業がどのように責任を持って AI を本番環境に統合しているかをご覧ください。 SF で開催されるこの招待者限定のイベントでは、テクノロジーとビジネスの交差点を探ります。 参加方法については、こちらをご覧ください。


水曜日、アレン AI 研究所 (AI2) は、70 億パラメータのオープン言語モデルのアップデートである OLMo 1.7-7B を発表しました。 AI は、より広範で多様な Dolma データセットを使用し、教育プロセスが改善されました。

2 月に初めてリリースされた OLMo は、「真のオープンソース、最先端の大規模言語モデル」と説明されています。 そのフレームワークには、完全な事前トレーニング データ、トレーニング コード、モデルの重み、および評価が含まれています。

ドルマ 1.5 ~ 1.7

本日のアップデートにより、OLMo 1.7-7B は、トレーニング手順とアーキテクチャの改善により、より長いコンテキスト長 (2,048 から 4,096 トークンまで) とより優れたパフォーマンスをサポートすることになります。 データセットとして、AI2 は、Dolma CC、Refined Web、StarCoder、C4、Stack Exchange、OpenWebMath、Project Gutenberg、Wikipedia などの幅広いソースからの 2 兆 3000 億のトークンを特徴とする Dolma 1.7 を開発しました。

Dolma 1.7 内のソース。 画像クレジット: AI2

OLMo は以前 Dolma 1.5 を使用していましたが、これには主に Web データが含まれていました。 Dolma 1.7 では、AI2 はソースの混合を多様化し、専門知識、複雑な推論、コーディングを必要とするタスクを処理するためにコンテンツを抽出しました。 さらに、新しいデータセットはより優れた重複排除を提供し、「文書レベルの重複スコアが、段落レベルの重複スコアの長さ正規化平均として計算されるしきい値 α を超える」文書全体を削除します。

VBイベント

AI インパクト ツアー – サンフランシスコ

サンフランシスコで開催される VB の AI Impact ツアーの次の目的地では、責任を持って AI をビジネスに統合する複雑さを説明します。 業界の専門家から洞察を得て、志を同じくするイノベーターとネットワークを築き、顧客エクスペリエンスを備えた GenAI の未来を探索し、ビジネス プロセスを最適化するチャンスをお見逃しなく。

招待状をリクエストする

Dolma 1.7 では、品質の向上したフィルタリングも備えています。 FastText 分類子は、高品質テキスト (適切にフォーマットされ、言語モデルのトレーニングに使用される幅広い有用なドメインをカバーする文書) と低品質テキストに基づいて文書を分類します。 前者の例には、Wikipedia、Small Web RSS フィード、Semantic Scholar などがあります。 低品質のサブセットには、アダルト エンターテイメントやフェイク ニュース Web サイトが含まれます。 AI2 によれば、この分類器は約 25 GB のデータでトレーニングされているという。

進化したトレーニング

以前のバージョンとは異なり、OLMo 1.7 では 2 段階のカリキュラムが使用されます。 最初の段階では、研究者はモデルをゼロからトレーニングします。 第 2 段階では、「学習率を 0 まで直線的に減衰させながら」、さらに 500 億トークン分の Dolma 1.7 の厳選されたサブセットを使用してデータがトレーニングされます。 AI2 は、「この高品質のサブセットを、(1) 利用可能なすべての Wikipedia、OpenWebMath、および Flan データを使用し、(2) Dolma CC、CC News、および Megawika を削除し、(3) 残りのソースのバランスを調整して、ほぼ同じ比率を達成することによって厳選している」と述べています。それぞれ。

AI2 は、これらのアップデートのおかげで、OLMo 1.7-7B は MMLU の Llama 2-7B と GSM8K の Llama-2-13B の両方を上回っていると主張しています。

更新された OLMo モデルは Apache 2.0 でライセンスされていますが、Dolma 1.7 は ODC-BY でライセンスされています。 どちらも現在、Hugging Face で入手可能です。

#AI2 #がより広範なデータセットとより優れたトレーニングを備えた #OLMo #アップデートをリリース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。