1706513124
2024-01-29 04:55:57
Eagle 7B は、次のような 7.52B パラメータ モデルです。
RWKV-v5 Eagle 7Bをリリースいたします。 Linux Foundation に基づき、Apache 2.0 ライセンスとしてライセンスを取得、制限なく個人または商業的に使用できます
次のベンチマークにわたって多言語パフォーマンスを実行しました。 xLAMBDA、 xStoryCloze、 xウィノグラード、 ×コピー
合計23の言語に対応
これらのベンチマークのほとんどは、それぞれの言語で常識的な推論をカバーしています。 また、RWKV v4 から v5 アーキテクチャの多言語パフォーマンスが全体的に大幅に向上していることを示しています。 そして v2 ワールド データセット。
また、上記では上位 23 言語程度をカバーしているため、多言語ベンチマークが不足していることにも注意してください。
このため、残りの 75 以上の言語、合計 100 以上のトレーニング済み言語にわたってモデル言語のパフォーマンスを直接評価することが困難になります。 この欠点は将来のモデルで改善されることを期待しています。
英語のパフォーマンスは、常識的推論と世界の知識にわたる 12 の個別のベンチマークにわたって測定されました。
ここでも、RWKV v4 から v5 アーキテクチャへの全体的な大きな変化が見られます。 そして v2 ワールド データセット。
v4 は以前、1T トークン層の最上位モデルである MPT-7b に負けていました。
v5 はベンチマークで大打撃を与え始め、場合によっては特定のベンチマーク (LAMBADA、StoryCloze16、WinoGrande、HeadQA_en、Sciq) で Falcon や llama2 を上回ってトップになることさえあります。
さらに、v5 のパフォーマンスは、指定されたおおよそのトークン トレーニング数により、予想されるトランスフォーマーのパフォーマンス レベルと一致し始めます。
Mistral-7B は噂の 2 ~ 7 兆トークンのトレーニングでリードを維持しています。
追加の 1T トークンをトレーニングすることでギャップが縮まり、llama2 ラインを超え、できればミストラル ラインに到達できると予想しています。
あるいは、軽く調整された (実際に小さな命令セットが混合された) 基本モデルとして、さまざまなコミュニティと命令で調整されたバリアントがどのように機能するかを確認したいと考えています。
注目すべき観察は、3,000 億トークン ポイント付近のチェックポイントが pythia-6.9b と同様のパフォーマンスを示していることです。
これは、RWKV-v4 アーキテクチャでの以前のパイルベースの実験と一致しており、RWKV のような線形トランスフォーマーは、同じトークン カウントのトレーニングにより、パフォーマンス レベルがトランスフォーマーと同様に拡張されます。
そうであれば、質問を繰り返します。 正確なアーキテクチャであれば、モデルの評価パフォーマンスのデータはそれほど重要ではありませんか?
それが本当であれば、アクセシビリティを高め、すべての人にとって AI のコストを下げるために、おそらく、より効率的でスケーラブルなアーキテクチャを追求する必要があるでしょう。 私たちの環境への影響を軽減します。
RWKV の多言語アプローチに関して私たちが受け取る一般的なフィードバックは次のとおりです。
-
英語の評価スコアに悪影響を及ぼし、リニアトランスの成長を遅らせます。
-
多言語モデルと純粋な英語モデルの多言語パフォーマンスを比較するのは公平ではない
そして、ほとんどの部分において、私たちは両方の点に同意します。
しかし、私たちは英語世界だけではない世界向けの AI を構築しているため、これを変更する計画はありません。
2023 年には、世界人口の 17% のみが英語を話します
(13億人)
ただし、世界の上位 25 言語およびそれ以外の言語を確実にサポートすることで、ほぼすべての言語をカバーできます。 40億人、つまり世界の50%
これは、ローエンドのハードウェアでも AI を安価かつ手頃な価格で実行できるようにするだけでなく、AI がすべての人をサポートできるようにするというチームの共通の目標ともよく一致しています。 しかし、彼らの言語をサポートすることによって。
私たちのコミュニティにおけるこの主な例は、 インドネシアとNLPの不協和音グループ、基本モデルの RWKV ラインからインドネシア語モデルを微調整します。
50 万ドルの事前トレーニングを必要とせずに、安価で手頃なベース (つまり単一ノード) で、強力な言語固有のモデルを構築できるようになります。
このリリースは、これまでで最も強力なリニア トランス (評価ベンチマークの観点から) のリリースをマークします。
LLaMA2 と Mistral を超えることはできなかったかもしれませんが。 それは以下の強力な証拠を提供します
-
RWKV-v5 モデル アーキテクチャは、同様のトークン数でトランスフォーマーのパフォーマンスと同様に拡張します。
-
大幅に低い推論コストで、LLaMA2 に近いレベルのパフォーマンスを達成できます。
-
多言語レベルのパフォーマンスをサポートしながら
私たちはこれに続き、さらに前進する予定です
-
[Feb 2024] 更新された RWKV v5: Eagle ペーパーでは、v4 以降のアーキテクチャの変更点とモデルのベンチマークと評価についてさらに詳しく説明します。
-
[Feb 2024] LLaMA2 7B モデルとの直接比較のため、トレーニング中の追加の 1T トークン (合計 2T)
-
[Mar 2024] v5 Eagle 2T モデルに基づく MoE モデル
-
[Mar 2024] RWKV-v6: 「フィンチ」 1.5B、3B ワールド モデル
免責事項: すべての日付はおおよそのものであり、スポンサー/プロバイダーの計算可用性に大きく左右されます。
私たちは以下の主要グループに感謝し、感謝の意を表します。
さまざまな開発者と協力して、成長を続けるコレクションに取り組んでいます。 RWKV関連プロジェクト。
#100以上の言語で1兆トークンを獲得しトランスフォーマーを超えて急上昇






