1755798663
2025-08-21 17:45:00
BytedanceのSeedチームは、長いコンテキストの推論、エージェント行動、および実用的な開発者ワークフロー向けに設計されたオープンソースの大規模な言語モデルの新しいファミリーであるSeed-Oss-36Bをリリースしました。このシリーズは、ネイティブ512Kコンテキストサポート、柔軟な「思考予算」管理、およびApache-2.0の下での研究と生産に優しいバリエーションの両方で到着し、世界で最も影響力のあるAIビルダーの1つからの深刻なオープンな貢献を示しています。
Seed -Oss -36Bは、3つのバリアントで導入された密な36BパラメーターLLMラインです。
- Seed -oss ‑ 36B ‑ base(合成命令データ付き)
- Seed -oss ‑ 36B ‑ Base(合成命令データなし)
- 種子‑ OSS ‑ 36B ‑ Instruct
すべては、Apache-2.0ライセンスで顔を抱きしめてリリースされ、無料の商用使用、変更、および再分配を可能にします。これは、APIロックインなしでフルスタックコントロールを望んでいる企業に特に役立ちます。シードチームは、グローバルユースケースのモデルを強力な推論、エージェントツールの使用、および長いコンテキストワークロードで配置します。
- ネイティブ512Kコンテキストウィンドウ:超長いコンテキストのためのトレーニングエンドツーエンド、大規模なドキュメント、マルチステップチェーン、およびエージェントトレースの摂取を可能にします。
- 「思考予算」の柔軟な制御:ユーザーは、推論の長さを動的に調整し、コスト/遅延とタスクごとの推論の深さを取引することができます。これは、生産推論管理に役立ちます。
- 推論とエージェントパフォーマンス:モデルは、バランスの取れた一般的な機能を保持しながら、複雑な問題解決とツール使用シナリオに合わせて調整されています。
- 研究にやさしいリリース戦略:2つのベースモデル – 1つは、より高いボックスパフォーマンスのための合成指導データを備えており、1つは「より純粋な」財団のないもので、応用目標と学術的目標の両方をサポートしています。
- 最新のLLMスタック:ロープ位置エンコーディング、GQA注意、RMSNORM、およびSWIGLUの活性化を備えた因果デコーダーのみの変圧器。 64レイヤー、36bパラメージ、5120隠されたサイズ、155kの音声。
- Seed -oss ‑ 36B –塩基(合成データを持つ有無にかかわらず)およびSeed -oss ‑ 36B ‑ Instructは、Apache -2.0の下で顔を抱きしめています。
- Apache -2.0は、商業展開(オンプレムまたはクラウド)、微調整、製品内の再分配、およびベンダー料金なしでの内部データソースおよびエージェントとの統合の方法をクリアします。
Bytedanceは、ベースモデルと指示モデルの両方に広範な結果を公開しています。以下の選択されたハイライトは、Seed-Oss-36Bモデルカードとサポートカバレッジから直接届きます。
ベースモデルベンチマーク
Seed-Oss-36Bベース(合成指導データを使用)vs同様のスケールのピアオープンソースベースは、知識、推論、数学、コーディング全体の強力なパフォーマンスを示しています。
- MMLU-Pro:65.1(ベースW/ Syn。)vs 58.5(QWEN2.5–32Bベース)。
- MMLU:84.9(syn。ベース)。
- Triviaqa:82.1(syn。ベース)。
- BBH(推論):87.7(ベースw/ syn。) – 複数の記事でリリースされたオープンソースソタとして報告されています。
- GSM8K:90.8;数学:81.7(ベースW/ Syn。)。
- コーディング:Humanval 76.8; MBPP 80.6(ベースW/ Syn。)。
注:bytedanceは、「w/ syn」をわずかに追跡する「Wosyn」バリアント(合成命令データなし)も報告しています。いくつかのベンチマークでは、研究の純度と訓練後の下流を目的としています。
モデルベンチマークを指示します
命令チューニングされたバリアントは、フォロー、推論、エージェントタスク、コーディング、多言語、安全性、および長いコンテストを強調しています。
- 知識:MMLU-Pro 82.7; MMLU 87.4; GPQA-D 71.4; SuperGPQA 55.7。
- 数学と推論:aime24 91.7、aime25 84.7、beyondaime 65; Arcagi V2 40.6。
- コーディング:LiveCodeBench V6 67.4; HLE 10.1。
- エージェントベンチマーク:SWEベンチ検証(オープンハンド)56; SWEベンチ検証(エージェントレス4*10)47; Tau1-Retail 70.4; Tau1-Airline 46。
- 長いコンテキスト:定規(128k)94.6。
- 多言語:MMMLU 78.4。
- 安全性:航空ベンチ75.6。
独立したカバレッジとマスコミは、512Kネイティブコンテキスト、制御可能な推論トークン、および複数のカテゴリにわたってオープンソースSOTAの主張を強調し、シード-Soss-36Bを長いコンテキストの推論およびエージェントの競争力のある30〜40Bクラスのオプションとして配置します。
ネイティブ512Kコンテキストは、新しいクラスのアプリケーションのロックを解除します。
- 長所分析:マルチドキュメント合成(RFP、法律、研究文献)、大規模なログ分析、およびエンドツーエンドの会議コーパス推論。
- エージェントトレース:単一のセッション予算内で、マルチステップツールコールと考え方のチェーンのような中間状態または批評のコンテスト内保持。
- 大規模なぼろきれ:最小限のチャンキング圧力、より大きな検索ウィンドウ、および積極的な切り捨て戦略なしのより豊富な相互断面の推論。
長いコンテキストはネイティブに(改造ではなく)訓練されているため、モデルは安定性と注意行動を長時間保持する必要がありますが、アプリケーション固有の遅延とメモリの最適化が依然として必要です。
- 合成データを備えたベース:最適なタスクのパフォーマンスと汎用アプリケーションに最適です。チューニングする前であっても、指導のような動作により強い可能性があります。
- 合成データのないベース:合成指導信号への曝露前を避けたい研究者に最適。オーダーメイドの訓練後および管理された研究に最適です。
- 指示:生産アシスタント、エージェント、および指示、ツールの使用、および接地された順守が箱から出る必要があるユーザーフェースエクスペリエンスに最適です。
- 大規模なドキュメントコンテキストを持つエンタープライズカピロット:ポリシー分析、SOP合成、監査パケットレビュー、および超長入力ウィンドウを使用したコンプライアンスレポート。
- エンジニアリングおよびOPSアシスタント:ログ/イベント分析長いウィンドウ、Change -Explainers、およびエージェントフレームワークを使用したルーティングツールの使用。
- 研究と法的ワークフロー:文献レビュー、デューデリジェンスバインダー、および最小限のチャンキング妥協を伴う判例法の分析。
- コードおよびデータタスク:マルチファイルリポジトリの推論、ノートブックリファクタル、およびエージェント開発者向けの長期にわたる計画シーケンス。
- 多言語/グローバル展開:シードオーサは国際的なユースケースに配置され、チームが単一市場の制約を超えて展開するのに役立ちます。
コミュニティデモは、マルチGPUリグで8ビットおよび4ビットの量子化されたビルドを使用してローカルに実行されているシードオス‑ 36Bを示し、ブラウザ‑ OSシミュレーション、倫理プロンプト、およびコード/HTMLタスクをテストします。スピード、コンテキストの利用、および「思考トークン」設定全体のトレードオフを期待してください。36Bの密な文脈での強力なハードウェアが必要です。 Apache -2.0ライセンスは、規制された環境に対してオンプレムおよびエアギャップの展開を実行可能にします。
このリリースは、中国のAIラボが強力なオープンモデルを許容ライセンスで出荷するように幅広くプッシュし、コミュニティの採用と透明な研究ツールを通じて米国の提供物とのギャップを狭めることを目指しています。業界全体で見られる高キャピールオープンラインをミラーする際に、商業モデル(Doubao)専有を維持するというバイテダンスの決定:クラウンジューエルシステムを公開することなく生態系の成長をサポートする強力なオープンベースライン。
Seed ‑ Oss ‑ 36Bは、オープンソースにまれな組み合わせをもたらします:ネイティブ512Kコンテキスト、推論長の明示的な制御、研究フレンドリーなベースバリアント、および許容型Apache -2.0ライセンス。ドキュメントが多いアシスタント、ツール使用エージェント、または長距離の推論システム、特に企業やオンプレムのコンテキストでは、今すぐ評価するための説得力のある非常に調整可能なオプションを構築するチームの場合。
#Bytedestines #SeedSS36B新しいオープンソースの長いコンテキストLLMに拡大 #sai #dheeraj #gummadi #2025年8月