1771586811
2026-02-20 10:32:00
リュビサ・バジッチ著
多くの人はAIが本物であると信じています。狭い領域ではすでに人間のパフォーマンスを超えています。うまく使えば、人間の創意工夫と生産性を前例のないほど増幅させることができます。その広範な採用は、高い遅延と天文学的なコストという 2 つの主要な障壁によって妨げられています。言語モデルとの相互作用は、人間の認知のペースよりもはるかに遅れています。コーディングアシスタントは何分間も考え込んでしまい、プログラマーのフロー状態が中断され、人間と AI の効果的なコラボレーションが制限される可能性があります。一方、自動化されたエージェント AI アプリケーションは、人間のペースでゆっくりと応答するのではなく、ミリ秒単位の遅延を要求します。
コストの面では、最新のモデルの展開には膨大なエンジニアリングと資本が必要です。液体冷却、高度なパッケージング、スタック型メモリ、複雑な I/O、および数マイルのケーブルを備えた部屋サイズのスーパーコンピューターは数百キロワットを消費します。これは都市規模のデータセンター キャンパスや衛星ネットワークにまで拡張され、運用コストが膨大になります。
社会はデータセンターと隣接する発電所によって定義されるディストピア的な未来を構築する準備ができているように見えますが、歴史は別の方向性を示唆しています。過去の技術革命は、グロテスクなプロトタイプから始まり、より実用的な成果をもたらすブレークスルーによって覆い隠されることがよくありました。
部屋を満たす真空管とケーブルの獣である ENIAC を考えてみましょう。 ENIAC は人類にコンピューティングの魔法を紹介しましたが、時間がかかり、コストがかかり、拡張性がありませんでした。このトランジスタは、ワークステーションや PC からスマートフォンやユビキタス コンピューティングに至る急速な進化を引き起こし、世界を ENIAC の無秩序なスプロールから救いました。
汎用コンピューティングは、構築が容易で高速かつ安価になることで主流になりました。
AI も同様のことを行う必要があります。
タラスについて
2 年半前に設立された Taalas は、あらゆる AI モデルをカスタム シリコンに変換するプラットフォームを開発しました。これまでにないモデルを受け取った瞬間から、わずか 2 か月でハードウェアとして実現できます。
結果として得られるハードコア モデルは、ソフトウェア ベースの実装よりも桁違いに速く、安価で、消費電力が低くなります。
Taalas の仕事は、次の基本原則によって導かれています。
1. 総合専門化
コンピューティングの歴史を通じて、重要なワークロードを最大限に効率化するには、深い専門化が最も確実な道でした。
AI 推論は、人類がこれまで直面した中で最も重要な計算ワークロードであり、専門化から最大の利益を得られるものです。
その計算上の要求は、個々のモデルごとに最適なシリコンの生産という、完全な専門化の動機となります。
2. ストレージと計算の統合
現代の推論ハードウェアは、人為的な分割によって制約されています。一方にはメモリが、もう一方には計算があり、根本的に異なる速度で動作します。
この分離は長年の矛盾から生じています。 DRAM は、標準的なチップ プロセスと互換性のあるタイプのメモリよりもはるかに高密度であるため、安価です。ただし、オフチップ DRAM へのアクセスは、オンチップ メモリよりも数千倍遅くなります。逆に、DRAM プロセスを使用して計算チップを構築することはできません。
この格差が最新の推論ハードウェアの複雑さの多くを支えており、高度なパッケージング、HBM スタック、大規模な I/O 帯域幅、チップあたりの消費電力の高騰、液体冷却の必要性を生み出しています。
ターラスはこの境界を排除します。ストレージとコンピューティングを DRAM レベルの密度で単一チップ上に統合することにより、当社のアーキテクチャは以前に可能であったものをはるかに超えています。
3. 徹底的な簡素化
メモリとコンピューティングの境界を取り除き、シリコンを各モデルに合わせて調整することにより、ハードウェア スタック全体を第一原理から再設計することができました。
その結果、難しいテクノロジや特殊なテクノロジ、HBM、高度なパッケージング、3D スタッキング、液体冷却、高速 IO に依存しないシステムが実現します。
エンジニアリングの簡素化により、システム全体のコストを大幅に削減できます。
初期の製品
この技術理念に基づいて、Taalas は世界最速、低コスト/消費電力の推論プラットフォームを作成しました。
図 1: Llama 3.1 8B モデルと配線された Taalas HC1
本日、当社は最初の製品である有線 Llama 3.1 8B を発表します。 チャットボットのデモ そして 推論APIサービス。
Taalas のシリコン Llama は、ユーザーあたり 17,000 トークン/秒を達成します。これは現在の最新技術よりもほぼ 10 倍高速でありながら、構築コストが 20 分の 1、消費電力が 10 分の 1 です。
Llama 3.1 8B、入力シーケンス長 1k/1k のパフォーマンス データ |ソース: Nvidia ベースライン (H200)、Taalas によって測定された B200 | Groq、Sambanova、Cerebros のパフォーマンスから 人工分析 | Taalas labsが運営するTaalas Performance
図 2: Taalas HC1 は、Llama 3.1 8B 上でリーダーシップ トークン/秒/ユーザーを提供します
最初の製品のベースとして、その実用性から Llama 3.1 8B を選択しました。サイズが小さく、オープンソースで利用できるため、最小限のロジスティクスの労力でモデルを強化することができました。
Llama は大部分が速度のためにハードウェア化されていますが、構成可能なコンテキスト ウィンドウ サイズと低ランク アダプター (LoRA) による微調整のサポートを通じて柔軟性を維持しています。
私たちが第 1 世代の設計に取り組み始めた時点では、低精度パラメータ形式は標準化されていませんでした。したがって、当社の最初のシリコン プラットフォームでは、カスタムの 3 ビットの基本データ型が使用されました。 Silicon Llama は、3 ビットと 6 ビットのパラメーターを組み合わせて積極的に量子化されているため、GPU ベンチマークと比較して品質が多少低下します。
当社の第 2 世代シリコンは標準の 4 ビット浮動小数点形式を採用し、高速性と効率性を維持しながらこれらの制限に対処します。
今後のモデル
私たちの 2 番目のモデルは、依然として Taalas の第 1 世代シリコン プラットフォーム (HC1) に基づいており、中規模の推論 LLM になります。この春には私たちのラボで導入される予定で、その後すぐに推論サービスに統合される予定です。
これに続いて、当社の第 2 世代シリコン プラットフォーム (HC2) を使用してフロンティア LLM が製造されます。 HC2 は、かなり高い密度とさらに高速な実行を提供します。導入は冬を予定している。
瞬間的な AI を今すぐあなたの手に
私たちのデビュー モデルは明らかに最先端ではありませんが、とにかくベータ サービスとしてリリースすることにしました。これは、LLM 推論がミリ秒未満の速度とほぼゼロのコストで実行されるときに何が可能になるかを開発者が探索できるようにするためです。
私たちは、私たちのサービスによって、以前は実用的ではなかった多くのクラスのアプリケーションが可能になると信じており、開発者がこれらの機能をどのように適用できるかを実験して発見することを奨励したいと考えています。
アクセスを申請する ここ、従来の AI レイテンシーとコストの制約を取り除くシステムを利用します。
内容、チーム、技術について
ターラスの中核は、長年の協力者からなる小規模なグループであり、その多くは 20 年以上一緒に働いています。無駄のない集中力を維持するために、私たちは同等のスキルと数十年にわたる共有経験をもたらす外部パートナーに依存しています。チームはゆっくりと成長し、実証された卓越性、私たちの使命との整合性、そして確立された慣行の尊重を通じて新しいチームメンバーが加わります。ここでは、内容がスペクタクルを上回り、技術が規模を上回り、厳密さが冗長性を上回ります。
タアラスは、群がる数、溢れんばかりのベンチャーキャピタルの金庫、明晰な思考をかき消す誇大宣伝の叫び声を抱えて、城壁都市を包囲する中世の軍隊のように、ディープテックの新興企業が自ら選んだ問題に取り組む世界において、精密な攻撃である。
当社の最初の製品は、24 人のチームメンバーからなるチームによって世に送り出され、総額わずか 3,000 万ドルが費やされ、2 億ドル以上が集まりました。この成果は、正確に定義された目標と規律ある集中力が力技では不可能なことを達成できることを示しています。
今後もオープンに進んでいきます。当社の Llama 推論プラットフォームはすでにあなたの手の中にあります。将来のシステムは成熟するにつれて続きます。私たちはそれらを早期に公開し、迅速に反復し、粗い部分を受け入れます。
結論
イノベーションは、前提条件に疑問を持ち、ソリューション領域の無視されている隅々にまで踏み込むことから始まります。それが私たちがターラスで選んだ道です。
当社のテクノロジーは、パフォーマンス、電力効率、コストにおいてステップ関数の向上を実現します。
これは、主流とは根本的に異なるアーキテクチャ哲学を反映しており、AI システムの構築と展開方法を再定義します。
破壊的な進歩が最初は見慣れたものに見えることはほとんどありません。私たちは、業界がこの新しい運用パラダイムを理解し、採用できるよう支援することに全力で取り組んでいます。
当社の最初の製品は、有線の Llama から始まり、より高機能なモデルに急速に拡張され、ユビキタス AI の核となる障壁である高い遅延とコストを排除します。
私たちは、瞬時の超低コストのインテリジェンスを開発者の手に渡し、開発者がそれを使って何を構築するのかを楽しみにしています。
#ユビキタスAIへの道