Squeeze Beats は AI 軽量最適化テクノロジーで大手テクノロジーを魅了します
性能を犠牲にすることなくモデルサイズを削減…チップの特性に応じて計算フローチャートを調整
AIサービス会社とAI設計会社…双方が歓迎する世界トップクラスの技術
チップ設計の専門家によるスタートアップ…「NPU時代の主要インフラになる」
スクイーズビーツのキム・ヒョンジュン最高経営責任者(CEO)は先月11日、ソウル江南事務所で同社のAI軽量化・最適化技術の機能を説明し、来るべきニューラルネットワーク処理装置(NPU)時代の重要なインフラになると述べた。ホ・ジンソク記者 [email protected] 「クラウドサーバー利用料に月数億~数十億ウォンを費やす人工知能(AI)サービス会社の利用料を最大90%節約する。当社はAIがどんなAI半導体上でも最適に動作できるよう『サイズ』を縮小し、高速化する世界でも数少ないスタートアップ企業の一つだ」
AI軽量化・最適化スタートアップ企業Squeeze Beatsのキム・ヒョンジュンCEO(32)は、先月11日にソウルの江南オフィスで会った際、これが同社のビジネス手法だ、と語った。
AIは年を追うごとに賢くなっていきます。しかし、AIが処理しなければならない計算やデータが増えれば増えるほど、AIは重くなります。 AI が重くなると動作が遅くなり、クラウドのコストも高くなります。
AI半導体を製造するハードウェア企業も懸念を抱いている。既存のAIサービスは自社の半導体を使っても経済的に運用できるという自信を人々に与えるのが狙いだ。キム代表は「AIは半導体の特性に合わせて効率的に動作するように改良することができる。この技術のおかげで、世界的なAIサービス会社とAI半導体設計会社の両方からラブコールを受けている」と語った。
●AIダイエット…10台のサーバーで1台分の仕事ができる
Squeeze Beats が解決しようとしている問題は明らかです。 AIサービスの軽量化と最適化(効率化)。 ChatGPT によって引き起こされた大規模な言語モデル (LLM) の流行の背後には、管理できないインフラストラクチャのコストが潜んでいます。 Nvidia の最新の GPU サーバーの価格は 1 台あたり数億ウォンです。 AI プログラムが効率化されれば、1 台のサーバーで 10 台のサーバーのパフォーマンスを実現できます。キム最高経営責任者(CEO)は、「AIを生産する場所は増えたが、それを効率的に運用するのは別の分野の問題だ」と語った。
AIの効率性とは一体何でしょうか?キム最高経営責任者(CEO)は、「コンピューターの動作が遅くなると、ハードウェアを知らない人はただやみくもに再起動するが、コンピューターの構造を知っている専門家は不要なプログラムを停止し、メモリを整理してスムーズに早く動作させる。AIの効率もこれに似ている」と語った。
キムCEOが語る「ハードウェア知識に基づく効率化」は単純な比喩ではない。 AI 半導体は、主にコンピューティング (計算) とメモリ (ストレージ) の 2 つの軸を中心に展開します。いくら計算が速くても、データ(メモリ)を取り出す速度が遅ければ、半導体は空回りしてしまいます。これがいわゆるボトルネック現象である。 Squeeze Beats のテクノロジーはこのギャップを埋めます。たとえば、メモリからデータが取得されるまでの一時的な待機時間中に、アイドル状態の処理ユニットで他の計算が事前に実行されます。これは、シェフが水が沸騰するのを待っている間ボーっとしているのではなく、材料を準備して調理時間を短縮するのと似ています。

Squeeze Beatsのキム・ヒョンジュン代表は、昨年9月に米国カリフォルニア州のサンタクララコンベンションセンターで開催された「AIインフラサミット2025」の大規模推論モデルのパフォーマンス最適化セッションにパネリストとして参加し、意見を述べている。スクイーズビート提供
● ハードウェアのカスタマイズと効率化の魔法
Squeeze Beats にはさまざまな軽量化・最適化テクノロジーが搭載されています。軽量化とはAIモデルを小さく軽くすることであり、最適化とは小さなモデルを高速かつ効率的に実行できるようにする技術です。
AIモデルを軽量化する技術の一つに「量子化」があります。これは、32ビットの長いビットで表現されたデータを、8ビットや4ビットの短いビットに圧縮する技術です。キム代表は、「スーパーで買い物をするとき、10ウォン単位まで正確に計算しない。計算を1000ウォンや100ウォンに単純化しても、結果はそれほど変わらない。AIはデータを簡素化し、パフォーマンスを最小化または低下させる技術だ」と語った。
軽量化のための枝刈りという手法もあります。 AIモデルの多数のニューラルネットワークのうち、結果に大きな影響を与えない不要な接続を大胆にカットする技術です。より良く成長するために木の小枝を切り落とすのと同じ原理です。
最適化技術の代表例としてグラフ作成があります。これは、複雑な操作の順序を、ハードウェアが最適で高速に処理できる順序に並べ替えるテクノロジーです。
Squeeze Beats はこれらすべてのテクノロジーを組み合わせて 10 倍の速度を実現します。 CEO の Kim 氏は、「ある AI サービス会社は 10 秒で 10 枚の画像を作成する必要があり、10 個の GPU を使用していました。当社のソリューションを適用した後、1 個の GPU で同じ速度を達成することができました。」と述べました。
●「インテルも我々を求めている」…黒字経営
Squeeze Beats は、世界で最も権威のある AI カンファレンスのいくつかで、軽量化と最適化に関連する 70 以上の論文を発表してきました。顧客には、Naver、Kakao、Krafton、LG、KT、LGU+ などの大企業が含まれます。世界的な半導体企業であるインテルがパートナーです。インテルのAIアクセラレーター「Gaudi」を最適化する技術力が評価され、「インテル・パートナー・アライアンス・ゴールドレベル」を達成した。国内のAIスタートアップRebellionとも戦略的パートナーシップを締結し、国内のNPUエコシステムの拡大を主導している。
Google や Samsung のような大企業は、効率化テクノロジーを自社で社内に導入することはできないのでしょうか?キムCEOは自信を持っている。 「彼らは自分たちでそれを行うことができます。しかし、私たちはそれをより上手に行います。ハードウェアの底からアルゴリズムの最上位まですべてを知っているチームは世界でもほとんどありません。自分たちでやるよりも私たちを利用する方が効率的です。そのため、大規模な世界的企業が私たちに仕事を委託する可能性があります。」
●「人ができないことをやろう」POSTECH卒業生の執念
CEO のキム・ヒョンジュンは、POSTECH クリエイティブ IT コンバージェンス工学科の第 1 期卒業生です。私は学部時代から、決められたカリキュラムではなく、自分で学科規則を作ったり、生徒会を組織したりして、「無から有を生み出す」楽しさに夢中になってきました。私は幼い頃から起業するという夢を持っていました。私は常に、もしビジネスを始めたいとしても、他の人と同じレベルの成功はできないだろうという印象を持っていました。 「技術的な壁が必要だと感じたので、大学院に進学してAI半導体設計を専攻しました。ソフトウェアを極限まで最適化するにはハードウェアの知識が必要だと考えました」と氏は語った。
AI半導体設計を学んだ大学院時代の同僚や技術的なアドバイスをしたPOSTECHやソウル大学の教授ら4人で2022年3月にSqueeze Beatsを設立した。当初はCCTVやロボットに使われる「エッジAI」の軽量化に注力した。この技術には多くの需要がありましたが、商業化が成功するかどうかは別の話です。顧客は Squeeze Beats テクノロジーを使用して多額のコストを節約したいと考えていましたが、市場環境が芳しくないため、それは困難でした。
その機会は生成 AI ブームによってもたらされました。サーバーのコストに悩む企業が増えるにつれ、軽量化や最適化のテクノロジーが脚光を浴びるようになりました。同社は設立当初、Naver D2SFとPostech Holdingsからシード投資を呼び込むことでその可能性が認められました。 2024年にはカカオベンチャーズなどからプレシリーズAの投資を集めた。
Squeeze Beats は、NPU 市場はさらに拡大すると予測しています。 Kim CEOは「Nvidia GPUに代わるNPU市場が成長するにつれ、Squeezebitsの役割も大きくなるだろう」とし、「国内のNPUでも既存のAIが十分に高速かつ効率的に実行できることを当社のソリューションで証明している」と付け加えた。スクイーズビーチは創業3年目の2024年から利益を上げている。
キムCEOはSqueeze Beatsの今後について、「AI半導体とサービス会社の間の技術的な壁を取り除き、誰もが効率的にAIを活用できるよう、必要不可欠な仲介者となる」と述べた。

拡大表示
© dongA.com 無断複写・転載を禁じます。無断転載・再配布・AI学習等の使用を禁止します。
#月数億節約のAIダイエットコストを最大90削減허진석의 #톡톡 #스타트업東亜日報