日本語版
最新ニュース
科学&テクノロジー

NVIDIA の Voice AI は話しながら聞きます

2026 年 1 月 24 日 NVIDIA は、PersonaPlex-7B により、人間のように聞きながら同時に話すことができる音声 AI を提供します。 Alexa & Co による迷惑な遅延は終わります。 ChatGPT で電話をかけた人なら誰でも、このドラマを知っています。最初に話し、次に待ち、その後 AI が応答します。 3 つのステップ、3 つの遅延、自然さはゼロ。 NVIDIA は現在、このプロセスを完全にやり過ぎています。 PersonaPlex-7B は新しいモデルの名前で、これまでの音声 AI にはできなかったこと、つまり、同時に聞くことと話すことを実現します。まるで人と人との本当の会話のようです。このテクノロジーはオープンライセンスの下で利用可能であり、コールセンター、音声アシスタント、顧客サービスを根本的に変革する可能性があります。 ChatGPT が中断できない理由 ChatGPT や他の音声アシスタントとの違いは、アーキテクチャにあります。以前のシステムは連鎖的に動作します。音声認識が音声をテキストに変換し、言語モデルが回答を生成し、テキスト読み上げがそれを再び音声に変換します。 3 つの別々のシステム、3 つの待ち時間。中断?不可能。会話の中で自然に重なることはありますか? なし。 PersonaPlex-7B は、このカスケードを…

NVIDIA の Voice AI は話しながら聞きます

1769303506
2026-01-24 13:08:00

2026 年 1 月 24 日

NVIDIA は、PersonaPlex-7B により、人間のように聞きながら同時に話すことができる音声 AI を提供します。 Alexa & Co による迷惑な遅延は終わります。

ChatGPT で電話をかけた人なら誰でも、このドラマを知っています。最初に話し、次に待ち、その後 AI が応答します。 3 つのステップ、3 つの遅延、自然さはゼロ。 NVIDIA は現在、このプロセスを完全にやり過ぎています。

PersonaPlex-7B は新しいモデルの名前で、これまでの音声 AI にはできなかったこと、つまり、同時に聞くことと話すことを実現します。まるで人と人との本当の会話のようです。このテクノロジーはオープンライセンスの下で利用可能であり、コールセンター、音声アシスタント、顧客サービスを根本的に変革する可能性があります。

ChatGPT が中断できない理由

ChatGPT や他の音声アシスタントとの違いは、アーキテクチャにあります。以前のシステムは連鎖的に動作します。音声認識が音声をテキストに変換し、言語モデルが回答を生成し、テキスト読み上げがそれを再び音声に変換します。 3 つの別々のシステム、3 つの待ち時間。中断?不可能。会話の中で自然に重なることはありますか?

なし。 PersonaPlex-7B は、このカスケードを 70 億のパラメーターを持つ単一の Transformer モデルに置き換えます。着信音声を継続的に処理し、リアルタイムで並行して独自の応答を生成します。 このモデルは 2 つの並列データ ストリームを使用します。1 つはユーザーを追跡し、もう 1 つは AI の応答を追跡します。どちらも同じモデル状態を共有するため、AI は話している間も聞き続け、割り込みに応答できます。 応答速度がうるさい マークテックポスト 300 ミリ秒未満 – 従来のパイプラインでの通常の 1 秒よりも大幅に高速です。まさにこのスピードが、ロボットと自然の違いを生み出します。

声と役割の二重制御

エヌビディア パーソナライゼーションには 2 つのシステムが必要です。音声プロンプトは、声の調子、口調、話し方、いわば AI の音響 DNA を定義します。一方、最大 200 個のトークンを含むテキスト プロンプトによって、AI が銀行員、技術サポート、ゲーム キャラクターのいずれであるかが決まります。開発者は、技術的に機能するだけでなく、性格にも適合する正確なエージェントを構築できます。

このトレーニングでは、フィッシャー コーパスからの 1,200 時間以上の実際の人間の電話通話と、支援およびサービス シナリオのために合成的に生成された約 2,200 時間の対話が組み合わされています。この組み合わせは、自然な会話パターン (休止、つなぎ言葉、感情的なニュアンス) と商用アプリケーションの信頼性を組み合わせることが目的です。技術的には、PersonaPlex は言語モデルのバックボーンとして Helium を使用した Moshi アーキテクチャに基づいています。 Mimi エンコーダとデコーダは 24 kHz でオーディオを処理します。ソフトウェアは、A100 や H100 などの NVIDIA GPU 上で最適化されて実行されます。

ビジネスモデルとしてのオープンソース

コードは MIT ライセンスに基づいており、モデルの重みは NVIDIA オープン モデル ライセンスに基づいています。この出版物は明らかに広範な商用利用を目的としています。初期ベンチマークでは、会話の流暢さ、反応時間、タスク完了の点で、ペルソナプレックスが多くのオープンソース システムや独自システムを上回っていることが示されています。戦略的ハイライト: OpenAI と Google はクラウド API に依存していますが、NVIDIA は PersonaPlex をオンプレミス展開に位置付けています。企業はデータ管理を維持し、API への依存を回避し、コンプライアンス要件を満たします。これは、銀行、医療、または政府において決定的な利点です。

その背後にある数字は膨大です: 会話型 AI 市場は大きく成長しています 臨時ニュース 142.9億ドル(2025年)から413.9億ドル(2030年)へ。銀行はコンタクト センターのアウトソーシングに年間 1,000 億ドル以上を費やしています。音声 AI を使用する企業は、サポート コストを最大 90% 削減します。 NVIDIA はモデルを販売するだけではなく、インフラストラクチャの完全なアップグレードも販売します。ハードウェアはすでに存在しています データセンターPersonaPlex は、このためのソフトウェア スタックを提供します。競合他社は API モデルの収益性を維持する必要がありますが、NVIDIA はチェーン全体で収益化しています。

ビジネスパンクチェック

PersonaPlex-7B は別の音声ギミックではなく、数十億ドルの可能性を秘めたインフラストラクチャの変革です。 真の全二重機能により、おもちゃとエンタープライズ ツールが分離されます。現在でも古典的な ASR-LLM-TTS パイプラインを構築している人は、時間とお金を無駄にしています。 しかし、限界は現実のものです。英語のみ、ツールの統合なし、モジュールによるカスタマイズのないモノリシック アーキテクチャ。 ドイツ市場にとって、それは待つこと、あるいは代替品を検討することを意味します。

ハードウェア要件は簡単ではありません。本番環境では A100 または H100、それ以下のものは妥協となります。問題の本当の核心は別のところにある。NVIDIA はクラウドの魅力に対抗してオンプレミスに賭けているのだ。規制された業界では正しい賭けです。 GPU 予算のない新興企業や中小企業にとって、現時点ではクラウドに代わる選択肢はありません。ペルソナプレックスは旅の行き先を示しますが、誰もがチケットを買う余裕があるわけではありません。 コンタクト センターが多用される業界の意思決定者にとって、全二重は標準となるでしょう。 問題は、するかどうかではなく、いつ、誰と行うかです。 NVIDIA がテクノロジーを提供していますが、全員がビジネス ケースを自分で計算する必要があります。

よくある質問

音声 AI において全二重がそれほど重要なのはなぜですか?

全二重では、人間同士と同じように、中断、重複、自発的な反応を伴う自然な会話が可能になります。古典的なシステムは逐次的に動作し、会話がロボットのように見える人工的な一時停止を作成します。 PersonaPlex-7B は 300 ミリ秒未満で応答し、話しながら聞き続けることができるため、技術デモと実用的なツールの違いが生じます。

PersonaPlex-7B から最も恩恵を受けるのはどの企業ですか?

銀行、保険、小売、ヘルスケアなど、コンタクト センターを重視する業界が最も影響力を持っています。銀行はアウトソーシングに年間 1,000 億ドル以上を費やしており、音声 AI はこれらのコストを最大 90% 削減します。規制された業界も、クラウドに依存しないオンプレミス展開のメリットを享受できます。 GPU 予算のないスタートアップ企業は、当面はクラウド API に依存し続けることになるでしょう。

PersonaPlex-7B は ChatGPT Voice を置き換えることができますか?

技術的にはそうですが、実際にはユースケースによって異なります。 PersonaPlex は真の全二重およびオンプレミス制御を提供しますが、英語に制限があり、NVIDIA ハードウェアが必要です。 ChatGPT Voice はインフラストラクチャ投資なしでクラウド API として実行されますが、継続的なコストが高く、データ保護の制限があります。大規模なエンタープライズ シナリオやコンプライアンス要件の場合は、PersonaPlex の方が優れていますが、迅速なプロトタイプの場合は、依然としてクラウドの方が実用的です。

PersonaPlex-7B の実際のランニングコストはどれくらいですか?

API 料金はかかりませんが、NVIDIA A100 または H100 へのハードウェア投資と電力、冷却、メンテナンスが必要です。損益分岐点は月あたり約 50,000 インタラクションです。これを下回るとクラウドの方が安くなり、それを超えるとオンプレミスが魅力的になります。 OpenAI Realtime のようなクラウド API はトークンあたりのコストが高く、量が多い場合はすぐに月額 5 桁の金額に達します。規制された業界の場合、データ主権のおかげで、オンプレミスは少量でも利益をもたらすことがよくあります。

出典: マークテックポスト臨時ニュース

#NVIDIA #の #Voice #は話しながら聞きます

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。