1774558435
2026-03-26 20:48:00
まとめ
- Google は、応答の遅延を最小限に抑えるリアルタイム対話用の最先端のオーディオ モデルである Gemini 3.1 Flash Live を発表しました。
- 新しいモデルは、背景雑音を分離する能力が向上し、話のピッチや速度などの音響的なニュアンスを完全に認識します。
- この API はすでに Google AI Studio で利用可能ですが、このテクノロジーは同時に Gemini Live と Search Live を世界中で強化し、セキュリティ目的で SynthID ウォーターマークを付けたオーディオのみを出力します。
- 同時に、ヘッドフォン経由のライブ翻訳が iOS エコシステム (Android を除く) で正式に利用可能になり、元の話者の音色を維持しながら 70 以上の言語にリアルタイム翻訳を提供します。
人工知能システムとの対話は変化しており、現在は直接音声コミュニケーションと自然な対話に重点が置かれています。 Googleは次に進みました 重要なお知らせ Gemini 3.1 Flash Live モデルを正式に導入し、ヘッドフォン用の Live Translate 機能を iOS オペレーティング システムに拡張することで、エコシステムのオーディオ機能をアップグレードしています。
新しいリリースは、遅延を排除し、人間の音声をより正確に理解し、リアルタイムで言語の壁を打ち破ることに重点を置いています。同時に、彼らは開発者に新しい技術ツールを提供します。 Google AIスタジオ 信頼性の高い音声優先アプリケーションを統合します。
Gemini 3.1 Flash Live とその技術仕様とは
の Gemini 3.1 フラッシュ ライブ 彼女のトップオーディオモデルです グーグル リアルタイム ダイアログ用。Gemini Live API を通じて利用可能。非常に低い遅延を実現し、声のトーンを認識し、周囲のノイズを効果的に除去し、90 以上の言語をサポートし、要求の厳しい ComplexFuncBench Audio ベンチマークで 90.8% のスコアを獲得しています。
新しいアーキテクチャは基本的に 2.5 Flash Native Audio モデルを置き換えるもので、オーディオ信号処理に構造的な変更が導入されています。 Google のテクノロジーは単純な単語認識 (Speech-to-Text) に限定されません。ユーザーの思考終了を感知し、話速、ピッチ、沈黙を徹底的に分析し、不自然な中断を回避します。さらに、騒音遮断能力が大幅に向上し、人の会話と車の交通音やテレビの音などの環境音を区別します。
- ComplexFuncBench オーディオ: 90.8% という驚異的なスコア。これは、多くの制約のある複雑な命令の実行におけるモデルの精度を証明します。
- 多言語サポート: マルチモーダルなインタラクションのための 90 を超える言語での瞬時の音声認識と生成。
- AIマーキング: 生成されたすべてのオーディオ データには、誤った情報を防ぎ、コンテンツの識別を容易にする検出不可能なデジタル署名である SynthID の透かしが入れられます。
開発者向けのアーキテクチャ、API、ツール
で Google AIスタジオ、開発者は、「 ThinkingLevel 」を設定する機能を備えた新しいモデル (gemini-3.1-flash-live-preview) にアクセスできるようになり、最適な速度を実現するためにデフォルトで「minimal」に設定されます。このモデルは同期関数呼び出しをサポートしており、同じサーバー イベント内の複数のコンテンツを同時に管理できるため、音声エージェントの開発が迅速化されます。
新しい API にスムーズに移行するために、開発者はコードを適応させるように求められます。パラメータを使用していた以前のモデルとは異なり、 考える予算3.1 Flash Live は 思考レベル (最小、低、中、高)。最小オプションでは、リアルタイム アプリケーションのレイテンシが最小限に抑えられることが保証されます。単一の BidiGenerateContentServerContent イベントは音声データと文字起こしされたテキストを同時に返すことができるため、システムはデータを並行して処理できるように準備する必要があります。
- 入力トークン制限: セッションあたり 131,072 トークンに相当します。
- データ管理: テキスト、画像、オーディオ、ビデオ形式で入力し、テキストとオーディオで出力できます。
- ビデオコストの最適化: リソースの不必要な使用を避けるために、オーディオ アクティビティがある場合にのみビデオ フレームを送信することをお勧めします。
- 制限: 現在、このバージョンでは、非同期関数呼び出しとプロアクティブなオーディオ/感情的な対話機能はサポートされていません。
エコシステムへの統合: Gemini Live と Search Live
の Gemini 3.1 フラッシュ ライブ 消費者向けアプリケーションに直接フィードを供給する ジェミニライブ そして ライブ検索 200か国以上で。システムはより速く応答し、会話中の一時停止を最小限に抑え、会話のコンテキストを従来の 2 倍長く維持できます。
最終消費者のレベルでのアップグレード AI スマートフォン (Android および iOS) でのエクスペリエンスが根本的に向上します。インテリジェントアシスタントは人間の対話の自然な流れに従い、落ち着きを失うことなく中断を許可します。この特定のアーキテクチャは、長時間のブレインストーミング セッションに最適であることがわかります。同時に、世界中で Search Live (AI モードが利用可能な場合) を有効にすると、従来の Google 検索が高度なマルチモーダル プロセスに変わり、Google レンズを介してマイクやカメラとシームレスに連携します。
ライブ翻訳: iOS 上のリアルタイム翻訳者
サービス ライブ翻訳 OS 用の Google 翻訳アプリと完全に統合 iOSを使用すると、ユーザーは互換性のあるヘッドセットをライブ翻訳ツールに変えることができます。 70 以上の言語をサポートし、元のスピーカーの音色とリズムを維持します。
この機能は Android ユーザーがすでに利用可能でしたが、Apple エコシステムに導入されたことで、サービスのフットプリントが大幅に拡大しました。プロセスは簡単です。ユーザーが翻訳アプリを開き、「ライブ翻訳」コマンドを選択し、ヘッドフォンを接続すると、会話が直接翻訳されます。本質的な革新は音声パフォーマンスにあります。 AIは、言葉を冷たく「ロボット的」に朗読するだけでなく、対話者の実際のスタイルや気分(雰囲気)を伝えるためにそのトーンを調整します。このアップデートにより、機能の地理的範囲が拡大され、出張や観光地でのコミュニケーションが容易になります。
- 豊富な言語: 世界中の 70 以上の言語をサポートする即時翻訳。
- リアルなサウンドパフォーマンス: 元の話者のリズムと自然なポーズをコピーします。
- 画面の独立性: 翻訳はヘッドフォン内で継続的に行われるため、対話者間の継続的なアイコンタクトが保証されます。
テックギア提供
超低遅延 AI オーディオ モデルへの移行により、デジタル アシスタントの最大の構造的問題である即時性の欠如が解決されます。ギリシャの現実にとって、Googleの発表は非常に興味深い。膨大なサポート カタログ (Gemini Live と Live Translate の両方) にギリシャ語が含まれることで、構文的に複雑な語彙が主流のアングロサクソン言語と同等に扱われることが保証されます。
国内のビジネス部門では、観光、小売、カスタマー サポート部門の開発者や企業が堅牢な API を利用できるようになりました。 Gemini 3.1 Flash Live は、通りやレストランの喧騒を隔離しながら関数呼び出しを完璧に実行できるため、産業用途にすぐに使用できます。ハードウェア エコシステムの観点から見ると、iOS でヘッドフォン経由でライブ翻訳を提供するという Google の決定は、プラットフォームの制限を打ち破るものです。ギリシャの iPhone ユーザーは、究極の旅行およびコミュニケーション ツールを手に入れることができます。 「音声ファースト」インターフェースの時代への完全な移行が正式に始まり、キーボードは徐々にシームレスで自然な音声に取って代わられています。
#音声AIの新時代