米Googleは2026年9月24日(現地時間)、リアルタイム音声対話モデル「Gemini 3.8 Live」に動画生成のアバター機能「Live Avatar」を組み合わせた「Gemini 3.8 Live with Live Avatar」を発表した。同日から企業向けの「Gemini Enterprise」で一般提供を開始し、ユーザーの音声を聞きながら発話に合わせて口が動くアバター映像で応答するシステムを実用段階へと乗せた。
Gemini 3.8 Live with Live Avatarの仕組みと基本機能
Live Avatarは、9月15日に公開されたGemini 3.8 Liveの対話機能と、低遅延の映像ストリーミングを一体化した技術である。ユーザーの声を聞き取り、カメラ映像を確認しながら、発話に合わせて口が動くアバターの映像と音声で応答を行う。表情も自然に変わり、話し手の交代も滑らかに行われる点が特徴だ。カメラ映像や画面共有を音声と同時に処理できるため、ユーザーが見ているものをアバター側も把握しながら会話を進めることができる。
非同期ツール呼び出しと多言語対応の技術仕様
会話を止めずに裏でツールを実行する3.8 Liveの非同期ツール呼び出しにも対応している。公開されたデモ動画では、ホテルのチェックイン手続きにおいて、アバターが客との会話を続けながら裏でツールを呼び出して手続きを進める様子が紹介された。対応言語は日本語を含む97言語に及び、会話の途中で言語が切り替わっても、映像の品質を落とさず、見た目のずれを生じさせずにリップシンクや表情を追従させられるとしている。
https://x.com/c_nemri/status/2103231923728400583
企業における想定用途と導入事例
このサービスの狙いは、企業がオンライン上のサービスをより対話的に展開できるようにすることにある。想定する用途は顧客対応や手順を対話形式で案内するウォークスルーなどで、Web、モバイルアプリ、店頭のキオスク端末での利用を見込む。導入事例として、米Cox Automotiveが自動車情報サイト「Autotrader」向けに、会話しながら車両の検索や比較、ローンの相談を案内するアバター型アシスタントを構築したことが紹介された。
アバターの生成方法とカスタムアバターの制限
アバターの生成について、モデルカードでは設定した画像と音声入力を基に、自然な頭の動きと発話に同期した表情豊かな動画を生成すると説明している。企業はGoogleが用意した多様なプリセットのライブラリから選べるほか、高品質な参照画像1枚を基に独自のカスタムアバターを作成することもできる。ただし、カスタムアバターの作成はGoogleの許可リストに登録された企業に限って提供される。
安全性と利用条件、料金体系
安全対策として、なりすましなどの悪用を防ぐため、カスタムアバターの作成には許可リストへの登録と厳格な検証の手続きが設けられている。生成された音声と映像にはすべて電子透かし「SynthID」が埋め込まれ、AI生成コンテンツであることを検出できる。料金は従量課金制で、100万トークン当たり、アバター映像の出力が1ドルとなっている。米国とEUのエンドポイントで提供され、処理能力をあらかじめ確保するプロビジョンドスループットにも対応する。
