要約:
Google は、Gemini Enterprise エンタープライズ プラットフォームで「ライブ アバター」(リアルタイム デジタル ヒューマン)機能を正式に開始したと発表しました。このテクノロジーは、Google の最新の Gemini 3.8 Live 大規模モデル アーキテクチャと深く統合されています。独自のほぼゼロの遅延と非常に滑らかな音声会話に基づいて、ほぼリアルタイムの生成ビデオ生成機能が初めて導入され、会話型人工知能が「同時に聞いて、見て、話す」ことができる動的な視覚イメージを持つことが可能になります。

公式の紹介によると、Gemini 3.8 Live Live Avatar は、企業顧客向けに、より直感的で没入型の仮想サービス アシスタントを作成するように設計されています。オーディオ ストリームを基礎となるビデオ生成モデルと正確に同期することにより、システムは高精度のリップシンク、自然な表情の変化、およびスムーズな言語間の対話変換を実現できます。現在、デジタル ヒューマン システムは最大 97 言語をネイティブでサポートしており、会話中に言語を切り替えてもビデオの歪みや顔のずれは発生しません。
視覚的な画期的な進歩に加えて、プラットフォームには強力な非同期ツール呼び出し機能も装備されています。ユーザーとの自然で一貫した会話を維持しながら、デジタル ヒューマンはバックグラウンドでさまざまな外部 API やエンタープライズ データ インターフェイスをサイレントに呼び出して、ホテルのチェックイン登録や保険金請求書類の記入などの複雑な複数ステップのビジネスを処理できるため、過去に AI がバックグラウンド タスクを処理するときに発生した「クラッシュ」または長いサイレント待機現象に完全に別れを告げることができます。同時に、デジタルヒューマンは、端末装置のカメラおよび画面共有機能と組み合わせることで、ユーザーが表示する物理オブジェクトまたはソフトウェアインターフェイスのリアルタイムの視覚的理解と対話型のガイダンスを提供することもできます。
セキュリティとコンプライアンスの観点から、人工知能のディープフェイクや個人情報の盗難のリスクを防ぐために、Google は Live Avatar に対して複数のセキュリティ防御線を設定しました。デフォルトでは、システムは公式レビューによって事前に設定されたデジタル人物画像ライブラリのみを企業ユーザーに公開しますが、独占的なブランド画像や特定の顔をカスタマイズする許可は、厳格なホワイトリストレビューメカニズムの下に置かれます。さらに、システムによって生成されたすべてのリアルタイム音声およびダイナミック ビデオ ストリームには、AI 生成コンテンツの透明性とトレーサビリティを確保するために、目に見えず改ざん不可能な SynthID 電子透かしが埋め込まれています。
現在、Gemini 3.8 Live および Live Avatar 機能は、米国およびヨーロッパのデータセンター サービス ノードを通じてエンタープライズ レベルのサブスクリプション顧客に正式に公開されており、開発者 API アクセスのサポートも同時に提供されています。業界アナリストらは、生成ビデオ技術を基盤となる音声モデルに直接統合することで、従来のビデオレンダリングスイートによって引き起こされる高い遅延が解消されるだけでなく、AI仮想顧客サービスとインテリジェント対話型端末が「現実の人間とリアルタイムのビジュアル対話」の新時代に入りつつあることを示すと指摘した。
コメント