Résumé :
Google a annoncé le lancement officiel de la fonction « Live Avatar » (humain numérique en temps réel) dans la plate-forme d'entreprise Gemini Enterprise. Cette technologie est profondément intégrée à la dernière architecture grand modèle Gemini 3.8 Live de Google. Basé sur le délai original proche de zéro et la conversation vocale très fluide, il introduit pour la première fois des capacités de génération vidéo générative en temps quasi réel, permettant à l'intelligence artificielle conversationnelle d'avoir une image visuelle dynamique qui peut « écouter, regarder et parler en même temps ».

Selon l'introduction officielle, Gemini 3.8 Live Live Avatar est conçu pour créer un assistant de service virtuel plus intuitif et immersif pour les entreprises clientes. En synchronisant avec précision le flux audio avec le modèle de génération vidéo sous-jacent, le système peut réaliser une synchronisation labiale de haute précision, des changements naturels d'expression faciale et une conversion fluide des dialogues multilingues. Actuellement, le système humain numérique prend en charge nativement jusqu'à 97 langues, et il n'y aura pas de distorsion vidéo ni de dérive faciale lors du changement de langue en cours de conversation.
En plus des avancées visuelles, la plate-forme est également équipée de puissantes capacités d'appel d'outils asynchrones. Tout en maintenant une conversation naturelle et cohérente avec les utilisateurs, les humains numériques peuvent appeler silencieusement diverses API externes et interfaces de données d'entreprise en arrière-plan pour gérer des activités complexes en plusieurs étapes telles que l'enregistrement à l'hôtel et le remplissage des documents de réclamation d'assurance, disant complètement adieu au « crash » ou au long phénomène d'attente silencieuse qui se produisait lorsque l'IA traitait des tâches en arrière-plan dans le passé. Dans le même temps, combiné à la fonction de caméra et de partage d'écran du terminal, l'humain numérique peut également fournir une compréhension visuelle en temps réel et un guidage interactif des objets physiques ou des interfaces logicielles affichées par l'utilisateur.
En termes de sécurité et de conformité, afin de prévenir les risques de deepfakes grâce à l'intelligence artificielle et d'usurpation d'identité, Google a mis en place plusieurs lignes de défense de sécurité pour Live Avatar. Par défaut, le système n'ouvre aux utilisateurs professionnels que la bibliothèque d'images humaines numériques qui a été prédéfinie par un examen officiel, tandis que l'autorisation de personnaliser des images de marque exclusives ou des visages spécifiques est placée sous un mécanisme strict d'examen de liste blanche. De plus, tous les flux vocaux et vidéo dynamiques en temps réel générés par le système ont été intégrés à des filigranes numériques SynthID invisibles et infalsifiables pour garantir la transparence et la traçabilité du contenu généré par l'IA.
Actuellement, les fonctions Gemini 3.8 Live et Live Avatar ont été officiellement ouvertes aux clients abonnés au niveau de l'entreprise via les nœuds de service des centres de données américains et européens, et la prise en charge de l'accès aux API des développeurs est simultanément fournie. Les analystes du secteur ont souligné que l'intégration de la technologie vidéo générative directement dans le modèle vocal sous-jacent élimine non seulement la latence élevée causée par les suites de rendu vidéo traditionnelles, mais marque également que le service client virtuel IA et les terminaux interactifs intelligents entrent dans une nouvelle ère de « dialogue visuel en temps réel et en personne réelle ».
Commentaires