Google a mis à jour son système Gemini Audio avec de nouveaux modèles Gemini 3.5, introduisant des capacités de transcription améliorées qui éliminent automatiquement les hésitations comme les « euh » et les « hum ».
Ces nouvelles versions, incluant Gemini 3.5 Live, 3.5 Live Experimental et 3.5 Transcribe, sont conçues pour offrir une précision accrue aux fonctionnalités d’IA vocale de Google. Elles détectent automatiquement le jargon spécialisé et supportent plus de 85 langues, facilitant ainsi la compréhension de contenus divers.
L’objectif principal est d’améliorer la clarté des transcriptions, même en présence de bruits de fond ou lors de discours complexes. La suppression des marqueurs d’hésitation vise à rendre le texte transcrit plus concis, professionnel et agréable à lire, sans altérer le sens original du propos.
Cette avancée permet aux systèmes d’IA de Google de mieux interpréter et restituer la parole, offrant une expérience utilisateur plus fluide et naturelle pour les applications contrôlées par la voix.
Cette évolution marque une étape supplémentaire vers des interactions vocales plus naturelles et efficaces avec l’intelligence artificielle.
Source : The Verge AI