NVIDIA Magpie TTS : des agents vocaux multilingues à faible latence
NVIDIA lance Magpie TTS, un système de synthèse vocale avec poids ouverts pour des agents multilingues à faible latence et un contrôle total du déploiement.
NVIDIA lance Magpie TTS, un système de synthèse vocale avec poids ouverts pour des agents multilingues à faible latence et un contrôle total du déploiement.
La startup Fish Audio a levé 50 millions de dollars en financement d’amorçage pour développer ses modèles vocaux basés sur l’IA, attirant déjà 8 millions d’utilisateurs.
Hugging Face a dévoilé Real World VoiceEQ, une nouvelle méthodologie pour évaluer la qualité humaine des voix générées par l’IA, au-delà des métriques techniques.
OpenMOSS-Team lance MOSS-TTS v1.5, une mise à jour de son outil de synthèse vocale open source.
Spotify déploie un outil de création de livres audio basé sur l’IA d’ElevenLabs, marquant une étape stratégique pour renforcer sa présence sur ce marché.
OpenAI a acquis Weights.gg, une startup connue pour le clonage vocal de célébrités, intégrant son équipe sans prévoir de produit autonome.
Scenema.ai a dévoilé Scenema Audio, un modèle de clonage vocal expressif et de génération de parole en « zero-shot », dont les poids et le code sont accessibles.
xAI permet désormais aux développeurs de cloner leur propre voix pour des applications d’IA grâce à sa nouvelle fonctionnalité « Custom Voices », nécessitant une minute de parole.
Google Vids enrichit ses voix synthétiques avec 30 options plus expressives, intégrant émotions et soupirs.
Google a dévoilé Gemini 3.1 Flash TTS, une nouvelle technologie de synthèse vocale IA présentée comme la prochaine génération de parole expressive.