Un projet permet aux LLM de « visionner » et comprendre des vidéos
Un projet open-source démontre comment n’importe quel grand modèle linguistique (LLM) peut être doté de la capacité de « visionner » et de comprendre le contenu de vidéos.
Un projet open-source démontre comment n’importe quel grand modèle linguistique (LLM) peut être doté de la capacité de « visionner » et de comprendre le contenu de vidéos.
Google DeepMind présente Gemma 4 12B, un modèle multimodal unifié traitant texte et images sans encodeur dédié.
Google Gemma 4 12B, modèle IA multimodal, est désormais utilisable sur des ordinateurs personnels sans cloud.
Google a récemment publié onze démonstrations vidéo détaillées, mettant en scène les capacités avancées de ses modèles d’intelligence artificielle Gemini Omni et Gemini 3.5.
Google a dévoilé Gemini Omni, un nouveau modèle multimodal capable de transformer texte, images et audio en vidéo, marquant une avancée significative dans la génération de contenu assistée par IA.
Wirestock a levé 23 millions de dollars pour continuer à fournir des photos, vidéos et contenus 3D de ses 700 000 créateurs aux laboratoires d’intelligence artificielle.
NVIDIA Nemotron 3 Nano Omni : une IA multimodale pour analyser documents, audio et vidéo sur de longues séquences.
Hugging Face facilite l’entraînement de modèles d’IA multimodaux avec Sentence Transformers.