DeepMind a dévoilé une avancée majeure dans la compréhension vidéo avec l’intégration de capacités « agentiques » à son modèle Gemini.
Cette nouvelle approche permet à Gemini de ne plus se limiter à la simple identification d’objets ou d’actions dans une séquence vidéo. Le terme « agentique » implique une capacité à raisonner sur le contenu, à comprendre les intentions derrière les actions observées et à anticiper les conséquences potentielles.
Concrètement, cela signifie que Gemini peut analyser des vidéos pour en extraire une compréhension plus profonde, allant au-delà de la surface visuelle. Il pourrait par exemple interpréter une série de mouvements comme la préparation d’une tâche spécifique ou la résolution d’un problème, plutôt que comme de simples gestes isolés.
Cette capacité ouvre des perspectives significatives pour le développement d’agents intelligents capables d’interagir de manière plus autonome et pertinente avec leur environnement. Elle pourrait améliorer la robotique, les assistants virtuels ou les systèmes de surveillance, en leur offrant une perception du monde plus nuancée et contextuelle.
Cette évolution pourrait redéfinir les interactions entre les systèmes d’IA et le monde réel.
Source : DeepMind Blog