DeepMind : les générateurs vidéo, clés des modèles du monde pour la vision
Google DeepMind a démontré que les générateurs vidéo pourraient déjà posséder les « modèles du monde » manquants à la vision par ordinateur, avec moins de données.
Google DeepMind a démontré que les générateurs vidéo pourraient déjà posséder les « modèles du monde » manquants à la vision par ordinateur, avec moins de données.
Une nouvelle méthode de modélisation de la profondeur utilise les zones d’échec des capteurs comme signal de masquage, améliorant significativement la précision.
PhotoRoom a partagé sa stratégie de données pour l’entraînement de ses modèles d’IA, insistant sur l’importance de la qualité et de la diversité des ensembles.
Un pratiquant d’escrime historique a identifié les lacunes de l’IA en matière de suivi des mouvements complexes et propose de créer un jeu de données ouvert pour y remédier.
Un programme innovant permet à une manette Steam modifiée de se recharger de manière autonome, en utilisant ses moteurs haptiques et la vision par ordinateur.
Le modèle d’IA « Count Anything » promet de compter tout objet dans toute image via une instruction textuelle, réduisant de moitié les erreurs mais peinant sur les objets denses.
Des modèles d’IA embarquée plus petits prouvent leur efficacité pour des tâches concrètes, comme la reconnaissance du code Morse sur smartphone.
Le modèle WordDetectorNet de Harald Scheidl utilise une régression de boîtes englobantes par pixel et DBSCAN pour la détection de mots manuscrits, s’éloignant des méthodes classiques.
Une IA, Qwen2-VL, est entraînée pour détecter des fraudes complexes sur la blockchain via la vision par ordinateur.
Une nouvelle méthode améliore le suivi de personnes par systèmes multi-caméras en prédisant leur position même quand une caméra les perd, grâce à une calibration automatique.