L’OCR « Illimité » de Baidu traite des dizaines de pages en un seul passage
Le système OCR « Illimité » de Baidu peut désormais traiter des dizaines de pages de documents en un seul passage, surpassant les limites des systèmes précédents.
Le système OCR « Illimité » de Baidu peut désormais traiter des dizaines de pages de documents en un seul passage, surpassant les limites des systèmes précédents.
Mistral AI a dévoilé OCR 4, la quatrième version de son modèle de reconnaissance optique de caractères, qui évolue vers le parsing documentaire sémantique pour les pipelines de recherche et le RAG.
Papers with Code centralise les meilleurs modèles OCR open-source, avec les récentes contributions de Baidu et Mistral.
Mistral AI présente OCR 4, un modèle OCR qui se distingue par ses performances dans la lecture de divers formats de documents.
La nouvelle version PP-OCRv6 de PaddlePaddle est désormais disponible sur Hugging Face, offrant une reconnaissance optique de caractères (OCR) pour 50 langues.
Une nouvelle implémentation en C++ des modèles PaddleOCR (v3 à v6) utilise ncnn pour simplifier le déploiement et améliorer les performances par rapport au runtime officiel.
Une étude comparative révèle que les LLM visuels surpassent légèrement les pipelines basés sur l’OCR pour la lecture de documents longs et complexes, mais à un coût plus élevé.
La nouvelle version 3.5 de PaddleOCR intègre une architecture Transformers, améliorant significativement ses capacités de reconnaissance optique de caractères et d’analyse de documents.
Une étude comparative de 18 grands modèles de langage pour l’OCR révèle que des modèles plus anciens ou moins coûteux surpassent fréquemment les plus récents.
Nemotron-OCR v2, un modèle OCR multilingue rapide et performant, est désormais disponible.