FineBooks évalue l’OCR pour améliorer l’entraînement des modèles de langage

La qualité des textes numérisés par reconnaissance optique de caractères (OCR) issus de documents historiques pose un problème significatif pour l’entraînement des modèles de langage. Les erreurs et imprécisions de ces numérisations peuvent en effet altérer la compréhension et la performance des intelligences artificielles.

Pour y remédier, le projet FineBooks, une initiative conjointe de Hugging Face et EleutherAI, a entrepris une évaluation comparative de grande envergure. L’équipe a testé quatorze modèles OCR open-source sur un corpus de plus de 2 000 pages de livres anciens. Les résultats ont désigné dots.mocr comme le modèle le plus performant, atteignant une précision de 97,6 % au niveau des caractères pour un coût estimé à moins de deux dollars par millier de pages.

Cette performance est jugée suffisante pour la constitution de vastes ensembles de données d’entraînement pour l’IA. Toutefois, les chercheurs précisent que cette précision, bien qu’adaptée aux besoins des modèles de langage, n’est pas encore suffisante pour les exigences rigoureuses des transcriptions universitaires, qui requièrent une exactitude quasi parfaite. L’optimisation de l’OCR pour ces usages spécifiques demeure un objectif de recherche, ouvrant la voie à une meilleure exploitation des archives textuelles pour le développement futur de l’intelligence artificielle.

Source : The Decoder

Catégories : Brèves IA
← Article précédentClaude d'Anthropic explore la fonction zêta de RiemannArticle suivant →L'industrie tech s'interroge après le piratage d'une salle de sport par un agent Claude

Restez informé de l'actualité IA

Recevez chaque semaine notre sélection des meilleures analyses sur l'intelligence artificielle.

Pas de spam. Désinscription en un clic.

Laisser un commentaire

FR EN ES