Table des matières
ROC
Reconnaissance optique de caractères
En anglais: Optical Character Recognition
La reconnaissance optique de caractères (ROC) désigne les procédés informatiques pour la traduction d'images de textes imprimés ou dactylographiés en fichiers de texte. Elle réalise beaucoup moins que l'être humain qui, lui, exécute, en plus de la reconnaissance, la compréhension du message, sa mémorisation, voire son analyse critique dans un seul temps. Un ordinateur réclame pour l'exécution de cette tâche un logiciel de reconnaissance optique de caractères, ROC ou OCR (abréviation du terme anglais optical character recognition), Celui-ci permet de récupérer le texte dans l'image d'un texte imprimé et de le sauvegarder dans un fichier pouvant être exploité dans un traitement de texte pour enrichissement, et stocké dans une base de données ou du moins, sur un support sûr et exploitable par un système informatique.
Voir
- logiciels ROC/OCR sur ubuntu.org
- Tabula is a tool for liberating data tables locked inside PDF files. Un dockerfile sur https://github.com/tabulapdf