14/11/2025

ScribeOCR – Corrigez vos erreurs d'OCR directement dans le navigateur (en local)

Par admin

Y’a plein d’images et de scans en PDF sur le net ou sur votre disque dur, qui sont difficilement exploitable / indexables parce que la reconnaissance de caractères n’a pas bien fonctionné. L’OCR automatique a par exemple transformé un mot-clé en charabia et c’est illisible. Du coup, ce passage est perdu dans les limbes et impossible de le retrouver avec une simple recherche textuelle. C’est moche.

Faut dire que le problème est réel car quand on numérise des millions de livres avec un OCR à 90% de précision, ça a l’air génial, sauf que les 10% d’erreurs ne sont pas aléatoires. C’est toujours les mêmes confusions qui reviennent : “A” qui devient “H”, “C” qui devient “G”, “22” qui se transforme en “55”. Et pour les documents historiques avec des polices anciennes, c’est encore pire.

Heureusement, il existe un outil gratuit et open source qui tourne dans votre navigateur et qui va vous permettre de corriger ces milliers d’erreurs OCR sans envoyer vos docs sur les serveurs de Google, Microsoft ou je ne sais quoi d’autre. Cela s’appelle
ScribeOCR
et vous allez l’adorer !

Pourquoi ? Hé bien parce que c’est un éditeur d’OCR open-source qui tourne à 100% dans votre navigateur, donc aucune donnée n’est envoyée sur le net et parce qu’il est capable de corriger toutes les erreurs efficacement ! L’interface affiche le texte OCRisé par-dessus l’image source, comme ça, vous voyez immédiatement où sont les problèmes et vous corrigez tout ça en série.

Et surtout ScribeOCR génère une police custom pour chaque document. Ça vous laisse garder l’apparence originale du doc, tout en ayant un texte parfaitement indexable pour des recherches par exemple. Vous obtenez ainsi un PDF qui ressemble au document d’origine mais où chaque mot est cliquable et cherchable. Bref, c’est super pratique si vous numérisez des archives ou des vieux bouquins.

L’outil supporte plusieurs moteurs OCR dont Tesseract LSTM et Legacy et vous pouvez ajuster les paramètres de reconnaissance selon le type de document : vitesse, qualité, langue…etc. Y’a même des options avancées pour le debug et l’optimisation des polices.

L’outil permet donc de créer des PDF recherchables à partir de scans (c’est le cas classique) mais également de corriger des données OCR existantes, y compris les fichiers HOCR de Tesseract. Et pour numériser complètement des documents ou livres anciens, l’interface de correction vous aidera à faire de l’excellent travail !

Le projet est open-source (licence AGPL-3.0)
, ce qui veut dire que vous pouvez l’auto-héberger si vous voulez. Ainsi, pour l’installer en local, c’est très simple :

git clone --recursive https://github.com/scribeocr/scribeocr.git
cd scribeocr
npm i
npx http-server

Mais si vous voulez juste tester, y’a une démo sur
scribeocr.com
. Vous uploadez votre fichier, vous choisissez votre langue et votre moteur OCR, et hop c’est parti mon kiki.

Et pour les sorties, vous avez le choix : PDF, DOCX, HTML et d’autres formats. Vous pouvez même ajuster les paramètres d’export selon vos besoins. Auto-rotation, optimisation de police, tout est configurable !

Bref, au final
ScribeOCR
répare ces angles morts bien relou de la numérisation massive de documents sans que vous ayez à sacrifier votre vie privée !

Et ça c’est cool !

Source : korben.info

Actus auto-importées phonandroid

Après 6 ans d’attente, la minifigurine Lego Mario est enfin là

À l’occasion du MAR10 Day, Lego dévoile de nouveaux produits dont une mini figurine à l’effigie du plombier moustachu de Nintendo, Mario. Des années que les fans attendaient ça. Les… Source : www.phonandroid.com

Générer des vidéos directement dans ChatGPT ? Ce serait bientôt possible grâce à l’intégration de Sora

Sora, l’impressionnant générateur de vidéos IA d’OpenAI, a été lancé comme un produit autonome. Mais l’outil pourrait bientôt jouer sur deux tableaux : la maison-mère de ChatGPT pourrait bientôt l’intégrer directement……

Ils voulaient soigner leur addiction sexuelle grâce à cette application, mais n’importe qui pouvait voir leurs pires habitudes

Les développeurs d’une application aidant à lutter contre l’addiction à la pornographie ont laissé d’énormes failles de sécurité ouvertes pendant des mois. Ils en avaient pourtant été avertis de nombreuses……

Canal+ : de la pub et la fin du partage de compte, la chaîne envisage de tout chambouler dans ses abonnements

Lors de son dernier bilan financier, Canal+ a évoqué plusieurs pistes pour gagner en rentabilité. Forcément, la chaîne s’inspire des meilleures pratiques en la matière des plateformes en streaming. Rien……

UGREEN Nexode 45W : vite, la batterie externe de 20000 mAh passe à petit prix !

Les Ventes Flash de Printemps continuent sur Amazon et c’est maintenant au tour de la batterie externe UGREEN Nexode 45W de voir son prix fondre. Vous pouvez donc vous offrir……

ScribeOCR – Corrigez vos erreurs d'OCR directement dans le navigateur (en local)

Laisser un commentaire Annuler la réponse