Passer au contenu principal
v5.3.0 Disponible Maintenant

Le meilleur moteur d'OCR
gratuit au monde.

Tesseract OCR est le moteur standard de l'industrie, libre et open source pour la reconnaissance optique de caractères. Grâce à ses réseaux neuronaux récurrents LSTM, il extrait le texte des images avec plus de 99 % de précision dans plus de 100 langues. 100 % hors ligne et sécurisé.

60k+
Étoiles GitHub
100+
Langues Reconnues
40ans
D'Expérience Éprouvée
99%+
Précision de Reconnaissance
0 €
Coût — Gratuit à Vie
tesseract_demo.sh

$ # Extraire le texte d'un document numérisé

$ tesseract document.tiff resultat -l fra --psm 3


$ cat resultat.txt

Portez ce vieux whisky au juge blond qui fume. Ce texte a été extrait avec succès avec un taux de confiance de 99,8 %.

Trois étapes vers des données structurées.

Intégrez Tesseract à votre pipeline pour transformer instantanément vos images en texte structuré et PDF consultables.

01

Fournir l'Image

Prend en charge TIFF, JPEG, PNG et WebP. Tesseract utilise Leptonica pour une binarisation robuste, le débruitage et la mise à l'échelle.

02

Analyse de Mise en Page

Le moteur segmente la page en blocs, lignes et mots. Choisissez parmi 14 modes de segmentation de page (PSM).

03

Exécution du Réseau LSTM

Les réseaux neuronaux analysent les lignes de manière continue. Sortie : texte brut, hOCR, PDF standard, PDF avec texte invisible, TSV et ALTO.

Démo dans le Navigateur

Testez Tesseract en Ligne — Sans Installation

Convertissez vos documents scannés en texte éditable et PDF consultables directement dans votre navigateur. 100 % privé.

Tester l'OCR en Ligne →

📥 Installer Tesseract OCR

Prêt en quelques minutes. Choisissez votre système d'exploitation ci-dessous pour le guide d'installation officiel.

macOS Ubuntu / Debian Windows
Étape 1

Installer la Bibliothèque

Installez le moteur CLI via Homebrew.

os_install.sh

$ brew install tesseract

Étape 2

Télécharger les Modèles de Langues

Installez les modèles .traineddata supplémentaires.

lang_install.sh

$ brew install tesseract-lang

Étape 3

Vérifier l'Installation

Confirmez la version installée sur votre système.

check_version.sh

$ tesseract --version

Étape 1

Installer la Bibliothèque

Disponible directement via apt.

apt_install.sh

$ sudo apt install tesseract-ocr

Étape 2

Télécharger les Paquets de Langues

Installez le français et les autres langues.

apt_lang.sh

$ sudo apt install tesseract-ocr-fra tesseract-ocr-all

Étape 3

Vérifier l'Installation

Vérifiez la version dans votre terminal.

verify_tess.sh

$ tesseract --version

Étape 1

Installateur Windows

La référence communautaire est le binaire précompilé du projet UB Mannheim.

Télécharger UB Mannheim
Étape 2

Configurer le PATH Système (Indispensable)

Ajoutez le répertoire d'installation aux variables d'environnement Windows.

  • Ouvrez le menu Démarrer et recherchez Variables d'environnement.
  • Cliquez sur Modifier les variables d'environnement système.
  • Cliquez sur Variables d'environnement... en bas à droite.
  • Sous Variables système, sélectionnez la variable Path et cliquez sur Modifier.
  • Cliquez sur Nouveau et collez : C:\Program Files\Tesseract-OCR
  • Validez par OK et redémarrez votre invite de commande ou VSCode.

⚡ Aide-Mémoire des Commandes CLI

Les commandes indispensables pour vos tâches quotidiennes de reconnaissance de texte.

Extraction de Texte Basique

Extrait le texte d'une image vers un fichier .txt simple.

tesseract image.png sortie

Spécifier la Langue (Français)

Utilisez le paramètre -l pour définir la langue (ex: français).

tesseract image.png sortie -l fra

Plusieurs Langues Simultanées

Combinez les langues avec + pour les documents multilingues.

tesseract image.png sortie -l fra+eng

Générer un PDF Consultable

Crée un PDF avec texte invisible sélectionnable superposé à l'image.

tesseract image.png sortie pdf

Extraire les Coordonnées (hOCR)

Obtenez les boîtes englobantes exactes de chaque mot en HTML.

tesseract image.png sortie hocr

Segmentation du Layout (PSM)

Traitez un bloc unique de texte uniforme avec --psm 6.

tesseract image.png sortie --psm 6

Lister les Langues Installées

Affiche tous les modèles de langues disponibles sur votre système.

tesseract --list-langs

Exporter en TSV (Tableur)

Exporte les mots et indices de confiance sous forme de tableau.

tesseract image.png sortie tsv

Un moteur complet d'analyse de documents.

Ne se contente pas d'extraire des caractères : préserve la mise en page, la typographie et la structure.

Architecture du Moteur

Deep Learning avec LSTM

Le Tesseract moderne (v5+) s'appuie sur des réseaux neuronaux récurrents LSTM (Long Short-Term Memory). Il traite les lignes de texte comme des séquences continues, ce qui améliore considérablement la précision contextuelle.

Plus de 100 Langues Reconnues

Modèles prêts à l'emploi pour les écritures latines, cyrilliques, arabes, CJK et indiennes. Combinez les langues à la volée.

Création de PDF Consultables

Convertissez des lots volumineux d'images en documents PDF avec texte invisible sélectionnable parfaitement aligné sur l'image.

Entraînement Personnalisé

Affinez le réseau de neurones (fine-tuning) pour vos polices spécifiques ou manuscrits anciens via le dépôt tesstrain.

Modes de Moteur (OEM)

Basculez entre le moteur classique à règles et le réseau neuronal LSTM rapide selon vos besoins de performance.

Analyse Détaillée de Mise en Page

Exportez en hOCR ou ALTO avec les coordonnées exactes en pixels, les polices estimées et la confiance pour chaque mot.

Performances et Précision.

Mesures empiriques démontrant l'efficacité de Tesseract v5 selon la résolution et la qualité d'image.

Résolution d'Entrée Précision des Caractères Vitesse de Traitement Usage Recommandé
150 DPI ~88.5% Rapide (~0.8s) Brouillon / prévisualisation
300 DPI 99.2% Optimal (~1.2s) Documents Standards
600 DPI 99.7% Lent (~3.5s) Archivage Haute Fidélité

Note sur la précision : Mesures effectuées avec le modèle LSTM sur du texte imprimé propre. Consulter les rapports officiels →

Fondé sur des Décennies de Recherche.

Tesseract est une référence de la linguistique informatique. Son architecture est étayée par des publications scientifiques évaluées par des pairs.

  • Ray Smith (2007): "An Overview of the Tesseract OCR Engine" — Article fondamental sur l'analyse de mise en page et de mots.
  • Ray Smith (1994): "A Comparison of Tesseract and Other OCR Systems" — Étude comparative historique.
  • L'automatisation en pratique.

    Tesseract alimente les chaînes de traitement automatisées des plus grands secteurs d'activité.

    42,50 €
    { "total": 42.50 }

    Comptabilité & Factures

    Extrait montants, dates et lignes d'articles à partir de photos de reçus et factures.

    AA-123-BB

    Reconnaissance de Plaques (LPR)

    Pour la gestion de parkings, péages et contrôle d'accès intelligent.

    Vérification d'Identité & KYC

    Accélère les processus d'inscription en extrayant les données des pièces d'identité et passeports.

    PDF

    Numérisation Massive

    Convertissez des millions de pages d'archives en documents PDF entièrement consultables.

    Langues Prises en Charge par Tesseract OCR

    Tesseract supporte plus de 100 langues nativement. Recherchez votre langue ci-dessous et téléchargez le fichier .traineddata associé.

    Utilisation : Placez le fichier .traineddata dans le dossier TESSDATA_PREFIX puis lancez : tesseract image.png sortie -l fra Pour plusieurs langues simultanées : tesseract image.png sortie -l fra+eng+deu

    Interfaces Graphiques (GUI) pour Tesseract

    Tesseract s'exécute en ligne de commande, mais la communauté a conçu d'excellentes applications avec interface graphique pour le bureau.

    Application Plateforme Licence Meilleur Usage
    gImageReader Windows, Linux Gratuit Traitement de documents avec ajustement manuel de la mise en page
    Capture2Text Windows Gratuit Reconnaissance rapide à partir de captures d'écran et raccourcis clavier
    NAPS2 Windows, Mac, Linux Gratuit Numérisation de documents et création de PDF avec OCR
    FreeOCR Windows Gratuit Outil de bureau simple et classique
    Tesseract-UI / Normcap Mac, Windows, Linux Gratuit Glisser-déposer de fichiers et capture d'écran multiplateforme
    Remarque : La précision dépend de la version de Tesseract installée. Nous vous recommandons les frontends compatibles Tesseract v5.

    Modes de Segmentation de Page (PSM)

    Les documents se présentent sous des formes variées. Tesseract offre 14 modes de segmentation pour s'adapter à chaque structure.

    • PSM 3 : Segmentation automatique complète, sans OSD (Par défaut).
    • PSM 6 : Bloc unique de texte uniforme. Idéal pour les pages de livres.
    • PSM 11 : Texte épars. Trouve un maximum de texte sans ordre spécifique.

    [ ZONE OCR DÉTECTÉE ]
    pipeline.py
    import pytesseract
    from PIL import Image
    
    def extraire_document(chemin):
        img = Image.open(chemin)
        return pytesseract.image_to_string(img, lang='fra')
    
    texte_reconnu = extraire_document('facture.jpg')
    print(texte_reconnu)

    Intégration de Tesseract OCR avec Python

    En tant que bibliothèque native en C/C++ distribuée sur toutes les plateformes majeures, l'écosystème de connecteurs est immense.

    Qu'il s'agisse d'un backend Node.js avec tesseract.js, d'un pipeline Python avec pytesseract ou d'un microservice Go avec gosseract, l'intégration se fait en une ligne de code.

    Pourquoi Tesseract est unique.

    Tesseract réalise la tâche difficile de convertir des pixels en texte structuré avec une fiabilité maximale.

    100 % Gratuit et Libre.

    Sans jetons, sans clés d'API ni restrictions. Traitez 1 page ou 10 millions de pages sans frais.

    Fonctionnement Hors Ligne.

    Confidentialité absolue. Vos données ne quittent jamais votre infrastructure. Idéal pour les données médicales et juridiques.

    Propulsé par Leptonica.

    Intégration poussée avec Leptonica pour la binarisation automatique, la mise à l'échelle et le filtrage du bruit.

    Évolution Continue.

    Initié chez HP en 1985, ouvert par Google en 2005 et maintenu activement par la communauté internationale.

    Indépendant du Matériel.

    S'exécute sur Raspberry Pi, serveurs cloud ou clusters multi-cœurs avec accélération OpenMP.

    Détection d'Orientation et d'Écriture.

    Détecte automatiquement l'orientation de la page et le système d'écriture (mode OSD) pour ajuster le moteur.

    Foire aux questions sur Tesseract OCR.

    Que fait concrètement Tesseract OCR ?

    Tesseract convertit des images contenant du texte (factures, reçus, documents numérisés) en texte lisible, consultable et éditable par ordinateur. C'est le composant central de milliers d'applications de numérisation dans le monde.

    Tesseract OCR est-il gratuit pour un usage commercial ?

    Oui ! Tesseract OCR est 100 % gratuit et open source sous licence Apache 2.0. Vous pouvez l'intégrer dans vos applications personnelles, académiques et commerciales sans frais de licence.

    Tesseract OCR est-il toujours performant en 2026 ?

    Absolument. Grâce à son moteur neural LSTM introduit en version 4 et optimisé en version 5, Tesseract offre une précision comparable aux solutions cloud payantes tout en garantissant la confidentialité de vos données en local.

    Tesseract OCR est-il considéré comme de l'Intelligence Artificielle ?

    Oui. Alors que les anciennes versions (v3) utilisaient la reconnaissance de formes classique, le Tesseract moderne (v4 et v5) s'appuie entièrement sur des réseaux de neurones récurrents LSTM (Deep Learning).

    Quelle est la différence entre Tesseract v4 et v5 ?

    Tesseract 5 apporte des gains de vitesse substantiels par rapport à la version 4, tout en conservant la haute précision des modèles LSTM. Il corrige les fuites de mémoire et modernise les outils d'entraînement.

    Tesseract inclut-il une interface graphique (GUI) ?

    Pas nativement. Tesseract est une bibliothèque en C/C++ et un outil en ligne de commande. Pour disposer d'une interface graphique, utilisez des outils comme gImageReader, NAPS2 ou Capture2Text.

    Tesseract fonctionne-t-il directement dans le navigateur ?

    Oui. Le projet tesseract.js compile le code C++ en WebAssembly (WASM), permettant d'exécuter l'OCR directement côté client dans le navigateur web sans serveur externe.

    Comment entraîner Tesseract pour une police personnalisée ?

    Vous pouvez utiliser le dépôt tesstrain. Il s'agit d'une infrastructure basée sur des Makefiles qui automatise la génération de données d'entraînement et l'ajustement fin (fine-tuning) des modèles .traineddata.

    Pourquoi le texte reconnu comporte-t-il parfois des erreurs ?

    Tesseract nécessite des images suffisamment nettes et contrastées. Sur des images bruitées ou inclinées, appliquez un prétraitement (binarisation, redressement) avec OpenCV ou Pillow avant de lancer la reconnaissance.

    Quels formats d'image Tesseract OCR prend-il en charge ?

    Il prend en charge PNG, JPEG, TIFF, BMP, PNM, GIF et WebP via Leptonica. Pour de meilleurs résultats, privilégiez des formats sans perte comme TIFF ou PNG à 300 DPI ou plus.

    Quelle est la précision de Tesseract OCR ?

    Sur des documents scannés propres à 300 DPI, Tesseract v5 dépasse 95 % de précision par caractère et atteint souvent plus de 99 % sur du texte imprimé standard.

    Tesseract OCR fonctionne-t-il 100 % hors ligne ?

    Oui. Tesseract est un moteur 100 % local et autonome. Il ne transmet aucune donnée vers l'extérieur, respectant ainsi les exigences strictes de confidentialité (RGPD, secteur médical, bancaire et juridique).

    Tesseract OCR vs Google Cloud Vision API : que choisir ?

    Tesseract OCR est gratuit, open-source et 100 % hors ligne : la solution idéale pour le contrôle total des coûts et la confidentialité. Google Cloud Vision est plus performant sur l'écriture manuscrite complexe mais facture à l'appel d'API et nécessite d'envoyer vos documents dans le cloud.

    Comment améliorer la précision de Tesseract OCR ?

    La qualité de l'image source est déterminante :

    • Redimensionner à 300 DPI minimum — Tesseract a du mal sur les petits caractères.
    • Binarisation — Convertir en niveaux de gris et appliquer le seuillage d'Otsu pour un noir et blanc net.
    • Redressement (Deskew) — Corriger l'inclinaison des pages avant traitement.
    • Réduction du bruit — Appliquer un filtre médian pour supprimer les taches.
    • Choisir le bon mode PSM — ex : --psm 6 pour un paragraphe ou --psm 7 pour une ligne seule.
    • Indiquer la bonne langue — ex : -l fra pour le français ou -l fra+eng pour les documents bilingues.
    Quelles sont les alternatives open source modernes à Tesseract ?

    En complément de Tesseract, d'autres outils spécialisés existent :

    • PaddleOCR : Moteur de deep learning (PP-OCRv6) performant pour la reconnaissance de tableaux et de textes courbés.
    • Docling : Analyseur de documents pour l'IA générative et le RAG qui convertit les PDF et images en Markdown et JSON structurés.

    Prêt à extraire vos données ?

    Déployez votre premier pipeline d'OCR en une seule commande.

    $ tesseract scan.png stdout -l fra