Passa al contenuto principale
v5.3.0 Disponibile Ora

Il miglior motore di OCR
gratuito al mondo.

Tesseract OCR è il motore di riferimento industriale, libero e open source per il riconoscimento ottico dei caratteri. Grazie alle reti neurali ricorrenti LSTM, estrae testo da immagini con oltre il 99% di precisione in oltre 100 lingue. Funzionamento 100% offline e sicuro.

60k+
Stelle su GitHub
100+
Lingue Supportate
40anni
Di Esperienza Comprovata
99%+
Accuratezza di Riconoscimento
0 €
Costo — Gratuito per Sempre
tesseract_demo.sh

$ # Estrai testo da un documento scansionato

$ tesseract documento.tiff risultato -l ita --psm 3


$ cat risultato.txt

Cantami, o Diva, del Pelìde Achille l'ira funesta. Questo testo è stato estratto con successo con un'accuratezza del 99,8%.

Tre passaggi verso dati strutturati.

Integra Tesseract nella tua pipeline per trasformare all'istante le immagini in testo strutturato e PDF ricercabili.

01

Fornisci l'Immagine

Supporta TIFF, JPEG, PNG e WebP. Tesseract si affida a Leptonica per binarizzazione, riduzione del rumore e ridimensionamento.

02

Analisi del Layout

Il motore segmenta la pagina in blocchi, righe e parole. Scegli tra 14 modalità di segmentazione della pagina (PSM).

03

Esecuzione Rete LSTM

Le reti neurali analizzano le righe in modo continuo. Output: testo semplice, hOCR, PDF standard, PDF con testo invisibile, TSV e ALTO.

Demo nel Browser

Prova Tesseract Online — Senza Installazione

Converti documenti scansionati in testo modificabile e PDF ricercabili direttamente nel browser. 100% privato.

Prova l'OCR Online →

📥 Installa Tesseract OCR

Pronto in pochi minuti. Scegli il tuo sistema operativo per la guida ufficiale di installazione.

macOS Ubuntu / Debian Windows
Passo 1

Installa il Motore

Installa il binario CLI tramite Homebrew.

os_install.sh

$ brew install tesseract

Passo 2

Scarica i Modelli Linguistici

Installa i file .traineddata aggiuntivi.

lang_install.sh

$ brew install tesseract-lang

Passo 3

Verifica l'Installazione

Controlla la versione attiva sul sistema.

check_version.sh

$ tesseract --version

Passo 1

Installa il Pacchetto

Disponibile direttamente nei repository apt.

apt_install.sh

$ sudo apt install tesseract-ocr

Passo 2

Scarica la Lingua Italiana

Installa il pacchetto italiano e tutte le lingue.

apt_lang.sh

$ sudo apt install tesseract-ocr-ita tesseract-ocr-all

Passo 3

Verifica l'Installazione

Controlla la versione nel terminale.

verify_tess.sh

$ tesseract --version

Passo 1

Installer Windows

Il riferimento per Windows è il binario precompilato curato dal progetto UB Mannheim.

Scarica da UB Mannheim
Passo 2

Configura il PATH di Sistema (Fondamentale)

Aggiungi la cartella di installazione alle variabili d'ambiente di Windows.

  • Apri il menu Start e cerca Variabili di ambiente.
  • Clicca su Modifica le variabili di ambiente relative al sistema.
  • Clicca sul pulsante Variabili d'ambiente... in basso a destra.
  • Sotto Variabili di sistema, seleziona Path e clicca su Modifica.
  • Clicca su Nuovo e incolla: C:\Program Files\Tesseract-OCR
  • Conferma con OK e riavvia il prompt dei comandi o VSCode.

⚡ Prontuario dei Comandi da Terminale (CLI)

I comandi essenziali per le tue attività quotidiane di estrazione del testo.

Estrazione di Testo Base

Estrae il testo da un'immagine in un file .txt semplice.

tesseract immagine.png output

Specifica Lingua (Italiano)

Usa il parametro -l per impostare la lingua (es: italiano).

tesseract immagine.png output -l ita

Più Lingue Contemporaneamente

Unisci le lingue con + per documenti multilingue.

tesseract immagine.png output -l ita+eng

Genera un PDF Ricercabile

Crea un PDF con testo invisibile selezionabile sovrapposto all'immagine.

tesseract immagine.png output pdf

Estrai Coordinate (hOCR)

Ottieni le bounding box esatte di ciascuna parola in formato HTML.

tesseract immagine.png output hocr

Segmentazione Layout (PSM)

Tratta un blocco unico di testo uniforme con --psm 6.

tesseract immagine.png output --psm 6

Mostra Lingue Installate

Elenca tutti i modelli di lingua disponibili sul tuo sistema.

tesseract --list-langs

Esporta in Tabella TSV

Esporta parole e punteggi di confidenza in formato tabellare.

tesseract immagine.png output tsv

Un motore completo per l'analisi dei documenti.

Non estrae solo singoli caratteri: preserva impaginazione, font e struttura logica.

Architettura del Motore

Deep Learning con LSTM

Il Tesseract moderno (v5+) è basato su reti neurali ricorrenti LSTM (Long Short-Term Memory). Analizza le righe di testo come sequenze temporali continue, migliorando sensibilmente l'accuratezza contestuale.

Oltre 100 Lingue Riconosciute

Modelli pronti all'uso per alfabeti latino, cirillico, arabo, CJK e indiano. Combina più lingue istantaneamente.

Creazione di PDF Ricercabili

Converti grandi volumi di immagini in PDF con testo invisibile perfettamente allineato sull'immagine originale.

Addestramento Personalizzato

Esegui il fine-tuning delle reti neurali per caratteri speciali o manoscritti antichi tramite il repository tesstrain.

Modalità del Motore (OEM)

Alterna tra il motore tradizionale basato su regole e la rete neurale LSTM veloce in base alle tue esigenze prestazionali.

Analisi Dettagliata del Layout

Esporta in hOCR o ALTO con coordinate pixel precise, stima dei font e punteggio di confidenza per ogni parola.

Prestazioni e Precisione.

Metriche empiriche che mostrano l'efficacia di Tesseract v5 in base a risoluzione e qualità d'immagine.

Risoluzione Input Precisione Caratteri Velocità di Elaborazione Uso Consigliato
150 DPI ~88.5% Veloce (~0.8s) Bozze / anteprime veloci
300 DPI 99.2% Ottimale (~1.2s) Documenti Standard
600 DPI 99.7% Lento (~3.5s) Archiviazione ad Alta Fedeltà

Nota sull'accuratezza : Misure effettuate con il modello neurale LSTM su testo stampato nitido. Consulta i report ufficiali →

Fondato su Decenni di Ricerca Accademica.

Tesseract è una pietra miliare della linguistica computazionale. La sua architettura è documentata da pubblicazioni scientifiche peer-reviewed.

  • Ray Smith (2007): "An Overview of the Tesseract OCR Engine" — Articolo fondamentale sull'analisi di layout e parole.
  • Ray Smith (1994): "A Comparison of Tesseract and Other OCR Systems" — Studio comparativo storico.
  • L'automazione nella pratica.

    Tesseract alimenta le pipeline di elaborazione automatica nei principali settori industriali.

    42,50 €
    { "totale": 42.50 }

    Contabilità & Fatture

    Estrae importi, date e voci di spesa da fotografie di scontrini e fatture.

    AA 123 BB

    Lettura Targhe (ANPR/LPR)

    Per la gestione intelligente di parcheggi, caselli e varchi d'accesso.

    Verifica Identità & KYC

    Velocizza l'onboarding estraendo i dati da carte d'identità e passaporti.

    PDF

    Digitalizzazione Massiva

    Converti milioni di pagine d'archivio in documenti PDF completamente ricercabili.

    Lingue Supportate da Tesseract OCR

    Tesseract supporta oltre 100 lingue nativamente. Cerca la tua lingua qui sotto e scarica il file .traineddata corrispondente.

    Utilizzo : Posiziona il file .traineddata nella cartella TESSDATA_PREFIX ed esegui: tesseract immagine.png output -l ita Per più lingue contemporaneamente: tesseract immagine.png output -l ita+eng+deu

    Interfacce Grafiche (GUI) per Tesseract

    Tesseract nasce come strumento da riga di comando, ma la community ha creato fantastiche applicazioni desktop con interfaccia grafica.

    Applicazione Piattaforma Licenza Miglior Utilizzo
    gImageReader Windows, Linux Gratuito Elaborazione documenti con regolazione manuale del layout
    Capture2Text Windows Gratuito Riconoscimento rapido da screenshot tramite scorciatoie tastiera
    NAPS2 Windows, Mac, Linux Gratuito Scansione di documenti e creazione di PDF ricercabili con OCR
    FreeOCR Windows Gratuito Strumento desktop semplice e classico per Windows
    Tesseract-UI / Normcap Mac, Windows, Linux Gratuito Drag-and-drop e cattura screenshot multipiattaforma
    Nota: L'accuratezza dipende dalla versione di Tesseract installata. Consigliamo frontend compatibili con Tesseract v5.

    Modalità di Segmentazione della Pagina (PSM)

    I documenti hanno strutture visive molto variegate. Tesseract mette a disposizione 14 modalità di segmentazione per adattarsi a ogni layout.

    • PSM 3 : Segmentazione automatica completa, senza OSD (Predefinito).
    • PSM 6 : Singolo blocco uniforme di testo. Ideale per pagine di libri.
    • PSM 11 : Testo sparso. Trova quanto più testo possibile senza ordine specifico.

    [ AREA OCR RILEVATA ]
    pipeline.py
    import pytesseract
    from PIL import Image
    
    def estrai_documento(percorso):
        img = Image.open(percorso)
        return pytesseract.image_to_string(img, lang='ita')
    
    testo_riconosciuto = estrai_documento('fattura.jpg')
    print(testo_riconosciuto)

    Integrazione di Tesseract OCR con Python

    Essendo una libreria C/C++ distribuita per tutte le piattaforme principali, l'ecosistema di connettori è vastissimo.

    Che si tratti di un backend Node.js con tesseract.js, di una pipeline Python con pytesseract o di un microservizio Go con gosseract, l'integrazione richiede una sola riga di codice.

    Perché Tesseract è unico nel suo genere.

    Tesseract svolge l'arduo compito di convertire i pixel in dati strutturati con la massima affidabilità.

    100% Gratuito e Libero.

    Nessun token, nessuna chiave API né limiti di utilizzo. Elabora 1 pagina o 10 milioni di pagine senza costi.

    Funzionamento Offline.

    Privacy assoluta. I tuoi dati non lasciano mai la tua infrastruttura. Ideale per ambienti bancari, medici e legali.

    Potenziato da Leptonica.

    Integrazione avanzata con Leptonica per binarizzazione automatica, riscalatura e rimozione del rumore.

    Evoluzione Continua.

    Nato in HP nel 1985, reso open source da Google nel 2005 e mantenuto attivamente dalla community globale.

    Indipendente dall'Hardware.

    Funziona su Raspberry Pi, server cloud o cluster multi-core con accelerazione OpenMP.

    Rilevamento di Orientamento e Scrittura.

    Rileva automaticamente l'orientamento della pagina e il sistema di scrittura (OSD) per ottimizzare il motore.

    Domande frequenti su Tesseract OCR.

    Cosa fa esattamente Tesseract OCR?

    Tesseract converte immagini contenenti testo (fatture, scontrini, documenti scansionati) in testo modificabile, leggibile e ricercabile dal computer. È il componente chiave di migliaia di applicazioni nel mondo.

    Tesseract OCR è gratuito per uso commerciale?

    Sì! Tesseract OCR è 100% gratuito e open source con licenza Apache 2.0. Puoi utilizzarlo liberamente in progetti personali, accademici e commerciali senza pagare costi di licenza.

    Tesseract OCR è ancora performante nel 2026?

    Assolutamente sì. Grazie al motore neurale LSTM introdotto nella versione 4 e ottimizzato nella versione 5, Tesseract offre una precisione paragonabile alle soluzioni cloud a pagamento, garantendo totale riservatezza dei dati in locale.

    Tesseract OCR è considerato Intelligenza Artificiale?

    Sì. Mentre le versioni meno recenti (v3) utilizzavano il confronto di pattern tradizionale, il Tesseract moderno (v4 e v5) è interamente basato su reti neurali ricorrenti LSTM (Deep Learning).

    Qual è la differenza tra Tesseract v4 e v5?

    Tesseract 5 introduce miglioramenti notevoli di velocità rispetto alla versione 4, mantenendo l'elevata precisione dei modelli LSTM, correggendo perdite di memoria e modernizzando gli strumenti di training.

    Tesseract include un'interfaccia grafica (GUI)?

    Non nativamente. Tesseract è una libreria in C/C++ e uno strumento a riga di comando. Per disporre di un'interfaccia grafica, puoi utilizzare strumenti come gImageReader, NAPS2 o Capture2Text.

    Tesseract funziona direttamente nel browser?

    Sì. Il progetto tesseract.js compila il codice C++ in WebAssembly (WASM), consentendo l'esecuzione dell'OCR direttamente lato client nel browser web senza server esterni.

    Come addestrare Tesseract per un font personalizzato?

    È possibile utilizzare il repository tesstrain. Si tratta di un'infrastruttura basata su Makefile che automatizza la generazione di dati di addestramento e il fine-tuning dei modelli .traineddata.

    Perché il testo riconosciuto presenta talvolta errori?

    Tesseract richiede immagini con buona risoluzione e contrasto elevato. Su immagini rumorose o inclinate, applica un pre-trattamento (binarizzazione, raddrizzamento) con OpenCV o Pillow prima dell'elaborazione.

    Quali formati immagine supporta Tesseract OCR?

    Supporta PNG, JPEG, TIFF, BMP, PNM, GIF e WebP tramite Leptonica. Per risultati ottimali si raccomanda l'uso di formati senza perdita come TIFF o PNG a 300 DPI o superiori.

    Qual è il livello di accuratezza di Tesseract OCR?

    Su scansioni nitide a 300 DPI, Tesseract v5 supera il 95% di precisione per carattere e raggiunge spesso oltre il 99% su testo stampato standard.

    Tesseract OCR funziona al 100% offline?

    Sì. Tesseract è un motore 100% locale e autonomo. Non invia alcun dato a server esterni, rispettando i più stringenti requisiti di conformità e privacy (GDPR, settore medico, bancario e legale).

    Tesseract OCR vs Google Cloud Vision API: cosa scegliere?

    Tesseract OCR è gratuito, open source e 100% offline: la scelta perfetta per il controllo totale dei costi e della privacy. Google Cloud Vision è più efficace sulla calligrafia complessa ma addebita costi per singola chiamata API e richiede l'invio dei documenti nel cloud.

    Come migliorare la precisione di Tesseract OCR?

    La qualità dell'immagine d'origine è determinante :

    • Risoluzione ad almeno 300 DPI — Tesseract fatica sui caratteri molto piccoli.
    • Binarizzazione — Converti in scala di grigi e applica la sogliatura di Otsu per un bianco e nero netto.
    • Raddrizzamento (Deskew) — Correggi l'inclinazione delle pagine prima dell'elaborazione.
    • Riduzione del rumore — Applica un filtro mediano per rimuovere macchie e disturbi.
    • Scegli il corretto modo PSM — es: --psm 6 per un paragrafo o --psm 7 per una singola riga.
    • Indica la lingua corretta — es: -l ita per l'italiano o -l ita+eng per documenti bilingui.
    Quali sono le moderne alternative open source a Tesseract?

    Oltre a Tesseract, esistono strumenti specializzati per scenari specifici :

    • PaddleOCR : Framework basato su deep learning (PP-OCRv6) eccellente per tabelle complesse e testo curvo.
    • Docling : Parser di documenti per Generative AI e RAG che converte PDF e immagini in Markdown e JSON strutturato.

    Pronto a estrarre i tuoi dati ?

    Avvia la tua prima pipeline di OCR con un solo comando.

    $ tesseract scan.png stdout -l ita