Deep Learning con LSTM
Il Tesseract moderno (v5+) è basato su reti neurali ricorrenti LSTM (Long Short-Term Memory). Analizza le righe di testo come sequenze temporali continue, migliorando sensibilmente l'accuratezza contestuale.
Tesseract OCR è il motore di riferimento industriale, libero e open source per il riconoscimento ottico dei caratteri. Grazie alle reti neurali ricorrenti LSTM, estrae testo da immagini con oltre il 99% di precisione in oltre 100 lingue. Funzionamento 100% offline e sicuro.
$ # Estrai testo da un documento scansionato
$ tesseract documento.tiff risultato -l ita --psm 3
Tesseract Open Source OCR Engine v5.3.0 with Leptonica
Page 1
Estimating resolution as 300
$ cat risultato.txt
Cantami, o Diva, del Pelìde Achille l'ira funesta. Questo testo è stato estratto con successo con un'accuratezza del 99,8%.
Integra Tesseract nella tua pipeline per trasformare all'istante le immagini in testo strutturato e PDF ricercabili.
Supporta TIFF, JPEG, PNG e WebP. Tesseract si affida a Leptonica per binarizzazione, riduzione del rumore e ridimensionamento.
Il motore segmenta la pagina in blocchi, righe e parole. Scegli tra 14 modalità di segmentazione della pagina (PSM).
Le reti neurali analizzano le righe in modo continuo. Output: testo semplice, hOCR, PDF standard, PDF con testo invisibile, TSV e ALTO.
Converti documenti scansionati in testo modificabile e PDF ricercabili direttamente nel browser. 100% privato.
Pronto in pochi minuti. Scegli il tuo sistema operativo per la guida ufficiale di installazione.
Installa il binario CLI tramite Homebrew.
$ brew install tesseract
Installa i file .traineddata aggiuntivi.
$ brew install tesseract-lang
Controlla la versione attiva sul sistema.
$ tesseract --version
Disponibile direttamente nei repository apt.
$ sudo apt install tesseract-ocr
Installa il pacchetto italiano e tutte le lingue.
$ sudo apt install tesseract-ocr-ita tesseract-ocr-all
Controlla la versione nel terminale.
$ tesseract --version
Il riferimento per Windows è il binario precompilato curato dal progetto UB Mannheim.
Scarica da UB MannheimAggiungi la cartella di installazione alle variabili d'ambiente di Windows.
C:\Program Files\Tesseract-OCRI comandi essenziali per le tue attività quotidiane di estrazione del testo.
Estrae il testo da un'immagine in un file .txt semplice.
Usa il parametro -l per impostare la lingua (es: italiano).
Unisci le lingue con + per documenti multilingue.
Crea un PDF con testo invisibile selezionabile sovrapposto all'immagine.
Ottieni le bounding box esatte di ciascuna parola in formato HTML.
Tratta un blocco unico di testo uniforme con --psm 6.
Elenca tutti i modelli di lingua disponibili sul tuo sistema.
Esporta parole e punteggi di confidenza in formato tabellare.
Non estrae solo singoli caratteri: preserva impaginazione, font e struttura logica.
Il Tesseract moderno (v5+) è basato su reti neurali ricorrenti LSTM (Long Short-Term Memory). Analizza le righe di testo come sequenze temporali continue, migliorando sensibilmente l'accuratezza contestuale.
Modelli pronti all'uso per alfabeti latino, cirillico, arabo, CJK e indiano. Combina più lingue istantaneamente.
Converti grandi volumi di immagini in PDF con testo invisibile perfettamente allineato sull'immagine originale.
Esegui il fine-tuning delle reti neurali per caratteri speciali o manoscritti antichi tramite il repository tesstrain.
Alterna tra il motore tradizionale basato su regole e la rete neurale LSTM veloce in base alle tue esigenze prestazionali.
Esporta in hOCR o ALTO con coordinate pixel precise, stima dei font e punteggio di confidenza per ogni parola.
Metriche empiriche che mostrano l'efficacia di Tesseract v5 in base a risoluzione e qualità d'immagine.
| Risoluzione Input | Precisione Caratteri | Velocità di Elaborazione | Uso Consigliato |
|---|---|---|---|
| 150 DPI | ~88.5% | Veloce (~0.8s) | Bozze / anteprime veloci |
| 300 DPI | 99.2% | Ottimale (~1.2s) | Documenti Standard |
| 600 DPI | 99.7% | Lento (~3.5s) | Archiviazione ad Alta Fedeltà |
Nota sull'accuratezza : Misure effettuate con il modello neurale LSTM su testo stampato nitido. Consulta i report ufficiali →
Tesseract è una pietra miliare della linguistica computazionale. La sua architettura è documentata da pubblicazioni scientifiche peer-reviewed.
Tesseract alimenta le pipeline di elaborazione automatica nei principali settori industriali.
Estrae importi, date e voci di spesa da fotografie di scontrini e fatture.
Per la gestione intelligente di parcheggi, caselli e varchi d'accesso.
Velocizza l'onboarding estraendo i dati da carte d'identità e passaporti.
Converti milioni di pagine d'archivio in documenti PDF completamente ricercabili.
Tesseract supporta oltre 100 lingue nativamente. Cerca la tua lingua qui sotto e scarica il file .traineddata corrispondente.
.traineddata nella cartella TESSDATA_PREFIX ed esegui:
tesseract immagine.png output -l ita
Per più lingue contemporaneamente:
tesseract immagine.png output -l ita+eng+deu
Tesseract nasce come strumento da riga di comando, ma la community ha creato fantastiche applicazioni desktop con interfaccia grafica.
| Applicazione | Piattaforma | Licenza | Miglior Utilizzo |
|---|---|---|---|
| gImageReader | Windows, Linux | Gratuito | Elaborazione documenti con regolazione manuale del layout |
| Capture2Text | Windows | Gratuito | Riconoscimento rapido da screenshot tramite scorciatoie tastiera |
| NAPS2 | Windows, Mac, Linux | Gratuito | Scansione di documenti e creazione di PDF ricercabili con OCR |
| FreeOCR | Windows | Gratuito | Strumento desktop semplice e classico per Windows |
| Tesseract-UI / Normcap | Mac, Windows, Linux | Gratuito | Drag-and-drop e cattura screenshot multipiattaforma |
I documenti hanno strutture visive molto variegate. Tesseract mette a disposizione 14 modalità di segmentazione per adattarsi a ogni layout.
import pytesseract
from PIL import Image
def estrai_documento(percorso):
img = Image.open(percorso)
return pytesseract.image_to_string(img, lang='ita')
testo_riconosciuto = estrai_documento('fattura.jpg')
print(testo_riconosciuto)
Essendo una libreria C/C++ distribuita per tutte le piattaforme principali, l'ecosistema di connettori è vastissimo.
Che si tratti di un backend Node.js con tesseract.js, di una pipeline Python con pytesseract o di un microservizio Go con gosseract, l'integrazione richiede una sola riga di codice.
Tesseract svolge l'arduo compito di convertire i pixel in dati strutturati con la massima affidabilità.
Nessun token, nessuna chiave API né limiti di utilizzo. Elabora 1 pagina o 10 milioni di pagine senza costi.
Privacy assoluta. I tuoi dati non lasciano mai la tua infrastruttura. Ideale per ambienti bancari, medici e legali.
Integrazione avanzata con Leptonica per binarizzazione automatica, riscalatura e rimozione del rumore.
Nato in HP nel 1985, reso open source da Google nel 2005 e mantenuto attivamente dalla community globale.
Funziona su Raspberry Pi, server cloud o cluster multi-core con accelerazione OpenMP.
Rileva automaticamente l'orientamento della pagina e il sistema di scrittura (OSD) per ottimizzare il motore.
Tesseract converte immagini contenenti testo (fatture, scontrini, documenti scansionati) in testo modificabile, leggibile e ricercabile dal computer. È il componente chiave di migliaia di applicazioni nel mondo.
Sì! Tesseract OCR è 100% gratuito e open source con licenza Apache 2.0. Puoi utilizzarlo liberamente in progetti personali, accademici e commerciali senza pagare costi di licenza.
Assolutamente sì. Grazie al motore neurale LSTM introdotto nella versione 4 e ottimizzato nella versione 5, Tesseract offre una precisione paragonabile alle soluzioni cloud a pagamento, garantendo totale riservatezza dei dati in locale.
Sì. Mentre le versioni meno recenti (v3) utilizzavano il confronto di pattern tradizionale, il Tesseract moderno (v4 e v5) è interamente basato su reti neurali ricorrenti LSTM (Deep Learning).
Tesseract 5 introduce miglioramenti notevoli di velocità rispetto alla versione 4, mantenendo l'elevata precisione dei modelli LSTM, correggendo perdite di memoria e modernizzando gli strumenti di training.
Non nativamente. Tesseract è una libreria in C/C++ e uno strumento a riga di comando. Per disporre di un'interfaccia grafica, puoi utilizzare strumenti come gImageReader, NAPS2 o Capture2Text.
Sì. Il progetto tesseract.js compila il codice C++ in WebAssembly (WASM), consentendo l'esecuzione dell'OCR direttamente lato client nel browser web senza server esterni.
È possibile utilizzare il repository tesstrain. Si tratta di un'infrastruttura basata su Makefile che automatizza la generazione di dati di addestramento e il fine-tuning dei modelli .traineddata.
Tesseract richiede immagini con buona risoluzione e contrasto elevato. Su immagini rumorose o inclinate, applica un pre-trattamento (binarizzazione, raddrizzamento) con OpenCV o Pillow prima dell'elaborazione.
Supporta PNG, JPEG, TIFF, BMP, PNM, GIF e WebP tramite Leptonica. Per risultati ottimali si raccomanda l'uso di formati senza perdita come TIFF o PNG a 300 DPI o superiori.
Su scansioni nitide a 300 DPI, Tesseract v5 supera il 95% di precisione per carattere e raggiunge spesso oltre il 99% su testo stampato standard.
Sì. Tesseract è un motore 100% locale e autonomo. Non invia alcun dato a server esterni, rispettando i più stringenti requisiti di conformità e privacy (GDPR, settore medico, bancario e legale).
Tesseract OCR è gratuito, open source e 100% offline: la scelta perfetta per il controllo totale dei costi e della privacy. Google Cloud Vision è più efficace sulla calligrafia complessa ma addebita costi per singola chiamata API e richiede l'invio dei documenti nel cloud.
La qualità dell'immagine d'origine è determinante :
--psm 6 per un paragrafo o --psm 7 per una singola riga.-l ita per l'italiano o -l ita+eng per documenti bilingui.Avvia la tua prima pipeline di OCR con un solo comando.
$ tesseract scan.png stdout -l ita