Mesin Neural Network LSTM
Menggunakan arsitektur deep learning LSTM mutakhir untuk mengenali teks pada dokumen cetak maupun hasil pindai berkualitas rendah dengan akurasi sangat tinggi.
Tesseract OCR adalah standar industri untuk pengenalan karakter optik open source. Memanfaatkan neural network LSTM canggih untuk mengekstrak teks dari gambar dan pindaian dokumen dalam 100+ bahasa dengan akurasi lebih dari 99%. 100% lokal, offline, dan aman untuk privasi.
$ tesseract faktur.png output -l ind+eng --psm 3 pdf hocr
Memulai Tesseract OCR v5.3.0 (Mesin LSTM)...
Memuat pustaka gambar Leptonica: faktur.png (300 DPI, 2480x3508)
Memuat model bahasa: ind.traineddata, eng.traineddata
Menganalisis tata letak halaman (PSM 3: Segmentasi otomatis penuh)...
Pengenalan karakter dengan deep learning LSTM selesai (0.75s)
✓ Berhasil membuat output.txt (Teks polos)
✓ Berhasil membuat output.pdf (PDF yang dapat dicari/searchable)
✓ Berhasil membuat output.hocr (XML dengan koordinat bounding box)
Alur kerja 5 tahap pengolahan gambar menjadi teks terstruktur
Binarisasi adaptif (Otsu), pelurusan gambar miring (deskew), reduksi noise, dan normalisasi resolusi ke 300+ DPI.
Mendeteksi kolom, paragraf, baris teks, dan tabel secara otomatis untuk menentukan urutan baca.
Melacak baseline setiap baris teks dan memecah elemen karakter sebelum diproses oleh model neural network.
Jaringan saraf berulang (RNN) dua arah mengenali karakter berdasarkan konteks kalimat dengan akurasi tinggi.
Mengekspor hasil ke teks biasa, PDF dengan lapisan teks tersembunyi yang dapat dicari, hOCR, ALTO XML, atau TSV.
Panduan pemasangan cepat untuk semua sistem operasi utama
Gunakan pengelola paket Windows (winget atau Scoop) atau unduh installer resmi UB Mannheim:
# Direkomendasikan: instal via winget
winget install UB-Mannheim.TesseractOCR
# atau via Scoop:
scoop install tesseract
# Verifikasi instalasi:
tesseract --version
# Pasang Tesseract dengan Homebrew
brew install tesseract
# Pasang semua paket bahasa tambahan (Disarankan):
brew install tesseract-lang
# Verifikasi:
tesseract --version
tesseract --list-langs
# Ubuntu / Debian
sudo apt update
sudo apt install tesseract-ocr tesseract-ocr-ind tesseract-ocr-eng
# Fedora / RHEL
sudo dnf install tesseract tesseract-langpack-ind
# Arch Linux
sudo pacman -S tesseract tesseract-data-ind tesseract-data-eng
pip install pytesseract pillow opencv-python
# Contoh Python:
import pytesseract
from PIL import Image
# Ekstrak teks dari gambar
image = Image.open('dokumen.jpg')
text = pytesseract.image_to_string(image, lang='ind+eng')
print(text)
# Hasilkan PDF yang dapat dicari
pdf = pytesseract.image_to_pdf_or_hocr('dokumen.png', extension='pdf', lang='ind')
with open('output.pdf', 'wb') as f:
f.write(pdf)
npm install tesseract.js
// Kode Node.js atau Browser:
import { createWorker } from 'tesseract.js';
const worker = await createWorker('ind');
const ret = await worker.recognize('gambar.png');
console.log(ret.data.text);
await worker.terminate();
Alasan mengapa Tesseract menjadi pilihan utama jutaan developer dan peneliti
Menggunakan arsitektur deep learning LSTM mutakhir untuk mengenali teks pada dokumen cetak maupun hasil pindai berkualitas rendah dengan akurasi sangat tinggi.
Dukungan penuh untuk Bahasa Indonesia, Inggris, Arab, Mandarin, Jepang, dan berbagai aksara dunia dengan kemampuan membaca multi-bahasa sekaligus.
Membuat PDF dengan lapisan teks tak terlihat di bawah gambar asli sehingga dokumen dapat dicari kata kuncinya dan disalin dengan mudah.
Data dokumen tidak pernah dikirim ke server luar. Sangat aman untuk dokumen keuangan, hukum, dan medis yang bersifat rahasia.
Menyediakan koordinat kotak pembatas (Bounding Box) dan skor keyakinan untuk setiap kata dan karakter secara mendalam.
Cari dan unduh file model bahasa resmi (.traineddata) untuk lebih dari 100 bahasa dunia secara instan.
Aplikasi antarmuka grafis gratis untuk menggunakan OCR tanpa baris perintah
Antarmuka GTK/Qt yang intuitif. Membuka PDF/gambar, memilih area pemindaian, dan mengedit teks secara langsung.
Lihat gImageReader →Alat otomatisasi untuk menambahkan teks searchable ke PDF pindaian dengan koreksi orientasi dan deskew.
Lihat OCRmyPDF →Aplikasi GUI berbasis Java dan .NET yang mendukung pemrosesan OCR batch dan pengecekan ejaan.
Lihat VietOCR →Pilih mode PSM yang tepat untuk mendapatkan hasil akurasi OCR maksimal
| Nilai PSM | Deskripsi Mode | Contoh Penggunaan Terbaik |
|---|---|---|
--psm 3 |
Segmentasi halaman otomatis penuh (Default) | Dokumen standar dengan banyak paragraf dan halaman buku. |
--psm 6 |
Blok teks seragam tunggal | Kwitansi, faktur, struk belanja, dan paragraf tunggal. |
--psm 7 |
Satu baris teks tunggal | Plat nomor kendaraan, teks di bawah barcode, judul. |
--psm 8 |
Satu kata tunggal | Kode CAPTCHA, teks logo individual. |
--psm 11 |
Teks renggang tanpa urutan tertentu | Kartu nama, poster, flyer, data acak dalam tabel. |
Jawaban untuk pertanyaan teknis seputar Tesseract OCR
Melalui pustaka Leptonica, Tesseract mendukung format PNG, JPEG, TIFF, BMP, PNM, GIF, dan WebP. Untuk hasil terbaik, gunakan format tanpa kompresi rusak seperti TIFF atau PNG dengan resolusi 300 DPI.
Pada dokumen cetak yang jelas dan beresolusi tinggi, akurasi Tesseract v5 mencapai lebih dari 99%. Pada dokumen miring atau buram, pra-pemrosesan seperti binarisasi dan deskew akan meningkatkan akurasi secara signifikan.
Tesseract 100% gratis, open source, dan berjalan secara offline di perangkat lokal Anda; sedangkan API cloud berbayar per panggilan dan mengharuskan dokumen diunggah ke server pihak ketiga.
(1) Skalakan gambar ke 300 DPI; (2) Terapkan binarisasi hitam-putih Otsu; (3) Tentukan mode --psm yang sesuai; (4) Gunakan parameter multi-bahasa jika dokumen memuat istilah asing: -l ind+eng.