LSTM Derin Öğrenme Motoru
Geleneksel desen eşleme yerine modern LSTM sinir ağları kullanılarak geliştirilmiş, düşük kaliteli taramalarda bile benzersiz tanıma doğruluğu.
Tesseract OCR, endüstri standardı optik karakter tanıma çözümüdür. Gelişmiş LSTM yapay sinir ağları ile görsellerden ve taranmış belgelerden 100'den fazla dilde %99'un üzerinde doğrulukla metin çıkarır. Tamamen yerel, çevrimdışı ve güvenli.
$ tesseract fatura.png output -l tur+eng --psm 3 pdf hocr
Tesseract OCR v5.3.0 başlatılıyor (LSTM motoru)...
Leptonica kütüphanesi yüklendi: fatura.png (300 DPI, 2480x3508)
Dil modelleri yüklendi: tur.traineddata, eng.traineddata
Sayfa düzeni analiz ediliyor (PSM 3: Tam otomatik sayfa tespiti)...
LSTM derin öğrenme ile karakter tanıma tamamlandı (0.72s)
✓ output.txt başarıyla oluşturuldu (Düz metin)
✓ output.pdf başarıyla oluşturuldu (Aranabilir çift katmanlı PDF)
✓ output.hocr başarıyla oluşturuldu (Koordinatlı XML)
Görselden aranabilir metne 5 adımlı OCR işleme hattı
Adaptif ikilileştirme (Otsu), eğiklik düzeltme, parazit giderme ve 300+ DPI çözünürlük ölçekleme uygulanır.
Sütunlar, paragraflar, metin satırları ve tablolar otomatik olarak tespit edilip okuma sırası belirlenir.
Metin satırlarının taban çizgileri çıkarılır ve karakter parçacıkları yapay zeka modeline iletilir.
Çift yönlü LSTM sinir ağları, bağlamsal dil modelleriyle karakterleri yüksek doğrulukla tanımlar.
Sonuçlar metin dosyası, aranabilir PDF, hOCR (HTML), ALTO XML veya TSV tablosu olarak dışa aktarılır.
Tüm işletim sistemleri için hızlı kurulum yönergeleri
Windows Paket Yöneticisi (winget veya Scoop) veya UB Mannheim resmi kurulum paketini kullanabilirsiniz:
# Önerilen: winget ile kurulum
winget install UB-Mannheim.TesseractOCR
# veya Scoop ile kurulum:
scoop install tesseract
# Kurulumu test edin:
tesseract --version
# Homebrew ile Tesseract kurulumu
brew install tesseract
# Tüm dil paketlerini ekleme (Önerilen):
brew install tesseract-lang
# Doğrulama:
tesseract --version
tesseract --list-langs
# Ubuntu / Debian
sudo apt update
sudo apt install tesseract-ocr tesseract-ocr-tur tesseract-ocr-eng
# Fedora / RHEL
sudo dnf install tesseract tesseract-langpack-tur
# Arch Linux
sudo pacman -S tesseract tesseract-data-tur tesseract-data-eng
pip install pytesseract pillow opencv-python
# Python Örneği:
import pytesseract
from PIL import Image
# Görselden metin çıkarma
image = Image.open('belge.jpg')
text = pytesseract.image_to_string(image, lang='tur+eng')
print(text)
# Aranabilir PDF oluşturma
pdf = pytesseract.image_to_pdf_or_hocr('belge.png', extension='pdf', lang='tur')
with open('output.pdf', 'wb') as f:
f.write(pdf)
npm install tesseract.js
// Node.js veya Tarayıcı Kodu:
import { createWorker } from 'tesseract.js';
const worker = await createWorker('tur');
const ret = await worker.recognize('resim.png');
console.log(ret.data.text);
await worker.terminate();
Neden dünya çapında geliştiricilerin ve araştırmacıların 1 numaralı tercihi?
Geleneksel desen eşleme yerine modern LSTM sinir ağları kullanılarak geliştirilmiş, düşük kaliteli taramalarda bile benzersiz tanıma doğruluğu.
Türkçe, İngilizce, Almanca, Fransızca, Arapça, Kiril ve Asya alfabeleri dahil 100'den fazla dilde çok dilli eşzamanlı tanıma.
Taranmış belgelerin altına görünmez metin katmanı yerleştirerek arama yapılabilir, metin kopyalanabilir PDF'ler üretir.
Verileriniz hiçbir zaman harici sunuculara yüklenmez. Sağlık, finans ve hukuki belgeler için tam güvenlik sağlar.
Karakter ve kelime düzeyinde koordinat sınırlayıcı kutuları (Bounding Box) ve güven skorları ile tam yapılandırılmış veri.
100'den fazla dil için resmi eğitilmiş model dosyalarını (.traineddata) anında arayın ve indirin.
Komut satırı kullanmadan grafiksel arayüzle OCR yapmak için popüler ücretsiz araçlar
GTK/Qt tabanlı modern arayüz. PDF/resim açma, tarama alanı seçimi ve metin düzenleme yetenekleri sunar.
gImageReader'ı Gör →PDF belgelerinize otomatik aranabilir metin katmanı ekler, sayfaları düzeltir ve PDF/A arşiv standartlarına uyarlar.
OCRmyPDF'i Gör →Java ve .NET ile geliştirilmiş çapraz platform arayüz. Toplu OCR işleme ve yazım denetimi desteği.
VietOCR'ı Gör →En yüksek doğruluk için belgenize en uygun PSM modunu belirleyin
| PSM Değeri | Mod Açıklaması | En İyi Kullanım Senaryosu |
|---|---|---|
--psm 3 |
Tam otomatik sayfa bölümleme (Varsayılan) | Standart çok paragraflı dökümanlar ve kitap sayfaları. |
--psm 6 |
Tek tip metin bloğu | Faturalar, makbuzlar, fişler ve tek biçimli paragraflar. |
--psm 7 |
Tek bir metin satırı | Araç plakaları, barkod altındaki metinler, başlıklar. |
--psm 8 |
Tek bir kelime | Güvenlik kodları (CAPTCHA), tekli logo metinleri. |
--psm 11 |
Belirli bir sırası olmayan seyrek metin | Kartvizitler, afişler, tablolarda dağınık duran veriler. |
Tesseract OCR hakkında teknik detaylar
Leptonica kütüphanesi sayesinde PNG, JPEG, TIFF, BMP, PNM, GIF ve WebP formatlarını doğrudan destekler. En yüksek OCR kalitesi için 300 DPI çözünürlükte TIFF veya PNG önerilir.
Net ve yüksek çözünürlüklü basılı belgelerde Tesseract v5'in doğruluk oranı %99'un üzerindedir. Düşük kaliteli veya eğik taranmış belgelerde ikilileştirme (Binarization) ve eğiklik giderme (Deskew) ile başarı oranı artırılabilir.
Tesseract tamamen ücretsiz, açık kaynaklı ve internet bağlantısı gerektirmeden yerel olarak çalışır; bulut OCR servisleri ise kullanım başına ücretlendirilir ve verilerinizi harici sunuculara göndermenizi gerektirir.
(1) Görsel çözünürlüğünü 300 DPI'a ölçekleyin; (2) Otsu algoritmasıyla siyah-beyaz ikilileştirme yapın; (3) Belge düzenine göre doğru --psm modunu seçin; (4) Çok dilli belgelerde -l tur+eng parametresini kullanın.