「Tesseract」の名前の由来
4次元超立方体(テッセラクト)を意味します。テッセラクトが立方体に新しい次元を加えるように、当エンジンは静止画像に「構造化されたテキスト」という実用的な新しい次元を与えます。
Tesseract OCRは単なるソフトウェアではありません。人類の印刷された知識を、機械と人間双方が自由にアクセスできるようにするための世界的な共同プロジェクトです。
高品質な文字認識技術は公共の財産であるべきだと私たちは信じています。高性能サーバーからスマートフォン、Webブラウザに至るまで、あらゆる場所で100%無料かつプライバシー安全に利用できるOCRエンジンを提供し続けます。
1980年代の研究開発から、世界で最も利用されるオープンソースOCRエンジンへの進化
英国ブリストルおよび米国コロラド州のHewlett-Packard研究所で独自開発。当時最も精度の高いOCRエンジンの一つとして評価されました。
Googleが2005年にオープンソースとして公開し、10年以上にわたり開発を支援。バージョン4で画期的なLSTMニューラルネットワークが統合されました。
現在は世界中の開発者コミュニティによって活発にメンテナンスされ、2026年現在もオープンソース文字認識の最高峰であり続けています。
4次元超立方体(テッセラクト)を意味します。テッセラクトが立方体に新しい次元を加えるように、当エンジンは静止画像に「構造化されたテキスト」という実用的な新しい次元を与えます。
C++開発者、学習データを改善する言語専門家、ドキュメント執筆者など、あらゆるコントリビューターを歓迎しています。
GitHubで参加する