跳转至正文内容
开源传奇

社区驱动,
AI 赋能。

Tesseract OCR 不仅仅是一款软件,更是为了使人类所有的印刷知识都能被机器与公众自由检索而建立的全球开源合作项目。

我们的使命 (Our Mission)

我们坚信高质量的文字识别技术应当成为全人类共享的公共资源。无论是大型服务器集群、移动终端还是前端浏览器,我们致力于提供 100% 免费、完全离线且保障隐私的顶级 OCR 解决方案。

  • 隐私至上: 您的图片与文档始终留在本地设备,杜绝任何云端泄漏风险。
  • 通用支持: 支持全球 100 多种语言与文字书写体系,消除数字阅读鸿沟。
  • 网页即用: 体验免安装的 在线 OCR 工具,秒级完成文字提取。
COMMUNITY DRIVEN

发展历史 (Timeline)

从 20 世纪 80 年代的科研突破到全球最受推崇的开源 OCR 标准

1985 — 1994

诞生于惠普实验室 (HP Labs)

在英国布里斯托尔与美国科罗拉多州的惠普实验室完成原创研发,并在当年成为全球识别率最高的 OCR 商业引擎之一。

2005 — 2018

Google 开源与深度学习重构

Google 于 2005 年将其开源并赞助研发十余年。在第 4 代版本中全面引入了突破性的 LSTM 循环神经网络架构。

2019 — 至今

全球开源社区接力与繁荣

现由活跃的全球开源开发者社区全面掌舵与维护,持续引领开源光学字符识别领域的最高标准。

名称释义:“Tesseract”

“Tesseract”在几何学中指四维超正方体。正如超立方体为三维立方体赋予全新维度,本引擎为平面静止图像赋予了结构化可检索文本的实用新维度。

参与社区贡献

无论您是 C++ 底层开发者、语言模型训练专家还是技术文档撰写者,欢迎加入开源贡献队伍!

前往 GitHub 贡献