名称释义:“Tesseract”
“Tesseract”在几何学中指四维超正方体。正如超立方体为三维立方体赋予全新维度,本引擎为平面静止图像赋予了结构化可检索文本的实用新维度。
Tesseract OCR 不仅仅是一款软件,更是为了使人类所有的印刷知识都能被机器与公众自由检索而建立的全球开源合作项目。
我们坚信高质量的文字识别技术应当成为全人类共享的公共资源。无论是大型服务器集群、移动终端还是前端浏览器,我们致力于提供 100% 免费、完全离线且保障隐私的顶级 OCR 解决方案。
从 20 世纪 80 年代的科研突破到全球最受推崇的开源 OCR 标准
在英国布里斯托尔与美国科罗拉多州的惠普实验室完成原创研发,并在当年成为全球识别率最高的 OCR 商业引擎之一。
Google 于 2005 年将其开源并赞助研发十余年。在第 4 代版本中全面引入了突破性的 LSTM 循环神经网络架构。
现由活跃的全球开源开发者社区全面掌舵与维护,持续引领开源光学字符识别领域的最高标准。
“Tesseract”在几何学中指四维超正方体。正如超立方体为三维立方体赋予全新维度,本引擎为平面静止图像赋予了结构化可检索文本的实用新维度。
无论您是 C++ 底层开发者、语言模型训练专家还是技术文档撰写者,欢迎加入开源贡献队伍!
前往 GitHub 贡献