Google开放OCR源代码 助力数字图书馆项目
【IT168 开源资讯】近日,据Google公司的一篇博客文章(点击查看)写到,一名现就职于Google公司的前惠普职员正在研究光学字符识别(Optical Character Recognition,OCR)引擎,并试图将其投入开源领域。
Tesseract引擎最早在1985到1995年间由惠普实验室开发,但是随着惠普公司淡出OCR业务领域,此项技术也逐渐不被人注意。
Google公司正在与美国内华达州的拉斯维加斯大学进行合作,致力于将该OCR应用程序转化为开源软件。该大学在OCR领域具有领先的技术,而Google公司的前惠普职员又具有相关OCR工作经历,两者合作可以说是强强联合。
9月5日(本周二),Google曾宣布计划推出一项服务,让网民可以搜索到最早1700年的新闻报刊杂志的内容。如此来说,Google重新让OCR软件面世的原因就很明朗了,应该是利用该技术来实现自动扫描这些历史报刊。
把这个软件转化为开源软件的好处是可以解决一些OCR本身无法解决的问题,例如复杂的页面分析问题、如何识别复杂页面上的图片和文字等问题。
据分析人士称:Google将Tesseract OCR软件开源是为了创建其数字图书馆,这样说可能还早一些,不过从长久来看,此举无疑对Google帮助甚大。
点击查看原文
Tesseract引擎最早在1985到1995年间由惠普实验室开发,但是随着惠普公司淡出OCR业务领域,此项技术也逐渐不被人注意。
Google公司正在与美国内华达州的拉斯维加斯大学进行合作,致力于将该OCR应用程序转化为开源软件。该大学在OCR领域具有领先的技术,而Google公司的前惠普职员又具有相关OCR工作经历,两者合作可以说是强强联合。
9月5日(本周二),Google曾宣布计划推出一项服务,让网民可以搜索到最早1700年的新闻报刊杂志的内容。如此来说,Google重新让OCR软件面世的原因就很明朗了,应该是利用该技术来实现自动扫描这些历史报刊。
把这个软件转化为开源软件的好处是可以解决一些OCR本身无法解决的问题,例如复杂的页面分析问题、如何识别复杂页面上的图片和文字等问题。
据分析人士称:Google将Tesseract OCR软件开源是为了创建其数字图书馆,这样说可能还早一些,不过从长久来看,此举无疑对Google帮助甚大。
点击查看原文
0
相关文章