logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

选信创OCR,这四个坑我帮你踩过了

不是因为客户刚好用的是鲲鹏所以只适配鲲鹏,而是不管客户用啥,OCR引擎都能部署。见过太多案例,产品卖完人就不见了,出了问题只能干瞪眼。不是说不让用开源,但你要清楚后果:开源代码的合规审计是个无底洞,涉密项目和金融机构不可能接受”来历不明”的代码。你需要做的是:拿自己的真实业务数据,在自己的服务器环境里,实际部署跑一遍。文档扫描件、手机拍的斜角照片、老旧档案、带印章的发票——这些真实场景里的”脏数据

鸿蒙原生OCR来了!证件识别新体验

不过好消息是,鸿蒙的开发工具链比几年前的Android生态要友好。我们前后大概花了三到四个月,把证件识别SDK和护照阅读器的鸿蒙版本搞定了,目前已经有了完整的演示Demo。鸿蒙现在覆盖的不只是手机,还有平板和桌面PC,而且政企客户采购鸿蒙设备的比例在上升——信创环境下,鸿蒙PC很可能成为一个重要阵地。从实测来看,在鸿蒙手机上的OCR识别速度跟Android版本基本持平,有些场景甚至略快一点——可能

#harmonyos#华为
国产GPU跑OCR,实测数据告诉你答案

才是真正见分晓的地方。我们目前在两个国产GPU平台上做了完整的OCR性能测试:海光K100-Ai(其实就是深算一号,x86路线的GPGPU)和华为昇腾Atlas 300I Pro(达芬奇架构的NPU)。昇腾310P在NPU专属任务(比如纯推理、矩阵运算密集的场景)上表现不错,但在需要灵活编程的通用OCR pipeline里,受限于CUDA生态的缺失,适配起来确实更费劲一些。国产GPU连续跑上十几个

国产GPU跑OCR,实测数据告诉你答案

才是真正见分晓的地方。我们目前在两个国产GPU平台上做了完整的OCR性能测试:海光K100-Ai(其实就是深算一号,x86路线的GPGPU)和华为昇腾Atlas 300I Pro(达芬奇架构的NPU)。昇腾310P在NPU专属任务(比如纯推理、矩阵运算密集的场景)上表现不错,但在需要灵活编程的通用OCR pipeline里,受限于CUDA生态的缺失,适配起来确实更费劲一些。国产GPU连续跑上十几个

手写字迹那么乱,OCR是怎么认出来的

我有一次拿着一张二十年前的手写账本,试着用手机拍了拍,看能不能识别出来。结果出乎意料——大部分内容识别出来了,准确率能有七八成。当时就好奇,印刷体好认,手写字那么乱,计算机到底是怎么识别的?

OCR到底是什么?一种”扫一眼就能读字”的技术

手机扫描一张名片,联系人信息自动填进通讯录;用相机对着英文菜单拍一下,翻译结果立刻出来;银行柜台把身份证往感应区一放,信息秒填表单……这些场景背后,都是同一项技术在工作:OCR。

证件识别准确率99.8%,这个数字是怎么练出来的

你在酒店办入住,前台把护照往机器里一放,不到一秒,屏幕上就出现了你的姓名、国籍、证件号。这个过程看起来理所当然,但背后的准确率保障,是几十年工程积累的结果。证件识别的准确率通常宣称在99.8%以上。这个数字是怎么来的,又意味着什么?

#人工智能
大模型都能”看图说话”了,OCR还有存在的意义吗

GPT-4V出来之后,我见过一种说法:OCR要被大模型取代了。把一张图片丢给大模型,它能直接读出里面的文字,还能理解意思,比传统OCR强多了,OCR还有什么用?这个问题值得认真回答,因为它触及了AI技术演进中一个很常见的误区。

#人工智能
OCR从”字幕组”到大模型——四十年识字进化史

有一类工作,二十年前需要整屋子的工程师,今天一块芯片就能搞定。这就是OCR——光学字符识别,简单说就是让机器看懂文字。你以为这是个新技术?错了,它比大多数人以为的要老得多。

少数民族文字和阿拉伯文,OCR是怎么认出它们来的

OCR行业有一个”硬骨头”:多语言识别。英文只有26个字母,识别难度相对小。中文有7000多个常用汉字,困难度上了一个台阶。但这些跟阿拉伯文、泰文、蒙古文、藏文比起来,又都是小儿科了。

    共 39 条
  • 1
  • 2
  • 3
  • 4
  • 请选择