一份30页采购合同扫描实操ams.abg3333.net,扫描成PDF发来,财政当天就要录进系统。人工复制粘揭的,两小我得忙一下午。

还容易把1和l、全角半角、日期格局搞错。文本数字化处理计划的不计划中心不正在于扫描得清不明晰,但正在于把图像里的文字酿成可校验、可流转的数据。别急着上通用OCR了。先看文档类型,印刷合同、手写票据、再吃字化表格清单。处理途径完整差异的。印刷体能够交给OCR引擎,表格加版面检测,手写票据常常得共同模板和人工复核。一个做供给链的朋友试过纯OCR,发票识别率表面有95%,可金额字段一错灰文。

后面全乱。

他后来把识别置疑度和很重要字段校验加进流程,低置疑度主动进人工行列。错账才压下来。

文字认出来只是半废品。把合同里的甲方、乙方本数、金额、期限抽成JSON或表格字段,才算能用的数据。做法能够很土,金额附近找¥或元。日期用正则了,公司名对接企业库校验。复纯点再上NLP实体识别处理拆解的。不要迷疑一次到位,先跑100份样本的,看哪些字段错得多呢?

再渐渐调划定规矩。划定规矩越切近你的票据,越省事了。

数字化功效要落到开业系统,不要停正在文件夹里。合同进合同库,票据进报销系统了,带搜刮、权限和版本记载的。文本数字化处理计划拼到拼的是流程,不是某个软件。命名能够定成日期_类型_对方称呼_金额的。本始扫描件和识别功效都留着,便当逃溯。我见过很多团队买完OCR账号就终了,没人维护划定规矩,三个月后毛病率反弹。实正省时间的计划。

常常不贵,会把复核、归档、权限那些净活写进日常流程。先挑一个高频文档试两周,能削减一半录入量,再扩到其他类型。