摘要: 最近在看浏览器端 OCR 的实现,看到一个容易被忽略的地方:识别模型的输出,和用户想要的结果,中间隔着一层不小的工程。 模型给你的是「文字框 + 内容 + 置信度」,一堆散点。用户想要的是能直接粘进 Word 或 Excel 的东西。这中间的还原过程——判断哪些框属于同一行、哪些行构成一段、哪些列构 阅读全文
posted @ 2026-08-29 11:45 langka 阅读(1) 评论(0) 推荐(0)
摘要: 整页栅格化和只重编码内嵌位图是两回事。实测同一份 4 页报告的四档结果,并逐项验证文字、链接、页面框是否原样保留。 阅读全文
posted @ 2026-08-27 16:48 langka 阅读(4) 评论(0) 推荐(0)
摘要: 上个月有人反馈,在 iPhone 微信里用我的工具把图转成 WebP,下下来的文件在电脑上打不开,看图软件提示格式不对。 我第一反应是编码器写崩了。拿到那个文件用十六进制看了一眼,前四个字节是 89 50 4E 47——PNG 的魔数。文件名后缀写着 .webp,内容是一张不折不扣的 PNG。 问题 阅读全文
posted @ 2026-08-23 16:08 langka 阅读(2) 评论(0) 推荐(0)