Unlimited-OCR真正的价值不是“100页一次读完”,而是把长文档解析从分页脚本升级成可审计的长上下文流水线
AH-0512与AH-0521都在讲百度2026年开源的Unlimited-OCR。 截至2026-08-15,官方GitHub仍然活跃,MIT License明确,README记录了vLLM、ms-swift等支持,并对应论文《Unlimited OCR Works》。 原帖最容易让人记住的是: “100页一次读完,本地免费,精度超过DeepSeek-OCR。” 但长期可用的结论不能停在这里。
Unlimited-OCR真正的价值不是“100页一次读完”,而是把长文档解析从分页脚本升级成可审计的长上下文流水线
AH-0512与AH-0521都在讲百度2026年开源的Unlimited-OCR。
截至2026-08-15,官方GitHub仍然活跃,MIT License明确,README记录了vLLM、ms-swift等支持,并对应论文《Unlimited OCR Works》。
原帖最容易让人记住的是:
“100页一次读完,本地免费,精度超过DeepSeek-OCR。”
但长期可用的结论不能停在这里。
1. “One-shot long-horizon”解决的是上下文组织,不是无限内存
长PDF传统上常被拆页OCR,再自己合并。
Unlimited-OCR的设计目标之一是长时域解析,让模型在更长页面序列中处理文档。
这能减少: 跨页标题断裂; 表格续页; 脚注; 章节关系; 上下文丢失。
但“100页”仍然受: GPU显存; 输入分辨率; 页面复杂度; 推理后端; 文档长度; 模型配置影响。
Demonstrated Horizon ≠ Universal Capacity。
2. “PDF转300dpi”也不是越高越好
更高DPI意味着更多像素、显存和时间。
纯文本扫描件、复杂表格、古籍、双栏论文、工程图的最优预处理可能不同。
生产系统应该先做: Page Type Detection → DPI/Resize Strategy → OCR → Structure Check → Confidence/Error Flag。
不是所有文件统一放大到同一个分辨率。
3. 本地运行 ≠ 零成本
开源免费只代表没有按页API费。
本地仍有: GPU/CPU; 内存; 电费; 部署; 模型下载; 维护; 等待时间; 失败重跑。
对于少量文档,云OCR可能反而更便宜。
对于大量敏感合同、研究档案或长期批处理,本地的隐私和边际成本优势才更明显。
No API Bill ≠ Zero Cost。
4. “超过DeepSeek-OCR”必须绑定具体Benchmark
OCR没有一个统一“准确率”。
至少要区分: 文本识别; 版面; 表格; 公式; 多语言; 古籍; 长文档; 跨页理解。
如果官方论文在特定benchmark上领先,这只能支持对应任务和设置。
不能缩写成: “所有OCR都更准。”
Benchmark Win ≠ Universal Superiority。
5. 真正生产可用还需要Error Surface
长合同最危险的问题不是模型完全读不出来,而是:
某一页漏掉; 金额识错; 表格行列错; 否定词丢失; 页码错位; 签章/手写被忽略。
所以输出不能只有一个“全文本”。
至少附: page mapping; low-confidence regions; table structure; unreadable flag; source image reference。
对于法律、金融、医疗文档,OCR结果必须回到原页核对。
6. 长上下文反而更需要Chunkless≠Reviewless
一次读100页最大的诱惑是:
“既然模型一次读完,就不用逐页检查。”
这是错的。
One-shot减少工程拆分,不减少事实责任。
真正有价值的是让模型跨页理解后,再把关键事实定位回页码/区域。
7. 数据隐私:Local Model和Local Workflow仍要区分
如果整个模型、文件、日志和后处理都在本机,本地化确实能降低文档上传第三方云的暴露面。
但如果后续把OCR文本发送给云LLM做摘要,数据又出去了。
因此要画:
PDF → OCR Runtime → Local Output → Downstream Model → Storage/Logs。
Local OCR ≠ End-to-end Local Data Path。
8. 商业机会:Document Evidence Pipeline
真正可以卖的不是“一个免费OCR模型”。
而是:
- 文档导入;
- OCR;
- 版面/表格;
- 原页定位;
- 错误标记;
- 人工复核;
- 可检索证据;
- 更新/版本。
目标客户: 合同团队; 投研; 档案; 制造业文档; 本地知识库。
9. V3要测什么
找真实文档集: 扫描合同; 论文; 表格; 中文古籍; 低清图片。
与当前方案比较: 页级召回; 关键字段错误; 表格恢复; 耗时; GPU成本; 人工复核时间。
只有人工总成本下降,才算真正更便宜。
Stop Rule
如果某种文档需要高算力、错误难发现、人工复核反而变长,就不要因为“本地免费”强行替换已有OCR。
长文档OCR真正的升级,不是把100页塞进一次调用,而是把每个识别结果重新连回可验证的原始证据。
10. 版面还原和文字识别是两套问题
很多OCR看上去“字都认对了”,但真正进入知识库后才发现段落顺序、表格列、标题层级和脚注关系已经错了。对于RAG或合同抽取,结构错误会直接改变语义。因此评测不能只算字符准确率,还应测试Reading Order、Table Structure和Page-to-Chunk Mapping。
11. 长文档需要断点恢复
一次跑几十上百页时,进程中断、显存不足或某页异常都可能让整次任务失败。生产管线应保存页级/段级checkpoint,能够只重跑失败部分,而不是每次从第一页开始。这会直接影响“本地更便宜”是否成立。
12. 模型更新也需要回归集
OCR模型或推理框架升级后,不应只看新Benchmark。保留一组自己的“黄金文档”:最难合同、最乱表格、最差扫描件、历史古籍。每次升级跑同一组,确认旧能力没有回退。Dynamic Model Capability必须进入Document Evidence的版本记录。