LlamaIndex 提出 just-in-time Agentic OCR:两遍式文档处理平衡成本与精度
LlamaIndex 博客介绍一种面向“数据室”场景的两遍式文档处理模式:先用免费开源解析器对全部文件做轻量文本抽取并建立检索,再仅对检索命中的相关页面调用视觉语言模型做 OCR。作者以 84 份 SEC 文件、共 12013 页的实测说明该模式在约 10 至 100 份文档的临时问答场景中可行,并给出与离线大规模流水
LlamaIndex 提出 just-in-time Agentic OCR:两遍式文档处理平衡成本与精度