AI说PDF里没找到?用3步分清没有还是没读到。
你让AI查一份186页报告,它回复“没有相关内容”。这句话可能是真的,也可能只是扫描页没做OCR、文本覆盖不足,或查询只走了关键词路线。
开源项目pdf-mcp给了一个实用思路:先看页数与文本覆盖,再决定全文、分页、关键词或语义检索,最后把答案绑回页码和摘录。
官方仓库:网页链接 。
不用安装,也能先做3步纸面排查:第一,记录PDF页数、是否扫描件和文本覆盖;第二,用原词与自然语言各查一次;第三,把每个命中绑定到页码与原文摘录。
可复制交付物:文件|页数|文本覆盖|是否扫描件|查询词|命中页|证据摘录|失败解释。
已填写示例:年报.pdf|186|未知|否|供应链风险|待核验|待填|零结果不能判定不存在。
完成标准:每个答案都有页码和摘录;零结果能说明覆盖、OCR与查询路线;解释不了就标记“未知”,不把没读到写成没有。
仓库README公开了PDF信息、分页读取、关键词/语义检索、表格图片与OCR等能力,也提醒PDF文本可能是不可信输入。项目当前活跃开发,本轮只读核验,未安装、未处理真实文件,也未独立复现作者结果。
给研究员和分析师最有用的,不是更快得到一句答案,而是知道这句答案来自哪一页,哪里还没读到。
人工智能 PDF
