图纸、表格、扫描件,这些“AI 读不懂“的文件现在也能问了

图纸、表格、扫描件,这些“AI 读不懂“的文件现在也能问了
之前我们介绍了 Knowhere 的纯视觉理解路线VISION-MAP它能够更好地识别图像类资料而且能把原始页面留在系统里让 Agent 需要时直接看页每个结论都能回到证据上核对。有读者好奇一份几百页的文档难道要让视觉模型从头翻到尾吗当然不是。每问一次都通读全文又慢又贵还会把无关内容一起塞进上下文。VISION-MAP 真正要解决的是在不把原始页面抄没了的前提下先帮 Agent 找到最值得看的那几页。今天我们就来讲讲 VISION-MAP 是怎么工作的以及怎么使用它。VISION-MAP 是怎么工作的第一步保留源文件和页面标注。文档进入 Knowhere 后原始文件不会因为解析而被一份 Markdown 取代。每一页还会按原始样子存储但其核心内容和图表资产已被理解和标准页面里的文字、表格线、图片、印章和相对位置都在为后面的回溯和审计留下了完整入口。注意我们保留的是页面注释不是把文件页面作为图片再存一次。第二步建立地图。只有一堆页面还不够。一本几百页的文件如果没有结构Agent 还是只能从头翻到尾。VISION-MAP 会按照文档的章节关系组织页面形成“章—节—页面”的层级地图并给页面配上必要的轻量说明。这些说明负责告诉 Agent“这页大概讲什么、属于哪里”但不会取代原始页面。第三步先找路再看页。用户提出问题后Agent 不需要把整份文件重新读一遍。它会先根据问题在章节地图里判断方向哪些章节相关是否还要往下钻哪些页面值得收下。找到候选页面后再由视觉模型直接阅读原页核对金额、条款、图表或版式关系并把答案引用回具体页面。这也延续了 Knowhere 一直以来的三步思路先发现可能相关的内容再沿着章节结构导航最后交付可以追溯的证据。VISION-MAP 适合什么场景VISION-MAP 不是什么场景都用得上。文档干净、答案就在一段话里的时候直接读文字反而更快。它真正有用的地方是那些答案没那么好找还得留着让人复核的场景。尤其是处理高价值、强合规、高要求的文档时VISION-MAP 最能发挥作用。金融场景答案和出处一样重要如果分析师想知道“某公司本季度经营现金流下降的主要原因是什么”只靠关键词搜很容易翻出一堆带着“经营现金流”的段落——有的来自摘要有的是现金流量表有的是管理层讨论甚至可能混进上一年的对比数据。单看每一条都不算错拼在一起却说不清楚问题。VISION-MAP 的做法是先翻到现金流量表再去管理层讨论MDA里找对应的说明把数字、单位、口径、范围和解释依据都对上了再回答。给出的答案后面还跟着行项目、章节和页码你想验证随时可以点回去看。对于投研、审计、风控等任务而言“答案从哪里来”往往与答案本身同样重要。工程场景材料表、条款和图纸各说各的再看工程、建筑和制造行业。设计规范、招标文件、施工图集随便一套就是几百上千页。想查一个材料的防火等级、一个构件的安装要求翻起来才发现等级在一张表里要求写在另一章具体位置还得看图纸。这些东西一旦被切成一段段的文本块相互之间的关系就断了。VISION-MAP 则会把相关的条款、表格和图纸页面一起找出来让视觉模型对着页面核对。工程师和审查人员也能直接打开原页看清楚表格里的数字、图纸上的标注以及是不是最新版本。归根结底VISION-MAP 将 Agent 的文档问答从“给出一个概括性结论”推进为“像人一样读懂文档并拿出可核验依据的答案”这也更符合专业人员当前逐页阅读、定位、复核和决策的真实工作习惯。它替代不了人的判断但能省下不少来回翻资料、对版本的功夫也能少一些断章取义和引错版本的麻烦。为什么“能回到源页”这么重要因为合同审查、财务分析、工程核验这些事出了错是要担责任的不能一句“模型说的”就交差。在这一点上VISION-MAP 更像是给 Agent 配了一位懂行的文档审查员。它不会将文件简单切分为彼此割裂的文本 chunk而是以接近人类阅读的方式逐页理解文档中的标题层级、段落语义、表格、图像、图纸与版面结构并建立“问题—证据—页面位置”的可追溯关联。在用户提问后系统不仅生成答案还能基于对问题和文档结构的理解准确定位答案来自哪一页、哪一个章节、哪张表格甚至哪一处字段用户可一键跳转回原始证据进行核验。这种能力的核心价值不只是提升检索准确率更是显著增强 Agent 检索与回答过程的透明度、可解释性和可审计性。结果可以讨论但证据得随时能打开——这就是 VISION-MAP 想保留的东西。怎么在 Knowhere 里使用它现在最简单的体验方式是直接打开我们的在线Knowhere Brainhttps://notebook.knowhereto.ai/当你上传一份文档时可以根据文件特点选择合适的理解方式。如果是排版清晰、以正文为主的电子文档可以使用文本解析让 Agent 快速搜索和引用段落。如果是扫描文件、复杂报告、图纸、图文混排资料或者你特别在意原始版式与数字细节可以使用 VISION-MAP让 Agent 沿着章节地图找到相关页面再直接阅读原页。实际使用中你不需要操心底层到底调用了多少次模型。你只需要像平常一样提问例如“帮我核对这一年的合同金额和付款条件。”“这张图纸里设备 A 和管线 B 是什么关系”“这份报告的结论和前面的图表是否一致”Knowhere 会根据文档和问题选择路径把相关文字或页面交给 Agent。需要核验时你可以从回答回到章节、具体页图并追溯到最初上传的源文件。文本轨负责高效地读视觉轨负责完整地看。这就是 Knowhere 的两条文档理解路线也是我们做 VISION-MAP 的思路。如果你正在处理扫描合同、复杂报告、工程图纸或任何“解析成文字以后总觉得少了点什么”的文件欢迎来 Knowhere 体验 VISION-MAP也欢迎把那些最难读、最容易出错的文件交给我们。我们会继续把这双眼睛打磨得更好。

最新新闻

日新闻

周新闻

月新闻