围绕 PDF 与 Office 文档中的表格、流程图、图表、SmartArt 和内嵌图片,MOI 强化结构保留、原图兜底与来源追溯,为知识库和 Agent 提供更可靠的数据输入。
企业文档不仅包含正文,还包含 Excel 悬浮图片、公式与绘图元素,PPT 流程图、图表和 SmartArt,以及 PDF 中的跨页表、表内图片和复杂版面。
如果解析只得到零散文本,表格行列、图文关系和阅读顺序会丢失;错误数据进入知识库后,会直接影响检索证据与 Agent 回答的可靠性。
解析流水线将表格还原为保留表头、行列和合并单元格的 HTML,并针对普通表、一框多表、流程图表和跨页表采用不同策略。
无法可靠还原时保留表格或图片原图,不静默丢失内容;页眉页脚、标题、脚注和表内图片被拆成独立内容块,便于检索、展示与进一步编辑。
解析结果同时保留结构化内容与来源对象,让知识库能够按文字、表格和图片建立索引,Agent 在回答时可引用更完整的业务证据。
对有表头跨页表、三页以上连续表和低清密集表等场景采用保守策略,并明确人工校验与能力边界,避免把不稳定结果包装为确定事实。