OpenClaw 有价值应用(2026-05-10):多Agent文档智能抽取与知识结构化流——把手动整理文档变成系统化知识资产
场景演示
你是否有这样的困扰:
- 每周收到大量行业报告、合同文档、政策文件,手动整理耗时巨大
- 不同来源的文档格式各异(Word、PDF、网页),提取关键信息效率极低
- 整理后的知识点散落各处,下次找要用时根本想不起来存在哪
- 团队成员各读各的,无法形成共享的知识沉淀
多Agent文档智能抽取与知识结构化流可以彻底解决这个问题:
文档丢进去 → 多Agent并行解析 → 关键实体与关系自动抽取 → 存入飞书多维表格 → 按主题/行业/标签检索复用
核心价值:把"读后就忘、找时没有"变成"系统持续积累、随时命中"。
Step by Step
整体流程
文档入口(飞书/本地/邮件附件)
↓
[Agent-1] 文档分类与格式转换
↓
[Agent-2] 关键信息并行抽取(实体/关系/摘要)
↓
[Agent-3] 质量校验与交叉验证
↓
[Agent-4] 知识结构化入库(飞书Bitable)
↓
[Agent-5] 定期合成与知识图谱更新
Phase 1:文档入口(分类Agent)
Agent角色:文档分诊员
职责:
- 识别文档类型(合同/报告/政策/新闻/邮件)
- 按类型分配不同的抽取Prompt模板
- 判断是否需要OCR(扫描件)
输入:原始文档路径或飞书文件链接
输出:文档类型 + 格式评估 + 抽取优先级
Phase 2:并行抽取(3个抽取Agent)
Agent-A:负责实体抽取(人名/公司/日期/金额/指标)
Agent-B:负责关系抽取(关联关系/因果关系/从属关系)
Agent-C:负责摘要与核心观点抽取(3句话概括 + 关键结论)
三者并行处理,互不依赖。
Phase 3:质量校验(校验Agent)
职责:
- 交叉验证三个Agent的输出是否一致
- 检查关键信息是否有遗漏
- 标记低置信度条目,人工复核
Phase 4:结构化入库(入库Agent)
目标表结构(飞书Bitable):
| 字段 | 类型 | 说明 |
|---|---|---|
| 文档名称 | 单行文本 | 原始文件名 |
| 文档类型 | 单选 | 合同/报告/政策/新闻/其他 |
| 来源 | 单行文本 | 来源平台/公司 |
| 抽取日期 | 日期 | 处理时间 |
| 核心实体 | 多选 | 人名/公司/指标标签 |
| 核心关系 | 多行文本 | 关系描述 |
| 摘要 | 多行文本 | 3句话概括 |
| 关键结论 | 多行文本 | 可执行的结论 |
| 原文链接 | URL | 原始文档链接 |
| 置信度 | 数字 | 0-100 |
| 状态 | 单选 | 待复核/已确认/已归档 |
Phase 5:定期合成(合成Agent)
职责:
- 每周扫描新增记录,按主题聚合
- 生成"本周知识简报"推送给团队
- 识别跨文档的知识矛盾点并告警
- 更新知识标签体系
可复制提示词
文档分类Prompt
你是一个文档分诊专家。请分析以下文档,输出:
1. 文档类型:合同/财报/政策文件/行业报告/新闻资讯/邮件/其他
2. 格式评估:结构化程度(高/中/低)、是否需要OCR
3. 抽取优先级:P0(关键决策信息)/P1(重要参考)/P2(一般知识)
4. 推荐抽取模板:标准合同/财务报告/政策解析/通用文档
文档路径:[文档路径]
实体抽取Prompt
你是一个信息抽取专家。请从以下文档中抽取所有关键实体:
**实体类型要求**:
- 人物:姓名、职位
- 机构:公司名、组织名
- 数字:金额、百分比、增长率、排名
- 日期:关键时间节点、截止日期
- 指标:财务指标、绩效指标、行业指标
**输出格式**(JSON数组):
[
{"entity": "实体文本", "type": "人物/机构/数字/日期/指标", "context": "上下文句子", "importance": "高/中/低"}
]
文档内容:
[文档全文]
关系抽取Prompt
你是一个知识图谱工程师。请从以下文档中抽取实体之间的关系:
**关系类型**:
- 从属关系:A属于B/A是B的子公司
- 交易关系:A向B出售/收购/投资
- 竞争关系:A与B存在竞争
- 影响关系:A导致/促进/阻碍B
- 时间关系:A发生在B之前/之后
**输出格式**(JSON数组):
[
{"from": "实体A", "to": "实体B", "relation": "关系类型", "description": "关系描述", "confidence": "高/中/低"}
]
文档内容:
[文档全文]
摘要与结论Prompt
你是一个研究分析师。请完成以下任务:
**任务1:生成3句话摘要**
用三句话概括文档的核心内容,要求:
- 第1句:这是什么文档,涉及谁/什么事
- 第2句:核心发现或关键信息是什么
- 第3句:对目标读者的价值或启示是什么
**任务2:提取关键结论**
列出3-5条可执行的具体结论(不是摘要,而是从文档中推导出的洞察)
**任务3:标注置信度**
对整篇文档的信息可靠性打分(0-100),并说明置信度理由
文档内容:
[文档全文]
质量校验Prompt
你是一个知识质量审核员。请对以下三个Agent的输出进行交叉验证:
**实体抽取Agent输出**:[粘贴实体抽取结果]
**关系抽取Agent输出**:[粘贴关系抽取结果]
**摘要Agent输出**:[粘贴摘要结果]
**审核要点**:
1. 实体与关系是否匹配(不能抽取了实体但没有关系)
2. 摘要是否准确反映文档内容
3. 关键数字/日期是否有明显错误
4. 是否有遗漏的重要信息
**输出格式**:
- 一致性评分(0-100)
- 发现的问题列表
- 修正建议
- 低置信度条目标记(需要人工复核)
使用的Skills
| Skill | 用途 |
|---|---|
feishu-bitable | 知识入库、查询、结构化存储 |
multi-search-engine | 文档背景信息补充搜索 |
feishu-doc | 读取飞书云文档内容 |
summarize | 长文档快速摘要 |
halo-backend-publisher | 知识简报自动发布博客 |
价值与注意事项
核心价值
- 效率提升:原来人工整理一份50页报告需要3小时,现在5分钟自动完成
- 知识积累:每次处理的文档都成为团队知识资产,越积累越有价值
- 团队协同:多人阅读同一批文档,知识自动汇总,不依赖个人记忆
- 可追溯:所有抽取结果都带有原文上下文,方便回溯验证
- 主动推送:知识简报自动生成,团队成员不需要主动查找
注意事项
- 隐私合规:处理合同、客户资料等敏感文档时,确保在合规环境下操作
- 置信度校验:低置信度条目必须人工复核,不能完全依赖AI
- 格式多样性:扫描件PDF需要先OCR处理,否则抽取质量严重下降
- 标签体系维护:定期清理和合并重复标签,避免标签膨胀
- 知识冲突处理:当多个文档结论矛盾时,不要简单覆盖,要标注冲突并告警
适用边界
- ✅ 最适合:行业报告、合同摘要、政策文件、财报分析、竞品文档
- ⚠️ 次适合:会议纪要(需要更强的上下文理解)、创意文案(主观性太强)
- ❌ 不适合:纯图片扫描件(未OCR)、手写笔记、音视频转录稿
相关Agent:本工作流涉及多Agent协作调度,可参考 Agent Factory 技能创建专用文档处理Agent。