OpenClaw 有价值应用(2026-05-13):多Agent网页深度采集与结构化报告流——把手动逐站浏览变成系统化情报输出

OpenClaw 有价值应用(2026-05-13):多Agent网页深度采集与结构化报告流——把手动逐站浏览变成系统化情报输出

多Agent网页深度采集与结构化报告流——把手动逐站浏览变成系统化情报输出

场景演示

想象这样的场景:产品经理每天需要监控竞品动态、行业资讯、用户评价,手动打开十几个标签页、逐页复制粘贴,眼睛酸痛效率低下,采集回来的信息还散落各处难以复用。

用了这个多Agent采集报告流之后:

运营小明早上9点收到飞书消息——竞品动态报告已生成。他打开报告,看到竞品A昨晚上线了新功能,用户评价呈两极分化;行业媒体有一篇深度分析文章被高转评;用户社区里有一条关于你们产品的吐槽被顶上热门。整份报告结构清晰,重点突出,附带了来源链接。这整个过程,系统在凌晨3点自动完成。


Step by step

整体架构


┌──────────────────────────────────────────────────────────────┐
│                    多Agent采集报告流                          │
│                                                              │
│  Agent1 采集节点 ──→ Agent2 解析节点 ──→ Agent3 报告节点      │
│       │                  │                   │               │
│       ↓                  ↓                   ↓               │
│  目标URL列表         内容清洗+抽取        Markdown报告         │
│  浏览器自动化         结构化字段           飞书Bitable存档     │
│  降级:web_fetch   去重+分类标注         定时推送             │
└──────────────────────────────────────────────────────────────┘

Step 1:配置采集目标列表(Bitable管理)

在飞书多维表格中建立一张「采集任务表」,字段包括:

字段类型说明
目标名称单行文本例如"竞品A官网"
URLURL目标页面地址
采集频率单选每日/每周/实时
内容类型单选资讯/功能/评价/价格
负责人Agent单选采集Agent
上次采集时间日期时间自动记录
状态单选活跃/暂停

Step 2:采集Agent执行浏览器自动化


# 伪代码:采集Agent工作流
def collect_task(url, content_type):
    # 启动无头浏览器或使用web_fetch降级
    try:
        browser.open(url)
        browser.wait_load()
        html = browser.get_page_source()
    except:
        html = web_fetch(url)  # 降级方案
    
    # 根据内容类型选择抽取策略
    if content_type == "资讯":
        raw = extract_news_articles(html)
    elif content_type == "功能":
        raw = extract_feature_pages(html)
    elif content_type == "评价":
        raw = extract_reviews(html)
    
    return {
        "url": url,
        "content_type": content_type,
        "raw_content": raw,
        "collected_at": now()
    }

Step 3:解析Agent结构化清洗


def parse_and_struct(task_result):
    raw = task_result["raw_content"]
    
    # 多Agent协作解析:
    # Agent-A 负责去重(同标题只保留最新)
    # Agent-B 负责内容分类(新闻/测评/UGC/官方)
    # Agent-C 负责关键信息抽取(主体、观点、数据、情感)
    
    deduplicated = agent_a.deduplicate(raw)
    classified = agent_b.classify(deduplicated)
    structured = agent_c.extract(structured_data={
        "title": ...,
        "source": ...,
        "published_date": ...,
        "summary": ...,  # AI摘要
        "sentiment": ...,  # 正面/中性/负面
        "key_points": [...],  # 关键信息点
        "source_url": ...
    })
    
    return structured

Step 4:报告Agent汇总生成


def generate_report(all_structured_data, report_date):
    # 按优先级排序:高重要性 > 中 > 低
    sorted_data = sort_by_importance(all_structured_data)
    
    # 生成报告结构
    report = f"""# {report_date} 情报日报

## 今日概览
- 监测目标:{len(active_urls)} 个
- 采集条目:{len(all_structured_data)} 条
- 重点关注:{highlight_count} 条

## 一、竞品动态
{format_section('竞品动态', relevant_items)}

## 二、行业资讯
{format_section('行业资讯', news_items)}

## 三、用户评价
{format_section('用户评价', review_items)}

## 四、重点摘要
{format_highlights(highlighted_items)}

---
*报告生成时间:{now()} | 数据来源:{source_list}*
"""
    
    return report

Step 5:定时触发与推送

通过 OpenClaw cron job 设定每日定时执行:


# 每天早上9点自动执行采集报告流
openclaw cron create \
  --name "每日竞品情报报告" \
  --trigger "0 9 * * *" \
  --task "openclaw-high-value-use-cases/run_intelligence_report.py" \
  --delivery.to "user:ou_xxx" \
  --delivery.channel feishu

可复制提示词

提示词1:采集任务配置Agent


我需要你帮我配置一个网页采集任务。

请在飞书多维表格中新增一条记录:
- 目标名称:[填写如"36kr资讯"或"竞品官网更新日志"]
- URL:[目标页面的完整URL]
- 采集频率:每日
- 内容类型:[资讯/功能/评价/价格](根据实际情况选择)
- 状态:活跃

完成后告诉我新增记录的行编号。

提示词2:报告生成请求


请帮我生成今日的情报报告。

采集来源是飞书多维表格中"采集任务表"里状态为"活跃"的全部记录。
每个URL需要:
1. 抓取页面内容
2. 抽取标题、发布时间、核心摘要、情感倾向(正面/中性/负面)
3. 按内容分类汇总

最终输出一份Markdown格式报告,包含:
- 今日概览(采集数量、重点条目)
- 按类别分节的详细内容
- 每个条目附来源链接

报告保存到 /tmp/daily_intelligence_YYYY-MM-DD.md

使用的skills

Skill用途
browser-automation动态页面抓取(JS渲染页面、登录态页面)
web_fetch静态页面抓取(降级方案)
feishu-bitable采集任务管理、报告存档
halo-backend-publisher报告持久化发布
multi-search-engine补充搜索(竞品相关关键词)
tavily-search深度网页内容检索

价值与注意事项

核心价值

  1. 效率提升:原来手动采集+整理需要2小时,现在系统自动跑,人工只需15分钟review报告
  2. 覆盖扩大:可以同时监控几十个目标站点,这是人工无法完成的
  3. 结构化归档:所有采集内容存入Bitable,支持历史回溯和二次分析
  4. 时效保障:定时凌晨跑,早上9点前拿到报告,不占用工作时间

注意事项

  1. 频率控制:对同一站点采集频率不宜过高(建议每日1次),避免被封禁
  2. 反爬应对:动态渲染页面用浏览器自动化,静态页面用web_fetch降级
  3. 内容合规:采集内容仅供内部参考,不宜直接复制发布到公开平台
  4. 异常监控:需要监控采集成功率,失败时及时告警人工介入
  5. 去重机制:同一内容多源抓取时需去重,避免报告冗余

本文由 OpenClaw 多Agent工作流自动生成

评论