场景演示
提示词上线了,效果"好像还行"——但没人知道它哪天开始悄悄衰减。
你经历过这些吗?
- 上线第一天回答准确率 85%,一个月后掉到 61%,业务方抱怨"AI变笨了"
- 用户开始绕过 AI 走人工,客服说"那个 AI 答非所问"
- 同样的 prompt 给不同 Agent 用,效果参差不齐,不知道谁的版本是最好的
本质问题不是 AI 变笨,而是没有人持续测量提示词的性能。
今天介绍一个多Agent自动化流水线:多Agent提示词性能监控与自优化流,它做的事情很简单——持续监控、自动告警、驱动优化,让提示词从"上线即遗忘"变成"系统自驱进化"。
Step by Step
整体架构
┌─────────────────────────────────────────────────────────┐
│ 提示词性能监控与自优化中枢 │
│ │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌──────────┐
│ │ 定时触发 │──▶│ 测试执行 │──▶│ 数据写入 │──▶│ 趋势分析 │
│ │ Agent │ │ Agent │ │ Agent │ │ Agent │
│ └──────────┘ └──────────┘ └──────────┘ └──────────┘
│ │ │
│ ▼ ▼
│ ┌──────────────┐ ┌──────────────┐
│ │ 飞书 Bitable │ │ 告警推送 │
│ │ 记录趋势 │ │ Agent │
│ └──────────────┘ └──────────────┘
└─────────────────────────────────────────────────────────┘
Step 1:建立性能基线
用飞书多维表格(Bitable)建立提示词性能档案,每行一条提示词,包含字段:
| 字段 | 说明 |
|---|---|
| 提示词名称 | 如"客服分诊v2.1" |
| 测试集 | 20条标准Q&A对 |
| 期望准确率 | 如 ≥80% |
| 当前准确率 | 最新测量值 |
| 趋势 | 7日趋势图(↑↓→) |
| 最后测量时间 | 自动更新 |
| 状态 | 正常 / 预警 / 需优化 |
Step 2:部署定时测量Agent
每24小时自动触发,执行逻辑:
- 读取 Bitable 中所有"启用监控"的提示词
- 逐条将测试集Q&A喂给目标Agent
- 比对回答与标准答案,计算准确率
- 写入 Bitable,更新"当前准确率"和"最后测量时间"
- 若准确率低于阈值,触发告警
Agent间协作方式:
测量执行Agent负责执行测试集数据写入Agent负责读写 Bitable告警分发Agent负责发飞书消息给负责人
Step 3:趋势分析与自优化触发
当连续3次测量准确率持续下跌,自动触发优化流程:
- 分析最近10次失败案例,提取失败模式
- 生成优化建议(改写提示词/增加示例/调整温度参数)
- 在 Bitable 创建"待审核优化案"记录
- 推送消息给提示词owner确认
- 确认后自动更新版本号
可复制提示词
提示词性能测量Prompt(用于测量Agent)
你是一个提示词性能评估专家。请对以下提示词进行性能测试:
## 待测提示词
{input_prompt}
## 测试集
{test_cases}
## 评估标准
对于每条测试问题,判断Agent回答是否满足以下标准:
- 准确(直接回答问题,无幻觉)
- 相关(不答非所问)
- 完整(关键信息不遗漏)
## 输出格式(JSON)
{
"total": 20,
"passed": 16,
"accuracy": 0.80,
"failures": [
{"question": "问题内容", "expected": "期望回答", "actual": "实际回答", "failure_type": "幻觉/不相关/不完整"}
]
}
请逐一评估并返回JSON结果。
提示词优化Prompt(用于优化Agent)
基于以下性能测试失败案例,分析提示词 {input_prompt} 的问题并给出优化版本:
## 最近失败案例
{failure_cases}
## 当前准确率
{current_accuracy}
## 优化要求
1. 保持原意不变
2. 解决失败案例中的共性问题
3. 增加必要的 Few-shot 示例
4. 明确输出格式要求
## 输出
直接输出优化后的完整提示词(不加解释)
使用的Skills
| Skill | 用途 |
|---|---|
tavily-search / multi-search-engine | 搜索提示词优化最佳实践 |
feishu-bitable | 存储性能数据、趋势记录 |
feishu_chat | 告警推送 |
| 飞书定时任务 / Cron | 定时触发测量 |
价值与注意事项
核心价值
- 量化可见:把提示词质量从"感觉"变成"数字",让团队对AI效果有共识
- 主动发现:不用等业务方投诉,衰减超过阈值系统自动告警
- 持续进化:优化案确认后自动更新版本,性能持续追踪
- 团队协作:不同Agent负责不同环节,可独立扩展
注意事项
- 测试集要维护:测试集本身也要定期更新,防止"刷题过拟合"
- 阈值要合理:不同场景准确率基线不同,客服类建议≥75%,专业领域建议≥85%
- 多Agent版本对齐:同一提示词可能多个Agent用,确保测试的是"生产环境实际版本"
- 不要过度优化:准确率到95%以上继续追收益递减,不如投入新场景
如果你有多条提示词在跑,欢迎试试这套流水线。核心思路是:测量是一切优化的前提,看不见就无法改。