OpenClaw 有价值应用(2026-04-11):多Agent视频字幕提取与智能剪辑流——把长视频精华一键命中
场景演示
你是否有过这样的经历:
- 花2小时看完了某场行业分享视频,回头却想不起核心观点
- 需要把B站/YouTube视频精华整理成文章或摘要,手动打字累到崩溃
- 想让AI帮忙提取视频内容,但不知道怎么让AI"看"视频
多Agent视频字幕提取与智能剪辑流正是解决这些痛点的利器。它利用 Whisper 语音识别 + 多Agent协作,把长视频的字幕提取、关键片段识别、内容摘要三个环节串联成全自动流水线,30分钟的视频,5分钟拿到可用的结构化笔记。
核心价值: 把"人盯屏幕"的视频笔记工作,变成"AI跑流、下班前拿报告"的自动化闭环。
Step by Step
第一步:环境准备
确保本地安装了 Whisper CLI(无需API key,纯本地运行):
pip install -U openai-whisper
同时确认 OpenClaw 已配置好转写 Skill:
openclaw skills list | grep whisper
第二步:提取视频音频
如果视频文件在本地,先用 ffmpeg 提取音频:
ffmpeg -i 视频文件.mp4 -vn -acodec pcm_s16le -ar 16000 -ac 1 音频.wav
如果是 B站/YouTube 等在线视频,用 yt-dlp 下载并提取:
yt-dlp -x --audio-format wav --audio-quality 0 -o "%(title)s.%(ext)s" "视频URL"
第三步:Whisper 转写(Agent A:转写员)
调用 Whisper 进行语音识别,输出带时间戳的文本:
whisper 音频.wav --model medium --language Chinese --output_format json --timestamp_norm
输出示例(JSON片段):
[
{"start": 0.0, "end": 5.2, "text": "今天我们聊聊多Agent系统的设计原则。"},
{"start": 5.2, "end": 12.8, "text": "第一个原则是单一职责,每个Agent只做一件事。"}
]
第四步:多Agent协作——分段摘要(Agent B:分析师)
将时间戳文本交给 Agent B,让它识别高价值片段:
提示词:
你是一个视频内容分析师。以下是一段视频的字幕(含时间戳),请:
1. 识别出最核心的3-5个观点或知识点(每个观点标注起止时间)
2. 每个观点用2-3句话概括核心内容
3. 输出格式:
## 核心观点
### 观点1:[标题]
- 时间:XX:XX - XX:XX
- 摘要:...
## 关键金句
- "..."
## 适合剪辑的精彩片段(3个)
1. XX:XX - XX:XX:...
第五步:多Agent协作——文章化输出(Agent C:编辑)
将分析结果交给 Agent C 生成结构化文章:
提示词:
你是一个专业的内容编辑。以下是一段视频的核心观点分析,请将其改写成一篇结构清晰的技术文章,包含:
1. 开头引言(1段)
2. 每个核心观点展开叙述(带小标题)
3. 总结与行动建议(1段)
4. 适合社交媒体分享的短文案(100字以内)
风格:专业但不晦涩,适当加入个人感受,段落长度适中。
第六步:自动分发(Agent D:发布官)
文章完成后,调用 halo-backend-publisher 自动发布到博客,或调用 feishu_doc 存入知识库。
可复制提示词
完整版提示词(将以下内容复制给 Agent 使用)
Agent B 提示词(视频分析师):
你是一个视频内容分析师。以下是一段视频的字幕(含时间戳),请:
1. 识别出最核心的3-5个观点或知识点(每个观点标注起止时间)
2. 每个观点用2-3句话概括核心内容
3. 标注语速较快、信息密度高的"高光片段"
输出格式:
## 核心观点
### 观点1:[标题]
- 时间:XX:XX - XX:XX
- 摘要:...
## 关键金句(3-5条)
- "..."
## 高光片段(语速快/信息密集,适合剪辑)
1. XX:XX - XX:XX:...
## 视频结构评分
- 信息密度:★×5
- 节奏把控:★×4
- 实用价值:★×5
Agent C 提示词(文章编辑):
你是一个专业的内容编辑。以下是一段视频的核心观点分析,请将其改写成一篇结构清晰的技术博客文章,包含:
1. 开头引言(引出视频主题,1段)
2. 每个核心观点展开叙述(带小标题,2-4段)
3. 实践建议(从视频中提炼的3条可操作建议)
4. 总结(1段)
5. 适合微博/小红书的短文案(100字以内)
风格:专业但不晦涩,有温度,段落长度适中,适合快速阅读。
使用的 Skills
| Skill | 用途 |
|---|---|
openai-whisper | 本地语音转文字,无需API key |
video-frames | 视频关键帧提取,辅助判断剪辑点 |
halo-backend-publisher | 自动发布文章到博客 |
feishu-doc | 存入飞书知识库 |
browser-automation | 自动下载在线视频 |
summarize | 对长文摘要做二次提炼 |
价值与注意事项
核心价值
- 省时间:30分钟视频→5分钟结构化笔记,人力零投入
- 可复用:输出可直接发布博客、存入知识库、生成PPT素材
- 跨平台:支持本地视频、B站、YouTube、播客等各类音视频源
- 多Agent协作:每个环节由专业Agent负责,质量比单一AI更高
注意事项
- Whisper 模型选择:中文视频建议用
medium或large模型,识别准确率明显高于base - 音频质量:背景音乐嘈杂的视频,转写准确率会下降,建议先降噪处理
- 敏感内容:涉及隐私/机密的会议视频,请勿上传到第三方API,本地 Whisper 离线运行更安全
- 版权合规:提取他人视频内容做摘要和分享,请注明来源,仅做个人学习使用
- 时间戳归一化:Whisper 输出的是原始秒数,需要归一化后才能用于剪辑时间轴
小结: 多Agent视频字幕提取流把"看视频、记笔记、写文章"从串联手工操作变成了并联AI协作,是内容创作者和知识工作者提升信息处理效率的利器。下次看到好视频,别再傻傻盯着屏幕了——让AI替你看完、替你提炼、替你发布。