OpenClaw 有价值应用(2026-04-11):多Agent视频字幕提取与智能剪辑流——把长视频精华一键命中

OpenClaw 有价值应用(2026-04-11):多Agent视频字幕提取与智能剪辑流——把长视频精华一键命中

OpenClaw 有价值应用(2026-04-11):多Agent视频字幕提取与智能剪辑流——把长视频精华一键命中

场景演示

你是否有过这样的经历:

  • 花2小时看完了某场行业分享视频,回头却想不起核心观点
  • 需要把B站/YouTube视频精华整理成文章或摘要,手动打字累到崩溃
  • 想让AI帮忙提取视频内容,但不知道怎么让AI"看"视频

多Agent视频字幕提取与智能剪辑流正是解决这些痛点的利器。它利用 Whisper 语音识别 + 多Agent协作,把长视频的字幕提取、关键片段识别、内容摘要三个环节串联成全自动流水线,30分钟的视频,5分钟拿到可用的结构化笔记。

核心价值: 把"人盯屏幕"的视频笔记工作,变成"AI跑流、下班前拿报告"的自动化闭环。

Step by Step

第一步:环境准备

确保本地安装了 Whisper CLI(无需API key,纯本地运行):


pip install -U openai-whisper

同时确认 OpenClaw 已配置好转写 Skill:


openclaw skills list | grep whisper

第二步:提取视频音频

如果视频文件在本地,先用 ffmpeg 提取音频:


ffmpeg -i 视频文件.mp4 -vn -acodec pcm_s16le -ar 16000 -ac 1 音频.wav

如果是 B站/YouTube 等在线视频,用 yt-dlp 下载并提取:


yt-dlp -x --audio-format wav --audio-quality 0 -o "%(title)s.%(ext)s" "视频URL"

第三步:Whisper 转写(Agent A:转写员)

调用 Whisper 进行语音识别,输出带时间戳的文本:


whisper 音频.wav --model medium --language Chinese --output_format json --timestamp_norm

输出示例(JSON片段):


[
  {"start": 0.0, "end": 5.2, "text": "今天我们聊聊多Agent系统的设计原则。"},
  {"start": 5.2, "end": 12.8, "text": "第一个原则是单一职责,每个Agent只做一件事。"}
]

第四步:多Agent协作——分段摘要(Agent B:分析师)

将时间戳文本交给 Agent B,让它识别高价值片段:

提示词:


你是一个视频内容分析师。以下是一段视频的字幕(含时间戳),请:
1. 识别出最核心的3-5个观点或知识点(每个观点标注起止时间)
2. 每个观点用2-3句话概括核心内容
3. 输出格式:

## 核心观点

### 观点1:[标题]
- 时间:XX:XX - XX:XX
- 摘要:...

## 关键金句
- "..."

## 适合剪辑的精彩片段(3个)
1. XX:XX - XX:XX:...

第五步:多Agent协作——文章化输出(Agent C:编辑)

将分析结果交给 Agent C 生成结构化文章:

提示词:


你是一个专业的内容编辑。以下是一段视频的核心观点分析,请将其改写成一篇结构清晰的技术文章,包含:
1. 开头引言(1段)
2. 每个核心观点展开叙述(带小标题)
3. 总结与行动建议(1段)
4. 适合社交媒体分享的短文案(100字以内)

风格:专业但不晦涩,适当加入个人感受,段落长度适中。

第六步:自动分发(Agent D:发布官)

文章完成后,调用 halo-backend-publisher 自动发布到博客,或调用 feishu_doc 存入知识库。


可复制提示词

完整版提示词(将以下内容复制给 Agent 使用)

Agent B 提示词(视频分析师):


你是一个视频内容分析师。以下是一段视频的字幕(含时间戳),请:
1. 识别出最核心的3-5个观点或知识点(每个观点标注起止时间)
2. 每个观点用2-3句话概括核心内容
3. 标注语速较快、信息密度高的"高光片段"

输出格式:
## 核心观点
### 观点1:[标题]
- 时间:XX:XX - XX:XX
- 摘要:...

## 关键金句(3-5条)
- "..."

## 高光片段(语速快/信息密集,适合剪辑)
1. XX:XX - XX:XX:...

## 视频结构评分
- 信息密度:★×5
- 节奏把控:★×4
- 实用价值:★×5

Agent C 提示词(文章编辑):


你是一个专业的内容编辑。以下是一段视频的核心观点分析,请将其改写成一篇结构清晰的技术博客文章,包含:
1. 开头引言(引出视频主题,1段)
2. 每个核心观点展开叙述(带小标题,2-4段)
3. 实践建议(从视频中提炼的3条可操作建议)
4. 总结(1段)
5. 适合微博/小红书的短文案(100字以内)

风格:专业但不晦涩,有温度,段落长度适中,适合快速阅读。

使用的 Skills

Skill用途
openai-whisper本地语音转文字,无需API key
video-frames视频关键帧提取,辅助判断剪辑点
halo-backend-publisher自动发布文章到博客
feishu-doc存入飞书知识库
browser-automation自动下载在线视频
summarize对长文摘要做二次提炼

价值与注意事项

核心价值

  1. 省时间:30分钟视频→5分钟结构化笔记,人力零投入
  2. 可复用:输出可直接发布博客、存入知识库、生成PPT素材
  3. 跨平台:支持本地视频、B站、YouTube、播客等各类音视频源
  4. 多Agent协作:每个环节由专业Agent负责,质量比单一AI更高

注意事项

  1. Whisper 模型选择:中文视频建议用 mediumlarge 模型,识别准确率明显高于 base
  2. 音频质量:背景音乐嘈杂的视频,转写准确率会下降,建议先降噪处理
  3. 敏感内容:涉及隐私/机密的会议视频,请勿上传到第三方API,本地 Whisper 离线运行更安全
  4. 版权合规:提取他人视频内容做摘要和分享,请注明来源,仅做个人学习使用
  5. 时间戳归一化:Whisper 输出的是原始秒数,需要归一化后才能用于剪辑时间轴

小结: 多Agent视频字幕提取流把"看视频、记笔记、写文章"从串联手工操作变成了并联AI协作,是内容创作者和知识工作者提升信息处理效率的利器。下次看到好视频,别再傻傻盯着屏幕了——让AI替你看完、替你提炼、替你发布。
评论