AI 视频剪辑 Skill 分享「video-use」
https://github.com/browser-use/video-use
@browser_use 团队推出的开源 Skill,定位为面向 AI Coding Agents(Codex、Claude Code、Cursor、Hermes Agent 等)的视频剪辑 Skill。它不做传统意义上的 Premiere / CapCut 替代品,它是一套让 LLM 通过 “阅读转写文本 + 按需可视化” 来理解视频、并调用 ffmpeg 等工具完成剪辑的 prompt-engineering + 工具脚本集合。
核心思想:LLM 不“看”视频,它“读”视频
第一层:音频转写文本(always loaded)
通过 ElevenLabs Scribe 获得逐词时间戳、说话人分离、音频事件标记(如笑声、叹息、掌声),打包成约 12KB 的 takes_packed.md。这是 LLM 的主要“阅读材料”。
第二层:视觉时间线视图(on demand)
仅在决策点(歧义停顿、重拍对比、切点校验)调用 timeline_view.py 生成胶片帧 + 波形 + 字幕的 PNG 复合图。
对比朴素方案“30000 帧 × 1500 tokens = 4500 万 tokens 噪声”,项目走的是 “12KB 文本 + 少量 PNG” 的轻量化路径。这与 Browser Use 让 LLM 读结构化 DOM 而非直接看截图的思路一致。
技术流水线:Transcribe → Pack → Reason → EDL → Render → Self-Eval
- 转写 - transcribe. py / transcribe_batch.py
提取 16kHz 单声道音频,调用 ElevenLabs Scribe,缓存为 transcripts/<name>.json
- 打包 - pack_transcripts.py
将逐词 JSON 合并为按 0.5s 静音或说话人切换断句的 takes_packed.md
- 决策 - LLM 自身
阅读 packed transcript,必要时用 timeline_view.py 可视化
- 生成 EDL - subagents…