video-use 完全指南:26k star,用 coding agent 把素材剪成片

📅 2026-09-23 · ☕ 9 分钟阅读

video-use 官方项目 banner
video-use 官方 banner(来源:browser-use/video-use 仓库 static/video-use-banner.png

剪辑软件的问题从来不是"功能不够",而是你得学会它:时间线、快捷键、轨道、导出预设。而 video-use 换了个思路——把原始素材丢进一个文件夹,跟你的 coding agent 说一句「把这些剪成一条发布视频」,然后拿回 final.mp4

它的官方说明第一句就是:Introducing video-use — edit videos with Claude Code. 100% open source. 截至 2026-09-23,项目在 GitHub 上有 26,123 star、3,136 fork,MIT 协议,主语言 Python;仓库创建于 2026-04-12,最近一次提交是 2026-08-30。

🔥 为什么 video-use 值得关注?

一、它到底做什么

官方 README 列出的能力清单很具体,都是剪辑里最费手的那几件事:

能力说明
去掉废话和空镜剪掉 ummuh、口误起头,以及两条 take 之间的死时间
自动调色每一段自动套调色(暖调电影感、中性锐利,或任意自定义 ffmpeg 链)
音频淡入淡出每个剪切点做 30ms 淡变,听不到爆音
烧制字幕按你的风格烧进画面,默认 2 词一组大写块,可完全自定义
生成动画叠加通过 HyperFrames / Remotion / Manim / PIL 生成;并行子 agent 执行,一条动画一个
自评渲染结果在每一个剪切边界检查渲染输出,过关才给你看
会话记忆写进 project.md,下次开工接着上次的上下文

支持的内容类型官方也点明了:口播(talking heads)、混剪、教程、旅行、访谈——不需要预设或菜单,它会先看你的素材再决定怎么剪。

二、核心设计:LLM 不"看"视频,而是"读"视频

这是整个项目最值得借鉴的地方。把视频喂给模型做剪辑,直觉做法是抽帧——但代价惊人,官方自己算过这笔账:

朴素做法:30,000 帧 × 1,500 tokens = 45M tokens 的噪声
video-use:12KB 文本 + 若干张按需生成的 PNG

它用两层信息替代逐帧:

timeline_view 合成图:胶片条、说话人轨、波形、逐词标签与静音间隔
timeline_view 的输出示意:胶片条 + 说话人轨(SPEAKER 0/1)+ 波形 + 逐词标签,并标出静音间隔(如 620ms / 880ms)作为候选剪切点。图源:video-use 官方仓库 static/timeline-view.svg

官方把这个思路类比得很准:就像 browser-use 给 LLM 结构化 DOM 而不是截图——只不过这次是给视频。

三、流水线

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ 有问题?修复并重渲(最多 3 次)

值得注意的细节:自评循环是对渲染后的成片timeline_view,逐个剪切边界检查——视觉跳变、音频爆音、字幕被遮挡都在这一步抓。只有通过后才给你预览。

另外,剪出来的结果是一份 EDL(编辑决策表)再交给渲染,而不是让模型直接操作时间线——这也是它能稳定复现、可回滚的原因。

四、5 条设计原则

官方自述的设计取舍

  1. 文本 + 按需视觉 — 不倾倒帧,转写稿才是主界面
  2. 音频优先,视觉跟随 — 剪切点来自语音边界和静音间隔
  3. 询问 → 确认 → 执行 → 自评 → 沉淀 — 策略没确认前绝不动刀
  4. 对内容类型零假设 — 先看、先问,再剪
  5. 12 条硬规则 + 其余交给品味 — 制作正确性不可协商,审美可以自由

五、安装:两种方式

方式一:让 agent 自己装(官方推荐)

README 直接给了一段可粘贴的 setup prompt,丢给 Claude Code、Codex、Hermes、Openclaw 或任何有 shell 权限的 agent 即可:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the
skill with whichever agent you're running under, and set up the ElevenLabs
API key — ask me to paste it when you need it. Then read SKILL.md for daily
usage, and always read helpers/ because that's where the editing scripts live.
After install, don't transcribe anything on your own — just tell me it's ready
and wait for me to drop footage into a folder.

Agent 会负责 clone、装依赖、注册 skill,并在需要时向你索要 ElevenLabs API key(在 elevenlabs.io 后台获取)。

方式二:手动安装

# 1. 克隆并软链到 agent 的 skills 目录
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. 装依赖
cd ~/Developer/video-use
uv sync                         # 或: pip install -e .
brew install ffmpeg             # 必需
brew install yt-dlp             # 可选,用于下载在线素材

# 3. 配置 ElevenLabs API key
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

六、日常用法

把 agent 指向素材文件夹,然后正常开工:

cd /path/to/your/videos
claude    # 或 codex、hermes 等

会话里直接说需求:

edit these into a launch video

它会先盘点素材、提出剪辑策略、等你确认,然后产出 edit/final.mp4。所有输出都落在 <videos_dir>/edit/ 下,skill 目录保持干净。

想让它常驻(比如从自己的 VPS 或 Telegram 触发),官方建议跑在 Browser Use Box 上;官方还放了一条 15 秒演示

七、优点与注意事项

👍 优点

  • 输入自己的素材、输出真实剪辑,不是"AI 生成视频"
  • 去口头禅 / 静音、调色、淡变、字幕一次搞定
  • 自评 + 最多 3 次重渲,明显减少人工返工
  • 不逐帧喂模型,token 成本结构合理
  • MIT 开源,可读全部编辑脚本(helpers/)
  • 能挂在 OpenClaw / Claude Code / Codex 上,不锁死单一 agent

👎 注意

  • 依赖 ElevenLabs 转写服务,需要申请 API key(第三方付费服务,非项目自带)
  • 必须装 ffmpeg;安装命令以 macOS 的 brew 为主,Windows 需自行替换
  • 仓库最近提交是 2026-08-30,发布节奏偏"实验性",生产使用建议锁定版本
  • 它是个 agent 技能仓库(skill),不是能 pip install 就用完的库——使用体验取决于你挂的 agent
  • 没有官方网站,文档即 README + SKILL.md + helpers/ 源码

🎯 总结

video-use 的价值是把"剪辑"从一门手艺变成一段对话,而且它选对了实现路径——用转写稿当模型的输入、用 EDL 当中间产物、用自评保证质量。如果你已经在用 coding agent 干活,又常拍口播或教程视频,它会省掉你大量拉时间线的时间。唯一要提前想清楚的是 ElevenLabs 的成本,以及别指望它替你决定"剪得好不好"——审美那部分,官方明说留给你。

FAQ

Q: video-use 是"AI 生成视频"吗?

不是。它不生成画面,而是对你提供的原始素材做剪辑:去废话、调色、加字幕、加动画叠加、自评后导出 final.mp4

Q: 必须用 Claude Code 吗?

不必须。官方 README 明确列出 Claude Code、Codex、Hermes、Openclaw 以及任何有 shell 权限的 agent;本质上它是一组脚本 + 技能说明(SKILL.md + helpers/),由 agent 来调用。

Q: 需要付费吗?

项目本身 MIT 开源免费。但它依赖 ElevenLabs 的转写(Scribe)来拿到逐词时间戳,那部分需要你自己申请 API key,费用按 ElevenLabs 计费走。官方也提供了 Browser Use Cloud / Box 的托管方式(可选)。

Q: 剪辑结果在哪?

统一在 <你的素材目录>/edit/final.mp4,不会往 skill 目录里写东西。

Q: 能处理多长的视频?

它的设计是"每段素材单独转写再打包",因此长素材主要是转写成本和时间的问题;README 未给出硬性时长上限,实际表现取决于你的素材数量和 ElevenLabs 配额。

Q: 它能保证成片质量吗?

它保证的是制作正确性——剪切点无跳变/爆音、字幕不被挡、结构连续,这部分靠自评循环兜底。至于节奏和审美,官方把它归为"不协商之外的自由",由你拍板。

📌 相关阅读:Univer 完全指南:开源 Office SDK · Chatwoot 完全指南:开源客服系统 · witr 完全指南:进程溯源工具