📅 2026-09-23 · ☕ 9 分钟阅读
static/video-use-banner.png)剪辑软件的问题从来不是"功能不够",而是你得学会它:时间线、快捷键、轨道、导出预设。而 video-use 换了个思路——把原始素材丢进一个文件夹,跟你的 coding agent 说一句「把这些剪成一条发布视频」,然后拿回 final.mp4。
它的官方说明第一句就是:Introducing video-use — edit videos with Claude Code. 100% open source. 截至 2026-09-23,项目在 GitHub 上有 26,123 star、3,136 fork,MIT 协议,主语言 Python;仓库创建于 2026-04-12,最近一次提交是 2026-08-30。
官方 README 列出的能力清单很具体,都是剪辑里最费手的那几件事:
| 能力 | 说明 |
|---|---|
| 去掉废话和空镜 | 剪掉 umm、uh、口误起头,以及两条 take 之间的死时间 |
| 自动调色 | 每一段自动套调色(暖调电影感、中性锐利,或任意自定义 ffmpeg 链) |
| 音频淡入淡出 | 每个剪切点做 30ms 淡变,听不到爆音 |
| 烧制字幕 | 按你的风格烧进画面,默认 2 词一组大写块,可完全自定义 |
| 生成动画叠加 | 通过 HyperFrames / Remotion / Manim / PIL 生成;并行子 agent 执行,一条动画一个 |
| 自评渲染结果 | 在每一个剪切边界检查渲染输出,过关才给你看 |
| 会话记忆 | 写进 project.md,下次开工接着上次的上下文 |
支持的内容类型官方也点明了:口播(talking heads)、混剪、教程、旅行、访谈——不需要预设或菜单,它会先看你的素材再决定怎么剪。
这是整个项目最值得借鉴的地方。把视频喂给模型做剪辑,直觉做法是抽帧——但代价惊人,官方自己算过这笔账:
朴素做法:30,000 帧 × 1,500 tokens = 45M tokens 的噪声
video-use:12KB 文本 + 若干张按需生成的 PNG
它用两层信息替代逐帧:
(laughter)、(applause)、(sigh))。所有 take 打包进一个约 12KB 的 takes_packed.md,这就是 LLM 的主要"阅读界面"。timeline_view 能为任意时间区间生成一张合成 PNG:胶片条 + 波形 + 逐词标签。只在需要判断时调用——模糊的停顿、重拍对比、剪切点复核。timeline_view 的输出示意:胶片条 + 说话人轨(SPEAKER 0/1)+ 波形 + 逐词标签,并标出静音间隔(如 620ms / 880ms)作为候选剪切点。图源:video-use 官方仓库 static/timeline-view.svg。官方把这个思路类比得很准:就像 browser-use 给 LLM 结构化 DOM 而不是截图——只不过这次是给视频。
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ 有问题?修复并重渲(最多 3 次)
值得注意的细节:自评循环是对渲染后的成片跑 timeline_view,逐个剪切边界检查——视觉跳变、音频爆音、字幕被遮挡都在这一步抓。只有通过后才给你预览。
另外,剪出来的结果是一份 EDL(编辑决策表)再交给渲染,而不是让模型直接操作时间线——这也是它能稳定复现、可回滚的原因。
README 直接给了一段可粘贴的 setup prompt,丢给 Claude Code、Codex、Hermes、Openclaw 或任何有 shell 权限的 agent 即可:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the
skill with whichever agent you're running under, and set up the ElevenLabs
API key — ask me to paste it when you need it. Then read SKILL.md for daily
usage, and always read helpers/ because that's where the editing scripts live.
After install, don't transcribe anything on your own — just tell me it's ready
and wait for me to drop footage into a folder.
Agent 会负责 clone、装依赖、注册 skill,并在需要时向你索要 ElevenLabs API key(在 elevenlabs.io 后台获取)。
# 1. 克隆并软链到 agent 的 skills 目录
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. 装依赖
cd ~/Developer/video-use
uv sync # 或: pip install -e .
brew install ffmpeg # 必需
brew install yt-dlp # 可选,用于下载在线素材
# 3. 配置 ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
把 agent 指向素材文件夹,然后正常开工:
cd /path/to/your/videos
claude # 或 codex、hermes 等
会话里直接说需求:
edit these into a launch video
它会先盘点素材、提出剪辑策略、等你确认,然后产出 edit/final.mp4。所有输出都落在 <videos_dir>/edit/ 下,skill 目录保持干净。
想让它常驻(比如从自己的 VPS 或 Telegram 触发),官方建议跑在 Browser Use Box 上;官方还放了一条 15 秒演示。
pip install 就用完的库——使用体验取决于你挂的 agentvideo-use 的价值是把"剪辑"从一门手艺变成一段对话,而且它选对了实现路径——用转写稿当模型的输入、用 EDL 当中间产物、用自评保证质量。如果你已经在用 coding agent 干活,又常拍口播或教程视频,它会省掉你大量拉时间线的时间。唯一要提前想清楚的是 ElevenLabs 的成本,以及别指望它替你决定"剪得好不好"——审美那部分,官方明说留给你。
不是。它不生成画面,而是对你提供的原始素材做剪辑:去废话、调色、加字幕、加动画叠加、自评后导出 final.mp4。
不必须。官方 README 明确列出 Claude Code、Codex、Hermes、Openclaw 以及任何有 shell 权限的 agent;本质上它是一组脚本 + 技能说明(SKILL.md + helpers/),由 agent 来调用。
项目本身 MIT 开源免费。但它依赖 ElevenLabs 的转写(Scribe)来拿到逐词时间戳,那部分需要你自己申请 API key,费用按 ElevenLabs 计费走。官方也提供了 Browser Use Cloud / Box 的托管方式(可选)。
统一在 <你的素材目录>/edit/final.mp4,不会往 skill 目录里写东西。
它的设计是"每段素材单独转写再打包",因此长素材主要是转写成本和时间的问题;README 未给出硬性时长上限,实际表现取决于你的素材数量和 ElevenLabs 配额。
它保证的是制作正确性——剪切点无跳变/爆音、字幕不被挡、结构连续,这部分靠自评循环兜底。至于节奏和审美,官方把它归为"不协商之外的自由",由你拍板。
📌 相关阅读:Univer 完全指南:开源 Office SDK · Chatwoot 完全指南:开源客服系统 · witr 完全指南:进程溯源工具