Claude Code 自动化剪辑工作流
落盘:Drafts/Daily/T3-009-Claude-Code自动化剪辑工作流/ 基于既有调研笔记扩写为 T3 场景工作流母版 先说结论 阶段 工具/动作
Gana · 2026-08-23 · 18 分钟阅读落盘:
Drafts/Daily/T3-009-Claude-Code自动化剪辑工作流/基于既有调研笔记扩写为 T3 场景工作流母版
先说结论
| 阶段 | 工具/动作 | 产出 | 耗时 | 成本口径 |
|---|---|---|---|---|
| ① 准备 | 环境与权限 | 可运行环境 | 0.5–2 h | 以文档为准 |
| ② 主链路 | 见下文 | 核心半成品 | 按任务 | API/订阅 |
| ③ 人审 | 人工 | 可发布物 | 必要 | — |
| ④ 复盘 | 记录 | 退出条件 | 15 min | — |
全景图
[输入] → [主工具链] → [人审] → [发布/归档]
📷 配图待补:全景(
images/t3-009-schematic.png)
素材原文要点(保留)
title: "基于 Claude Code 的自动化剪辑工作流"
slug: claude-code-自动化剪辑
date: 2026-06-15
updated: 2026-06-16
tags: [Claude Code, 视频剪辑, 工作流, Agent]
categories: [AI工具]
summary: "videocut-skills 是基于 Claude Code Skills 的视频剪辑 Agent,专为口播视频设计。利用 Claude 的语义理解能力识别口误/重复/卡顿,配合火山引擎 ASR 实现转录和智能剪辑。2k Stars,MIT 协议。"
focus_keyword: "Claude Code 自动化剪辑"
source: https://github.com/Ceeon/videocut-skills
author: "Ceeon"
status: draft
基于 Claude Code 的自动化剪辑工作流
用语义理解替代模式匹配,AI 审核口播问题(静音/口误/重复) | 2k Stars | MIT | Claude Code Skill
这是什么
videocut-skills 是一套基于 Claude Code Skills 构建的视频剪辑 Agent,专门为口播类视频设计。作者 Ceeon 因为剪映「智能剪口播」有两个痛点——无法理解语义(识别不出重复说和说错后纠正的句子)以及字幕质量差(专业术语经常识别错误)——而开发了这个项目。
它的核心思路是用 Claude 的语义理解能力分析口播内容,再结合火山引擎 ASR 做字级别时间戳转录,最终生成一个审核网页供人工确认后由 FFmpeg 执行剪辑。一次 19 分钟的口播原片,系统可自动识别 608 处问题(静音 114 处 + 口误/重复 494 处)。
与剪映「智能剪口播」的核心差异:videocut-skills 的理解能力来自大语言模型而非规则匹配,能识别"同一个意思反复说""说错了立刻纠正""卡顿后重新组织语言"等复杂语义场景。此外还支持自定义专业术语词典、自更新偏好记忆(告诉 AI"静音阈值改成 1 秒"后它记住并应用)、以及 2-pass 编码高清导出。
适合谁 / 不适合谁
| 人群 | 是否推荐 | 原因 |
|---|---|---|
| 高频产出视频的创作者/UP 主 | ✅ 推荐 | 自动识别口误和重复,大幅减少手动剪辑时间 |
| 录制课程/讲座的教育者 | ✅ 推荐 | 长课程口播中的卡顿和重复自动标记 |
| 已有 Claude Code 环境的用户 | ✅ 推荐 | 零额外软件成本,Skills 即装即用 |
| 非口播类视频创作者 | ⚠️ 酌情 | 工具专为「说话类」视频设计,素材混剪/特效类不适用 |
| 无火山引擎 API 的用户 | ⚠️ 酌情 | 转录依赖火山引擎 ASR,需注册并获取 API Key |
| 对剪辑精度要求极高(逐帧编辑)的用户 | ❌ 不推荐 | 基于时间戳的剪辑精度在毫秒级而非逐帧级 |
安装与前置条件
- Claude Code CLI 已安装
- Python 3.8+(运行 FunASR 和 Whisper)
- FFmpeg(音视频处理)
- Node.js 18+(运行审核服务器脚本)
- 火山引擎 API Key(语音转录)
- 模型下载:FunASR 约 2GB,Whisper large-v3 约 3GB
# 克隆到 Claude Code skills 目录
git clone https://github.com/Ceeon/videocut-skills.git ~/.claude/skills/videocut
# 配置 API Key
cd ~/.claude/skills/videocut
cp .env.example .env
# 编辑 .env,填入火山引擎 API Key
# 安装环境(在 Claude Code 中执行)
# /videocut:安装
核心用法
完整工作流
┌─────────────────────────────────────────────┐
│ /videocut:安装 │
│ 首次使用,安装 Python/FFmpeg 和 AI 模型 │
└─────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────┐
│ /videocut:剪口播 视频.mp4 │
│ 1. 提取音频 → 上传火山引擎 │
│ 2. 火山引擎转录 → 字级别时间戳 │
│ 3. Claude AI 审核:静音/口误/重复/语气词 │
│ 4. 生成审核网页 → 浏览器打开 │
└─────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────┐
│ 【人工审核 + 执行剪辑】 │
│ - 单击跳转播放 │
│ - 双击选中/取消 │
│ - Shift 拖动多选 │
│ - 确认后点击「执行剪辑」→ FFmpeg 自动剪辑 │
└─────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────┐
│ /videocut:字幕 │
│ - Whisper 转录 + 词典纠错 │
│ - 人工确认 → 烧录字幕 │
└─────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────┐
│ /videocut:高清化 (可选) │
│ - 2-pass 编码 + 锐化 │
│ - 自动匹配原片参数,码率 1.2x │
└─────────────────────────────────────────────┘
Skill 清单
| Skill | 功能 | 输入 | 输出 |
|---|---|---|---|
安装 |
环境准备 | 无 | 安装日志 |
剪口播 |
转录 + AI 审核 + 剪辑 | 视频文件 | 剪辑后视频 |
高清化 |
2-pass + 锐化导出 | 视频文件 | 高清视频 |
字幕 |
生成字幕 | 视频文件 | 带字幕视频 |
自更新 |
记录偏好 | 用户反馈 | 更新规则文件 |
自定义词典
编辑 字幕/词典.txt,每行一个词:
Claude Code
MCP
API
注意事项与风险
- 火山引擎 API 费用:语音转录按调用量计费,长视频需注意成本
- 模型首次下载大:FunASR (~2GB) + Whisper large-v3 (~3GB) 首次下载耗时较长
- 审核网页端口:默认 8899,如果被占用需释放或修改
- 音画同步:使用 filter_complex + trim 而非 concat demuxer 来避免剪辑后音画不同步
- 项目更新频率:仅 18 次提交,核心功能稳定但迭代不频繁
与你现有工具的关系
- 与 [[Claude Code Humanizer:用 Claude Code Humanizer 提升文章可读性]] 同属 Claude Code Skills 生态,可组合使用
- 与 [[纯前端音视频转文字:浏览器端讯飞 API 长音频识别]] 互补:前者做内容识别转录,本工具做智能剪辑
- 剪辑后的素材可作为 [[../02-内容创作媒体/Toonflow:开源 AI 短剧生成工具]] 的输入素材
FAQ
Q: 和剪映「智能剪口播」相比有什么优势?
A: 剪映基于模式匹配,无法理解语义。videocut-skills 用 Claude 分析语义,能识别"重复说""说错后纠正""卡顿后重组"等复杂场景。此外支持自定义词典,专业术语识别更准确。
Q: 火山引擎转录超时怎么办?
A: 上传音频时使用 uguu.se(脚本默认),避免 catbox.moe(火山引擎访问慢)。
Q: 审核网页打不开?
A: 检查端口 8899 是否被占用:lsof -i :8899。
Q: 剪辑后音画不同步?
A: 脚本已通过 filter_complex + trim 处理此问题。如果仍有问题,检查源视频编码是否使用可变帧率(VFR)。
Q: 如何让 AI 记住我的剪辑偏好?
A: 使用 /videocut:自更新 命令,告诉 AI 例如"静音阈值改成 1 秒"或"保留适量嗯作为过渡",它会记录在规则文件中持续生效。
相关链接
- 来源:https://www.ahhhhfs.com/79181/
- GitHub:https://github.com/Ceeon/videocut-skills
- 火山引擎语音识别:https://console.volcengine.com/
完整工作流复盘
| 阶段 | 工具 | 产出 | 耗时 | 成本 |
|---|---|---|---|---|
| 准备 | 官方安装包/CLI | 环境 | — | — |
| 执行 | 主工具链 | 半成品 | — | 按量 |
| 人审 | 人工 | 终稿 | — | — |
成本对比
| 项目 | 传统手工 | 本工作流 |
|---|---|---|
| 时间 | 更长的重复劳动 | 重复段可脚本化 |
| 金钱 | 人力为主 | 工具+API |
| 风险 | 遗漏步骤 | 脚本错误需告警 |
适合谁 / 不适合谁
✅ 愿意按文档配置、接受人审的人
❌ 要零配置一键商业终稿的人
一句话总结
把 Claude Code/Obsidian 类能力当成工序配件:能加速重复段,不能代替选题与人审。
🔗 以文内仓库与官网为准;Lovart https://www.lovart.ai/ 和 Lovart中文版: https://www.lovart.art 可作视觉互补。
周更落地节奏(T3-009 通用)
周一:锁场景与退出条件
写清本周只要哪一个成果(例如「3 条可发短视频」或「10 个 SKU 主图」),以及什么情况下停用某工具。
周二:跑通最小链路
只跑最短路径,不加花活。成功标准写在纸上:输入是什么、输出文件叫什么、谁人审。
周三至周四:资产化
把可复用的 Brand Kit、主体、提示词摘要、n8n 工作流导出备份。资产不留下,周末等于重装。
周五:人审与分发
事实、侵权、平台规则三问。过不了就降级内部样片。
周末:复盘一页纸
成本、失败点、是否触发换栈。工具会变,节奏可以不变。
Lovart 负责视觉方案/定妆发散,LibTV 负责视频编排与主体复用,Liblib 负责灵感与模型社区——三者按环节出现,不互相抢职责。开源环节(n8n/Postiz/Rembg 等)负责可控与自托管。金额与套餐以官网为准,本稿不编造测速榜。
补充说明(2):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。
补充说明(3):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。
补充说明(4):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。
补充说明(5):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。
补充说明(6):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。
补充说明(7):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。
补充说明(8):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。
场景里的人味与边界
我写工作流文时,最怕两种读者误会:一是以为串完工具就等于有了创意;二是以为成本表里的「小时级」包含了你盯着空白选题发呆的下午。真实情况是:工具只吃掉重复劳动,吃不掉判断。
所以每个 T3 我都会给自己留三句不好听的话:
- 没有人审的自动化,是加速度事故。
- 没有退出条件的工具栈,只会单向变胖。
- Lovart / LibTV / Liblib 有分工:视觉方案、视频编排、灵感社区——抢职责就会两头不靠谱。
如果你的团队还在争论「要不要再加一个神器」,先问:它替换的是哪一个已有环节?替换不了就别加。
失败演练(建议真做一次)
挑一条低风险内容,故意制造一次失败:关掉 API Key、传错尺寸、Postiz 绑错测试号。看 n8n 会不会叫、人审能不能拦、回滚要几分钟。演练不过关,就不要上主号。
资产清单(周五必须留下)
- Brand Kit / 主体参考 / 提示词摘要
- n8n 工作流导出
- 发布状态表(draft/review/approved/published)
- 本周成本小计(订阅 + 按量)
没有这份清单,下周你还会从头安装宇宙。
落地补充(1):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。
落地补充(2):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。
落地补充(3):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。
落地补充(4):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。
落地补充(5):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。
落地补充(6):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。
BLOCK 自检(T3-009)
- [x] 多工具串联解决一个完整场景问题
- [x] 含结论总表 / 全景或阶段结构
- [x] 含成本对比(传统 vs AI)
- [x] 有适合/不适合或等价边界
- [x] 配图为待补 callout 或可访问图(无 IMAGE_BRIEF 断链)
- [x] 未走 lovart-review / Sanity Blog
- [ ] 实拍工作流截图待补