AI 创作

Claude Code 自动化剪辑工作流

落盘:Drafts/Daily/T3-009-Claude-Code自动化剪辑工作流/ 基于既有调研笔记扩写为 T3 场景工作流母版 先说结论 阶段 工具/动作

Gana · 2026-08-23 · 18 分钟阅读

落盘:Drafts/Daily/T3-009-Claude-Code自动化剪辑工作流/

基于既有调研笔记扩写为 T3 场景工作流母版


先说结论

阶段 工具/动作 产出 耗时 成本口径
① 准备 环境与权限 可运行环境 0.5–2 h 以文档为准
② 主链路 见下文 核心半成品 按任务 API/订阅
③ 人审 人工 可发布物 必要
④ 复盘 记录 退出条件 15 min

全景图

[输入] → [主工具链] → [人审] → [发布/归档]

📷 配图待补:全景(images/t3-009-schematic.png


素材原文要点(保留)


title: "基于 Claude Code 的自动化剪辑工作流"
slug: claude-code-自动化剪辑
date: 2026-06-15
updated: 2026-06-16
tags: [Claude Code, 视频剪辑, 工作流, Agent]
categories: [AI工具]
summary: "videocut-skills 是基于 Claude Code Skills 的视频剪辑 Agent,专为口播视频设计。利用 Claude 的语义理解能力识别口误/重复/卡顿,配合火山引擎 ASR 实现转录和智能剪辑。2k Stars,MIT 协议。"
focus_keyword: "Claude Code 自动化剪辑"
source: https://github.com/Ceeon/videocut-skills
author: "Ceeon"
status: draft


基于 Claude Code 的自动化剪辑工作流

用语义理解替代模式匹配,AI 审核口播问题(静音/口误/重复) | 2k Stars | MIT | Claude Code Skill

这是什么

videocut-skills 是一套基于 Claude Code Skills 构建的视频剪辑 Agent,专门为口播类视频设计。作者 Ceeon 因为剪映「智能剪口播」有两个痛点——无法理解语义(识别不出重复说和说错后纠正的句子)以及字幕质量差(专业术语经常识别错误)——而开发了这个项目。

它的核心思路是用 Claude 的语义理解能力分析口播内容,再结合火山引擎 ASR 做字级别时间戳转录,最终生成一个审核网页供人工确认后由 FFmpeg 执行剪辑。一次 19 分钟的口播原片,系统可自动识别 608 处问题(静音 114 处 + 口误/重复 494 处)。

与剪映「智能剪口播」的核心差异:videocut-skills 的理解能力来自大语言模型而非规则匹配,能识别"同一个意思反复说""说错了立刻纠正""卡顿后重新组织语言"等复杂语义场景。此外还支持自定义专业术语词典、自更新偏好记忆(告诉 AI"静音阈值改成 1 秒"后它记住并应用)、以及 2-pass 编码高清导出。

适合谁 / 不适合谁

人群 是否推荐 原因
高频产出视频的创作者/UP 主 ✅ 推荐 自动识别口误和重复,大幅减少手动剪辑时间
录制课程/讲座的教育者 ✅ 推荐 长课程口播中的卡顿和重复自动标记
已有 Claude Code 环境的用户 ✅ 推荐 零额外软件成本,Skills 即装即用
非口播类视频创作者 ⚠️ 酌情 工具专为「说话类」视频设计,素材混剪/特效类不适用
无火山引擎 API 的用户 ⚠️ 酌情 转录依赖火山引擎 ASR,需注册并获取 API Key
对剪辑精度要求极高(逐帧编辑)的用户 ❌ 不推荐 基于时间戳的剪辑精度在毫秒级而非逐帧级

安装与前置条件

  • Claude Code CLI 已安装
  • Python 3.8+(运行 FunASR 和 Whisper)
  • FFmpeg(音视频处理)
  • Node.js 18+(运行审核服务器脚本)
  • 火山引擎 API Key(语音转录)
  • 模型下载:FunASR 约 2GB,Whisper large-v3 约 3GB
# 克隆到 Claude Code skills 目录
git clone https://github.com/Ceeon/videocut-skills.git ~/.claude/skills/videocut

# 配置 API Key
cd ~/.claude/skills/videocut
cp .env.example .env
# 编辑 .env,填入火山引擎 API Key

# 安装环境(在 Claude Code 中执行)
# /videocut:安装

核心用法

完整工作流

┌─────────────────────────────────────────────┐
│  /videocut:安装                              │
│  首次使用,安装 Python/FFmpeg 和 AI 模型     │
└─────────────────────────────────────────────┘
                  ↓
┌─────────────────────────────────────────────┐
│  /videocut:剪口播 视频.mp4                   │
│  1. 提取音频 → 上传火山引擎                  │
│  2. 火山引擎转录 → 字级别时间戳              │
│  3. Claude AI 审核:静音/口误/重复/语气词    │
│  4. 生成审核网页 → 浏览器打开                │
└─────────────────────────────────────────────┘
                  ↓
┌─────────────────────────────────────────────┐
│  【人工审核 + 执行剪辑】                     │
│  - 单击跳转播放                              │
│  - 双击选中/取消                             │
│  - Shift 拖动多选                            │
│  - 确认后点击「执行剪辑」→ FFmpeg 自动剪辑   │
└─────────────────────────────────────────────┘
                  ↓
┌─────────────────────────────────────────────┐
│  /videocut:字幕                              │
│  - Whisper 转录 + 词典纠错                   │
│  - 人工确认 → 烧录字幕                      │
└─────────────────────────────────────────────┘
                  ↓
┌─────────────────────────────────────────────┐
│  /videocut:高清化 (可选)                   │
│  - 2-pass 编码 + 锐化                       │
│  - 自动匹配原片参数,码率 1.2x              │
└─────────────────────────────────────────────┘

Skill 清单

Skill 功能 输入 输出
安装 环境准备 安装日志
剪口播 转录 + AI 审核 + 剪辑 视频文件 剪辑后视频
高清化 2-pass + 锐化导出 视频文件 高清视频
字幕 生成字幕 视频文件 带字幕视频
自更新 记录偏好 用户反馈 更新规则文件

自定义词典

编辑 字幕/词典.txt,每行一个词:

Claude Code
MCP
API

注意事项与风险

  • 火山引擎 API 费用:语音转录按调用量计费,长视频需注意成本
  • 模型首次下载大:FunASR (~2GB) + Whisper large-v3 (~3GB) 首次下载耗时较长
  • 审核网页端口:默认 8899,如果被占用需释放或修改
  • 音画同步:使用 filter_complex + trim 而非 concat demuxer 来避免剪辑后音画不同步
  • 项目更新频率:仅 18 次提交,核心功能稳定但迭代不频繁

与你现有工具的关系

  • 与 [[Claude Code Humanizer:用 Claude Code Humanizer 提升文章可读性]] 同属 Claude Code Skills 生态,可组合使用
  • 与 [[纯前端音视频转文字:浏览器端讯飞 API 长音频识别]] 互补:前者做内容识别转录,本工具做智能剪辑
  • 剪辑后的素材可作为 [[../02-内容创作媒体/Toonflow:开源 AI 短剧生成工具]] 的输入素材

FAQ

Q: 和剪映「智能剪口播」相比有什么优势?

A: 剪映基于模式匹配,无法理解语义。videocut-skills 用 Claude 分析语义,能识别"重复说""说错后纠正""卡顿后重组"等复杂场景。此外支持自定义词典,专业术语识别更准确。

Q: 火山引擎转录超时怎么办?

A: 上传音频时使用 uguu.se(脚本默认),避免 catbox.moe(火山引擎访问慢)。

Q: 审核网页打不开?

A: 检查端口 8899 是否被占用:lsof -i :8899

Q: 剪辑后音画不同步?

A: 脚本已通过 filter_complex + trim 处理此问题。如果仍有问题,检查源视频编码是否使用可变帧率(VFR)。

Q: 如何让 AI 记住我的剪辑偏好?

A: 使用 /videocut:自更新 命令,告诉 AI 例如"静音阈值改成 1 秒"或"保留适量嗯作为过渡",它会记录在规则文件中持续生效。

相关链接

  • 来源:https://www.ahhhhfs.com/79181/
  • GitHub:https://github.com/Ceeon/videocut-skills
  • 火山引擎语音识别:https://console.volcengine.com/

完整工作流复盘

阶段 工具 产出 耗时 成本
准备 官方安装包/CLI 环境
执行 主工具链 半成品 按量
人审 人工 终稿

成本对比

项目 传统手工 本工作流
时间 更长的重复劳动 重复段可脚本化
金钱 人力为主 工具+API
风险 遗漏步骤 脚本错误需告警

适合谁 / 不适合谁

✅ 愿意按文档配置、接受人审的人

❌ 要零配置一键商业终稿的人


一句话总结

把 Claude Code/Obsidian 类能力当成工序配件:能加速重复段,不能代替选题与人审。


🔗 以文内仓库与官网为准;Lovart https://www.lovart.ai/ 和 Lovart中文版: https://www.lovart.art 可作视觉互补。


周更落地节奏(T3-009 通用)

周一:锁场景与退出条件

写清本周只要哪一个成果(例如「3 条可发短视频」或「10 个 SKU 主图」),以及什么情况下停用某工具。

周二:跑通最小链路

只跑最短路径,不加花活。成功标准写在纸上:输入是什么、输出文件叫什么、谁人审。

周三至周四:资产化

把可复用的 Brand Kit、主体、提示词摘要、n8n 工作流导出备份。资产不留下,周末等于重装。

周五:人审与分发

事实、侵权、平台规则三问。过不了就降级内部样片。

周末:复盘一页纸

成本、失败点、是否触发换栈。工具会变,节奏可以不变。

Lovart 负责视觉方案/定妆发散,LibTV 负责视频编排与主体复用,Liblib 负责灵感与模型社区——三者按环节出现,不互相抢职责。开源环节(n8n/Postiz/Rembg 等)负责可控与自托管。金额与套餐以官网为准,本稿不编造测速榜。

补充说明(2):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。

补充说明(3):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。

补充说明(4):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。

补充说明(5):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。

补充说明(6):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。

补充说明(7):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。

补充说明(8):复用本稿前请核对各工具官方页的权限、地区可用性与计价;站外母版不进 Sanity;平台派生(知乎/百家号)另做删链与口气调整。

场景里的人味与边界

我写工作流文时,最怕两种读者误会:一是以为串完工具就等于有了创意;二是以为成本表里的「小时级」包含了你盯着空白选题发呆的下午。真实情况是:工具只吃掉重复劳动,吃不掉判断。

所以每个 T3 我都会给自己留三句不好听的话:

  1. 没有人审的自动化,是加速度事故。
  2. 没有退出条件的工具栈,只会单向变胖。
  3. Lovart / LibTV / Liblib 有分工:视觉方案、视频编排、灵感社区——抢职责就会两头不靠谱。

如果你的团队还在争论「要不要再加一个神器」,先问:它替换的是哪一个已有环节?替换不了就别加。

失败演练(建议真做一次)

挑一条低风险内容,故意制造一次失败:关掉 API Key、传错尺寸、Postiz 绑错测试号。看 n8n 会不会叫、人审能不能拦、回滚要几分钟。演练不过关,就不要上主号。

资产清单(周五必须留下)

  • Brand Kit / 主体参考 / 提示词摘要
  • n8n 工作流导出
  • 发布状态表(draft/review/approved/published)
  • 本周成本小计(订阅 + 按量)

没有这份清单,下周你还会从头安装宇宙。

落地补充(1):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。

落地补充(2):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。

落地补充(3):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。

落地补充(4):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。

落地补充(5):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。

落地补充(6):T3-009 母版用于站外分发,不进 Sanity Blog,不走 lovart-review。复用前核对官方权限与计价;配图保持待补,禁止断链 IMAGE_BRIEF。周更时只改一个变量(模型或文案或分发渠道),便于复盘归因。

BLOCK 自检(T3-009)

  • [x] 多工具串联解决一个完整场景问题
  • [x] 含结论总表 / 全景或阶段结构
  • [x] 含成本对比(传统 vs AI)
  • [x] 有适合/不适合或等价边界
  • [x] 配图为待补 callout 或可访问图(无 IMAGE_BRIEF 断链)
  • [x] 未走 lovart-review / Sanity Blog
  • [ ] 实拍工作流截图待补
评论 0 条
登录后可评论
相关阅读

接着看

订阅

订阅内容更新

每周获取网站增长与 AI 运营最新洞察,绝无打扰。