AI 创作

xiaohu-video-translate 深度拆解:一句话把外语视频变成中文字幕版,全程本地零 API 费

你刷到一个超有价值的英文技术分享、日语访谈、韩语教程——但没字幕,看着费劲。市面上有各种「视频翻译」工具,要么收费按分钟计,要么上传播出内容有隐私风险,要么翻译

Gana · 2026-08-23 · 18 分钟阅读

你刷到一个超有价值的英文技术分享、日语访谈、韩语教程——但没字幕,看着费劲。市面上有各种「视频翻译」工具,要么收费按分钟计,要么上传播出内容有隐私风险,要么翻译质量像机翻。xiaohu-video-translate 是一个完全不同的方案:它不是 SaaS,而是一套给 AI 编程工具用的「技能」——你说一句话,它自动完成下载→转写→翻译→润色→烧录字幕的全流程。全程在你电脑里跑,转写不花 API 费,翻译复用你已经在用的 AI。 上线一周多已经 516 stars、82 forks,这波热度不是没道理的。


📊 xiaohu-video-translate 速览

维度 详情
项目定位 AI 编程工具技能:视频下载+转写+翻译+字幕烧录
GitHub xiaohuailabs/xiaohu-video-translate
⭐ Stars 516
许可证 MIT — 完全开源
技术栈 Python + Bash 脚本 + Whisper + FFmpeg
兼容平台 Claude Code / OpenClaw / Gemini CLI / Codex
系统支持 macOS(Apple Silicon 最佳)/ Windows(WSL 或原生)/ Linux
语音转写 Whisper(MLX + Metal GPU 加速,苹果芯片;faster-whisper 兜底)
成本 转写零 API 费,翻译复用你已有的 AI 编程工具
发布日 2026-06-08

一、它到底是个什么东西?不是软件,是「AI 技能」

大多数视频翻译工具是独立软件或网页服务。xiaohu-video-translate 的思路完全不同:它是一套给 AI 编程 CLI 工具用的「技能包」(Skills)。

你已经在用 Claude Code、Gemini CLI、Codex 或 OpenClaw 写代码或做自动化——这个项目做的事情,就是把「视频翻译」这个任务的每一步写成可执行的脚本,再配上一份 AI 能读懂的说明书(SKILL.md)。装好之后,你只需要对 AI 说「把这个 YouTube 链接翻译成中文字幕视频」,剩下的全自动。

本质上,它是把传统需要四个软件(下载器 + 转写工具 + 翻译引擎 + 字幕编辑器)来回切换的工作流,变成了一段对话。

你的对话
    │
    ▼
 AI 编程工具(Claude Code / Gemini CLI / Codex 等)
    │
    ├── ① 调 yt-dlp 下载视频
    ├── ② 提取音频 → Whisper 转写(词级时间戳 SRT)
    ├── ③ 调翻译脚本(任意外语 → 中文)
    ├── ④ 润色:纠错 + 断句 + 去标点 + 双语排版
    └── ⑤ FFmpeg 烧录字幕 → 输出带字幕视频 + Markdown 文稿

二、拆解三个技能模块

项目里包含三个独立技能,各司其职又能协同:

技能 1:xiaohu-video-md — 总指挥

这是整个系统的大脑。它负责调度全流程:
- 接收用户指令(URL 或本地文件路径)
- 调用下载器获取视频
- 提取音频轨道
- 驱动 Whisper 做语音转写(生成带词级时间戳的 SRT 字幕文件)
- 调用 xiaohu-subtitle-polish 做翻译和润色
- 输出带字幕的视频 + Markdown 格式的完整文稿

关键设计:它会先读取 config.json 里的 output_dir(绝对路径),所有中间文件和最终产物都严格写在这个目录下,不会乱洒文件到当前目录。这个看似小的细节,体现了作者对「AI 技能可靠性」的深入思考——AI 执行自动化任务时,路径管理是最容易出错的地方。

技能 2:xiaohu-subtitle-polish — 字幕翻译与润色引擎

这是整个系统的「质量防线」。传统机翻字幕的问题是什么?
- 专有名词翻错:Whisper 把 "Claude" 听成 "cloud",把 "MCP" 听成 "NCP"
- 断句反人类:按时间戳硬切,一句话从中间断开,上句没说完,下句接不上
- 标点混乱:转写结果带一堆逗号句号,烧到字幕上很扎眼
- 术语全翻中文:技术分享里 API、SDK、GPU 这种词应该保留英文

这个模块做的事情:
1. 纠错:自动检测并修正常见的 ASR 转写错误(尤其是专有名词和缩写)
2. 翻译:把任意外语翻译成中文(源语种 Whisper 自动识别)
3. 断句:按语义边界重新切分句子,用停顿位置做自然断句,字幕不会半句话跨两条
4. 去标点:清理掉句号、逗号等影响阅读的标点
5. 时间戳对齐:翻译后字数变了,重新校准每条字幕的起始时间
6. 双语 ASS 生成:中文大、英文小,比例约 1.7:1,用真正的 ASS 格式实现一条字幕内字号对比

为什么是 ASS 而不是 SRT?
SRT 做不了双语字号反差——在 SRT 里写 inline 字体标签会被 FFmpeg 剥离(实测三档字号输出 md5 完全一致)。ASS 格式交给 libass 渲染才能实现「中文 28pt、英文 17pt」的真反差。这是作者踩过坑后得出的方案,细节见真章。

技能 3:xiaohu-video-download — 下载器

纯粹的下载工具,支持:
- 单个视频下载
- 音频单独提取
- 播放列表批量下载
- 本地视频烧字幕(跳过下载步骤)
- YouTube、抖音等平台的 cookie 管理

抖音首次使用需要跑一次 douyin_login.py,浏览器扫码登录,登录态只存在本地。


三、Whisper 转写:本地、免费、能离线的核心武器

整个系统最亮眼的地方,是转写完全不走 API

它调用 OpenAI 的 Whisper 模型在你本地跑:
- Apple Silicon Mac:用 mlx-whisper,走 MLX 框架 + Metal GPU 加速,转一段 10 分钟视频约 1-2 分钟
- 非 Apple Silicon Mac / Windows / Linux:用 faster-whisper,CTranslate2 后端,CPU 也能跑,速度略慢但精度一致
- 可选备份引擎 whisper-cpp,纯转文字最快,但不输出词级时间戳

Whisper 模型首次运行会自动从 HuggingFace 下载(large-v3-turbo 约 1.5GB),之后完全离线可用。

这意味着什么?
- 没有 API 调用次数限制
- 没有每分钟收费
- 数据不离开你的电脑
- 断网也能用(模型下载过一次后)

对于需要批量处理视频的用户来说,这个成本优势是碾压级的。同类 SaaS 服务通常 $0.1-0.5/分钟,处理 100 分钟视频就是 $10-50。用这套工具,成本为零。

两种模式
- 精确模式(默认):large-v3-turbo 模型,约 95% 精度
- 快速模式:medium 模型,约 90% 精度,但速度快 81%

日常用精确模式完全够,赶时间或视频背景噪音小时切快速模式。


四、多语言字幕:不是「英文翻译器」,是「语种无关」的翻译管线

很多视频翻译工具本质上是个「英译中」工具。xiaohu-video-translate 的设计要通用得多:

Whisper 自动识别原语种,所以不管视频是日语、韩语、法语、西班牙语还是阿拉伯语——只要 Whisper 能识别,都能转写。翻译环节再把任意外语统一翻成中文。

项目作者在 README 里放了一张演示图:同一段 a16z 英文访谈,同时翻成中/日/韩/阿/法五种语言的双语字幕。包括从右往左书写的阿拉伯语也排得整整齐齐。

这是靠 ASS 字幕格式的灵活排版能力做到的,SRT 根本搞不定——这再次验证了「技术选型」的重要性。

字幕类型两种可选:
- 纯中文:画面干净,适合纯观看
- 中英双语:中文大、英文小,主次分明,适合顺便练听力


五、安装与使用:macOS 最顺,Windows 有坑但能绕

macOS(尤其 Apple Silicon)

brew install yt-dlp ffmpeg
pip3 install --break-system-packages mlx-whisper
git clone https://github.com/xiaohuailabs/xiaohu-video-translate.git
cd xiaohu-video-translate && bash install.sh

然后在 ~/.claude/skills/xiaohu-video-md/config.json 里设好 output_dir,重启 Claude Code 就能用。全程 5 分钟。

Windows

项目的原话是「这套工具是按 Mac 调的」。Windows 上最省事的方案是 WSL2 + Ubuntu,装好之后用法跟 Linux 完全一致。

原生 Windows 也能跑,但有三点要注意:
1. 转写引擎用 faster-whisper(MLX 不支持 Windows)
2. install.sh 是 bash 脚本,用 Git Bash 跑,或者手动复制技能文件夹
3. 中文字体要换:脚本默认用 macOS 的苹方(PingFang SC),Windows 上中文会变成方块。需要手动把 FFmpeg 烧录参数里的字体改成微软雅黑

字体这个坑在 Linux 上也存在——Linux 没有苹方,需要装 Noto Sans CJK。作者在 README 里坦承「跨平台字体适配正在做」,态度诚恳。


六、怎么用:说人话就行

装好后重启你的 AI 编程工具,然后用大白话说:

你说的话 它做的事
「把这个链接翻译成中文字幕视频 https://youtu.be/xxxx」 全流程:下载→转写→翻译→烧字幕→出文稿
「翻译这个日语视频,要中英双语字幕 https://...」 同上,日语源,双语字幕输出
「把这个视频转成文字 https://...」 只转写,出 Markdown 文稿,不烧字幕
「给我本地这个视频加中文字幕 ~/Movies/talk.mp4」 处理本地文件,跳过下载
「用快速模式转写 https://...」 换 medium 模型,更快但精略低
「翻译时不要水印」 关掉默认水印

这种「自然语言驱动」的交互方式,比传统 CLI 工具的命令行参数要友好太多。你不用记 --model large-v3-turbo --subtitle-type bilingual --no-watermark 这种长参数,直接说你要什么效果就行。


七、优缺点总结

✅ 优点

优点 说明
转写零 API 费 本地 Whisper,无限量转写
数据完全本地 视频音频不上传任何服务器
多语种支持 不限于英文,日语/韩语/法语/阿拉伯语等都行
字幕质量高 自动纠错+语义断句+专有名词保留,不是机翻直出
双语字幕 真正的 ASS 双语,中文大英文小,SRT 做不到
自然语言交互 不用说命令,说人话就行
工具链兼容 Claude Code / Gemini CLI / Codex / OpenClaw 都能用
MIT 开源 免费可商用,字幕样式随便改

❌ 缺点

缺点 说明
依赖 AI 编程工具 不能独立使用,必须配合 Claude Code 等
入门门槛 需要先会用 AI 编程 CLI 工具,纯小白有学习成本
macOS 优先 Windows/Linux 有字体和引擎适配问题
翻译质量依赖你的 AI 翻译质量取决于你用什么模型做翻译(Claude/Gemini/GPT)
无图形界面 交互完全靠对话,没有可视化面板
大量视频批处理 目前适合单视频处理,批量场景需自己脚本化

八、谁适合用?

🟢 强烈推荐

  • AI 编程工具的日常用户:你已经在用 Claude Code/Gemini CLI 写代码,加个技能就能多一个视频翻译能力
  • 需要大量处理外语视频的人:研究者、内容创作者、学习外语的人——本地无限量转写是杀手级优势
  • 隐私敏感型用户:视频内容涉及商业机密或个人隐私,不能上传到第三方服务
  • 技术教程搬运+翻译:把国外优质技术内容翻译成中文,配上双语字幕发布

🟡 可以试试

  • 自媒体创作者:需要翻译外网素材做二次创作,但要注意版权问题
  • 开源技术文档团队:翻译国外会议演讲、技术分享视频

🔴 不太适合

  • 完全不用 AI 编程工具的用户:没有 Claude Code/Gemini CLI 等工具,这套技能用不了
  • 想要一键 App 的用户:这不是一个独立应用,没有图形界面
  • 需要专业级字幕排版:虽然 ASS 能做到中文大英文小,但复杂的卡拉 OK 动效、多行滚动字幕等不支持

九、与同类工具的对比

维度 xiaohu-video-translate Veed.io 字幕翻译 Happy Scribe 剪映字幕翻译
转写费用 免费(本地 Whisper) $18/月起 $12/月起 免费(有限额)
数据隐私 ✅ 全程本地 ❌ 上传到云端 ❌ 上传到云端 🟡 本地但联网
多语种 ✅ Whisper 支持全语种 🟡 主要语种
双语字幕 ✅ 真 ASS 双语
翻译质量 依赖你的 AI 模型 🟡 机翻 🟡 机翻 🟡 机翻
开源 ✅ MIT
使用方式 AI 对话 Web 界面 Web 界面 桌面 App
入门门槛 🟡 中等 ⭐ 低 ⭐ 低 ⭐ 低

xiaohu-video-translate 的定位非常清晰:它不是要做最易用的视频翻译工具,而是要做最省钱、最保护隐私、最适合 AI 编程用户工作流的视频翻译方案。


十、总结

xiaohu-video-translate 是一个「思路打开」的项目。它没有试图再造一个 SaaS,而是巧妙地利用 AI 编程工具的能力边界,把视频翻译这件事变成了一段对话。

它的核心优势三角是:本地 Whisper 转写(零成本 + 无限量)+ 自然语言交互(零学习成本)+ 工具链兼容(不锁定生态)。516 stars 只用了一周多,说明市场上对这种「把 AI 编程工具当操作系统用」的思路是有强烈需求的。

当然,它有门槛——你得先是一个 AI 编程工具的用户。但如果你已经是,那这套技能几乎是零成本获得了一个强大的视频翻译能力。

对于更完整的视频创作链路,建议搭配 LibTV(https://www.liblib.tv 做视频编辑和生成——比如你把国外讲师的演讲翻译成中文后,想在关键处加一些中文画面或数据可视化,LibTV 的节点式工作流能让你在同一个无限画布上完成这些增强。对于需要品牌化包装的视频内容,用 Lovart(https://www.lovart.ai 和 Lovart中文版: https://www.lovart.art 统一视觉调性,让翻译后的视频保持品牌一致感。

一句话总结:如果你的日常工作流里已经有 Claude Code 或 Gemini CLI,花 5 分钟装上这个技能,你就多了一个「全自动视频翻译助手」。不花钱、不传数据、说句话就行。


如果觉得有用,关注我,每周深度拆解 2-3 个 GitHub 开源 AI 创作工具,讲真话,不恰饭。

🔗 本文提到的工具:
- xiaohu-video-translate:https://github.com/xiaohuailabs/xiaohu-video-translate
- LibTV 视频创作平台:https://www.liblib.tv
- Lovart 设计 Agent:https://www.lovart.ai 和 Lovart中文版: https://www.lovart.art
- Whisper(OpenAI):https://github.com/openai/whisper

怎么选: 你每周会认真碰到本工具主场景,并且愿意读文档/做人审,再把 xiaohu-video-translate 留进周更工具箱;只想零配置一键终稿、或不愿碰权限与复核,先别押它当唯一主力。

xiaohu-video-translate 深度拆解:一句话把外语视频变成中文字幕版,全程本地零 API 费 界面预览
xiaohu-video-translate 深度拆解:一句话把外语视频变成中文字幕版,全程本地零 API 费 界面预览
评论 0 条
登录后可评论
相关阅读

接着看

订阅

订阅内容更新

每周获取网站增长与 AI 运营最新洞察,绝无打扰。