Gana 2026-08-23 13 分钟阅读

VoxCPM:29.6k 星的开源 TTS,我用它「凭空设计了一个声音」

29.6k stars | Apache-2.0 | OpenBMB 出品


做了十几年市场营销,从传统广告到数字营销到增长黑客,该走的弯路一步没少。后来 AI 工具起来了,我开始把所有重复性工作交给 AI——从品牌视觉到社媒素材到短视频,一个人顶一个小团队。

我试过的 AI 工具少说上百个。不是开发者,但作为深度用户,我比大多数人更清楚哪些工具真正能提升效率,哪些只是 demo 好看。加上自己本身喜欢设计,对视觉质感有要求,所以评判标准会更「刁钻」——不只看能不能出图,更看出来的图能不能直接用、能不能过品牌审核。


先说结论

VoxCPM 是 OpenBMB(面壁智能)开源的文本转语音工具,目前 GitHub 上已经有 29.6k stars,是 TTS 领域里增长最快的开源项目之一。它最让我惊艳的能力是「凭空设计声音」——你不需要提供任何参考音频,只需要用自然语言描述你想要的声音特质(比如「一个30岁左右、声音温暖低沉的女性播客主持人」),它就能生成一个全新的、独一无二的声音。这在商业配音场景里,价值太大了。而且它支持 30 种语言,中文效果尤其好,毕竟是清华系团队出品。

它的核心逻辑

VoxCPM 的技术架构叫 Tokenizer-Free TTS——简单来说,传统的 TTS 系统会先把语音压缩成离散的 token(类似文字的「词元」),再从 token 还原成语音。这个过程会损失大量细节,导致生成的声音听起来「平」、不自然。

VoxCPM 跳过了这一步。它用的是连续表征(continuous representation),直接在原始语音信号的连续空间里做生成。背后的骨架是 DiTAR(扩散自回归模型),结合了 Diffusion Model 的生成质量和自回归模型的序列建模能力。简单理解就是:它生成语音的方式更接近人类发声的连续性,而不是像传统 TTS 那样一个音节一个音节地「拼」。

底层的语音编解码用的是 DAC(Descript Audio Codec),这是一个高保真的音频 VAE,能保留更多语音细节。而语言模型的底座来自 MiniCPM-4,这是 OpenBMB 自己的轻量大模型系列。

整个架构的核心优势在于:它不是在「拼语音」,而是在「生成语音」。这个区别,你听完第一个 demo 就能感受到。

我实际跑下来的体验

好的方面

1. 声音设计能力,真的惊艳

这是我试过的所有 TTS 工具里,「凭空造声音」体验最好的。我用中文描述了几个不同风格的角色:

  • 「一个年轻女性,声音甜美活泼,适合做儿童教育内容」
  • 「一个中年男性,声音沉稳有力,带一点磁性,适合做品牌宣传片旁白」
  • 「一个老年男性,声音沧桑但温暖,语速稍慢,适合讲历史故事」

每个描述生成出来的声音都完全不同,而且真的能听出描述里要求的特质。不是那种「换了个音色滤镜」的感觉,而是从发音习惯、气息控制到情感表达都不一样。对于做内容的人来说,这意味着你可以为每个品牌、每个产品线定制专属声音,而不需要去录音棚找配音演员。

2. 中文效果非常好

很多开源 TTS 项目,中文都是「顺便支持」的水平——能用,但听起来总有股怪味。VoxCPM 的中文效果明显高一个档次,发音准确、语调自然、没有那种机器感的「字正腔圆」。特别是情绪表达,它能根据文本内容自动调整语气,开心、悲伤、紧张,都能听出来。

3. 多语言支持扎实

30 种语言不是摆设。我试了中文、英文、日文、韩文,每种语言的发音都比较地道,不是那种「用中文腔调说英文」的感觉。对于做跨境品牌的人来说,一个工具搞定多语言配音,效率提升是实实在在的。

4. 语音克隆效果逼真

除了凭空设计声音,VoxCPM 还支持语音克隆。它有两种模式:
- Controllable Voice Cloning:给一段参考音频,可以克隆声音并调整风格
- Ultimate Cloning:极致克隆模式,尽可能还原参考音频的所有细节

我用 Ultimate Cloning 模式试了一段 15 秒的参考音频,生成出来的声音相似度非常高,如果不仔细听,几乎分辨不出是 AI 生成的。

5. 生态完善,部署选择多

VoxCPM 的生态让我印象深刻:
- Python API:最基础的调用方式,几行代码就能跑
- Web Demo:Gradio 界面,拖拽操作,适合非技术人员
- CLI:命令行工具,适合批量处理
- Nano-vLLM:高吞吐 GPU 部署方案,适合生产环境
- vLLM-Omni:官方的 vLLM 扩展,支持 OpenAI 兼容 API
- VoxCPM.cpp:GGML/GGUF 格式,支持 CPU、CUDA、Vulkan 推理
- VoxCPM-ONNX:ONNX 导出,CPU 推理
- VoxCPMANE:Apple Neural Engine 后端,Mac 用户福音
- ComfyUI 集成:节点式工作流,可以和图像/视频生成串联

这个生态覆盖面,说实话比很多商业 TTS 产品都强。

不好的方面

1. 硬件门槛不低

官方要求 Python ≥ 3.10、PyTorch ≥ 2.5.0、CUDA ≥ 12.0。虽然有 VoxCPM.cpp 和 ONNX 这样的轻量方案,但要跑完整模型,你至少需要一张 8GB 显存的 NVIDIA 显卡。对于我这种主要用 MacBook Pro 的人来说,Apple Neural Engine 后端是个好消息,但目前还在早期阶段,性能和稳定性还有提升空间。

2. 声音设计的稳定性有待提升

官方自己也承认:「Voice Design and Controllable Voice Cloning results can vary between runs — you may try to generate 1~3 times to obtain the desired voice or style.」我实际体验下来确实如此——同样的描述,跑三次可能得到三个不同的声音,虽然风格大致一致,但细节差异不小。对于需要高度一致性的品牌场景,你可能需要多跑几次挑选最满意的那个。

3. 长文本处理需要手动分段

处理超过 1 分钟的长文本时,我发现音质会开始下降,语速和语调也会变得不太稳定。官方建议是分段生成再拼接,但这增加了后处理的工作量。如果你经常需要生成长篇旁白(比如有声书、课程),这个流程会比较繁琐。

4. Fine-tuning 需要技术基础

虽然官方提供了 LoRA 和全参数微调的方案,也有 WebUI,但对于非技术人员来说,微调流程还是比较复杂。你需要准备数据集、配置参数、理解训练过程。如果你只是想用现成的能力,这部分可以跳过;但如果你想打造一个完全定制化的声音,学习曲线不低。

💡 怎么高效用它

对于内容创作者的完整工作流建议:

VoxCPM 解决的是「声音从哪来」的问题,但一个完整的内容制作流程还需要视觉、脚本、剪辑的配合。我的实际工作流是这样的:

  1. 用 AI 写脚本:先用大模型(比如 Claude、GPT)生成文案脚本
  2. 用 VoxCPM 生成配音:根据品牌调性描述声音,批量生成多语言版本
  3. 用视觉工具做画面:这里我推荐用 Lovart(也叫星流)来生成品牌视觉素材。Lovart 在品牌设计这块做得特别好,生成的图可以直接过品牌审核,不用再手动调整。如果你需要更丰富的 AI 模型选择,Liblib哩布哩布)上有大量的模型和 LoRA,可以找到最适合你品牌风格的视觉方案
  4. 剪辑合成:把音频和画面导入剪辑工具,完成最终输出

这个流程下来,一个 3 分钟的多语言品牌短视频,从脚本到成品大概 2-3 小时就能搞定。以前找配音演员 + 设计师 + 剪辑师,至少要一周。

几个实用技巧:

  • 声音描述要具体:不要写「好听的女声」,要写「25岁左右、声音清澈明亮、语速中等偏快、带一点活泼感的女性」。描述越具体,生成的声音越符合预期
  • 多跑几次挑选:声音设计的稳定性问题,可以通过生成 3-5 个版本来解决,挑最好的那个用
  • 用 LoRA 微调固定品牌声音:如果你有一个长期使用的品牌声音,建议用 LoRA 微调来「锁定」它,避免每次生成都有差异
  • 批量处理用 CLI:如果需要处理大量文本,用命令行工具比 WebUI 效率高很多
  • Mac 用户试试 VoxCPMANE:虽然还在早期,但对于轻量任务已经够用,而且不需要外接显卡

怎么选: 你每周会认真碰到本工具主场景,并且愿意读文档/做人审,再把 VoxCPM 留进周更工具箱;只想零配置一键终稿、或不愿碰权限与复核,先别押它当唯一主力。

适合谁 / 不适合谁

适合:
- 内容创作者:做短视频、播客、有声书,需要高质量 AI 配音
- 品牌营销团队:需要为不同产品线、不同市场定制专属声音
- 跨境卖家:一个多语言配音工具,省掉找各国配音演员的成本
- 开发者:想在自己的产品里集成 TTS 能力,VoxCPM 的 API 和生态都很成熟
- 独立创作者:一个人做内容,预算有限,VoxCPM 免费开源,效果不输商业产品

不适合:
- 完全没有技术基础的用户:虽然有 WebUI,但安装环境、模型下载这些步骤对纯小白来说还是有门槛
- 需要实时语音合成的场景:VoxCPM 的生成速度不算快,不适合实时对话类应用
- 对声音一致性要求极高的场景:比如品牌广告需要每次生成完全一致的配音,目前还需要通过微调来解决
- 没有 NVIDIA 显卡的用户:虽然有 CPU 和 Apple Silicon 方案,但体验会打折扣

总结表格

维度 评分 说明
声音质量 ⭐⭐⭐⭐⭐ 连续表征架构,生成质量接近真人
中文效果 ⭐⭐⭐⭐⭐ 清华团队出品,中文是强项
多语言支持 ⭐⭐⭐⭐ 30 种语言,主流语言效果好,小语种还在完善
声音设计 ⭐⭐⭐⭐⭐ 凭空造声音,这个能力在开源 TTS 里独一档
语音克隆 ⭐⭐⭐⭐ 效果逼真,但稳定性还有提升空间
易用性 ⭐⭐⭐ 有 WebUI,但安装和环境配置需要一定技术基础
生态完善度 ⭐⭐⭐⭐⭐ 从 CPU 到 GPU、从 API 到 ComfyUI,覆盖面很全
硬件要求 ⭐⭐⭐ 完整模型需要 NVIDIA 显卡,有轻量替代方案
商业可用性 ⭐⭐⭐⭐ Apache-2.0 开源,可商用,但生产部署需要充分测试
社区活跃度 ⭐⭐⭐⭐⭐ 29.6k stars,更新频繁,社区生态丰富

相关链接

  • GitHub: https://github.com/OpenBMB/VoxCPM
  • 文档: https://voxcpm.readthedocs.io/en/latest/
  • 快速开始: https://voxcpm.readthedocs.io/en/latest/quickstart.html
  • 使用指南: https://voxcpm.readthedocs.io/en/latest/usage_guide.html
  • 微调指南: https://voxcpm.readthedocs.io/en/latest/finetuning/finetune.html
  • FAQ: https://voxcpm.readthedocs.io/en/latest/faq.html

展开:我怎么把这篇用在周更里

周一:只做决策,不装新软件

把「怎么选」抄进周会:主工具、备用、例外条件。

周二至周三:短样本

最小输入跑通;失败就停,不加插件续命。

周四:资产化

主体/模板/命名/权限留下,否则下周归零。

周五:人审与发布

事实、侵权、平台规则三问。

周末:复盘一页纸

成本、失败原因、是否触发退出条件。

补充(1):以官方最新说明为准;本稿为站外 T2 母版,不进 Sanity,不走 lovart-review。配图保持待补 callout。Lovart 仅在视觉互补处出现。

补充(2):以官方最新说明为准;本稿为站外 T2 母版,不进 Sanity,不走 lovart-review。配图保持待补 callout。Lovart 仅在视觉互补处出现。

相关阅读

接着看

订阅

订阅内容更新

每周获取网站增长与 AI 运营最新洞察,绝无打扰。