VoxCPM2:短样本克隆真人音色的开源 TTS
OpenBMB 的 VoxCPM2 用 2B 参数做开源语音克隆:30 种语言、48kHz 输出,Apache-2.0 可商用,配音和播客都能本地跑。
项目资料
GitHub Ecosystem- 许可证
- Apache-2.0
- 主语言
- Python
- 星标
- 38,243
- 核查时间
- 2026-10-01
以上快照资料以核查当日为准,可能随版本或运营策略变化。
给视频配音、做播客,要么花钱请人录,要么忍受一听就假的合成音。OpenBMB 的 VoxCPM2 是一个 tokenizer-free 的开源 TTS 系统:2B 参数、训练数据超过 200 万小时,丢一段十几秒的参考音频进去,语气、停顿这些口头习惯会留在克隆出来的声音里。视频号「AIFeed」9 月初推荐时说“真人声音和合成没分出来”,还给了它“GitHub 趋势第一”的说法——趋势名次没法回溯验证,但这个仓库的前代 VoxCPM1.5 确实在 README 里挂过 2025 年 12 月的 #1 GitHub Trending 记录。
核心功能
- 可控克隆:给一段参考音频,还能用文字额外约束情绪、语速和表达,在保留原音色的基础上调整说话方式。
- 终极克隆:参考音频加转写文本一起给,模型从参考处无缝续读,音色、节奏、风格全部延续,这是 VoxCPM1.5 同款能力。
- 用文字造声音:只写一句自然语言描述(性别、年龄、语气、情绪、语速)就能生成全新音色,不需要参考音频。
- 30 种语言:输入文本不用打语言标签直接合成,中文还支持粤语、四川话、吴语、东北话等 9 种方言。
- 48kHz 输出:16kHz 参考音频经 AudioVAE V2 直接输出 48kHz 成品,内置超分,不用外挂升采样器。
- 流式实时:官方数据,NVIDIA RTX 4090 上 RTF 低至约 0.3,经 Nano-vLLM 或 vLLM-Omni 加速到约 0.13,vLLM-Omni 还提供 OpenAI 兼容的
/v1/audio/speechAPI。
典型使用场景
- 短视频和播客配音:批量口播用同一个克隆音色出声,改一句文稿重新生成一次,不用反复进录音棚。
- 产品旁白与有声内容:用声音设计造一个固定声线,让整个系列内容的音色保持一致。
- 多语言本地化:同一份文案按 30 种语言出多个版本,不用为每种语言另找配音。
快速上手
pip install voxcpm
要求 Python 3.10-3.12、PyTorch 2.5.0 以上、CUDA 12.0 以上。第一段音频:
from voxcpm import VoxCPM
import soundfile as sf
model = VoxCPM.from_pretrained("openbmb/VoxCPM2", load_denoiser=False)
wav = model.generate(
text="用 VoxCPM2 合成的第一段中文语音。",
cfg_value=2.0,
inference_timesteps=10,
seed=42,
)
sf.write("demo.wav", wav, model.tts_model.sample_rate)
没有 NVIDIA GPU 的话,Hugging Face 上有 OpenBMB/VoxCPM-Demo 在线 Playground,试音色够用。
小结
VoxCPM2 适合要批量出人声、想保住自己或固定音色的创作者和开发者;只是偶尔配一段、对音色不挑剔的用户,在线 Playground 更省事。权重和代码都是 Apache-2.0,可商用(截至 2026-10-01 约 38.2k 星)。要留意的是本地推理需要 CUDA 环境,模型权重下载体积不小,低配机器建议走 vLLM 服务器部署。如果想要开箱即用的桌面端,YoVoice 把 VoxCPM2 连同另外 6 个本地 TTS 模型打包成了应用,装完就能试。