音视频#文本转语音#声音克隆

VoxCPM2:短样本克隆真人音色的开源 TTS

OpenBMB 的 VoxCPM2 用 2B 参数做开源语音克隆:30 种语言、48kHz 输出,Apache-2.0 可商用,配音和播客都能本地跑。

项目资料

GitHub Ecosystem
仓库地址github.com/OpenBMB/VoxCPM
许可证
Apache-2.0
主语言
Python
星标
38,243
核查时间
2026-10-01

以上快照资料以核查当日为准,可能随版本或运营策略变化。

给视频配音、做播客,要么花钱请人录,要么忍受一听就假的合成音。OpenBMB 的 VoxCPM2 是一个 tokenizer-free 的开源 TTS 系统:2B 参数、训练数据超过 200 万小时,丢一段十几秒的参考音频进去,语气、停顿这些口头习惯会留在克隆出来的声音里。视频号「AIFeed」9 月初推荐时说“真人声音和合成没分出来”,还给了它“GitHub 趋势第一”的说法——趋势名次没法回溯验证,但这个仓库的前代 VoxCPM1.5 确实在 README 里挂过 2025 年 12 月的 #1 GitHub Trending 记录。

核心功能

  • 可控克隆:给一段参考音频,还能用文字额外约束情绪、语速和表达,在保留原音色的基础上调整说话方式。
  • 终极克隆:参考音频加转写文本一起给,模型从参考处无缝续读,音色、节奏、风格全部延续,这是 VoxCPM1.5 同款能力。
  • 用文字造声音:只写一句自然语言描述(性别、年龄、语气、情绪、语速)就能生成全新音色,不需要参考音频。
  • 30 种语言:输入文本不用打语言标签直接合成,中文还支持粤语、四川话、吴语、东北话等 9 种方言。
  • 48kHz 输出:16kHz 参考音频经 AudioVAE V2 直接输出 48kHz 成品,内置超分,不用外挂升采样器。
  • 流式实时:官方数据,NVIDIA RTX 4090 上 RTF 低至约 0.3,经 Nano-vLLM 或 vLLM-Omni 加速到约 0.13,vLLM-Omni 还提供 OpenAI 兼容的 /v1/audio/speech API。

典型使用场景

  • 短视频和播客配音:批量口播用同一个克隆音色出声,改一句文稿重新生成一次,不用反复进录音棚。
  • 产品旁白与有声内容:用声音设计造一个固定声线,让整个系列内容的音色保持一致。
  • 多语言本地化:同一份文案按 30 种语言出多个版本,不用为每种语言另找配音。

快速上手

pip install voxcpm

要求 Python 3.10-3.12、PyTorch 2.5.0 以上、CUDA 12.0 以上。第一段音频:

from voxcpm import VoxCPM
import soundfile as sf

model = VoxCPM.from_pretrained("openbmb/VoxCPM2", load_denoiser=False)
wav = model.generate(
    text="用 VoxCPM2 合成的第一段中文语音。",
    cfg_value=2.0,
    inference_timesteps=10,
    seed=42,
)
sf.write("demo.wav", wav, model.tts_model.sample_rate)

没有 NVIDIA GPU 的话,Hugging Face 上有 OpenBMB/VoxCPM-Demo 在线 Playground,试音色够用。

小结

VoxCPM2 适合要批量出人声、想保住自己或固定音色的创作者和开发者;只是偶尔配一段、对音色不挑剔的用户,在线 Playground 更省事。权重和代码都是 Apache-2.0,可商用(截至 2026-10-01 约 38.2k 星)。要留意的是本地推理需要 CUDA 环境,模型权重下载体积不小,低配机器建议走 vLLM 服务器部署。如果想要开箱即用的桌面端,YoVoice 把 VoxCPM2 连同另外 6 个本地 TTS 模型打包成了应用,装完就能试。