音视频#开源#智能体#自托管#文本转语音#声音克隆#配音#CLI#macOS#Windows

yovoice:把配音工作台整个搬到本地的开源语音创作工具

给视频、课程和有声内容做配音,常见的路是粘进云端 TTS:按字收费、声音同质化、文稿还得先上传。yovoice 把 7 个本地 TTS 模型经 audio.cpp 跑在自己机器上,1-60 秒参考音频克隆声音,录音、剪辑、导出齐备,另带 CLI 和 Agent Skill。Apache-2.0 开源,macOS 与 Windows 可用。

项目资料

GitHub Ecosystem
仓库地址github.com/leemysw/yovoice
许可证
Apache-2.0
主语言
TypeScript
星标
194
核查时间
2026-09-27

以上快照资料以核查当日为准,可能随版本或运营策略变化。

给视频配一段旁白,最常见的路径是把文稿粘进某个云端 TTS 服务:按字计费,音色千人一面,文稿还要先传到别人服务器上。yovoice 走的是另一条路——这个 Apache-2.0 开源工具把 7 个 TTS 模型经 audio.cpp 引擎在本地运行,配音、旁白、有声内容全程不出本机。视频号「对齐观察」在 2026 年 9 月 27 日的视频里推荐过它。项目 2026 年 9 月 15 日才创建,12 天已接近 200 星(截至 2026-09-27 为 194 星),当前版本 0.1.4。

核心功能

  • 声音克隆:1-60 秒参考音频就能复刻音色;IndexTTS 2.0/2.5 支持情感控制和「匹配参考语气」,2.5 还能直接编辑发音。
  • 用文字造声音:VoxCPM2 和 Qwen3-TTS VoiceDesign 支持文本引导的声音设计,一句描述(低沉、语速慢)就能生成新音色,不需要参考音频。
  • 7 个本地模型:IndexTTS 2.0/2.5、VoxCPM2、OmniVoice、Qwen3-TTS Base/CustomVoice/VoiceDesign,全部经 audio.cpp 本地推理,模型支持断点续传下载和 GGUF 导入。
  • 完整音频工作流:导入或录制参考音频、剪辑、试听、导出都在应用里完成;项目、声音和设置存在 ~/.yovoice,卸载不丢数据。
  • CLI + Agent Skill:把仓库里的 skills/yovoice 链接交给 Claude Code、Codex 这类智能体,装好后直接说「用 voice.wav 当参考音色,平静地读 narration.txt,存成 narration.wav」,不必打开桌面 App。
  • 跨平台硬件加速:macOS 14+ 在 Apple Silicon 上走 Metal;Windows 10/11 x64 支持 CPU、NVIDIA CUDA 和实验性 Vulkan。

典型使用场景

  • 视频和播客创作者:旁白配音自己出,改一句文稿就重新生成一次,不用按字付钱,也不用把未发布内容传上云。
  • 课程和有声书制作:同一音色贯穿多集,长文稿分批生成后在历史记录里统一导出。
  • 开发者:给应用加本地语音能力,或让智能体通过 CLI 批量生成语音资产。

快速上手

到仓库 Releases 下载对应安装包:macOS 14+(Apple Silicon)是 .dmg,Windows 10/11 x64 是 -setup.exe(需要时自动装 WebView2)。装好后第一步在设置里下载选定的模型,然后贴入文字、选表达方式、生成、试听、导出。

想从源码跑:

make install
make app-run

小结

yovoice 适合经常配音、在意成本和文稿隐私的创作者与开发者;一年配不了几段、对音色不挑剔的轻度用户,光下载模型那一步就嫌重。三点注意:OmniVoice 模型权重是 CC-BY-NC,仅限非商用;模型文件要单独下载,体积不小,硬盘紧张的要挑着装;项目上线仅两周、版本 0.1.4,遇到问题大概率要去 GitHub 提 issue。TypeScript 编写,Apache-2.0 协议。