音视频#开源#智能体#自托管#文本转语音#声音克隆#配音#CLI#macOS#Windows
yovoice:把配音工作台整个搬到本地的开源语音创作工具
给视频、课程和有声内容做配音,常见的路是粘进云端 TTS:按字收费、声音同质化、文稿还得先上传。yovoice 把 7 个本地 TTS 模型经 audio.cpp 跑在自己机器上,1-60 秒参考音频克隆声音,录音、剪辑、导出齐备,另带 CLI 和 Agent Skill。Apache-2.0 开源,macOS 与 Windows 可用。
项目资料
GitHub Ecosystem- 许可证
- Apache-2.0
- 主语言
- TypeScript
- 星标
- 194
- 核查时间
- 2026-09-27
以上快照资料以核查当日为准,可能随版本或运营策略变化。
给视频配一段旁白,最常见的路径是把文稿粘进某个云端 TTS 服务:按字计费,音色千人一面,文稿还要先传到别人服务器上。yovoice 走的是另一条路——这个 Apache-2.0 开源工具把 7 个 TTS 模型经 audio.cpp 引擎在本地运行,配音、旁白、有声内容全程不出本机。视频号「对齐观察」在 2026 年 9 月 27 日的视频里推荐过它。项目 2026 年 9 月 15 日才创建,12 天已接近 200 星(截至 2026-09-27 为 194 星),当前版本 0.1.4。
核心功能
- 声音克隆:1-60 秒参考音频就能复刻音色;IndexTTS 2.0/2.5 支持情感控制和「匹配参考语气」,2.5 还能直接编辑发音。
- 用文字造声音:VoxCPM2 和 Qwen3-TTS VoiceDesign 支持文本引导的声音设计,一句描述(低沉、语速慢)就能生成新音色,不需要参考音频。
- 7 个本地模型:IndexTTS 2.0/2.5、VoxCPM2、OmniVoice、Qwen3-TTS Base/CustomVoice/VoiceDesign,全部经 audio.cpp 本地推理,模型支持断点续传下载和 GGUF 导入。
- 完整音频工作流:导入或录制参考音频、剪辑、试听、导出都在应用里完成;项目、声音和设置存在
~/.yovoice,卸载不丢数据。 - CLI + Agent Skill:把仓库里的
skills/yovoice链接交给 Claude Code、Codex 这类智能体,装好后直接说「用 voice.wav 当参考音色,平静地读 narration.txt,存成 narration.wav」,不必打开桌面 App。 - 跨平台硬件加速:macOS 14+ 在 Apple Silicon 上走 Metal;Windows 10/11 x64 支持 CPU、NVIDIA CUDA 和实验性 Vulkan。
典型使用场景
- 视频和播客创作者:旁白配音自己出,改一句文稿就重新生成一次,不用按字付钱,也不用把未发布内容传上云。
- 课程和有声书制作:同一音色贯穿多集,长文稿分批生成后在历史记录里统一导出。
- 开发者:给应用加本地语音能力,或让智能体通过 CLI 批量生成语音资产。
快速上手
到仓库 Releases 下载对应安装包:macOS 14+(Apple Silicon)是 .dmg,Windows 10/11 x64 是 -setup.exe(需要时自动装 WebView2)。装好后第一步在设置里下载选定的模型,然后贴入文字、选表达方式、生成、试听、导出。
想从源码跑:
make install
make app-run
小结
yovoice 适合经常配音、在意成本和文稿隐私的创作者与开发者;一年配不了几段、对音色不挑剔的轻度用户,光下载模型那一步就嫌重。三点注意:OmniVoice 模型权重是 CC-BY-NC,仅限非商用;模型文件要单独下载,体积不小,硬盘紧张的要挑着装;项目上线仅两周、版本 0.1.4,遇到问题大概率要去 GitHub 提 issue。TypeScript 编写,Apache-2.0 协议。