音视频#文本转语音#翻译

VideoLingo:一键字幕翻译加配音的开源流水线

VideoLingo 把视频翻译做成一键流水线:词级识别对齐、AI 分段、术语表翻译、多后端配音甚至声音克隆,Apache-2.0 开源。

项目资料

GitHub Ecosystem
仓库地址github.com/Huanshere/VideoLingo
许可证
Apache-2.0
主语言
Python
星标
18,702
核查时间
2026-10-08

以上快照资料以核查当日为准,可能随版本或运营策略变化。

把一条英文视频做成中文字幕版,传统路子是转录、人工切句、机翻、对轴、配音,十分钟的视频折腾几个小时。VideoLingo 把这条链做成了开源的一键流水线(截至 2026-10-08 仓库 18,702 stars,v3.1.1 发布于 9 月 27 日):yt-dlp 拉视频,Qwen3-ASR 做词级识别对齐,NLP 和 AI 负责字幕分段,术语表保证译名一致,最后用 GPT-SoVITS、CosyVoice2 等后端配音,支持参考音频做声音克隆。项目口号是「Netflix 级字幕」,README 同时写明了前提:翻译质量取决于源音频、语言和所选模型。

核心功能

  • 词级对齐:Qwen3-ASR 加 Qwen3-ForcedAligner 本地跑转写和时间轴,字幕切割位置跟词走,不按死字数硬切;想换 WhisperX 也可以手动装作后端。
  • AI 字幕翻译配音三步走:直译 → 反思 → 意译重写,配自定义术语表,人名和专有名词前后一致。
  • 配音可选克隆:GPT-SoVITS、OpenAI、Edge TTS、Fish Audio、F5-TTS、CosyVoice2 等后端,GPT-SoVITS 和 CosyVoice2 支持参考音频。
  • 三种产出:纯字幕文件、双语字幕成片、配音成片,8 种输入语言。
  • 过程可控:Streamlit 界面里可以暂停、恢复、停止单步任务,带详细日志和断点续跑,模型选择器会自动拉取你 API 下的全部模型列表。
  • 给 agent 留接口:uv run start.py --api 起本地 HTTP API,脚本和 agent 可以批量提交任务、查进度、取结果;一次处理一个任务,通过 output/ 目录交换文件。

典型使用场景

  • 知识搬运:YouTube 技术演讲出一版中文双语字幕。
  • 出海团队给产品视频做多语言配音版本。
  • 课程视频批量翻译归档,术语表统一译法。

快速上手

Windows 下载 Release 里的源码 zip,解压后双击 OneKeyStart.bat,首跑自动装 uv、Python 3.12 和 FFmpeg;三平台通用:

git clone https://github.com/Huanshere/VideoLingo.git
cd VideoLingo
uv run start.py   # 浏览器打开 Streamlit 界面

侧边栏填 LLM 的 API URL、Key 和模型名,贴一个 YouTube 链接就能跑通第一单;Apple Silicon 用 MLX 加速转写,Intel Mac 走 CPU,Linux 服务器有 NVIDIA 卡可以用官方 Docker 镜像部署(默认 CUDA 12.8.1/cu128)。

小结

做视频翻译搬运、要批量出双语字幕的团队,VideoLingo 把几小时的活压到十几分钟;本地 Qwen3-ASR 转写免费,但翻译和配音环节仍需自备 LLM 与 TTS 的 key,Streamlit 界面本身也做了多语言。Apache-2.0 协议,Python 3.12。README 自己写明翻译质量取决于源音频、语言和所选模型,重要片子出片前务必人工校对;Intel Mac 配音默认不带背景音。翻译完的成片要再加工,可以交给 video-use 让 agent 接手精剪。