音视频#视频生成

LongCat-Video-Avatar 1.5:照片加音频生成口播数字人

美团 LongCat 团队开源的数字人模型:一张照片配一段音频生成口播视频,1.5 版换用 Whisper 做口型同步、8 步蒸馏加速,MIT 协议可商用。

项目资料

GitHub Ecosystem
仓库地址github.com/meituan-longcat/LongCat-Video
许可证
MIT
主语言
Python
星标
8,446
核查时间
2026-10-01

以上快照资料以核查当日为准,可能随版本或运营策略变化。

口播视频的门槛从来不在写稿,在出镜:布光、拍摄、剪辑,半天就没了。美团 LongCat 团队的 LongCat-Video-Avatar 把这件事压成两个输入——一张人物照片、一段音频,输出带口型同步的口播视频。1.5 版于 2026 年 5 月 21 日发布,代码和权重全部开源。视频号「榕哥AI落地」宣传语是“虚拟人口播要进白菜价时代”,指的就是这个项目;它的评测场景也正好对上视频里列的新闻播报、知识课程、电商带货。

核心功能

  • 照片加音频出片:不需要训练或微调形象,一张图片配一段音频直接生成人物开口说话的视频,官方支持 Audio-Text-to-Video、Audio-Text-Image-to-Video 等原生任务。
  • Whisper 口型同步:1.5 版把音频编码器从 Wav2Vec2 换成 Whisper-Large,唇形跟随更顺滑自然。
  • 长视频稳定:官方称在长视频生成中保持全身时序稳定与身份一致,不再出现越长越崩的情况。
  • 风格泛化:动漫角色、动物、多人互动、手持物体这类复杂场景都能处理,不只是真人头像。
  • 单轨与多轨音频:支持单人输入,也支持多轨音频驱动多角色,适合对话类内容。
  • 8 步推理:基于 DMD2 的步数蒸馏把推理压到 8 NFE,出片速度和成本一起降下来。

典型使用场景

  • 新闻播报与知识课程:固定形象加每日文案,批量出带口型的播报视频。
  • 电商带货讲解:商品图配讲解音频,生成虚拟主播口播,不用真人出镜。
  • 动漫与虚拟IP内容:风格化角色也能开口,配音即出片。

快速上手

代码在 meituan-longcat/LongCat-Video 仓库,权重在 Hugging Face:

git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Video
cd LongCat-Video
pip install -r requirements.txt

README 另要求 torch 2.6.0(CUDA 12.4)与 flash_attn 2.7.4.post1。想跳过环境,社区已有 ComfyUI 节点(如 rookiestar28/ComfyUI-LongCat-Avatar)和 RunPod 镜像可用。

小结

LongCat-Video-Avatar 适合想批量做口播内容又不想出镜的团队,也适合研究音频驱动视频的开发者;想要“传个照片几分钟出片”的轻度用户,托管服务更省心,比如 HeyGen 这类商用平台。代码 MIT 协议,截至 2026-10-01 约 8.4k 星。要留意:本地推理对显存和 CUDA 环境要求不低,出片是离线渲染,做不了实时直播——需要实时交互的话看 LiveTalking。