用 Opus 5.5 做视频:从一句话到成片的工作流
Opus 5.5 画不出一个像素,但能写程序渲出每一帧、剪辑素材、指挥视频模型。本文把一周内验证过的路线、真实成本和六个坑,整理成可照着做的教程。

花大约 $3 和半小时,你能得到一条 84 秒、1080p、配乐卡着剪辑点的成片——文字不糊、数字不融、每一帧都能改代码重渲。做这件事的不是视频模型,是 Opus 5.5 写的程序。
事实核查截至 2026-09-30。关键数字全部挂来源;表述分三级——已证实(官方文档或经核实的一手材料)、社区经验(创作者自述,未经独立复核)、社区推断(超出披露范围的推测,出现时明确标注);下文未单独标注者均为社区经验。
它不是视频模型
Anthropic 的 platform docs 写明,Opus 5.5 的输入输出是“文本+图片→文本”(已证实,platform docs);官方模型页的定位是 agentic coding、computer use 和 knowledge work,通篇没有视频相关表述——发布当天的报道也没提。你在 X 上刷到的那些片子,基本都是它编排外部工具的副产物。
博主 zhuermu 自费在 API 上跑了五条片,再把五份成片的源码读了一遍——五次独立运行,收敛出的管线几乎同构(社区经验,博客):用 HTML/Canvas/WebGL 写一个 renderFrame(t),每一帧都是时间 t 的函数;headless Chrome 并行截帧;ffmpeg 编码、拼接、混音;抽帧拼成 contact sheet 自检;发现问题,改代码,重渲。他的原话:
Opus 5.5 is not a video model like Sora. It does not paint pixels. It writes a program that draws every frame in a headless browser, then hands the frames to ffmpeg.
所以这个生态里其实只有三种机制:写程序画每一帧;剪辑外部素材;指挥外部视频模型。本篇三条路线照此展开,路线一、二走全代码渲染,路线三分实拍线和生成线。措辞纪律也一样:下文不写“它画了一帧”“它生成了视频”,只写“它写的程序渲染出的帧”和“它剪辑的外部素材”。
写实能力有数据可查。X 账号 baboonAI4S 拿 athemeroy 语料库的 1401 个去重视频跑了解剖(“三天”的具体起止,推文没注明):代码绘制动效占 33%,3D 渲染占 29%,写实照片级只有 2.8%,剩下三成多散在其他风格类(社区经验,原推)。分类的底子是语料库用 Gemini 3.8 Flash 做的自动判定(1,119 个“yes/likely”文件),非人工逐条,这组数字当方向看,别当精确普查。要真人出镜、实拍质感,直接去路线三,让视频模型出画面、Opus 管编排。
环境与预算
工具三件套:Claude Code(订阅 Pro 或 5x,或 API 按量,zhuermu 用的 API)、本地 ffmpeg、headless Chrome(走 Playwright 的话浏览器用 npx playwright install 装;直接复用本机 Chrome 的无头模式也行,zhuermu 就这么干的)。配音三选一:edge-tts 免费稳定但没感情(cosine 的选择);MiniMax(zhuermu 用,他的原话“未单独计费”,是没花钱还是成本没单列,博客没展开);Kokoro-82m(deedydas——Menlo Ventures 合伙人、Anthropic 投资人——的 3b1b 风格讲解片拿它配音)。headless 模式有个坑,六条经验里专门有一条。
成本方面,每个数字都是作者自述(社区经验,未经独立复核;zhuermu 的测试无赞助、无厂商额度),原样照抄:
| 场景 | 数字 | 来源 |
|---|---|---|
| deedy 1 分钟宣传片 | 自称约 $2;API 还是订阅口径,他没说 | 推文 |
| 第三方复现 | $3.21 与 $4(OpenRouter,二手转述) | Traictory 汇总 |
| zhuermu 五条总账 | 至少 $55.41:八次运行,其中一次超时被杀、无成本记录,所以是下限;单条 $2.96–$14.79 | 博客 |
| zhuermu 建议值 | 短片 $3–9;8 分钟以上讲解片带一次返工约 $15,中断另算 | 同上 |
| cosine 40+ 分钟教程 | 约 $100,约占其订阅额度 20%(档位文中未说明) | 博客 |
| 订阅换算 | 做 1 分钟成片约花 5x 计划($100/月那档)1% 的周额度;额度全用满约 400 分钟(i陆三金个人估算,只当量级参考) | 微博 |
这张表全是 n=1 的自述:deedy 连口径都没说,第三方复现是二手转述,cosine 的订阅档位也没写明。拿它定预算,最多定到量级。真要兜底,三招都有出处:贵步骤先报价请批(koldo2k 的做法,写进提示词即可);订阅模式自带周额度硬顶,跑到一半被掐,靠交接文档开新会话续上(cosine 第八步,zhuermu 的中断续跑就是这么活的);API 模式在 Claude Code 里随时 /cost 看本场花费,跑飞了 Ctrl-C 杀掉,缩小范围重跑。
时间预期:84 秒的片约 24 分钟、48 轮(zhuermu);15 秒竖版给足逐秒分镜 23 分钟、自然语言改一版 4 分钟(台中网页公司 des13);6 分钟英语课一轮约 45 分钟(0x0funky)。cosine 的 40+ 分钟教程只公开了成本,没公开总耗时。提示缓存让“改一版”比视频模型重新抽卡便宜——这是微博 AI 博主 i陆三金的经验判断,没有对比数字,信几分自己掂量;des13 那 4 分钟改一版就是这个道理。技能栈方面他的建议够用:HyperFrames 或 Remotion 加 TTS 是底座,想花哨再接 Gemini 生图、ElevenLabs、3D 生成。
也别从零造轮子,现成的有一排:HyperFrames(准备动作只有 npx hyperframes skills update,des13 靠它做了四支品牌动画、全程没开剪辑软件,v2code 有七步教程)、buildwithhanif/claude-animation-skill、ClaudeAnimationBase(p5.js 起步模板)、Lemo-Opuscar(39 种风格)、Papermotion(剪纸动画引擎)、video-use(实拍剪辑方向,27,613 星,09-30 查的,星数随时在变)、shipvideo(launchvideo.io 背后,一个 agent 文件加 3 个工具,自述每片约 90k 入 / 15k 出 token)。先装一个跑通,再决定要不要自己攒管线。
zhuermu 还给过一个自建 pipeline 的对照,帮你判断要不要自己攒:自建的是固定脚本,边际成本近零,风格单一;走 Opus,每条片都等于重写一遍工具,花几刀到十几刀,换来的是每章视觉重新设计。他的落点,就是后面六条经验的标题:决定结果的,越来越是你交给它的 brief 和它背后的材料。
一句话短片
三条路线里最短的一条。最小上手有两条路。
裸奔:一句提示词,加一份交付约束备注。zhuermu 五条片共用同一份备注,抄来就能用:
1080p 30fps;全部画面由代码生成;除提供的配音稿外,
不使用任何图像/视频/音乐/语音生成服务;允许抽帧自检。
备注里“不使用语音生成服务”,禁的是它自行调用外部付费服务。配音的落法有两种:你在自己这边用 edge-tts 或 MiniMax 做好音频再递给它(zhuermu 的做法);或者把这一条改成“允许用 edge-tts 合成配音”,让它在你机器上本地合成——cosine 的流水线就这么跑(edge-tts 免费且本地,不碰付费服务)。改一句话的事,别让这条备注卡住第一天。
装 HyperFrames:照 v2code 的七步教程走,装 Node 和 FFmpeg,写带 data-* 属性的 HTML(写法直接看那篇教程,有完整示例),preview 看效果,render 出片。
第一次跑的最短路径(裸奔线):新建空目录,放两个文件——brief.md 写目标和全部事实材料,voiceover.txt 放逐句配音文本(或者你已经做好的一段段 mp3);在这个目录里起 Claude Code 会话,把文末模板贴给它。它交回分镜稿和最难 2–4 秒的动效样后,你在同一个会话里回一句“分镜通过,先渲第 X 秒那段”,或者“把开头改成……”——确认就是这个动作,不用跑任何命令。全片渲完先要 contact sheet,看完再收成片。
动手前记住 athemeroy 语料库的生产指南给出的三阶段验收:先出分镜稿;全片里最难的那 2–4 秒先做动效样;两样都确认了,再全量渲染、交付可复现的工程。跳过前两步直接渲成片,返工的钱全是白花。
前两个实证来自 zhuermu 的复刻(社区经验):
Wasmer 发布片。 给它的全部输入,是 HN 上那句 “Make a modern slick and punchy video for this announcement:” 加上博客正文。成片 84 秒,$2.96,约 24 分钟,48 轮,一次过。配乐由 numpy 振荡器合成,120 BPM,卡在每个剪辑点上。交付前作者抽帧自检,抓出三个 bug:透明标题字、两条字幕重叠、ffmpeg 命令在手机屏上溢出。还有个细节:博客只说“比原生慢约 5%”,没给原生数字,它把原生柱标成 baseline,没有编一个数出来。
Earthrise。 输入只有“重现阿波罗 8 号拍下 Earthrise 的时刻”。它自己找到 NASA Goddard 的重建时间线(SVS 4129)、LOLA 月面地形和 1968 年星历,从 16:38:13 UT 起按实时推进,三次快门落在历史时间戳上。NASA 官方版本从照片反推构图,它选择沿 NASA 时间线重放。zhuermu 的结论:渲染质量早够用了,瓶颈在它把你的需求理解成了什么。
第三个实证来自 cosine 的收录:群论宣传片(视频作者是 B站 UP sadssxa,提示词晒在评论区)。一句中文——“给我做一个抽代但不局限于抽代的宣传片 几分钟 视频要丰富 不要那么抽象 主要是展示抽代的美 视觉表现要丰富有冲击力 你懂我意思不”,无任何 skill。它决定用 Python 合成 D 小调 90 BPM 的原创配乐、按小节卡场景,写了 1200 行的 1080p 动画页面。B站播放约 22.8 万(BV12Zhm6oE6m)。
中文圈的对照数据来自 des13:一句英文提示词,40 秒横版 25 分钟出片;修改用自然语言,「小鴿擋到文字,讓他和其他三個角色排成一列」「不要往下捲動」,4 到 12 分钟出新版。token 帐单全公开:每支输出 4.5–8.3 万 token,四支合计 943–1296 万 token(缓存读计入总量,也是大头)。
约束的给法也不只“一句话”一种。riku720720 拿 3,459 字符的日文规格书做出一只像素跑酷:Canvas 2D、160×90、禁外部资源,规格写死,发挥空间就小(原推)。3D 方向同样走得通:Clearwater 浅水模拟开了源码,AxtonLiu 的鹈鹕骑车剧场版用了自写 GPU 光线步进渲染器加程序音乐(原推)。一句话和一份规格书之间:想省事就给一句话,想精控就写规格书,中间地带自己拿捏。
一句话提示词适合试上限,交付级项目要控制解读。zhuermu 复刻 Wasmer、Earthrise、P(doom) 三个爆款全部一次过,“launch demos are cherry-picked”的怀疑在这三次复刻里不成立——不过三个样本、同一个操作者,推不出普遍结论;但他的两个讲解片都是 v1 翻车、v2 才对(见六条经验)。要确定性,往下两条路线。
长讲解流水线
个人博主 cosine(余弦,与做 Genie 的那家 AI 公司重名不同人)用这套流程做了 40 多分钟的长教程:配图、配音、音效、进度条、分 EP、响度统一、封面,全由它安排(社区经验,博客)。八步拆开:
步骤 1–2,素材与脚本。 先喂素材:官方文档、产品截图、参考视频,全部丢进项目目录(PDF、图片、mp4 直接放),让它整理成资料。规矩定死:口播里说的每件事,都要能在资料里找到出处;找不到,就别说。旁白逐句写,每句对应一个画面。先出几张静帧或一小段预览,顺眼了再全量渲染,返工成本从这里压下来。
步骤 3–4,配音与字幕。 每句单独合成配音并缓存,改哪句重做哪句;字幕按逐词时间戳切,画面跟着词走。音效直接用代码生成;BGM 在人声出现时自动压低;每集响度统一。edge-tts 免费稳定,缺点是没感情。
步骤 5–6,包装与提速。 进度条、章节时间轴、分 EP、合集、封面、投稿简介,全部从同一份时间轴生成;改了内容,重跑一遍自动同步。渲染慢就直说“渲染太慢了,想办法优化”,它自己找路:多开并发、复用浏览器实例、慢变图层只渲三分之一帧。cosine 的实测数字:合集渲染从 21 分钟降到 9 分钟,进度条层从 15 分钟降到 2 分多,单集从 6 分钟降到 4 分钟。
步骤 7–8,验收与交接。 渲完让它自验收:查帧数、音画对齐、响度,抽帧看字幕排版挤不挤。最后通看一遍,必须人来。上下文很长时,让它把技术栈、文件结构、改法写成交接文档,新会话接得上。
中文圈还有更省心的样本。B站 @美丫姐 把文章 PDF 丢给 Opus 5.5 后去睡觉,醒来拿到成片和封面:配音按角色身份分声线,AI 角色带电子感,关键剧情自动配警示乐,全程零 skill、零关键帧(专栏)。她自己的对照是,8 月做 AI 剪辑还要给关键帧加脚本描述。两个月差出一整套工序。
变体不少:dotey 的 12 分钟 Transformer 科普(原推);kimmonismus 的 3 分钟 AI 简史,Remotion 写了约 7400 行 React/TS;Tony Dinh 的对照(cosine 转录):一年前 $1000+,现在 30 分钟内出片——一边是钱一边是时间,口径他没细说,连品牌素材都是它自己去扒的;Addy Osmani 的 40 秒《浏览器如何工作》,每帧都是 JS 画的;emollick 把同样内容改成动漫短视频风,一次出(后三条均 cosine 收录);deedy 的 3b1b 风格论文讲解,工具链 manim + Kokoro-82m + ffmpeg,他的原话是“我没指定任何具体工具”(推文)。
cosine 有一条反直觉观察:“提示词写得越简单,它自己脑补的东西反而越多、越好。“别误读,前提是素材已经喂足。素材空着,简单提示词换来的就是自由发挥。
外部素材线
⚠️ 状态声明:deedy 的完整流程截至 2026-09-30 未发布。他在 09-29 的推文串里写 “I’m going to share my entire flow this week”(原推),“本周”指 09-29 起的那周。本章只基于他公布的七步概要和 09-24 推文的技术披露,超出部分均为社区推断。本篇发布当天已重查原推,出了就更新。相关时间线:Opus 5.5 发布周 09-22;zhuermu 博客 09-26;cosine 09-27;baboonAI4S 解剖 09-29;deedy 原推 09-29。
先把本章的定位说在前头:目前是预告加清单。deedy 流程未发布,可照着跑的只有 video-use 一条,且只有结果记录、没有操作步骤。把这章当菜单读,别当食谱。
实拍/档案线。 deedy 的《America: a 250 year tribute》是 5 分钟纪录片,他的说法是 “completely orchestrated by opus”(宝玉转述的中文版也在流传)。公布的七步:写全片脚本 → 从 YouTube 和档案馆搜集 CC 授权素材 → 剪辑与画面裁剪 → 超分与上色 → 配音、字幕合成 → 配乐 → 审片迭代。硬的技术披露只有一条:09-24 那条 1 分钟宣传片,他的原话是 “no video gen model was used here, no additional libraries. Just JavaScript, playwright and ffmpeg”;纪录片七步清单里同样没有视频生成这一环。七步之外的部分,超分和上色用什么工具、素材怎么筛,他没说,市面上的一切细节描述都算社区推断。
实拍剪辑方向有更小的已验证案例。gregpr07 拍了 13 条 take,交给 video-use 自动读字幕、挑最好一条、剪辑调色加字幕,2 分钟完事,$0.90(原推;他本人就是 video-use 的维护者 Gregor Zunic,参考时记得这层关系)。AxtonLiu 把 83 秒真人原片转成线稿,自述零人工、约 29 分钟(原推)。成本要分开报的例子也有:sab8a 用 Opus 5.5 加 OpenEdit 做口播精剪,约 1 小时 51 分,token 花了 $23、fal 外部服务 $49,两项分开列账(原推)。混合管线照这个习惯记账,月底不会吓到自己。
生成素材线。 あばねちゃん的路子:GPT sol(推文原话如此,具体指哪个产品没写)生成 3 张舞蹈定格姿势图,Grok 把每张做成 6 秒舞蹈视频,三段交给 Opus 剪成 15 秒 showreel(原推)。她的日文提示词原句:
あなたがどれほど素晴らしいモーションデザイナーかを示す、ダイナミックな15秒のモーショングラフィックスビデオを作成してください。タイトルは「億万株姫☆あばねちゃん」です。履歴書用のショーリールのような感じで、全力でやって。
Opus 当导演。 gavinpurcell 让它接 Runway MCP 出镜头,拍超级智能纪录片(原推);OriSilver 用 Blender 草模控 Seedance(原推);koldo2k 走全外包编排,Magnific、Seedream 5 Pro、GPT 2.5 剪纸、Kling 2.5、Lyria 3,总共花了 1,500 credits(哪家服务的积分、折多少美元,推文没写,抄不进预算表就先当贵),而且昂贵步骤前先报价请批(原推)。这条纪律可以直接抄进任何混合管线:外部服务的账单不归你盯,审批权就得留在自己手里。
分工口径参考 apiyi 指南:真人和实拍质感交给 Sora/Veo 这类视频模型,Opus 管编排与包装;照片素材“调用而非生成”,代码加 Ken Burns 效果和遮罩就够。
六条经验
前五条来自 zhuermu 的实操总结,第六条是风格控制:
① 先事实核查,再写 brief。 RSI v1 画面漂亮,引用的 arXiv ID 他逐个查过、全真,但它把“提示工程→上下文→harness→自我进化”画成四棒接力,每棒日期都提前了:context engineering 2025 年 6 月火起来,标成 2024;harness engineering 2026 年 2 月,标成 2025。zhuermu 的形容:“每个零件都对,拼出来的故事比历史整齐。“RSI v2 修好:431 秒 20 章,35 个 arXiv ID 全真。Values v1 更糟,八处事实问题,他的博客举了四例:预印本编号当期刊版本、把论文里”28–62 个百分点“说得比原文更绝对、一条无出处的”西方价值观“论断、把 specs/constitutions 画成第四训练阶段;另四处去他博客对账。Values v2 全修。两个项目 v1 与 v2 的唯一差别:brief 核查过。
② 说清楚你要哪种解读。 一句话进去,它会挑最安全的路走。Earthrise 沿 NASA 时间线重放,属于好的意外;要确定结果,把解读写进 brief。
③ 让它看自己的输出。 五条片全靠抽帧自检抓到 bug。contact sheet 是标准动作,交付前必做。Eric Buess 总结过这个循环(cosine 收录):模型写代码、渲染、回头看自己渲出来的帧、把不对的地方修掉。
④ 别让长任务死在回合结束。 headless 模式下,回合一结束,后台渲染进程跟着死。解法两个:前台分段渲;或提示词写明“渲染完才能停”。
⑤ 画面跟着声音走。 先合成配音,量出每句真实时长,再排画面。用拉伸音频去贴画面,漂移超过 10 秒就重排。
⑥ 风格和节奏用工程绕。 讲不清风格就垫图、垫视频(i陆三金);换推理档加笔刷库能换画风——小互(AI 解读站)拆解的那支手绘 MV,Medium 推理出 Flash 风,改成 xhigh 加 p5.brush 后成水彩绘本,注意他一次换了两个变量,画风变化归因给谁没做对照;节奏是模型最常出错的地方(ClaudeAnimationBase 指南),先拿 2–4 秒动效样验节奏,再铺全片。
排错与模板
| 症状 | 修理 |
|---|---|
| 字幕重叠、透明标题字、ffmpeg 命令溢出手机屏 | 抽帧自检(contact sheet) |
| 日期与事实错 | 用核查过的 brief 重来(六条经验①) |
| 音画漂移 | 先配音、量时长,后排画面 |
| 后台渲染中途死 | 前台分段渲;提示词写明渲染完才能停 |
| 节奏乱 | 先做最难 2–4 秒的动效样 |
| 画风不对 | 垫图/垫视频;换笔刷库;换推理档 |
模板有三种形态可参考。一句话级:des13 统计的爆款第一名(1370 万观看,其统计口径)就一句「製作一支 2 分鐘的 [主題] 動畫影片,每一幀都用程式碼繪製」,配上路线一里那份交付备注。分镜级:des13 的 15 秒竖版给逐秒分镜,出片后用自然语言改。委托级:donaldjewkes 的 MV 委托书 9,554 字符,配现成 MP4、歌曲、源码,允许图像生成、Seedance 2.5、ElevenLabs,代理连做 12 小时(原推),要精控,照这个形态写。同一句式在我们站上也有可复制的动效 showreel 模板,GLM-5.3 实测跑通。
最后一份模板可直接抄,四个模块对应多位创作者验证过的有效模式——目标、素材边界、交付规格、自检许可:
制作一支 2 分钟的 [主题] 动画短片,每一帧都用代码绘制。
素材边界:
- 配音稿见 voiceover.txt,语音用 edge-tts 在本地合成;
除此之外不使用任何图像/视频/音乐生成服务。
- 口播里的每个事实(日期、数字、人名)先对照我提供的资料核查,
找不到出处的删掉,或改写成有出处的说法。
交付规格:
- 1080p 30fps MP4;画面全部由 HTML/Canvas 渲染;配乐用代码合成。
- 先合成配音、量出每句真实时长,画面按真实时长排;
需要拉伸音频超过 10 秒时,重排画面,别硬拉音频。
自检与流程:
- 允许随时抽帧拼 contact sheet 检查画面。
- 先交分镜稿和全片中最难 2–4 秒的动效样,我确认后再全量渲染。
- 渲染未完成不要停止;回合要结束前,把进度和续跑方法写成交接文档。
语料与延伸
prompt 语料三份:athemeroy 的 88 例 prompt/工作流矩阵;zhuyansen 的 96 条全文 prompt,jasonzhu.ai 可在线播放;X-RayLuan 的逐字 prompt 仓(整仓为 EasyVeo 引流,选例有商业偏置,挑着用)。本站此前拆过画廊里的一批 Opus 5.5 提示词和一份游戏 VFX 提示词,可以对照着看。
语料本身也有水分:baboonAI4S 数出 282 个标注非 Opus 制作、39 组完全重复,别家视频模型公司 higgsfield 混进来发了 22 条,热门仓库里的数字别照单全收。提示词长度的跨度也大:从 172 字到 1.7 万字,差一百倍;还有人 24 小时内“借鉴”了别人 1750 词的 prompt,5-gram 重合率 87%(均为 baboonAI4S 统计)。看语料时先看出处,再看句子。
还有两处容易翻车。模型听不到音频,要卡音乐,先让它“测”音乐:P(doom) 那条 MV 的解法,是用 Python 逐帧算能量、低音和节拍网格存成表,所有视觉读这张表,“It could not hear the song, so it measured it”。另外,deedy 承诺的完整流程一旦公布,外部素材线那一章要照着重写——本篇发布当天(09-30)查过一次,还没出。