评论#视频生成#代码智能体

当模型不画像素:Opus 5.5 的一周视频潮

Anthropic 没宣传过 Opus 5.5 的视频能力,用户一周内把它做成品类:1401 条视频、四份账单、两成掺水。现象、原理、边界与成本,一篇讲清。

阿波罗 8 号 1968 年拍下的 Earthrise:地球悬在灰色月面地平线上空(NASA 摄影,公有领域)

Opus 5.5 画不出一个像素——官方文档写得明明白白,输入文本和图片,输出文本。可它成了最近一周全网产量最高的视频作者之一:Menlo Ventures 合伙人 deedydas 用它剪出五分钟美国建国 250 年纪录片,B站上一句中文提示词做出来的群论宣传片播放二十几万,还有人建了语料库专门收录这类视频,三天收了 1401 条。它做视频靠的不是生成,是写程序。这件事的原理、边界和价格,一周里被几份公开复盘摸得差不多了,值得把账算给大家看。

一周长出的视频运动

时间线先摆清楚。Opus 5.5 在 9 月 22 日发布周登场,官方材料通篇没提视频。三天之内,开发者 atheremeroy 建的语料库收了 1401 条去重视频,日更曲线从 22 日的 121 条涨到 24 日的 537 条,次日回落到 213(X 用户 baboonAI4S 对语料库做的统计,快照截至 9 月 26 日前后)。Hacker News 的官方发布帖收了 1806 分、1129 条评论,讨论几乎全在模型对比上——视频话题只出现一条。这场运动没有任何官方推手,是用户自己撞出来的。

撞出来之后,基建一周内就长齐了:athemeroy 的语料库逐条溯源、日更;zhuyansen 的合集收了 986 件作品、259 条提示词;剪辑工具 video-use(browser-use 出品)涨到 27,613 星;launchvideo.io 背后的 shipvideo 在 9 月 24 日开源了整套管线。中文圈也没慢半拍:群论宣传片 B站播放约 22.8 万,Opus 与 GPT 6 Astra 的同题对比约 16.5 万(截至 9 月 30 日的约数),台中的网页公司 des13 直接拿它产了四支品牌动画,提示词、耗时、token 账单全部公开。

类型分布里有个耐人寻味的头名:“让 AI 吹 AI”的内容占 21%,产品宣传片 20%、游戏交互 19%、科普 12%。这场视频潮的第一主题,是 AI 侏儒自己。

它不画像素

原理一句话:它写的程序渲染每一帧,再把帧交给 ffmpeg。博主 zhuermu 把五条成片的源码读了一遍——五次独立运行,收敛出几乎同构的管线:HTML/Canvas/WebGL 写一个 renderFrame(t),每一帧都是时间的函数;headless Chrome 逐帧截图;ffmpeg 编码合成;最后抽帧拼成 contact sheet 自己检查、改代码、重渲。deedydas 的原话更直白:“没用视频生成模型,没有额外的库,就是 JavaScript、Playwright 和 ffmpeg。Claude 写了这个网站动画,然后给它录了屏。”

这和 Sora 那类视频模型是两个物种。Sora 在猜像素,Opus 在写渲染器。猜出来的画面,文字会糊、手指会多、图表数字会融化;写出来的画面,改一句话重跑一遍就行。产物是代码——可读、可改、可复现,这是“工程”和“抽卡”的分界线。

边界在哪

语料库的数字把能力边界画得很清楚:代码绘制动效占 33%,3D 渲染 29%,写实照片级只有 2.8%(Gemini 自动分类的结果,当方向看)。它最强的,是程序员每天都在做的事;最弱的恰恰是传统视频模型的主场。这个生态里最好的作品,大概率出自会写代码的人之手——LHC 质子对撞是代码驱动的 Blender,房子从线稿长成成品是 Three.js,一条 80 秒短片可以是一个零依赖的 HTML 文件。

比画面更紧的边界是解读。zhuermu 的智能体自我进化讲解片,第一版画面漂亮、35 个 arXiv 引用全真,但时间线整体错位——context engineering 2025 年 6 月才火起来,被标成 2024。他的形容是“每个零件都对,拼出来的故事比历史整齐”。上限不在它画得多好,在它把你的需求理解成了什么。

它的耳朵也是假的。它听不到音乐,做 MV 的解法是工程师式的:用 Python 解码歌曲,逐帧算能量、低音和节拍网格存成表,让所有画面读这张表——“It could not hear the song, so it measured it.”

质疑声同期就在。Hacker News 一个 427 分的讨论帖(“Opus 5.5 is good at explainer videos”)里,高赞评论不客气:有人说这只是“把演示文稿 skill 变成视频”,有人说这类内容 AI 时代之前就是 slop,还有人看到视频第一反应是“求文字版”。这些批评不算冤枉它——2.8% 的写实占比摆在那里,要真人实拍质感,目前还是得让 Sora、Veo 出画面,Opus 当导演(deedydas 的纪录片就是走的“编排”路线,完整流程他答应本周公布)。

成本经济学

一周下来,价签谱系齐了,全部是作者自述:纯剪辑一条 2 分钟的 take,$0.90(video-use 作者自己的演示);84 秒品牌片,$2.96;8 分钟以上的讲解片带一次返工,约 $15;40 多分钟的长教程,约 $100(cosine 自述约合其订阅额度的 20%);最贵的一档是 shneural 那条 15 秒动效 showreel——900 帧、1 小时 32 分、$81 的 API 账单,Opus 自作主张调了机器上的 Blender。Tony Dinh 的对照最直观:一年前同类产品宣传片他花了 $1000 多,现在不到 30 分钟。

但真正的经济学在结构里。zhuermu 拿它和自己两个月前自建的白板视频流水线做了对照:自建的是固定脚本,建好之后每条边际成本近零,但风格只有白板一种;Opus 不用建工具,可每条视频都是重写一遍工具,用完就扔。还有一条容易被忽略的:提示缓存让“改一版”比视频模型重新抽卡便宜——des13 的实测是改一句自然语言,4 到 12 分钟出新版。便宜的迭代,才是它插进创作流程的真正入口。

热闹里的水分

泡沫也在同一周里现形。baboonAI4S 对语料的统计(自动标注口径)显示:282 条视频标注非 Opus 制作,39 组完全重复,竞品公司 higgsfield 混进来发了 22 条;有人 24 小时内“借鉴”别人 1750 词的提示词,5-gram 重合率 87%——这是在案的个案,不代表普遍水平,但说明提示词本身已经成了被抄的资产。热度曲线也在 9 月 24 日见顶后次日腰斩——三天快照里的一天回落,说“潮退”为时过早,说“只会涨”也不成立。

有意思的是,方法本身的复现检验反而站得住:zhuermu 拿原始提示词复刻三个爆款,全部一次过。“发布视频是精选出来的”这种怀疑,在这三次复刻里不成立。水分在语料墙里,不在方法里。另一个信号是空白:1401 条里数据可视化只占 1.3%——潮水涌向炫技和自我指涉,真正干活的地方没人。

上限在 brief

把一周的复盘摆在一起,最像结论的是 zhuermu 那句话:决定结果的,越来越是你交给它的 brief,和它背后的材料。他的两个讲解片都是 v1 错、v2 对,唯一差别是 v2 之前他做了事实核查、把核查过的 brief 交给模型。cosine 的观察“提示词越简单,它脑补的东西越多越好”和这并不矛盾——一句话买的是想象力,交付级结果买的是核查,两种买法服务两种场景。

比任何一条视频更值得记下的,是能力到达的方式:Anthropic 没有宣传过视频,路线图上大概也没有它,用户一周内把它做成一个品类。下一个这样的能力,多半也不会出现在发布会 Keynote 里,而在愿意花 $3 试一次的人手里。想试的话,我们同一天发了一篇可以照着做的教程,从一句话到成片的路线、成本和坑都在里面。