模型#代码生成#Next.js#评估#匿名模型#Vercel

匿名模型 Pixel Canary 追平 GPT 6 Astra 编程评测,但一道题平均要跑 17 分钟

匿名模型 Pixel Canary 限时免费上架 Vercel,编程评测追平 GPT 6 Astra;但一道题平均要跑 17 分钟,提示词或被用于训练。

黑底白字的 Vercel 公告横幅:Pixel Canary 在 AI Gateway 匿名期免费开放

又一款匿名模型开始公开压测,这次带着硬评测成绩。2026 年 9 月 25 日,代号 Pixel Canary 的模型上架 Vercel AI Gateway,挂在 stealth/pixel-canary 名下,匿名期免费;同日更新的 Next.js Agent Evals 榜单上,它以 90.3% 的基线成功率追平 GPT 6 Astra (high),代价是一道题平均要跑 1015.80 秒,全场最慢。

事实部分

  • 上架与定位:据 Vercel changelog,模型定位编程,覆盖应用构建与重构,官方称「很适合前端开发和移动应用设计」,从响应式布局到导航和交互组件。开发方未公布,模型页也未给出详细能力元数据。据 InfoQ 报道,Cline 平台侧也宣布了限时免费。
  • 评测成绩:Next.js Agent Evals(2026-09-25 榜单)按 pass@4 计分——每题最多尝试 4 次,任一次通过即算过。Pixel Canary 基线通过 31 题中的 28 题(90.3%),与 GPT 6 Astra (high) 持平;配上 AGENTS.md 打包文档后通过 30 题(96.8%),并列该设置下的最高分。通过的任务覆盖 App Router 迁移、数据获取、图片与字体优化、缓存和视图过渡。
模型 智能体 平均耗时(秒) 基线成功率 加 AGENTS.md
Claude Opus 5.5 (high) Claude Code 269.62 97% 97%
GPT 6 Sol (high) Codex 285.70 97% 97%
Pixel Canary OpenCode 1015.80 90% 97%
GPT 6 Astra (high) Codex 251.89 90% 97%
Kimi K3 OpenCode 352.34 84% 97%

数据来自 Vercel 的 Next.js Agent Evals(2026-09-25 榜单),成功率为 pass@4 口径。

  • 速度是硬伤:平均 1015.80 秒一道题,约为 GPT 6 Astra(251.89 秒)的 4 倍、Kimi K3(352.34 秒)的 3 倍;榜首 Claude Opus 5.5 也只要 269.62 秒,成功率还高 7 个百分点。
  • 规格与数据政策:模型页标注上下文 262,144 tokens(约 26 万)、最大输出 131,072 tokens,reasoning effort 可调;changelog 明确该模型不提供 ZDR(零数据保留),提示词和回复可能被用于训练与模型改进。
  • 社区反应与身份猜测:据 InfoQ 汇总,有用户实测个位数 token/s、单任务跑 5–8 小时甚至中途报 provider error。身份猜测从 Qwen 3.8(泰语、印地语分词特征)、Google(Pixel 与 Canary 的命名联想)到 Kimi K3.1 都有,均无证据。

编辑判断

匿名上架是发布前的测压手段——上周登顶调用量榜的 Space Bunny 是一例,但那次只有调用量,这次 Pixel Canary 拿出了能力榜:匿名模型里第一个在硬评测挤进第一梯队的,「值得试」终于有了实测依据。慢也是明码标价的:17 分钟一道题,适合挂后台跑迁移、重构这类长任务,不适合交互式改代码。

把公司代码发过去之前有两件事要想清楚:没有 ZDR,提示词可能被留作训练数据;免费只在匿名期有效。等身份和定价官宣后,可以对照 GPT-6 Sol 与 Luna 的定价,看这波补贴的真实意图。