评论#代码智能体

Claude 订阅约为 OpenAI 的 5 倍价值:开发者怎么选模型、省 Token

SemiAnalysis 实测九家订阅:日常主力模型上,Claude 的 API 等价价值约为 OpenAI 的 5 倍。附开发者选模型、省 Token 做法。

选 AI 编程订阅时,最难回答的问题是「这个套餐到底能用多少」:Claude 和 ChatGPT 都只给一条 0 到 100% 的进度条,不告诉你对应多少 Token。半导体与 AI 研究机构 SemiAnalysis 在 2026 年 10 月 5 日发布的订阅实测,把这条进度条换算成了美元:在两家都当作日常主力的模型上,Claude 订阅的 API 等价价值约为 OpenAI 的 5 倍。这篇文章把结论拆成开发者能直接用的三件事:怎么选模型,怎么省 Token,以及从这份测试的做法里能学到什么。文末也交代我们自己「无脑选 Claude」的理由和它的前提。

要点

  • 价值差在中档:200 美元档上,OpenAI 的 GPT-6 Astra 用满约值 2,897 美元,Anthropic 的 Fable 5.1 约值 2,485 美元,两者接近;但 Opus 5.5 对 GPT-6.1 Sol 这一档,Claude 各套餐约为 OpenAI 的 5 倍(SemiAnalysis,2026-10-05)。
  • 额度不是常数:OpenAI 在 9 月 29 日 DevDay 前后把 200 美元档的每个模型 Token 减半;SemiAnalysis 还碰到过同款账号额度低约 20% 的 A/B 测试。
  • Token 里缓存读取占大头:编程智能体反复重发旧上下文,缓存命中与否,比换一句提示词更影响账单和额度。

测试是怎么做的

SemiAnalysis 的做法值得先看懂,因为它决定了结论能不能直接套到你的用量上。订阅套餐不公布 Token 数,只有 5 小时和 7 天两个窗口的百分比进度条。测试团队一种 Token 一种 Token 地测:用同一个提示模板反复发请求,记录每次请求计费了多少 Token、进度条停在哪,再统计「进度条每跳一格用了多少 Token」。

具体分四类:新输入、缓存写入、缓存读取和输出。输入测试每次换一个随机标签,保证缓存不命中;缓存写入测试给提示打缓存标记;缓存读取测试用固定标签,第一次写入、之后全是读取;输出测试用技术文章逼模型写长文,因为模型会拒绝「把某个词重复十万遍」这类机械请求。丢掉首尾两个不完整的台阶后,他们不断增加台阶,直到误差落进 ±5% 才报数。最后,把每类 Token 的单价按 SemiAnalysis 自己 9 月的智能体用量比例混合,乘以 API 标价,得到「API 等价价值」。

这套方法给开发者两条提醒。第一,同一个套餐的价值取决于「套餐、模型、负载」三元组:SemiAnalysis 在文中指出,不能脱离模型和负载说一个套餐值多少钱。第二,它的负载是智能体编程,缓存读取占比很高;如果你主要在聊天窗口里问答,实际体验会不同。

选模型的依据

按 Anthropic 官方文档(2026-10-08 查看),三档 Claude 模型的 API 价格如下,GPT-6.1 Sol 的价格来自 OpenAI 发布页,见我们的 GPT-6.1 Sol 报道:

模型输入输出缓存命中
Claude Fable 5.1$10 / MTok$50 / MTok$0.25 / MTok
Claude Opus 5.5$4 / MTok$20 / MTok$0.20 / MTok
Claude Sonnet 5.5$2 / MTok$10 / MTok$0.10 / MTok
GPT-6.1 Sol$2 / MTok$10 / MTok$0.10 / MTok

订阅里的规则和这张表不完全一致。SemiAnalysis 的数据显示,Claude 套餐里 Fable 最多只占一半额度,用完后另一半还能跑别的模型;Sonnet 5.5 和 Opus 5.5 的订阅价值差别不大,到 Fable 5.1 才明显缩水。这给出一个朴素的分工:

  • 日常编码用 Opus 5.5:它是 Anthropic 推荐的长时编程主力,在订阅里性价比最高。Opus 5.5 发布时同时下调了 API 价格,订阅额度也有所提高。
  • 难题再切 Fable 5.1:架构设计、疑难 bug 这类一次卡住就浪费几小时的任务,用它;其余任务不值得耗这份贵的额度。
  • 批量、简单的活交给 Sonnet 5.5:订阅里它和 Opus 价值接近,但 API 价格只有一半,脚本化调用时更省。

如果走 API 按量付费而非订阅,规则变成单价乘以用量。Sol 和 Sonnet 5.5 标价相同,OpenAI 官方在 Terminal-Bench Science 上给出的单任务成本是 Sol 5.47 美元、Opus 5.5 23.21 美元(OpenAI 自报)。所以「Claude 订阅更值」说的是订阅里的额度,不等于每个任务都更便宜。

为什么我们仍选 Claude

边界在这里:下面是编辑部的日常体验,不是 SemiAnalysis 的结论,也没有做过对照实验。我们的体感是,Claude 在写代码时返工少、多步任务更容易一次做对,所以同样一个需求花的轮次更少。哪怕单价更高,总消耗未必更多;再叠加订阅里大约 5 倍的价值差,选择并不纠结。

这个判断有两个缺口,我们也不回避。其一,SemiAnalysis 在文中直说业界缺乏可靠的 Token 效率数据,也不认可常被引用的 Artificial Analysis 评分能代表真实工作,所以「谁做同一件事用的 Token 更少」目前只能靠自己的体验。其二,OpenAI 的 Pro 套餐没有 5 小时限制,月内更容易把额度用满;SemiAnalysis 的判断是,这抵不过 Opus 5.5 约 4 倍的价值差。如果你的工作是整夜跑任务,这一点值得自己算一遍。

另一个现实:OpenAI 在 9 月底刚调整过订阅,价目表变化的起点见我们的 Pro 订阅改版报道。过去不少独立开发者看重 OpenAI 的慷慨额度,按 SemiAnalysis 的测量,这条优势已经不成立。

省 Token 的做法

下面的做法都围绕一个事实:智能体用量里缓存读取占比大,而且单价差距悬殊。以 Opus 5.5 为例,新输入每百万 Token 4 美元,缓存命中只要 0.20 美元,相差 20 倍。

  1. 让缓存命中。Anthropic 的缓存文档把排查项列得很清楚:两次调用之间,tool_choice、图片、思考配置和 output_config.effort 要保持一致,调用要落在缓存有效期内(默认 5 分钟,1 小时的长缓存写入价是基础输入价的 2 倍)。Opus 5.5 的最小可缓存长度是 512 Token。把稳定的内容(系统提示、工具定义、规范文档)放在前面,易变的内容放最后。
  2. 按任务调思考强度。输出是最贵的 Token 类型。我们的Opus 5.5 报道提到,Opus 5.5 默认 effort 为 medium,并有开发者指出 max 档的输出 Token 消耗偏高;批量跑之前先用小样本试。
  3. 一个任务开一个会话。长会话每一轮都要重读历史,缓存读取虽便宜但不是零;任务完成后开新会话,把必要结论写进项目文档里,比无限续聊更省。
  4. 把规划放到不耗额度的地方。ChatGPT 桌面端的 Chat 模式不消耗 Codex 额度,具体做法见巧用 GPT 省 Codex 额度。Claude 这边我们没有核实类似的免费模式,所以不在这里下结论。
  5. 看清两道窗口。5 小时窗口一周内会反复重置,月度上限由周限额封顶;把重任务排在窗口刚重置之后,别在窗口尾巴上开长任务。

额度会变,别押注

SemiAnalysis 这份报告最有意思的一段是它抓到了一次 A/B 测试:三个同款账号里,有一个额度低约 20%,而且账号更老。向厂商确认后,对方说这属于「极小范围」测试,目的是调整人们触达限额时的平衡,并强调没有整体下调。这说明厂商能在不通知的情况下改额度,也说明足够细的测量能发现这种改动。

价目表的变动同样频繁:OpenAI 把 200 美元档用量从 Plus 的 20 倍降到 10 倍,推出 500 美元的 Ultrafast 档;旧额度只保留到 10 月 29 日。SemiAnalysis 的数据显示,改完后 OpenAI 的 100、200、500 美元三档每美元换到的 Token 一样,而 Anthropic 各档一直是同一单价。

两家减补贴的路径也不同。SemiAnalysis 估算订阅只占 Anthropic 收入约一成,却占推理算力四成以上。Anthropic 的做法是越贵的模型给得越少,OpenAI 是所有模型一起下调。对开发者的含义是:今天的最优选择明天可能就不是,Opus 5.5 订阅的价值在 API 降价后其实也略有下降。

给开发者的建议

  • 别预付长周期:厂商随时调额度,月付留着转身的余地。
  • 自己记账:不测像 SemiAnalysis 那么细,也至少每周记一次「某个固定任务耗掉多少百分比」,额度悄悄变动时你会第一时间发现。
  • 读套餐要看三元组:看「套餐、模型、负载」,不看广告上的倍数;OpenAI 这次就是把倍数标注一并删了。
  • 别靠重置活动做计划:OpenAI Codex 负责人 Tibo 承诺未来 28 天要么每天上线改进,要么给全体用户重置额度,这是好消息,但不是可以排进日程的资源。
  • 按任务路由模型:日常 Opus、难题 Fable、批处理 Sonnet,再用自己的体验校准,不迷信榜单。