模型#跑分#模型推理

决策模型成新品类:Jev 传估值超百亿美元

Jev 定义「只做决定」的机器原生模型;OpenAI、Amazon 两周内跟进,TypeSafe 传谈判估值超 100 亿美元。

Latent Space 访谈节目封面:红发的 Jev 创始人 Diogo Almeida 与 Jev 产品界面

量子位 10 月 3 日整理 Latent Space 访谈:TypeSafe AI 创始人 Diogo Almeida(前 OpenAI 研究员,参与过 ChatGPT 相关工作)把公司第一款产品 Jev 定义为「System-One 模型」——机器原生、大型可编程、不会聊天、只会做决定:三个 API 原语分别对应 switch 分支(choice)、if 判断(null)与排序阈值(score),输出直接交给程序读取,不给对话留接口。他称训练方法是自研的 RLCD(以程序闭环验证为目标的强化学习),刻意不做传统安全对齐、不做公开 benchmark——理由是榜单「极易被操纵」。公司自称上线六天视频播放破 3870 万、日处理量破万亿 token;名字来自杰文斯悖论,主打极致性价比。

创始人:带着情绪离场

Almeida 的背景解释了这款产品的气质:他在 OpenAI 参与过 instructor-GPT 相关工作(用自研算法替代 PPO 数据清洗),据他自述是「带着情绪」离职创业——「明明看见方向,却怎么也推不动」。他曾在交流中向奥特曼讲过可编程 AI 的想法,转述的回应是鼓励:「这他妈也太好了,你应该去干!」公司自称更像「数据实验室」而非模型实验室:大量招聘数据人才、刻意不用用户数据训练(避免幂律分布导致过拟合),应用场景锁定暗数据分析、coding agent、实时决策与游戏。他的五年目标也很具体:拉动全要素生产率(TFP)增长 3%。

两周内:从单品到品类

TechCrunch 9 月 30 日报道 OpenAI 推出了自己的「Jev 克隆」,10 月 1 日又报道 Amazon 跟进——标题的措辞是「决策模型正涌向全网」。一个创业公司的新范式在两周内被两大巨头复制,这在基础模型行业并不多见:上一次类似的快速跟进还要数推理模型的 o1 时刻。TechCrunch 对 OpenAI 版本的解读尤其值得注意:决策模型可能帮前沿实验室管住自己的蜂群智能体——智能体做规划时最烧钱的正是无谓的生成,而分支判断恰好不需要生成。

估值传闻:三周翻 50 倍

多家外媒报道,TypeSafe 正在谈判一轮超过 10 亿美元的新融资,估值超 100 亿美元——而它 9 月 15 日才以 4000 万美元种子轮(DCVC 领投,James Hardiman 主导)出 stealth,当时估值约 2 亿。三周 50 倍的传闻尚无条款或参与方确认,需要打折听;但它与 OpenAI、Amazon 的快速跟进互相印证了一件事:市场相信「给程序用的模型」是一个真实品类,而不只是营销叙事。

需要打折的部分

Jev 的关键数字全部来自公司自述:万亿 token 日处理量、444.6 倍成本优势(分析师已提出质疑)、「第三方 JevBench 75.3 分登顶」——而创始人本人拒绝公开 benchmark 的立场,恰恰让这些自报数字无法被独立核验。Almeida 对此的回应是自洽的:「直到你把模型放进自己的工作流,针对那个工作流去测量,才能判断它在真正重要的流程里表现如何。」这对买家是更高的评估成本,对行业是一个反 benchmark 的实验。

编辑判断:范式之争

Almeida 的论断很尖锐:「现在几乎所有模型真正创造的商业价值都接近于零。」匿名模型上榜单的故事我们之前报道过——行业对榜单的迷信正在被两头夹击:一头是操纵,一头是「榜单根本测不到你真正的场景」。决策模型能不能立住,取决于有多少生产系统的 switch/if 真的被 choice/null/score 替换——跑分说明不了这件事。OpenAI 和 Amazon 已经下注;三个月后看工作流里有没有它。