代季峰创办的 Naive AI 开源首款模型:309B 参数、原生 1M 上下文
Naive AI 开源 Naive-N0.5-Flash:309B 总参、15.5B 激活、原生 1M 上下文、MIT 许可;官方称研发大多由 AI 完成。

代季峰(清华大学副教授)创办的 Naive AI 9 月 28 日开源了公司首款模型 Naive-N0.5-Flash:一个 309B 总参数、15.5B 激活的 MoE 模型,原生支持 1M token 上下文,权重与推理代码以 MIT 许可发布在 Hugging Face。它的卖点是「用 AI 造模型」:官方技术报告称架构探索、实验运行与系统优化大部分由 AI 完成,人类负责定目标与最终决策。
事实部分
- 规格:309B 总参数、15.5B 激活,基于小米开源的 MiMo-V2.5 底座做后训练;注意力结构为 5 层 SWA 加 1 层 DSA(DeepSeek 稀疏注意力,取 top-2048 位置),不含全注意力。
- 许可与价格:MIT 许可开源权重与推理代码;API 定价为每百万 token 输入 0.6 元、输出 2.6 元、缓存读取 0.07 元。
- 官方自报基准:PaperBench 63.2、MLE-bench-30 73.7%、NL2Repo 71.9,NanoGPT SpeedRun 73.8 秒(此前纪录 77.5 秒)——均为厂商自报,未经独立验证。
- AI 参与研发:NaiveRT 系统优化 6 天跑完 151 组实验,投机解码延迟从 12.3 毫秒降到 3.4 毫秒;另有 AI 产出的世界模型 AutoWM。
- 公司背景:Naive AI 成立于 2026 年 2 月,据报道估值已达 14 亿美元。
编辑判断
这条新闻的看点是流程而不是单个跑分:如果「AI 做实验、人做决策」的分工属实且可复现,中小团队追赶前沿的成本结构会不一样——实验瓶颈从人力变成算力预算。两个保留意见:模型是在开源底座上做后训练,不是从零训练;「用 AI 造」的部分官方报告自证成分高。想验证的话,权重就在 Hugging Face,MIT 许可可以直接拿去跑;对比对象可以看同样走开源路线、主打 Agent 跑分的 Nex-N2.5。