vLLM 团队创业公司 Inferact:16 块 TPU v7 跑 Kimi K3,比 GB200 快 57%
据量子位报道,vLLM 原班人马创办的 Inferact 为谷歌 TPU 写了 megakernel 推理内核,配合 DeepSeek 的 DSpark 推测解码,在 16 块 TPU v7 上跑 Kimi K3 达到每秒 709 token,同等条件下 GB200 为 452 token,代码已开源。
「投机解码」标签聚合的各栏目已发布内容,按本站发布日期从新到旧排列。
1 条
据量子位报道,vLLM 原班人马创办的 Inferact 为谷歌 TPU 写了 megakernel 推理内核,配合 DeepSeek 的 DSpark 推测解码,在 16 块 TPU v7 上跑 Kimi K3 达到每秒 709 token,同等条件下 GB200 为 452 token,代码已开源。