Muse、Manus 2.0 与 Grok Bot:个人智能体的三条路线
七周内 Grok Bot、Muse、Manus 2.0 相继落地。本文对照三家的技术路线、自报评测数据、中英文圈口碑与开发故事,给出分人群的选用建议。

2026 年 8 月 11 日,xAI 把 Grok Bot 挂上 beta;9 月 8 日,Meta 发布 Muse;9 月 28 日,恢复独立运营不到一个月的 Manus 推出 2.0。七周之内,「个人智能体」从发布会概念变成货架上三件可以今天注册的商品——而且三家对「AI 替你干活」该怎么做,给出的答案几乎没有重叠。
本文对照三家的定位、技术路线、评测数据和口碑争议,读完你可以回答一个具体问题:这三个产品该不该用、该用哪个、哪些数字该信。
三件商品,三种卖法
| Meta Muse | Manus 2.0 | Grok Bot | |
|---|---|---|---|
| 发布 | 2026-09-08 | 2026-09-28 | 2026-08-11(beta) |
| 公司 | Meta(Meta Superintelligence Labs) | 蝴蝶效应 Butterfly Effect(新加坡) | xAI |
| 一句话定位 | 替普通人跑腿的私人助理 | 创作工场 + 事件自动化平台 | 可以派活的 AI 队友 |
| 价格 | 免费 + 订阅(具体档位未完全公布) | 免费额度 + 付费(2.0 未公布新定价);Cue 凭邀请码免费 | 捆绑 SuperGrok($30/月起)与 Cursor 付费套餐,无单独定价 |
| 平台 | iOS / Android / muse.ai / WhatsApp | Web / 桌面 / 移动端 | 桌面(含 Linux 构建)/ iOS |
| 底层模型 | Muse Spark(自研) | Claude 与微调 Qwen(官方确认不自研基座) | Grok 4.5 / 4.6(自研) |
| 可用地区 | 美国和加拿大 | 海外版已上线,国内版「组建团队中」 | 需 SuperGrok / Cursor 订阅 |
三家切的是同一块市场——「不用你盯着的 AI」——但切入点不同。Muse 赌的是几十亿普通人第一次用智能体,把宝押在信任和安全上;Manus 2.0 避开通用入口,往视频剪辑、游戏开发、事件自动化这些重执行场景走;Grok Bot 把自己包进现有订阅,先发给愿意折腾的极客和 Cursor 开发者。
技术路线:钱花在三个不同的地方
| 维度 | Muse | Manus 2.0 | Grok Bot |
|---|---|---|---|
| 基座模型 | 自研 Muse Spark,预训练栈推倒重构 | 不练基座,工程做在 Cascade 调度层 | 自研 Grok 4.5/4.6,为长任务优化 |
| 执行环境 | Muse Secure VM:每用户独立云虚拟机 + 浏览器 | 云端沙盒 + 可购买的 Cloud Computer + 授权后操作你的本机(Computer Use) | Agent Computer:一个账号下所有 Bot 共享的持久云电脑 |
| 权限与安全 | Sentinel 独立审批代理,模型看不到真实凭证 | 连接器授权 + 预算额度 | 共享 cookie 与登录态,文档明言「不是独立的安全边界」 |
| 交互形态 | 像和人聊天:一条长对话、可打断、Artifacts 富输出 | 项目制工作台(Manus Studio)+ 手机远程遥控本机 | 消息派活,Bot 干完回来要审批 |
| 多智能体 | 模型层多智能体编排(推理加速) | Cue 里多个 Agent 拉群协作,各有邮箱/手机号/钱包 | 多 Bot 并行、互相传球、群聊协调 |
Meta:预算花在「信任基础设施」上
Muse 的智能体跑在每用户一个的 Muse Secure VM 里,内部代号 Hatch。Meta 在工程博客里把架构写得很细:智能体被关在 systemd-nspawn 容器里,root 被映射成无特权用户,禁用 io_uring,砍掉 CAP_SYS_PTRACE 等能力;所有对外请求经过一个独立的 Sentinel 代理(eBPF 过滤,第四层到第七层都检查),模型提出动作,只有 Sentinel 能批准。最硬的一条是凭证替身:智能体拿到的永远是代理 token,真实密码在出网瞬间才被替换进去——提示注入骗它泄露密码,也泄无可泄。
这套东西贵,但它是 Muse 全部卖点的前提:敢把邮箱、日历、支付连进来,才谈得上替你干活。Muse 的记忆是一份用户可以直接查看和编辑的 MEMORY.md,敏感动作(发邮件、花钱)默认弹出审批卡片,年底还要上 Confidential VM——整台虚拟机用只有用户自己持有的密钥加密,Meta 自己都看不了。
Manus:不练基座,把工程做在调度层
Manus 从第一天就没打算训练自己的基座模型,官方在 2025 年 12 月确认构建于 Claude 与微调版 Qwen 之上。2.0 的核心是自研 harness Cascade:项目启动时保持轻量,只在任务需要时才把专业能力装进上下文。官方给的数字是一套测试配置下 token 消耗降低 23.2%、任务完成时间缩短 28.2%、运行成本下降 32%——注意,测试方法没有公开,媒体普遍标注「未经验证」。
省下来的钱被做成了产品:Manus Studio 把桌面端升级成人和 AI 共享的工作台,视频剪辑给出可编辑的时间线(换歌、换素材、导出),Game Dev 能做多人和对战游戏再一键发布成网页。Automations 从定时任务升级成事件触发——新邮件、Slack 消息、Notion 更新都能点着一轮工作。新应用 Cue 更激进:每个 Agent 配自己的邮箱、手机号、钱包和电脑,能接电话、留摘要,扫餐厅二维码就能替你点单。
xAI:一台云电脑,一队队友
Grok Bot 以「队友」为基本单位:每个 Bot 是一个有名字、有记忆、有自己屏幕的持久智能体,跑在你账号专属的一台云电脑上,有浏览器、文件系统和终端。Bot 之间共享这台机器的 cookie、登录态和文件,可以互相传上下文、在群聊里交接任务——xAI 的文档自己也提醒:屏幕是分开的工作面,不是分开的安全边界。
分发策略暴露了 xAI 的处境。它没有微软 M365 那样的企业渠道,于是把 Grok Bot 捆进 SuperGrok 和 Cursor 的付费套餐(Grok 4.5 据报道部分用 Cursor 会话数据训练,两家关系不浅),先吃消费级重度用户和开发者。8 月 26 日起所有 SuperGrok 与 Cursor Teams 套餐默认包含。企业版还在 waitlist。
评测数据:能看,不能横着比
三家没有共享基准,下表全部是官方或第三方口径的原样数字,横向对比会得出错误结论。
| 产品 | 指标 | 数值 | 口径 |
|---|---|---|---|
| Muse Spark(Contemplating 模式) | Humanity’s Last Exam | 58% | 官方博客,多智能体并行推理 |
| Muse Spark(Contemplating 模式) | FrontierScience Research | 38% | 官方博客 |
| Muse Spark | 同等能力的预训练算力 | 比 Llama 4 Maverick 低一个数量级以上 | 官方缩放律测量 |
| Grok 4.6 | Cursor agent 基准 | 70.8%(xhigh 档) | 官方 model card,上代 4.5 为 66.7% |
| Grok 4.6 | DeepSWE v1.1 | 67.0%(xhigh 档) | 官方 model card |
| Grok 4.6 | APEX-Agents(投行/咨询/法律跨应用任务) | 57.5% | 官方 model card,Mercor 评测 |
| Grok 4.6 | Terminal-Bench 3.0 | 26.0% | 官方 model card |
| Grok 4.6 | 内部幻觉率基准 | 1.7% | 官方 model card,越低越好 |
| Grok 4.5 | Artificial Analysis 智能指数 | 第 4 名 | 第三方 |
| Manus(2025 年 3 月发布时) | GAIA 三级通过率 | 86.5% / 70.1% / 57.7% | 自报,同期 OpenAI Deep Research 为 74.3% / 69.1% / 47.6%,社区有争议 |
| Manus 1.5 | 平均任务完成时间 | 从 15 分钟降到 4 分钟以内 | 官方 |
| Manus 2.0 Cascade | token / 耗时 / 成本 | −23.2% / −28.2% / −32% | 自报,测试配置未公开,未独立验证 |
能横向对比的只有采用率,这组数字也最一边倒。Sensor Tower 估计 Muse 上线头十天日均下载环比增长 55%,当年 ChatGPT 同期是 24%,Claude 和 Grok 上线期是负增长;同一窗口 Claude 累计约 40 万下载、Grok 约 20 万,Muse 上线头五天就有约 73 万(各机构口径差异大:截至 9 月 25 日 Sensor Tower 算累计 340 万,Apptopia 算 430 万,Appfigures 只算 230 万)。The Information 援引 Meta 内部数据称首周用户超 50 万、日活 25 万。9 月 18 日起 Muse 一直占着美国 iOS 免费榜第一。
Manus 的商业化数字同样惊人:上线八个月 ARR 破 1 亿美元,2025 年 12 月 run-rate 1.25 亿美元,2026 年中年化收入冲到 4-5 亿美元区间,日收入从 30 万美元涨到近 150 万。36 氪追问过这一点:这些收入里有多少是 Meta 收购期间靠其广告管道灌进来的,拆分后内生 ARR 悲观估计可能回落到 1 亿美元以下。
口碑:英文圈在吵隐私,中文圈在劝冷静
英文圈。 《华尔街日报》记者 Nicole Nguyen 的评测标题就是结论——「有用,同时吓人」(Helpful and Scary at the Same Time):她让 Muse 改名叫扎克伯格被拒,改叫终结者却通过了。TechRadar 的 Lance Ulanoff 是最有说服力的转变样本:这位老科技记者起先把扎克伯格「五年内人人都有 AI 助理」的预言斥为自利宣传,把邮箱交出去时自嘲「我疯了吗」(Have I lost my mind?),两周后写下「个人智能体大概真的会改变世界」。CNN 的 Lisa Eadicicco 称赞 Muse 会主动解释任务卡在哪(订不到票时把原因讲清楚,等用户下一步指示),Business Insider 的 Katie Notopoulos 坦承「过去二十年 Meta 给了大家足够多不安心理由」,还是交出了邮箱、信用卡和健康数据。美国银行的研究报告代表了机构态度:反馈积极,但隐私与信任仍是普及的前提。负面事件也实打实:Amazon 直接封了 Muse 在自家商城代购的权限,理由是代理标识与数据使用不清。
围绕 Muse 背后的 Meta Superintelligence Labs,大佬们的旧怨还在。OpenAI 的 Sam Altman 曾把 Meta 的挖人称作「mafioso poaching style」(黑手党式挖角),Google DeepMind 的 Demis Hassabis 则说「Meta 现在并不在前沿」,又说「有比钱更重要的东西」。扎克伯格本人 9 月 16 日在 X 上回应了节奏之争:Meta 为安全和隐私把 Muse 压了几个月才上线,「我们没有要求别人也这么做,我们直接做了」。
中文圈。 智东西的判断被广泛引用:国内大厂靠入口、生态和补贴铺开了 WorkBuddy、豆包、千问工作,海外 Muse 已打出口碑,Manus 2.0 的选择是「不在通用入口上硬碰」,往云电脑、自动化、视频、游戏这些更垂直、更重执行的方向走。非常在线的评论区立场更冷:官方未公布 2.0 定价与参数,「先别掏钱」,别被「token 减少 23.2%」这种单一指标带偏——那是官方测试配置,不是承诺。对国内用户最实际的一条:Manus 2.0 目前只有海外版,官方称正在组建团队开发面向国内市场的产品。
三个开发故事
Muse:从挖人战争到为安全压档期
2025 年 6 月 30 日,扎克伯格一纸备忘录成立 Meta Superintelligence Labs,Scale AI 创始人 Alexandr Wang 出任首席 AI 官,前 GitHub CEO Nat Friedman 联合执掌;外界流传的薪酬包最高到一两亿美元,Altman 的「mafioso」之骂由此而来。7 月底扎克伯格发表「个人超级智能」宣言,赌的是眼镜会成为下一代主设备。转折在 Llama 4——他 9 月在 Sources 播客里承认这一代走偏了。MSL 用九个月重构预训练栈,交出的 Muse Spark 官方称同等能力算力比 Llama 4 Maverick 低一个数量级以上;7 月的 Spark 1.1 安全报告显示,模型在化学与生物、网络安全两个域的预缓解评估「不能排除达到高风险门槛」,靠多层缓解压到「中或更低」才放行。整个 Muse 项目(内部代号 Hatch)为安全打磨推迟数月——扎克伯格后来把这次压档期挂在了嘴上。还有个插曲:Meta 曾花约 20 亿美元收购 Manus,2026 年 4 月被中国监管叫停,两家在 9 月完成拆分。
Manus:邀请码炒到五位数的一夜爆红
蝴蝶效应 2022 年由连续创业者肖弘(Red Xiao)创办,比 ChatGPT 上线还早两个月。2024 年 10 月,团队立项做 Manus——灵感来自 Cursor,名字取自 MIT 校训 Mens et Manus(手脑并用)。2025 年 3 月 6 日邀请制上线,联合创始人季逸超(Peak Ji)出镜的演示视频 20 小时破百万播放,一周候补 200 万人,邀请码在闲鱼被炒到 5 万-10 万元。首席科学家季逸超本身就是传奇:高中独立写出猛犸浏览器,2012 年创办 Peak Labs 做 Magi 搜索引擎,MIT TR35 入选者;他对 MIT Technology Review 说的是「希望 Manus 是我此生做的最后一个产品——因为再有疯狂想法,交给 Manus 就行」。爆红之后是断腕:Benchmark 领投新融资,总部迁往新加坡,约 120 名国内员工只有 40 名核心随迁。然后是过山车:2025 年 12 月 Meta 约 20 亿美元收购交割;2026 年 4 月北京叫停;腾讯领投、创始团队与红杉中国、真格基金按原估值回购,腾讯成为最大机构股东;9 月 1 日恢复独立运营,四周后甩出 2.0。
Grok Bot:旗舰跳票,侧翼包抄
Grok 4 在 2025 年 7 月发布时风头很盛,马斯克随即放话 Grok 5 会「crushingly good」(碾压级地好),原定 2025 年底上线。然后是两次跳票:先推到 2026 年一季度,再推到二季度,两个窗口都过了,Grok 5 至今还在 Colossus 2 超算上训练(2026 年 1 月 200 亿美元 E 轮融资公告里唯一确认的一句)。xAI 的打法是侧翼补位:7 月 8 日的 Grok 4.5 定位「Opus 级」,因 EU AI Act 在欧洲被锁八天才解禁;8 月 12 日的 Grok 4.6 主打长时任务与交互式工作;前一天上线的 Grok Bot 把这些模型变成了产品。xAI 的底牌仍然是算力——Colossus 一期加二期在 2025 年底已超 100 万张 H100 等效算力。
安全:三家分歧最大的地方
个人智能体要拿你的邮箱、支付和身份,安全架构因此成了产品差异的核心。Muse 走隔离路线:独立 VM、Sentinel 审批、凭证替身、邮件连接器自动过滤一次性验证码和密码重置链接(防止智能体被诱导重置你的其他账号)。Grok Bot 走便利路线,共享登录态意味着一个 Bot 被注入,你的整台云电脑都暴露,xAI 文档自己写明这些屏幕「不是独立的安全边界」。Manus 在发布前四天被 Salt Labs 实锤:一封携带混淆指令的邮件就能在受害者环境里执行代码、触达已连接服务的凭证——讽刺的是,这个洞是 Meta 的赏金项目在收购期间确认并修复的,Salt Labs 说 Manus 对报告没有回应。Cue 给每个 Agent 配钱包、在预算内自主支付,支付确认与退款流程目前没有文档,多家里媒都把这列为最大未验证风险。
现在该怎么选
- 想免费体验「AI 替我干活」、人在美国或加拿大:装 Muse。它是三家里唯一把普通用户当第一公民做的——不用配置任何东西,聊天就行。代价是把邮箱、日历交给 Meta,这个决定没人能替你做。
- 重度创作者、自动化玩家、开发者:Manus 2.0 的垂直深度(视频时间线、游戏发布、事件触发自动化、手机遥控本机)三家里最厚,但先跑免费额度验证你的真实工作流再付费;国内用户等国内版落地。
- 已订阅 SuperGrok 或 Cursor:Grok Bot 是白送的,值得立刻试。把不敏感的任务先交给它——共享凭证的设计决定了你应该给它一台「干净」的云电脑,而不是登录了所有服务的裸机。
- 三家共同的风险清单:支付授权、邮件凭证、提示注入(Manus 刚刚示范过)、以及所有评测数字都是自报口径。智能体时代的第一课:像审核新员工一样审核你的 AI。
这三家在下三种注:Meta 赌信任基础设施能换来几十亿用户,Manus 赌调度工程和创作工具能跑赢基座厂商,xAI 赌算力和模型能力最终吞掉一切。七周之内三条路线全部落地,2026 年的下半年,大概率会决出第一条被证伪的路。