评论#安全#设备操控

Muse、Manus 2.0 与 Grok Bot:个人智能体的三条路线

七周内 Grok Bot、Muse、Manus 2.0 相继落地。本文对照三家的技术路线、自报评测数据、中英文圈口碑与开发故事,给出分人群的选用建议。

黑白航拍的四层公路立交桥,多条匝道在空中交汇分岔,比喻三家公司的个人智能体走的三条不同路线(Wikimedia Commons,公共领域,HAER 历史工程档案)

2026 年 8 月 11 日,xAI 把 Grok Bot 挂上 beta;9 月 8 日,Meta 发布 Muse;9 月 28 日,恢复独立运营不到一个月的 Manus 推出 2.0。七周之内,「个人智能体」从发布会概念变成货架上三件可以今天注册的商品——而且三家对「AI 替你干活」该怎么做,给出的答案几乎没有重叠。

本文对照三家的定位、技术路线、评测数据和口碑争议,读完你可以回答一个具体问题:这三个产品该不该用、该用哪个、哪些数字该信。

三件商品,三种卖法

Meta Muse Manus 2.0 Grok Bot
发布 2026-09-08 2026-09-28 2026-08-11(beta)
公司 Meta(Meta Superintelligence Labs) 蝴蝶效应 Butterfly Effect(新加坡) xAI
一句话定位 替普通人跑腿的私人助理 创作工场 + 事件自动化平台 可以派活的 AI 队友
价格 免费 + 订阅(具体档位未完全公布) 免费额度 + 付费(2.0 未公布新定价);Cue 凭邀请码免费 捆绑 SuperGrok($30/月起)与 Cursor 付费套餐,无单独定价
平台 iOS / Android / muse.ai / WhatsApp Web / 桌面 / 移动端 桌面(含 Linux 构建)/ iOS
底层模型 Muse Spark(自研) Claude 与微调 Qwen(官方确认不自研基座) Grok 4.5 / 4.6(自研)
可用地区 美国和加拿大 海外版已上线,国内版「组建团队中」 需 SuperGrok / Cursor 订阅

三家切的是同一块市场——「不用你盯着的 AI」——但切入点不同。Muse 赌的是几十亿普通人第一次用智能体,把宝押在信任和安全上;Manus 2.0 避开通用入口,往视频剪辑、游戏开发、事件自动化这些重执行场景走;Grok Bot 把自己包进现有订阅,先发给愿意折腾的极客和 Cursor 开发者。

技术路线:钱花在三个不同的地方

维度 Muse Manus 2.0 Grok Bot
基座模型 自研 Muse Spark,预训练栈推倒重构 不练基座,工程做在 Cascade 调度层 自研 Grok 4.5/4.6,为长任务优化
执行环境 Muse Secure VM:每用户独立云虚拟机 + 浏览器 云端沙盒 + 可购买的 Cloud Computer + 授权后操作你的本机(Computer Use) Agent Computer:一个账号下所有 Bot 共享的持久云电脑
权限与安全 Sentinel 独立审批代理,模型看不到真实凭证 连接器授权 + 预算额度 共享 cookie 与登录态,文档明言「不是独立的安全边界」
交互形态 像和人聊天:一条长对话、可打断、Artifacts 富输出 项目制工作台(Manus Studio)+ 手机远程遥控本机 消息派活,Bot 干完回来要审批
多智能体 模型层多智能体编排(推理加速) Cue 里多个 Agent 拉群协作,各有邮箱/手机号/钱包 多 Bot 并行、互相传球、群聊协调

Meta:预算花在「信任基础设施」上

Muse 的智能体跑在每用户一个的 Muse Secure VM 里,内部代号 Hatch。Meta 在工程博客里把架构写得很细:智能体被关在 systemd-nspawn 容器里,root 被映射成无特权用户,禁用 io_uring,砍掉 CAP_SYS_PTRACE 等能力;所有对外请求经过一个独立的 Sentinel 代理(eBPF 过滤,第四层到第七层都检查),模型提出动作,只有 Sentinel 能批准。最硬的一条是凭证替身:智能体拿到的永远是代理 token,真实密码在出网瞬间才被替换进去——提示注入骗它泄露密码,也泄无可泄。

这套东西贵,但它是 Muse 全部卖点的前提:敢把邮箱、日历、支付连进来,才谈得上替你干活。Muse 的记忆是一份用户可以直接查看和编辑的 MEMORY.md,敏感动作(发邮件、花钱)默认弹出审批卡片,年底还要上 Confidential VM——整台虚拟机用只有用户自己持有的密钥加密,Meta 自己都看不了。

Manus:不练基座,把工程做在调度层

Manus 从第一天就没打算训练自己的基座模型,官方在 2025 年 12 月确认构建于 Claude 与微调版 Qwen 之上。2.0 的核心是自研 harness Cascade:项目启动时保持轻量,只在任务需要时才把专业能力装进上下文。官方给的数字是一套测试配置下 token 消耗降低 23.2%、任务完成时间缩短 28.2%、运行成本下降 32%——注意,测试方法没有公开,媒体普遍标注「未经验证」。

省下来的钱被做成了产品:Manus Studio 把桌面端升级成人和 AI 共享的工作台,视频剪辑给出可编辑的时间线(换歌、换素材、导出),Game Dev 能做多人和对战游戏再一键发布成网页。Automations 从定时任务升级成事件触发——新邮件、Slack 消息、Notion 更新都能点着一轮工作。新应用 Cue 更激进:每个 Agent 配自己的邮箱、手机号、钱包和电脑,能接电话、留摘要,扫餐厅二维码就能替你点单。

xAI:一台云电脑,一队队友

Grok Bot 以「队友」为基本单位:每个 Bot 是一个有名字、有记忆、有自己屏幕的持久智能体,跑在你账号专属的一台云电脑上,有浏览器、文件系统和终端。Bot 之间共享这台机器的 cookie、登录态和文件,可以互相传上下文、在群聊里交接任务——xAI 的文档自己也提醒:屏幕是分开的工作面,不是分开的安全边界。

分发策略暴露了 xAI 的处境。它没有微软 M365 那样的企业渠道,于是把 Grok Bot 捆进 SuperGrok 和 Cursor 的付费套餐(Grok 4.5 据报道部分用 Cursor 会话数据训练,两家关系不浅),先吃消费级重度用户和开发者。8 月 26 日起所有 SuperGrok 与 Cursor Teams 套餐默认包含。企业版还在 waitlist。

评测数据:能看,不能横着比

三家没有共享基准,下表全部是官方或第三方口径的原样数字,横向对比会得出错误结论。

产品 指标 数值 口径
Muse Spark(Contemplating 模式) Humanity’s Last Exam 58% 官方博客,多智能体并行推理
Muse Spark(Contemplating 模式) FrontierScience Research 38% 官方博客
Muse Spark 同等能力的预训练算力 比 Llama 4 Maverick 低一个数量级以上 官方缩放律测量
Grok 4.6 Cursor agent 基准 70.8%(xhigh 档) 官方 model card,上代 4.5 为 66.7%
Grok 4.6 DeepSWE v1.1 67.0%(xhigh 档) 官方 model card
Grok 4.6 APEX-Agents(投行/咨询/法律跨应用任务) 57.5% 官方 model card,Mercor 评测
Grok 4.6 Terminal-Bench 3.0 26.0% 官方 model card
Grok 4.6 内部幻觉率基准 1.7% 官方 model card,越低越好
Grok 4.5 Artificial Analysis 智能指数 第 4 名 第三方
Manus(2025 年 3 月发布时) GAIA 三级通过率 86.5% / 70.1% / 57.7% 自报,同期 OpenAI Deep Research 为 74.3% / 69.1% / 47.6%,社区有争议
Manus 1.5 平均任务完成时间 从 15 分钟降到 4 分钟以内 官方
Manus 2.0 Cascade token / 耗时 / 成本 −23.2% / −28.2% / −32% 自报,测试配置未公开,未独立验证

能横向对比的只有采用率,这组数字也最一边倒。Sensor Tower 估计 Muse 上线头十天日均下载环比增长 55%,当年 ChatGPT 同期是 24%,Claude 和 Grok 上线期是负增长;同一窗口 Claude 累计约 40 万下载、Grok 约 20 万,Muse 上线头五天就有约 73 万(各机构口径差异大:截至 9 月 25 日 Sensor Tower 算累计 340 万,Apptopia 算 430 万,Appfigures 只算 230 万)。The Information 援引 Meta 内部数据称首周用户超 50 万、日活 25 万。9 月 18 日起 Muse 一直占着美国 iOS 免费榜第一。

Manus 的商业化数字同样惊人:上线八个月 ARR 破 1 亿美元,2025 年 12 月 run-rate 1.25 亿美元,2026 年中年化收入冲到 4-5 亿美元区间,日收入从 30 万美元涨到近 150 万。36 氪追问过这一点:这些收入里有多少是 Meta 收购期间靠其广告管道灌进来的,拆分后内生 ARR 悲观估计可能回落到 1 亿美元以下。

口碑:英文圈在吵隐私,中文圈在劝冷静

英文圈。 《华尔街日报》记者 Nicole Nguyen 的评测标题就是结论——「有用,同时吓人」(Helpful and Scary at the Same Time):她让 Muse 改名叫扎克伯格被拒,改叫终结者却通过了。TechRadar 的 Lance Ulanoff 是最有说服力的转变样本:这位老科技记者起先把扎克伯格「五年内人人都有 AI 助理」的预言斥为自利宣传,把邮箱交出去时自嘲「我疯了吗」(Have I lost my mind?),两周后写下「个人智能体大概真的会改变世界」。CNN 的 Lisa Eadicicco 称赞 Muse 会主动解释任务卡在哪(订不到票时把原因讲清楚,等用户下一步指示),Business Insider 的 Katie Notopoulos 坦承「过去二十年 Meta 给了大家足够多不安心理由」,还是交出了邮箱、信用卡和健康数据。美国银行的研究报告代表了机构态度:反馈积极,但隐私与信任仍是普及的前提。负面事件也实打实:Amazon 直接封了 Muse 在自家商城代购的权限,理由是代理标识与数据使用不清。

围绕 Muse 背后的 Meta Superintelligence Labs,大佬们的旧怨还在。OpenAI 的 Sam Altman 曾把 Meta 的挖人称作「mafioso poaching style」(黑手党式挖角),Google DeepMind 的 Demis Hassabis 则说「Meta 现在并不在前沿」,又说「有比钱更重要的东西」。扎克伯格本人 9 月 16 日在 X 上回应了节奏之争:Meta 为安全和隐私把 Muse 压了几个月才上线,「我们没有要求别人也这么做,我们直接做了」。

中文圈。 智东西的判断被广泛引用:国内大厂靠入口、生态和补贴铺开了 WorkBuddy、豆包、千问工作,海外 Muse 已打出口碑,Manus 2.0 的选择是「不在通用入口上硬碰」,往云电脑、自动化、视频、游戏这些更垂直、更重执行的方向走。非常在线的评论区立场更冷:官方未公布 2.0 定价与参数,「先别掏钱」,别被「token 减少 23.2%」这种单一指标带偏——那是官方测试配置,不是承诺。对国内用户最实际的一条:Manus 2.0 目前只有海外版,官方称正在组建团队开发面向国内市场的产品。

三个开发故事

Muse:从挖人战争到为安全压档期

2025 年 6 月 30 日,扎克伯格一纸备忘录成立 Meta Superintelligence Labs,Scale AI 创始人 Alexandr Wang 出任首席 AI 官,前 GitHub CEO Nat Friedman 联合执掌;外界流传的薪酬包最高到一两亿美元,Altman 的「mafioso」之骂由此而来。7 月底扎克伯格发表「个人超级智能」宣言,赌的是眼镜会成为下一代主设备。转折在 Llama 4——他 9 月在 Sources 播客里承认这一代走偏了。MSL 用九个月重构预训练栈,交出的 Muse Spark 官方称同等能力算力比 Llama 4 Maverick 低一个数量级以上;7 月的 Spark 1.1 安全报告显示,模型在化学与生物、网络安全两个域的预缓解评估「不能排除达到高风险门槛」,靠多层缓解压到「中或更低」才放行。整个 Muse 项目(内部代号 Hatch)为安全打磨推迟数月——扎克伯格后来把这次压档期挂在了嘴上。还有个插曲:Meta 曾花约 20 亿美元收购 Manus,2026 年 4 月被中国监管叫停,两家在 9 月完成拆分。

Manus:邀请码炒到五位数的一夜爆红

蝴蝶效应 2022 年由连续创业者肖弘(Red Xiao)创办,比 ChatGPT 上线还早两个月。2024 年 10 月,团队立项做 Manus——灵感来自 Cursor,名字取自 MIT 校训 Mens et Manus(手脑并用)。2025 年 3 月 6 日邀请制上线,联合创始人季逸超(Peak Ji)出镜的演示视频 20 小时破百万播放,一周候补 200 万人,邀请码在闲鱼被炒到 5 万-10 万元。首席科学家季逸超本身就是传奇:高中独立写出猛犸浏览器,2012 年创办 Peak Labs 做 Magi 搜索引擎,MIT TR35 入选者;他对 MIT Technology Review 说的是「希望 Manus 是我此生做的最后一个产品——因为再有疯狂想法,交给 Manus 就行」。爆红之后是断腕:Benchmark 领投新融资,总部迁往新加坡,约 120 名国内员工只有 40 名核心随迁。然后是过山车:2025 年 12 月 Meta 约 20 亿美元收购交割;2026 年 4 月北京叫停;腾讯领投、创始团队与红杉中国、真格基金按原估值回购,腾讯成为最大机构股东;9 月 1 日恢复独立运营,四周后甩出 2.0。

Grok Bot:旗舰跳票,侧翼包抄

Grok 4 在 2025 年 7 月发布时风头很盛,马斯克随即放话 Grok 5 会「crushingly good」(碾压级地好),原定 2025 年底上线。然后是两次跳票:先推到 2026 年一季度,再推到二季度,两个窗口都过了,Grok 5 至今还在 Colossus 2 超算上训练(2026 年 1 月 200 亿美元 E 轮融资公告里唯一确认的一句)。xAI 的打法是侧翼补位:7 月 8 日的 Grok 4.5 定位「Opus 级」,因 EU AI Act 在欧洲被锁八天才解禁;8 月 12 日的 Grok 4.6 主打长时任务与交互式工作;前一天上线的 Grok Bot 把这些模型变成了产品。xAI 的底牌仍然是算力——Colossus 一期加二期在 2025 年底已超 100 万张 H100 等效算力。

安全:三家分歧最大的地方

个人智能体要拿你的邮箱、支付和身份,安全架构因此成了产品差异的核心。Muse 走隔离路线:独立 VM、Sentinel 审批、凭证替身、邮件连接器自动过滤一次性验证码和密码重置链接(防止智能体被诱导重置你的其他账号)。Grok Bot 走便利路线,共享登录态意味着一个 Bot 被注入,你的整台云电脑都暴露,xAI 文档自己写明这些屏幕「不是独立的安全边界」。Manus 在发布前四天被 Salt Labs 实锤:一封携带混淆指令的邮件就能在受害者环境里执行代码、触达已连接服务的凭证——讽刺的是,这个洞是 Meta 的赏金项目在收购期间确认并修复的,Salt Labs 说 Manus 对报告没有回应。Cue 给每个 Agent 配钱包、在预算内自主支付,支付确认与退款流程目前没有文档,多家里媒都把这列为最大未验证风险。

现在该怎么选

  • 想免费体验「AI 替我干活」、人在美国或加拿大:装 Muse。它是三家里唯一把普通用户当第一公民做的——不用配置任何东西,聊天就行。代价是把邮箱、日历交给 Meta,这个决定没人能替你做。
  • 重度创作者、自动化玩家、开发者:Manus 2.0 的垂直深度(视频时间线、游戏发布、事件触发自动化、手机遥控本机)三家里最厚,但先跑免费额度验证你的真实工作流再付费;国内用户等国内版落地。
  • 已订阅 SuperGrok 或 Cursor:Grok Bot 是白送的,值得立刻试。把不敏感的任务先交给它——共享凭证的设计决定了你应该给它一台「干净」的云电脑,而不是登录了所有服务的裸机。
  • 三家共同的风险清单:支付授权、邮件凭证、提示注入(Manus 刚刚示范过)、以及所有评测数字都是自报口径。智能体时代的第一课:像审核新员工一样审核你的 AI。

这三家在下三种注:Meta 赌信任基础设施能换来几十亿用户,Manus 赌调度工程和创作工具能跑赢基座厂商,xAI 赌算力和模型能力最终吞掉一切。七周之内三条路线全部落地,2026 年的下半年,大概率会决出第一条被证伪的路。