评论#智能体#MCP#提示词#记忆#评估

Agent 牌桌已变:值钱的是流程、记忆和评估,不是提示词

视频号「元智社」称:Agent 值钱的是流程、记忆、评估和工具链,复制提示词只是入门动作。对照 Anthropic 与 Cognition 指南逐项核实。

摆好棋子的木质国际象棋盘,对应「Agent 的牌桌已经变了」的比喻(Wikimedia Commons,CC0)

2026 年 9 月 19 日,视频号「元智社」发了一条观点视频,文案只有一句话:「Agent 的牌桌已经变了。真正值钱的是把流程、记忆、评估和工具链跑稳,只会复制提示词越来越像入门动作。」这条视频没有给证据,但结论和 Anthropic、Cognition 公开的工程指南指向一致。本文把这句话拆成四个词逐一核对,看哪些站得住、哪些要打折。

提示词只值入场费

复制别人调好的提示词曾经真能白捡效果,原因很简单:那时的任务大多发生在单个窗口里,一问一答就结束。Agent 不是。Anthropic 在 2024-12-19 的《Building effective agents》里写得很直白:“They are typically just LLMs using tools based on environmental feedback in a loop.”——Agent 就是在循环里用工具、根据环境反馈迭代的 LLM。循环一长,提示词只决定第一步的质量,后面每一步取决于工具好不好用、上下文记不记得住、错了能不能被发现。

记忆和上下文

上下文是每轮都在重排的有限资源,这是提示词管不了的部分。Anthropic 在 2025-09-29 的《Effective context engineering for AI agents》里把 prompt engineering 的延伸命名为 context engineering:“Context engineering is the art and science of curating what will go into the limited context window”,同时确认了 context rot 的存在:窗口里 token 越多,模型准确召回的能力越差。所以「记忆」不是加分项,是预算管理:把关键事实写进外部笔记、压缩快满的对话、给子 Agent 干净的窗口,视频里说的「记忆跑稳」对应的就是这一层。

评估先行

评估是「跑稳」的前提:先定义什么叫稳,才谈得上发现回归。Anthropic 在 2026-01-09 的《Demystifying evals for AI agents》里给出的判断是:“Evals make problems and behavioral changes visible before they affect users, and their value compounds over the lifecycle of an agent.”——没有评估集的团队只能靠用户投诉发现问题,而且分不清回归和噪声。Cognition 在 2025-06-12 的《Don’t build multi-agents》里把 context engineering 称为 “effectively the #1 job of engineers building AI agents”,支撑这种迭代的正是可复现的测试。

工具链的标准化

工具链这一层已经有事实标准。MCP 由 Anthropic 在 2024-11-25 发布,OpenAI 于 2025-03-25 宣布采纳,Google DeepMind 在 2025-04-09 跟进(据 Wikipedia,查于 2026-09-28)。工具接入标准化之后,护城河就从「我有独家提示词」移到「我的工具文档写得多清楚、失败时多好诊断」——Anthropic 说他们在 SWE-bench 上花在工具上的时间超过了提示词。本站介绍过的 VibeKit(给编码 Agent 的沙箱 SDK)和 Team9(本地优先的 Agent 运行时)都属于这一层的基建。

反方的理由

最强的反方是:对多数个人项目,这套话就是过度工程。任务单一、调用量小的时候,提示词调优依然够用;评估集要维护,Mem0、Letta 这类记忆方案会引入新的故障面,编排框架连 Anthropic 都不推荐先上——同一篇文章里写的是 “Consistently, the most successful implementations weren’t using complex frameworks or specialized libraries.”。工程化的成本要规模化之后才回本,牌桌变了,不等于每个人都该现在下注。

还有一层诚实的提醒:原视频只有一句文案,没有可核对的证据链。本文的论据全部来自公开工程指南;观点归元智社,核对归本站。

先做十次测试

不用引框架。把同一个输入在你的 Agent 上跑十遍,数一数结果不一致的次数、从第几次开始跑偏。这十分钟的土办法就是评估集的雏形,它会直接告诉你:你的瓶颈在提示词,还是在那张牌桌上。