智能体框架#跑分#设备操控

Agent-S:让智能体像人一样操作电脑

Simular 开源的电脑操作框架:看屏幕、点鼠标、敲键盘完成桌面与网页任务,不必为每个应用对接接口;README 报告 OSWorld 72.6%。

项目资料

GitHub Ecosystem
仓库地址github.com/simular-ai/Agent-S
许可证
Apache-2.0
主语言
Python
星标
12,576
核查时间
2026-10-10

以上快照资料以核查当日为准,可能随版本或运营策略变化。

想让智能体替你点鼠标、敲键盘,过去通常得为每个应用单独写接口或脚本,界面一改版就得返工。Agent S 是 Simular 开源的电脑操作框架:给它一句自然语言任务,它每一步都看屏幕截图,直接在桌面和网页应用里点击、输入、滚动,不需要对接任何 API。仓库截至 2026-10-10 有 12,576 个 star,以 Apache-2.0 协议发布。当前版本 Agent S3 在 README 中报告的 OSWorld 成绩是 72.6%,高于该基准上约 72% 的人类水平。

核心功能

  • 截图驱动,逐步执行:每一步以屏幕截图为输入,主模型规划下一步动作;OSWorldACI 把动作翻译成可执行的 Python 代码,在真实桌面上落地。
  • 定位模型负责找控件:主模型说出要点哪个按钮,定位模型把这句描述映射到屏幕坐标。README 推荐 UI-TARS-1.5-7B,并要求用 --grounding_width 与 --grounding_height 填写它的输出分辨率,例如 1920×1080。
  • Behavior Best-of-N 选优:同一任务跑多条轨迹,再挑出最好的一条。README 显示,这一步把 Agent S3 在 OSWorld 上的成绩从 66% 提高到 72.6%。
  • 反思代理默认开启:反思代理辅助工作代理复盘失败的步骤,README 中的默认值为开启,可用 --enable_reflection 参数调整。
  • 可选的本地代码环境:开启后,智能体可以通过 call_code_agent 动作运行 Python 和 Bash,处理表格、批量文件和脚本类任务。该功能默认关闭。

Agent S2 架构图:管理者制定计划,工作者把动作交给定位模块执行,经验与知识存入记忆模块

上图是上一代 Agent S2 的架构。README 称 Agent S3 在它的基础上更简单、更快,也更灵活。

性能数据

项目 README 给出的对比如下,三组数字都由项目方测得:

基准Agent S3 单独运行加入选优后
OSWorld66%(100 步设置)72.6%(Behavior Best-of-N)
WindowsAgentArena50.2%56.6%(3 次 rollout 选优)
AndroidWorld68.1%71.6%

OSWorld 的对比图还列出了 GTA1 w/ GPT-5 的 63.4%、Agent S2 的 48.8% 等其他方法。README 没有注明测试硬件和具体日期。这些数字说明选优步骤确实有效,但尚未见到第三方复现。

Agent S3 与其他方法的 OSWorld 成功率对比图,Agent S3 加 Best-of-N 为 72.6%,图中标注人类水平约 72%

典型使用场景

  • 重复性的桌面操作:每周要在网页、表格和邮件之间搬运数据的人,可以把这件事写成一句任务交给智能体,自己只做结果抽查。
  • 智能体研究者:以 OSWorld 为基线,对比 Agent S3 与自己的方法。仓库附有 OSWorld 部署说明,论文已被 TMLR 2026 接收。
  • 跨平台界面实验:在 macOS、Windows 或 Linux 上验证定位与规划策略,并对照论文中 WindowsAgentArena 与 AndroidWorld 的结果。

快速上手

pip install gui-agents
brew install tesseract   # macOS,pytesseract 依赖它
agent_s \
    --provider openai \
    --model gpt-5-2025-08-07 \
    --ground_provider huggingface \
    --ground_url http://localhost:8080 \
    --ground_model ui-tars-1.5-7b \
    --grounding_width 1920 \
    --grounding_height 1080

运行前要先启动定位模型的服务,并把它的地址填进 --ground_url;主模型的密钥通过环境变量提供,例如 OPENAI_API_KEY。命令开始后,智能体会接管当前屏幕,建议先在虚拟机或测试账号里试跑。如果要嵌入自己的程序,README 的 gui_agents SDK 一节给出了用 AgentS3 与 OSWorldACI 组装智能体的完整示例。

小结

适合有一定工程能力、希望在本地或自有环境里掌控模型与数据的开发者和研究者,也适合想复现 OSWorld 结果的人。不适合只想开箱即用的普通用户;README 推荐的托管方案是 Simular 的 Sai 与 Simular API。如果只需要智能体在你已登录的浏览器里干活,BrowserSkill 的范围更窄,也更轻。仓库采用 Apache-2.0 协议,主要语言为 Python,最近一次推送在 2026-10-08。

有几点需要先想清楚:

  • 它会真实控制鼠标与键盘,README 明确提醒谨慎使用。本地代码环境会以当前用户的权限执行任意代码,只应在可信环境中开启。
  • 定位模型需要自己部署。README 推荐 UI-TARS-1.5-7B,托管推理端点的费用由使用者自己承担。
  • 性能数字来自项目方测试,尚无第三方复现。托管版 Sai 在 OSWorld 2.0 上报告的 73%,同样是厂商自报的结果。
  • 设计上针对单显示器屏幕。仓库目前有 55 个开放 issue,使用前建议先看一遍已有讨论。