Agent-S:让智能体像人一样操作电脑
Simular 开源的电脑操作框架:看屏幕、点鼠标、敲键盘完成桌面与网页任务,不必为每个应用对接接口;README 报告 OSWorld 72.6%。
项目资料
GitHub Ecosystem- 许可证
- Apache-2.0
- 主语言
- Python
- 星标
- 12,576
- 核查时间
- 2026-10-10
以上快照资料以核查当日为准,可能随版本或运营策略变化。
想让智能体替你点鼠标、敲键盘,过去通常得为每个应用单独写接口或脚本,界面一改版就得返工。Agent S 是 Simular 开源的电脑操作框架:给它一句自然语言任务,它每一步都看屏幕截图,直接在桌面和网页应用里点击、输入、滚动,不需要对接任何 API。仓库截至 2026-10-10 有 12,576 个 star,以 Apache-2.0 协议发布。当前版本 Agent S3 在 README 中报告的 OSWorld 成绩是 72.6%,高于该基准上约 72% 的人类水平。
核心功能
- 截图驱动,逐步执行:每一步以屏幕截图为输入,主模型规划下一步动作;OSWorldACI 把动作翻译成可执行的 Python 代码,在真实桌面上落地。
- 定位模型负责找控件:主模型说出要点哪个按钮,定位模型把这句描述映射到屏幕坐标。README 推荐 UI-TARS-1.5-7B,并要求用
--grounding_width与--grounding_height填写它的输出分辨率,例如 1920×1080。 - Behavior Best-of-N 选优:同一任务跑多条轨迹,再挑出最好的一条。README 显示,这一步把 Agent S3 在 OSWorld 上的成绩从 66% 提高到 72.6%。
- 反思代理默认开启:反思代理辅助工作代理复盘失败的步骤,README 中的默认值为开启,可用
--enable_reflection参数调整。 - 可选的本地代码环境:开启后,智能体可以通过
call_code_agent动作运行 Python 和 Bash,处理表格、批量文件和脚本类任务。该功能默认关闭。

上图是上一代 Agent S2 的架构。README 称 Agent S3 在它的基础上更简单、更快,也更灵活。
性能数据
项目 README 给出的对比如下,三组数字都由项目方测得:
| 基准 | Agent S3 单独运行 | 加入选优后 |
|---|---|---|
| OSWorld | 66%(100 步设置) | 72.6%(Behavior Best-of-N) |
| WindowsAgentArena | 50.2% | 56.6%(3 次 rollout 选优) |
| AndroidWorld | 68.1% | 71.6% |
OSWorld 的对比图还列出了 GTA1 w/ GPT-5 的 63.4%、Agent S2 的 48.8% 等其他方法。README 没有注明测试硬件和具体日期。这些数字说明选优步骤确实有效,但尚未见到第三方复现。

典型使用场景
- 重复性的桌面操作:每周要在网页、表格和邮件之间搬运数据的人,可以把这件事写成一句任务交给智能体,自己只做结果抽查。
- 智能体研究者:以 OSWorld 为基线,对比 Agent S3 与自己的方法。仓库附有 OSWorld 部署说明,论文已被 TMLR 2026 接收。
- 跨平台界面实验:在 macOS、Windows 或 Linux 上验证定位与规划策略,并对照论文中 WindowsAgentArena 与 AndroidWorld 的结果。
快速上手
pip install gui-agents
brew install tesseract # macOS,pytesseract 依赖它
agent_s \
--provider openai \
--model gpt-5-2025-08-07 \
--ground_provider huggingface \
--ground_url http://localhost:8080 \
--ground_model ui-tars-1.5-7b \
--grounding_width 1920 \
--grounding_height 1080
运行前要先启动定位模型的服务,并把它的地址填进 --ground_url;主模型的密钥通过环境变量提供,例如 OPENAI_API_KEY。命令开始后,智能体会接管当前屏幕,建议先在虚拟机或测试账号里试跑。如果要嵌入自己的程序,README 的 gui_agents SDK 一节给出了用 AgentS3 与 OSWorldACI 组装智能体的完整示例。
小结
适合有一定工程能力、希望在本地或自有环境里掌控模型与数据的开发者和研究者,也适合想复现 OSWorld 结果的人。不适合只想开箱即用的普通用户;README 推荐的托管方案是 Simular 的 Sai 与 Simular API。如果只需要智能体在你已登录的浏览器里干活,BrowserSkill 的范围更窄,也更轻。仓库采用 Apache-2.0 协议,主要语言为 Python,最近一次推送在 2026-10-08。
有几点需要先想清楚:
- 它会真实控制鼠标与键盘,README 明确提醒谨慎使用。本地代码环境会以当前用户的权限执行任意代码,只应在可信环境中开启。
- 定位模型需要自己部署。README 推荐 UI-TARS-1.5-7B,托管推理端点的费用由使用者自己承担。
- 性能数字来自项目方测试,尚无第三方复现。托管版 Sai 在 OSWorld 2.0 上报告的 73%,同样是厂商自报的结果。
- 设计上针对单显示器屏幕。仓库目前有 55 个开放 issue,使用前建议先看一遍已有讨论。