尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Agent-S:首个在 OSWorld 基准上超越人类水平的开源 GUI 智能体框架

发布时间:2026/9/14 17:57:29

资讯中心
01
ARTICLE

Agent-S:首个在 OSWorld 基准上超越人类水平的开源 GUI 智能体框架

Agent-S:首个在 OSWorld 基准上超越人类水平的开源 GUI 智能体框架
Agent-S首个在 OSWorld 基准上超越人类水平的开源 GUI 智能体框架【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-SAgent-S 是目前唯一在 OSWorld 上以 72.60% 成功率超过人类表现约 72%的开源 GUI 智能体框架。不依赖专用训练仅靠通用大模型 独立定位模型 经验注入的框架设计就把桌面操作做到了超人类。这篇文章带你拆开它的四层结构并给出从克隆到第一次出结果的最短路径。它到底做了什么先看清楚这几个数字系统 / 设置OSWorld 成功率说明Agent S3 BBoN72.6%超过人类基线约 72%Agent S3单轨迹100 步66.0%已是当时开源最强GTA1 w/ GPT-563.4%此前的 SOTAClaude 3.7 Sonnet Computer-Use62.9%闭源商业基线Agent S248.8%上一代架构用于对比迭代幅度这组数字重要的地方在于两点。第一72.6% 不是刷出来的OSWorld 要求在真实 Ubuntu/Windows 桌面上完成 369 类真实任务跨应用、带系统设置、文件操作人类基线本身就是 72% 左右Agent S3 单轨迹 66% 已经超过此前所有系统加上 BBoN行为最优 N 次后越过人类线。第二它是零样本泛化的同一个框架不针对 WindowsAgentArena 和 AndroidWorld 做任何适配准确率就能从 50.2% 提到 56.6%、从 68.1% 提到 71.6%。下图是 S3 在 OSWorld 上与人类及其他系统的对比结果。Agent-S3 在 OSWorld 基准测试中的准确率对比BBoN 设置下超过人类水平再看一眼它上一代 S2 的分层架构有助于理解 S3 砍掉了什么。Agent-S 的分层架构图早期版本用 Manager/Worker 分工S3 简化为单层 Worker结果看完了下面拆内部。拆开看GUI 智能体是怎么被拆成四个模块的S3 的设计原则是每层只管一件事决策归 Worker坐标归 ACI脏活归 Code Agent挑优归 BBoN。四个模块都可以单独换掉这也是它能同时兼容 GPT-5、Claude、Gemini 和开源模型的原因。Worker 决策循环单层结构 每步反思gui_agents/s3/agents/agent_s.py 里的AgentS3注释很直白uses no hierarchy for less inference time。S2 的 Manager-Worker 两层规划在 S3 中被砍掉只留一个 Worker 直接看截图出动作推理延迟因此显著降低。防死循环交给一个独立的反思模型每步动作后调用一次# gui_agents/s3/agents/worker.pyWorker 在每步决策前先生成反思 reflection, reflection_thoughts self._generate_reflection(instruction, obs) if reflection: generator_message fREFLECTION: You may use this reflection on the previous action and overall trajectory:\n{reflection}\n反思提示词在 gui_agents/s3/memory/procedural_memory.py被严格限制为三种输出轨迹偏了点名是循环动作但不许建议具体动作、轨迹正常简短确认、任务已完成。这个取舍很克制——反思只负责报警不负责指挥避免第二个模型干扰第一个模型的决策。ACI 接口层自然语言指令到可执行代码gui_agents/s3/agents/grounding.py 中的OSWorldACI是整个框架的手。它把动作定义成一组带agent_action装饰器的高层原语click、type、drag_and_drop、hotkey、scroll、done每个原语接收元素描述而非坐标# gui_agents/s3/agents/grounding.py描述 - 坐标 - pyautogui 代码 agent_action def click(self, element_description: str, num_clicks: int 1, button_type: str left, hold_keys: List []): Click on the element... coords1 self.generate_coords(element_description, self.obs) # 调视觉定位模型出 (x,y) x, y self.resize_coordinates(coords1) # 从定位模型坐标空间缩放到真实屏幕 command import pyautogui; command fpyautogui.click({x}, {y}, clicks{num_clicks}, button{repr(button_type)}); return command定位由独立模型默认 UI-TARS-1.5-7B完成主模型永远不需要输出像素坐标——这是为什么选双模型的答案把最容易出错的坐标回归从通用 LLM 里剥离出来。同一文件里还有两个值得注意的设计type()遇到 Unicode 会自动切到剪贴板粘贴而非pyautogui.write()后者写不了中文文本范围选取highlight_text_span()走的是 Tesseract OCR 词表 LLM 选词的路径而不是再次像素定位。程序性记忆API 文档是自动生成的S2/S3 的记忆不是数据库而是注入系统提示词的过程性知识。看这段构造逻辑gui_agents/s3/memory/procedural_memory.py# 用内省扫描 ACI 类把每个 agent_action 方法变成伪代码文档 for attr_name in dir(agent_class): if attr_name in skipped_actions: continue attr getattr(agent_class, attr_name) if callable(attr) and hasattr(attr, is_agent_action): signature inspect.signature(attr) procedural_memory f def {attr_name}{signature}: {attr.__doc__} 模型看到的我能调什么方法不是人手写的提示词而是反射扫描出来的真实函数签名加 docstring——加一个原语提示词自动更新两者永不失配。同一文件里还装着 Code Agent 的系统提示词、行为描述器BBoN 用和对比裁判BBoN 用的全部模板等于把框架的全部经验集中在一个可审计的文件里。Code Agent 与 BBoN脏活外包和离线挑优两个组件分别处理 GUI 做不好的事。call_code_agent()仍在OSWorldACI中把算总和、批量清洗表格这类任务丢给 gui_agents/s3/agents/code_agent.py 里的CodeAgent一个带 20 步预算、逐步写 Python/Bash 的子智能体完成后返回 DONE/FAIL/BUDGET_EXHAUSTED 加执行历史Worker 收到报告后必须用 GUI 动作重新打开文件核验代码代理的结果从不被直接信任。BBoNgui_agents/s3/bbon/则完全离线同一任务跑 N 遍behavior_narrator.py对每对前后截图生成这步发生了什么的事实清单comparative_judge.py拿事实清单加首末两张截图让裁判模型投票选最优轨迹# gui_agents/s3/bbon/comparative_judge.py裁判输出胜出的轨迹下标 response call_llm_formatted(self.judge_agent, [], messagesmessages) answer, thoughts split_thinking_response(response) judge_choice int(answer) # 1..N 中胜出的轨迹BBoN 不改推理路径、不加在线开销纯靠多采样 事后裁判换来 66% → 72.6% 的增量——这也是 S3 论文标题叫 The Unreasonable Effectiveness of Scaling Agents 的原因。内部拆完了下面把它跑起来。跑起来从克隆到第一次出结果环境准备支持 Linux、macOS、Windows单显示器。除了装包还需要tesseractOCR 路径依赖和 API 密钥# 安装 Agent-S 与 OCR 依赖Linux/macOS pip install gui-agents brew install tesseract # Linux 用 apt install tesseract-ocr # 配置模型密钥 export OPENAI_API_KEY你的密钥 export HF_TOKEN你的密钥想改代码则克隆后开发模式安装git clone https://gitcode.com/GitHub_Trending/ag/Agent-S pip install -e .。最小可运行配置关键参数汇总完整说明见 gui_agents/s3/cli_app.py参数说明推荐值--provider/--model主决策模型openai / gpt-5-2025-08-07--ground_provider/--ground_url/--ground_model定位模型端点必填huggingface 推理端点 / UI-TARS-1.5-7B--grounding_width/--grounding_height定位模型坐标分辨率必填1920 / 1080UI-TARS-72B 用 1000 / 1000--max_trajectory_length轨迹中保留的截图轮数8--enable_local_env启用本地代码执行任意代码仅可信环境默认关两个组合建议。高配GPT-5 做决策 UI-TARS-1.5-7B 做定位README 官方推荐。低配决策侧换 Anthropic/Claude 或本地 vLLM支持列表见 models.md定位侧用同一 UI-TARS 系列——注意定位模型是必需项不是可选项。一条命令跑通# 给一个任务Agent-S3 直接开始操作你的桌面 agent_s \ --provider openai --model gpt-5-2025-08-07 \ --ground_provider huggingface --ground_url http://localhost:8080 \ --ground_model ui-tars-1.5-7b \ --grounding_width 1920 --grounding_height 1080 \ --task Open VS Code and close itCLI 默认进入交互模式输入 Query每 15 步内循环截图 → predict → execmacOS 上每个动作前会弹系统确认框show_permission_dialogLinux 用 zenity 弹窗这是官方自带的权限闸门。运行中按一次 CtrlC 暂停观察屏幕再按一次退出。日志分 normal/debug/sdebug 三份写入logs/排查轨迹问题先看 sdebug。跑通之后还有几处值得留意的边界。值得关注的细节与边界上下文管理是双策略的。Worker.flush_messages()对 OpenAI/Anthropic/Gemini 这类长上下文模型只删旧截图、保留全部文字对其他模型直接丢弃整轮对话。--max_trajectory_length 8控制的是保留的截图张数而不是消息条数——调大它换来更长记忆代价是 token 费用线性上涨。代码代理与 GUI 的交接规则比想象中严格。过程性记忆里的硬规定代码代理改完文件后当前打开的应用不会刷新Worker 必须关掉整个应用再重开才能看到修改结果且永不单独信任代码代理输出。这条规则在 OSWorld 的表格类任务上是实际得分点也解释了为什么 S3 特别擅长电子表格——计算走 openpyxl 代码路径呈现走 GUI 核验。BBoN 的裁判输入是事实而非原始视频。裁判只看每步动作前后的差异描述加首末截图避免长视频超上下文也让 N 可以开到 3 甚至更多而不爆炸。代价是它只能用于有完整轨迹落盘的场景OSWorld 评测、run_local.py本地跑批交互式 CLI 里用不上。边界要讲清楚框架默认面向单显示器桌面--enable_local_env会在你机器上以当前用户权限执行任意 Python/Bash官方自己都标注只在可信环境开启OSWorld 提示词里内置了基准专用密码osworld-public-evaluation复用到真实环境前需要自己审视这套提示。另外 BBoN 的增量是离线批处理换来的实时交互场景你拿到的是单轨迹 66% 的水平。如果你正在评估 GUI 智能体框架选型或想搭一套桌面自动化基线Agent-S 的价值在于它把决策、定位、代码执行、评测四件事拆成了可独立替换的模块——gui_agents/s3/ 目录本身就是一张模块清单哪一层想换供应商或换实现只需要动一个文件。【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。