Agent-S3:72.6%,首个超越人类的开源智能体
Agent-S372.6%首个超越人类的开源智能体【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S先给一个数字。在 OSWorld 这个AI 能不能真的操作电脑的基准上人类平均成功率约 72%开源框架 Agent-S3 在加上 Behavior Best-of-NbBoN后拿到 72.60%是目前第一个越过人类线的 computer-use 智能体。这篇文章不堆卖点只讲三件事这个数字怎么来的、怎么跑起来、以及哪几个开关需要你真正做判断。 先说结论它值得进你的选型清单如果你的团队要挑一个开源的 GUI 自动化智能体落地Agent-S3 是目前不需要太多解释的那一个。理由全在数字里单跑 S3OSWorld、100 步设置就是 66%已超过此前最强的 63.4%GTA1 w/ GPT-5叠加 bBoN 后到 72.60%越过人类基准线零样本泛化在 WindowsAgentArena 上从 3 次运行里挑最优50.2% 提到 56.6%AndroidWorld 从 68.1% 提到 71.6%。第三点容易被忽略但可能是最有价值的后两个基准不是 Linux 桌面一个是 Windows、一个是 Android模型没有任何针对适配直接迁移就能跑出成绩。 它是怎么跑的S3 的设计哲学就四个字做减法。S1 时代是 Manager-Worker 的分层架构S3 直接拍平成单层Worker 看截图、做推理、产出动作ACIgrounding 模块把点击保存按钮翻译成具体的 pyautogui 代码程序性记忆库存放提示词与经验知识另有一个默认开启的反思 agent 帮 Worker 自检。层级少了推理链路变短这是 S3 比 S2 更快、也更好排查问题的直接原因。三代演进方向很清楚版本OSWorld 成功率一句话点评Agent S20.6%分层架构先证明路线可行Agent S248.8%通用-专家框架多基准刷出 SOTAAgent S372.60%含 bBoN拍平结构首次超越人类最小可用配置两条命令跑起来两个前提单显示器并且你要接受这个 agent 会执行 Python 代码来操作你的电脑。安装git clone https://gitcode.com/GitHub_Trending/ag/Agent-S cd Agent-S pip install -e .另外要装 tesseractPytesseract 依赖它。官方推荐组合是主模型 gpt-5-2025-08-07、grounding 模型 UI-TARS-1.5-7B后者需部署在 Hugging Face Inference Endpoints 或 vLLM 等推理端点agent_s \ --provider openai --model gpt-5-2025-08-07 \ --ground_provider huggingface --ground_url http://localhost:8080 \ --ground_model ui-tars-1.5-7b \ --grounding_width 1920 --grounding_height 1080grounding 的两个尺寸必须和模型的输出坐标分辨率一致UI-TARS-1.5-7B 是 1920×1080换 UI-TARS-72B 则改 1000×1000。主模型还支持 Anthropic、Gemini、Azure OpenAI、vLLM、Open Router细节见仓库里的 models.md。说实话最小配置其实不低配——推荐组合就是高配成本大头在自托管 7B grounding 模型这不是一个轻量级项目。 多出来的 6.6 个点从哪来单跑 66%、bBoN 72.60%差值不是换更强的模型而是一个朴素的机制同一任务跑 N 次再挑最好的那次。实现分两步。先是 Behavior Narrator 对每条轨迹的截图对生成事实描述fact captions说清楚相邻画面之间发生了什么变化然后 Comparative Judge 拿着这些事实加首末截图在多条轨迹里比较择优。对应脚本在 osworld_setup/s3/bbon/先跑generate_facts.py生成描述再跑run_judge.py对比会直接产出 BoN2.json、BoN3.json 这类逐档对比文件。代价是 N 倍的推理开销。但如果你要的是能算出成功率的批量自动化这个性价比很高——WindowsAgentArena 和 AndroidWorld 的提升用的就是同一套3 次里选优的配置。⚠️ --enable_local_env 该不该开S3 还有个开关值得单独说本地代码执行。打开后agent 可以通过call_code_agent直接在你的机器上跑 Python 和 Bash用代码一步完成表格处理、文件批处理这类事而不是慢慢点 GUI。但要清楚它的边界执行的是任意代码权限就是启动 agent 的那个用户Bash 有 30 秒硬超时兜底官方 README 也明确写了只在可信环境使用。我的建议内部实验可以开生产环境放沙箱里跑并留全量执行日志。最后几句单显示器限制、必须自托管 grounding 模型这些约束 README 里都写明了不算隐藏成本。回头看 S1 到 S3 的轨迹——20.6% 到 72.60%进步不是靠把模型堆大而是结构拍平、评测标准化、多次运行择优这三件事叠加的结果。所以如果你的需求是让 AI 把电脑上的活干了先别急着自研把仓库拉下来跑通一个任务看看开源 agent 现在的真实水位再决定要不要往里投入。【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考