尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

UI-TARS 实战指南:让 AI 看懂屏幕,像人一样操作你的电脑和手机

发布时间:2026/9/15 12:35:38

资讯中心
01
ARTICLE

UI-TARS 实战指南:让 AI 看懂屏幕,像人一样操作你的电脑和手机

UI-TARS 实战指南:让 AI 看懂屏幕,像人一样操作你的电脑和手机
UI-TARS 实战指南让 AI 看懂屏幕像人一样操作你的电脑和手机【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS把一张截图丢给 AI让它帮你点按钮、填表单它多半会失明——分不清哪个是输入框坐标也点偏。GUI 自动化一直是块硬骨头。UI-TARS 是字节跳动和清华大学联合研发、开源的多模态智能体让 AI 直接看屏幕像人一样操作电脑和手机。一句话定位UI-TARS 是既能看懂界面、又能输出操作指令的开源多模态智能体。给它一张截图加一句指令它告诉你该点哪个元素、按哪些键也可以直接把操作执行下去。先摆最有分量的数字OSWorld 基准在真实虚拟电脑里完成日常任务的成功率上UI-TARS-1.5 拿到 42.5%OpenAI CUA 是 36.4%Claude 3.7 是 28%。UI-TARS 系统整体示意图感知、推理、动作三个模块如何配合 它和传统自动化工具差在哪传统工具Selenium、Appium 这类要先拿到页面的 API 和元素选择器页面元素的门牌号脚本按 ID 找登录按钮按钮改个名字脚本就废了。UI-TARS 不依赖选择器——丢一张截图过去它自己认界面、自己定坐标页面改版了照样能用。第二个区别是会思考。传统脚本逐行执行出错只会一路跑到底UI-TARS 带系统2推理先想清楚再动手的慢思考每步先输出一段 Thought 分析屏幕再给出 Action点错了它看新截图调整计划而不是直接失败。⚡ 安装与首次运行5 分钟从截图到点击仓库里的 ui-tars 包负责后处理把模型输出的 Thought Action 文本翻译成能执行的自动化代码。先装上它pip install ui-tars # 或 uv pip install ui-tars再跑最小示例。这里模拟模型回了一句点击 (100,200) 处的按钮库会把这句话解析成结构化动作再生成 PyAutoGUI 脚本from ui_tars.action_parser import parse_action_to_structure_output, parsing_response_to_pyautogui_code response Thought: Click the button\nAction: click(start_box(100,200)) w, h 1920, 1080 parsed parse_action_to_structure_output( response, factor1000, origin_resized_heighth, origin_resized_widthw, model_typeqwen25vl ) code parsing_response_to_pyautogui_code(responsesparsed, image_heighth, image_widthw) print(code)打印出来就是几行 pyautogui 代码在本机跑起来鼠标就会点那个坐标。真实场景前面还有一步把截图发给模型拿到 response这一段只管翻译。想翻源码或看更多示例克隆仓库即可git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS️ 桌面、手机、网页三类场景分别能做什么codes/ui_tars/prompt.py 里带了三套提示词模板正好对应三类环境。桌面COMPUTER_USE适合 Windows、Linux、macOS。让它打开浏览器搜索指定内容并点开搜索结果填写一份办公文档保存并命名把文件拖进指定文件夹执行快捷键组合移动MOBILE_USE面向 Android 真机和模拟器多了长按、启动应用、Home、返回这类移动特有动作长按复制一段文字启动指定应用完成登录流程按 Home、返回键在应用间切换网页Midscene.js 集成配合开源项目 Midscene.js 跑浏览器任务自动填写并提交网页表单跨多个页面点击并提取数据在多个浏览器间跑兼容性回归 它是怎么工作的感知、推理与动作整个流程拆成三块。感知截图发给模型它做元素识别——哪个是按钮、哪个是输入框、在什么位置。推理动手前先慢思考输出一段 Thought想清这步的目标和下一步避免乱点。动作想完从统一动作空间里选——点击、双击、右键、拖拽、键盘、滚动、输入文字。模型给的只是一行字符串codes/ui_tars/action_parser.py 负责把字符串变成结构化数据再变成 pyautogui 代码。有个细节容易被忽略坐标。模型不是按原图看截图而是按缩放后的图看输出的坐标要换算回原始分辨率才能点准。仓库里的 README_coordinates.md 专门讲这个过程坐标处理示意模型输出的坐标如何映射回原始屏幕分辨率 实测成绩领先多少、弱在哪项目给出的 UI-TARS-1.5 数据基准任务类型UI-TARS-1.5对比OSWorld100 步电脑操作42.5%CUA 36.4% / Claude 3.7 28% / 此前 SOTA 38.1%200 步Windows Agent Arena50 步电脑操作42.1%此前 SOTA 29.8%Android World手机操作64.2%此前 SOTA 59.5%WebVoyager网页84.8%CUA 87%Online-Mind2web网页75.8%CUA 71%ScreenSpot-V2 / ScreenSpotPro元素定位94.2% / 61.6%均领先对比模型Poki 网页游戏游戏15 款 100%含 2048、迷宫、方块消除UI-TARS 在不同基准上与之前 SOTA 模型的得分对比桌面和手机方向优势明显网页方向处第一梯队但不是最高——按你的场景选别只看总分。️ 常见坑与解法先备好显卡本地推理需要支持 CUDA 的 GPU内存建议 16GB 以上。坐标映射容易配错运行时要传原始截图的宽高传成缩放后的尺寸点击会整体偏移基于 Qwen2.5-VL 的模型先读一遍 README_coordinates.md。给界面留时间屏幕切换需要时间别急着发下一个动作生成的脚本动作间已带 time.sleep(1)失败就重发新截图再试。从小任务开始先用单点击、输入文字验证坐标再扩展到多步流程。别完全放心模型偶尔认错元素或误判关键操作留人工复核。适合谁用适合三类人想搭 GUI 自动化能力的开发者、想自动跑手机或网页回归的测试工程师、想研究多模态智能体与推理的科研人员。克隆仓库跑通最小示例再接真实任务——五分钟后你就能让 AI 点下第一个按钮。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。