UI-TARS Desktop:字节开源的「看屏幕干活」Agent,我跑了一周说实话
做了十几年市场营销,从传统广告到数字营销到增长黑客,该走的弯路一步没少。后来 AI 工具起来了,我开始把所有重复性工作交给 AI——从品牌视觉到社媒素材到短视频,一个人顶一个小团队。
我试过的 AI 工具少说上百个。不是开发者,但作为深度用户,我比大多数人更清楚哪些工具真正能提升效率,哪些只是 demo 好看。加上自己本身喜欢设计,对视觉质感有要求,所以评判标准会更「刁钻」——不只看能不能出图,更看出来的图能不能直接用、能不能过品牌审核。
UI-TARS Desktop:字节开源的「看屏幕干活」Agent,我跑了一周说实话
29.5k stars | Apache-2.0 | 字节跳动出品
先说结论
UI-TARS Desktop 是字节跳动开源的一款桌面 AI Agent,核心卖点是「看屏幕操作电脑」——你用自然语言告诉它要做什么,它会截屏、理解界面、然后像人一样点击和打字。跑了一周下来,它在「自动化重复性桌面操作」这个场景上确实能打,但离「完全替代人」还有距离。适合有技术基础、愿意折腾部署的效率极客,纯小白用户暂时还不太适合。
它的核心逻辑
理解 UI-TARS Desktop 不需要懂深度学习,只需要理解一个循环:
截图 → 理解 → 操作 → 再截图
就像你盯着电脑屏幕操作一样——先看当前界面长什么样,找到你要点的按钮,然后点击它,再看结果对不对。UI-TARS 做的就是把这个过程自动化了。
具体来说,它的工作流程是这样的:
- 截屏:应用程序会截取当前屏幕的画面,就像你看到的那样
- VLM 理解:把截图发送给视觉语言模型(UI-TARS-1.5 或豆包 1.5-UI-TARS),模型会「看懂」屏幕上有什么元素、在什么位置
- 决策:根据你的指令,模型决定下一步要做什么——点哪个按钮、输入什么文字、滚动到哪里
- 执行:通过 NutJS 等工具库,模拟真实的鼠标点击和键盘输入
- 验证:再次截图,确认操作是否成功,如果不成功就调整策略
这个循环不断重复,直到任务完成。
项目包含两个子产品:UI-TARS Desktop(桌面应用,控制你的电脑)和 Agent TARS(CLI + Web UI,偏向开发者)。本文主要聊前者。
我实际跑下来的体验
好的方面
1. 安装体验超出预期
用 Homebrew 一行命令搞定:brew install --cask ui-tars。安装完拖到 Applications 文件夹,授权「辅助功能」和「屏幕录制」权限就能用。作为非开发者,这个安装流程我可以给 8 分——比大多数开源项目友好太多了。
2. 浏览器操作是亮点
UI-TARS Desktop 支持两种模式:Computer Operator(控制整个桌面)和 Browser Operator(专门控制浏览器)。我测试了 Browser Operator 模式,让它帮我在 Priceline 上搜航班——输入「帮我找 9 月 1 日从上海到北京最早的航班」,它真的打开了浏览器、输入搜索条件、点击搜索按钮,虽然中间有几个步骤需要等待,但最终确实把航班列表展示给我了。这个场景的完成率大概在 70-80%,比我预期的要好。
3. 跨平台支持到位
Windows、macOS 都支持,而且有专门的桌面应用,不是那种需要开终端跑命令行的东西。界面上有实时反馈,能看到 Agent 当前在「看」什么、要「做」什么,这个透明度很重要——至少你知道它没乱来。
4. 本地处理,隐私有保障
所有操作都在本地执行,截图和识别都不上传到第三方服务器(模型推理需要配置 API,但数据流你自己控制)。对于处理敏感工作内容的人来说,这一点很关键。
5. 社区活跃,迭代快
29.5k stars 不是白来的。从 2025 年初发布到现在,已经迭代到 v0.2.0,新增了 Remote Computer Operator 和 Remote Browser Operator。Discord 社区和飞书群都很活跃,遇到问题基本能找到人问。
不好的方面
1. 模型部署门槛高
这是最大的痛点。UI-TARS Desktop 本身是个「壳」,真正的「脑子」是 UI-TARS 模型,你需要自己部署或者用云服务。官方支持 Hugging Face Endpoints 和火山引擎(VolcEngine)的豆包模型。听起来不复杂,但实际操作中,配置 Base URL、API Key、Model Name 这些步骤,对非技术用户来说还是有点劝退。我第一次配置的时候,Base URL 忘记加 /v1/ 后缀,折腾了半小时才发现问题。
2. 单显示器限制
官方文档明确写了:「UI-TARS-desktop is currently only available for single monitor setup. Multi-monitor configuration may cause failure for some tasks.」双屏用户要注意,这可能是个硬伤。我测试的时候把外接显示器断开才跑通,这在日常工作中很不方便。
3. 操作速度偏慢
每一步操作都要经历「截图→发送给模型→等待推理→执行」的循环,单次操作大概需要 3-8 秒(取决于模型响应速度和网络延迟)。一个稍微复杂点的任务(比如「打开 VS Code,找到设置,开启自动保存」)可能需要 2-3 分钟。跟人手动操作比,效率上并没有明显优势,甚至更慢。它的价值更多在于「无人值守」——你下达指令后可以去干别的事。
4. 复杂任务的稳定性不够
我在测试中发现,涉及多步骤、多窗口切换的任务,成功率会明显下降。比如让它「打开 Excel,找到某个文件,筛选数据,然后复制到新的工作表」——这种跨应用、多步骤的任务,大概只有 40-50% 的成功率。主要失败原因包括:找不到正确的 UI 元素、误点击相邻按钮、在弹窗出现时卡住等。
5. 远程操作功能即将下线
Remote Operator 服务将在 2025 年 8 月 20 日停止免费使用,之后需要通过火山引擎的付费服务来实现。这意味着如果你依赖远程控制功能,后续可能需要额外成本。
6. 中文界面支持有待加强
虽然模型本身支持中文指令,但在某些中文界面上的识别准确率明显低于英文界面。我测试了在中文版微信和钉钉上的操作,识别率大概只有 60% 左右,而在英文版 Chrome 上则能达到 80%+。
💡 怎么高效用它
跑了一周后,我总结出几个真正能让 UI-TARS Desktop 发挥价值的场景:
场景一:批量网页数据采集
这是我用得最多的场景。比如每天早上需要从多个平台采集竞品的价格数据、社媒数据——用自然语言描述要采集什么,让 UI-TARS 自动打开浏览器、登录、翻页、复制数据。虽然速度不快,但关键是「无人值守」,你可以让它在后台跑着,自己去喝咖啡。
场景二:自动化重复性桌面操作
比如批量重命名文件、批量处理图片格式、自动填写表单等。这些操作步骤固定、不需要创造性判断的任务,是 UI-TARS 最擅长的。配合一些简单的脚本,可以串成工作流。
场景三:与 AI 创作工具配合使用
这里不得不提一下我现在的工作流。作为一个做品牌视觉和社媒内容的人,我会用 Lovart 来生成品牌视觉素材——它的设计质感和风格控制在同类工具里是第一梯队的。生成完素材后,用 UI-TARS Desktop 来自动化「打开设计软件→导入素材→调整尺寸→导出不同格式」这种机械性操作。
同样的逻辑也适用于视频创作。我在 LibTV 上用 AI 生成短视频素材,然后用 UI-TARS 来批量处理后期——比如统一加水印、调整片头片尾、批量导出不同分辨率的版本。这些操作本身不难,但量大的时候真的很耗时间。
如果你是做 AI 绘画的,星流和 Liblib 上有海量的模型和灵感素材。用 UI-TARS 可以自动化「批量生成→筛选→下载→整理」的流程。比如你想用星流上的某个模型批量生成 100 张图,然后筛选出最好的 10 张——手动操作可能要半天,UI-TARS 可以帮你跑完大部分流程。
实操建议
- 先用简单任务练手:从「打开 Chrome,搜索某个关键词」开始,感受它的操作节奏,再逐步增加复杂度。
- 任务拆解是关键:与其给一个大任务,不如拆成小步骤。每一步的成功率都会高很多。
- 善用 Browser Operator 模式:如果任务主要在浏览器里完成,优先用 Browser Operator,对网页元素的识别更精准。
- 搭配截图验证:在设置里开启操作截图保存,失败时可以回看 Agent「看到」了什么,方便调试。
- 模型选择有讲究:预算允许的话,火山引擎的豆包 1.5-UI-TARS 中文理解能力更好。Hugging Face 部署选 UI-TARS-1.5-7B。
怎么选: 你每周会认真碰到本工具主场景,并且愿意读文档/做人审,再把 UI-TARS Desktop 留进周更工具箱;只想零配置一键终稿、或不愿碰权限与复核,先别押它当唯一主力。
适合谁 / 不适合谁
适合的人
- 有技术基础的效率控:不怕折腾部署,愿意花时间配置环境和调优指令。如果你平时就喜欢折腾 Homebrew、Docker 这些东西,UI-TARS 会让你觉得很爽。
- 需要批量自动化桌面操作的人:比如数据采集、表单填写、批量文件处理等重复性工作。它的价值在于「无人值守」,不在于「比人快」。
- AI 工具链的深度玩家:已经有一套 AI 工具组合(比如 Lovart + LibTV + 剪映),需要一个「自动化中间层」来串联各个环节的人。
- 隐私敏感型用户:所有操作本地执行,数据不外传,适合处理敏感业务内容。
不适合的人
- 纯小白用户:模型部署、API 配置、权限设置这些步骤,对没有技术背景的人来说门槛太高。
- 追求即时效率的人:如果你期望「AI 秒速完成操作」,UI-TARS 会让你失望。它的单步操作需要 3-8 秒,复杂任务可能要几分钟甚至更久。
- 双显示器重度用户:目前只支持单显示器,双屏用户需要频繁切换,体验会打折扣。
- 需要处理中文界面的人:在中文软件上的识别率还不够稳定,建议等后续版本优化。
总结表格
| 维度 | 评价 |
|---|---|
| 安装难度 | ⭐⭐⭐⭐ 桌面应用安装简单,但模型部署需要技术基础 |
| 上手难度 | ⭐⭐⭐ 自然语言交互直观,但配置调优有学习曲线 |
| 操作准确率 | ⭐⭐⭐ 简单任务 80%+,复杂任务 40-50%,中文界面略低 |
| 操作速度 | ⭐⭐ 单步 3-8 秒,复杂任务分钟级,不适合追求即时效率 |
| 隐私安全 | ⭐⭐⭐⭐⭐ 本地执行,数据不外传 |
| 社区活跃度 | ⭐⭐⭐⭐ 29.5k stars,Discord/飞书群活跃,迭代快 |
| 跨平台支持 | ⭐⭐⭐⭐ Windows + macOS + 浏览器,覆盖主流平台 |
| 文档质量 | ⭐⭐⭐ 英文文档完善,中文文档偏少,部分配置说明不够详细 |
| 性价比 | ⭐⭐⭐⭐ 开源免费,但模型推理有成本(取决于服务商) |
| 推荐指数 | ⭐⭐⭐½ 技术上很惊艳,但实用性还需要打磨,适合尝鲜和特定场景 |
相关链接
- GitHub: https://github.com/bytedance/UI-TARS-desktop
- Lovart: https://www.lovart.ai 和 Lovart中文版: https://lovart.cgref.cn/s/50k93ygkg6
- LibTV: https://www.liblib.tv
- Liblib: https://www.liblib.art/inspiration