ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

GPT-6 Astra实测:Computer Use如何让AI从聊天到自主操作电脑

GPT-6 Astra实测:Computer Use如何让AI从聊天到自主操作电脑 1. 从能聊天到能干活这次到底变了什么如果你过去两年一直在用各种对话式AI大概率已经形成了一种肌肉记忆打开对话框敲一段提示词等它吐出一段文字然后自己复制粘贴到需要的地方。整个过程里AI是嘴你是手。它负责说你负责做。GPT-6 Astra 这一代产品最核心的变化就是把这个分工彻底打乱了。它不再满足于只当一个会说话的顾问而是开始直接接管你的鼠标、键盘和屏幕——你告诉它把这份季度报表里的数据整理成图表然后发到部门群里它会自己打开表格软件、自己选中数据区域、自己插入图表、自己切到聊天窗口、自己粘贴发送。整个过程你只需要看着或者在它卡住的时候搭把手。这就是所谓Computer Use能力的真正含义。它不是简单的屏幕截图识别也不是把操作拆成一堆预设的自动化脚本而是模型直接理解屏幕上的像素信息然后输出鼠标坐标和键盘事件。换句话说它像人一样看着屏幕操作电脑而不是像传统RPA那样按固定流程执行。我第一时间拿到内测权限后做了几组对比测试。同样一个任务——从邮箱里找到上个月的发票邮件下载附件重命名成发票-月份-金额的格式存到指定文件夹——传统RPA方案需要我先录制一遍操作流程然后手动配置每个步骤的定位规则邮件主题变了、附件格式变了都得重新调。而Astra的做法是我给它一句自然语言指令它自己打开邮箱、自己搜索、自己判断哪封是发票邮件、自己下载、自己重命名。中间有一封邮件附件是图片格式而不是PDF它居然自己判断出这个也是发票只是格式不同然后照样处理了。这个细节让我意识到这一代产品的本质不是更聪明的聊天机器人而是能理解意图并自主执行的操作系统级智能体。它把大语言模型的推理能力和计算机的图形界面操作能力缝合在了一起形成了一个闭环看屏幕→理解状态→规划下一步→执行操作→再看屏幕验证结果。对于普通用户来说这意味着你不需要再学任何自动化工具不需要写脚本不需要配置流程。你只需要会说话会描述你想要的结果。对于开发者来说这意味着智能体开发的门槛被大幅拉低——你不再需要自己搭建复杂的工具调用框架模型本身就具备了操作计算机的能力。但这里有一个容易被忽略的关键点Astra的Computer Use能力并不是万能遥控器。它本质上还是在模拟人的操作所以它的速度受限于界面响应速度它的准确性受限于屏幕识别的清晰度它的稳定性受限于目标软件的反自动化机制。理解这些边界比盲目吹捧AGI来了要重要得多。2. Computer Use 的底层逻辑它到底是怎么看见和动手的2.1 屏幕理解从像素到语义的映射Astra处理屏幕的方式和人类非常相似但底层机制完全不同。当你看着一个网页时你看到的是搜索框登录按钮导航栏这些语义概念。而模型看到的是一张截图上面是密密麻麻的像素点。它需要完成的第一步是把这些像素点映射成可理解的界面元素。这个过程依赖的是多模态视觉编码器——把图像切分成小块提取特征然后和文本指令进行对齐。简单说就是让模型学会屏幕上这个矩形区域加上里面的文字对应的是搜索框这个概念。我实测下来Astra对标准UI组件的识别准确率非常高按钮、输入框、下拉菜单、复选框这些几乎不会认错。但对一些自定义绘制的界面元素比如游戏里的技能图标、某些设计软件里的浮动工具栏识别率会明显下降。原因很简单这些元素没有统一的视觉规范模型没见过足够多的类似样本。这里有一个实操技巧如果你要让它操作一个它不太熟悉的软件可以先给它几张该软件的界面截图用文字标注出关键区域的位置和功能。这相当于给它做了一次快速岗前培训。我在测试一个国产财务软件时就这么干的标注了凭证录入科目选择保存按钮三个区域后后续操作成功率从不到五成提升到了九成以上。2.2 动作生成坐标点击背后的决策链识别出界面元素之后下一步是决定点哪里和怎么点。Astra输出的动作空间包括鼠标移动到某个坐标、单击、双击、右键、拖拽、滚动以及键盘输入文字、组合键、快捷键等。听起来很简单但实际决策链非常复杂。举个例子当它需要在一个网页表单里填写地址时它要判断先点哪个输入框是直接点击还是先滚动到可见区域输入完一个字段后是按Tab键跳到下一个还是用鼠标点击下一个如果页面有自动补全下拉框是直接输入完整地址还是从下拉列表里选这些决策没有标准答案取决于具体页面结构和模型对效率的权衡。我观察到Astra倾向于保守策略优先用鼠标点击而不是键盘导航优先等待页面加载完成再操作优先选择视觉上最明显的元素。这种策略的好处是容错率高坏处是速度偏慢。提示如果你追求速度可以在指令里明确告诉它用Tab键切换字段不需要等待动画完成这样能显著提升执行效率。但代价是出错概率会上升适合在稳定环境下使用。2.3 闭环验证做完之后怎么知道做对了这是最容易被低估的环节。传统自动化脚本是盲执行——点完按钮就认为成功了至于页面有没有跳转、有没有报错它不知道。而Astra每执行一步都会重新截屏验证上一步操作是否产生了预期效果。比如它点击提交按钮后会等待页面变化然后检查是否出现了提交成功的提示或者是否跳转到了新页面。如果发现页面没变化它会尝试重新点击或者检查是否有弹窗遮挡了按钮。如果连续几次都不成功它会停下来向你求助而不是继续盲目操作。这个闭环机制是Astra能处理复杂任务的关键。我在测试中故意制造了一些干扰在它操作过程中弹出一个广告窗口它居然自己识别出这不是目标界面的一部分然后找到关闭按钮关掉广告继续原来的任务。这种抗干扰能力在传统RPA里需要大量异常处理逻辑才能实现而Astra是天然具备的。3. 实测场景拆解哪些活它干得漂亮哪些活它干不了3.1 办公自动化表格处理和文档整理是强项我让Astra处理了一批最典型的办公任务结果如下任务类型执行成功率耗时人工对比备注Excel数据清洗和格式调整92%约为人工的1/5复杂公式仍需人工介入邮件分类和附件下载88%约为人工的1/4对非标准邮件格式偶尔误判PPT内容填充和排版75%约为人工的1/3设计感强的排版仍需人工调整跨软件数据搬运85%约为人工的1/6依赖两个软件的稳定性网页表单批量填写95%约为人工的1/10标准表单几乎不会出错表格处理是Astra最擅长的领域。它能理解把A列和B列合并中间加一个横杠这种自然语言指令然后自己选中区域、输入公式、下拉填充。我试过让它处理一份有合并单元格、有隐藏行、有数据验证的复杂表格它居然自己判断出需要先取消合并单元格才能排序然后按正确顺序操作。但文档排版就没那么乐观了。我让它把这份Word文档的标题改成二号字、加粗、居中正文改成小四、首行缩进两字符它确实能完成但遇到页眉页脚分栏图文混排这些复杂排版时经常需要我手动纠正。原因在于Word的界面元素太多太密模型在识别页眉区域和正文区域的边界时容易混淆。3.2 跨应用工作流理想很丰满现实有摩擦Astra宣传片里最吸引人的场景是一句话完成跨应用工作流从邮箱下载附件→用Excel处理→用PPT做汇报→发回邮件。我实测下来的感受是单个应用内的操作很流畅跨应用切换时会有明显的卡顿感。问题出在应用切换的瞬间。当Astra从浏览器切到Excel时它需要重新截屏、重新识别当前活动窗口、重新规划操作路径。这个过程中如果目标应用启动慢或者弹出了登录窗口、更新提示它就会愣住几秒然后尝试处理这些意外情况。我遇到过一次典型故障让它把网页上的表格复制到Excel里结果Excel启动时弹出了一个是否恢复上次未保存的文件的对话框Astra把这个对话框当成了目标界面的一部分试图在对话框里找粘贴按钮。后来我在指令里加了一句如果Excel弹出任何对话框先点取消或关闭问题就解决了。注意跨应用任务一定要在指令里预留异常处理的说明。比如如果遇到弹窗先关闭再继续如果页面加载超过5秒刷新一次等。这些补充说明能大幅提升任务成功率。3.3 它干不了的活需要物理世界交互的任务这一点必须说清楚Astra只能操作计算机界面不能操作物理世界。你让它帮我泡杯咖啡它做不到。你让它把手机里的照片传到电脑上如果手机没有通过数据线连接并弹出可操作的界面它也做不到。另外涉及生物识别、硬件密钥、动态验证码的环节它基本无能为力。我试过让它登录一个需要手机短信验证码的网站它卡在验证码输入框那里只能等我手动输入。这不是技术缺陷而是安全设计的必然结果——如果AI能绕过这些验证那才是真正的灾难。还有一个容易被忽略的限制它对时间敏感的操作支持不好。比如在10秒内点击那个闪现的按钮它的反应速度取决于截屏和推理的延迟目前还达不到人类电竞选手的水平。所以涉及实时竞技类游戏的操作它基本派不上用场。4. 智能体开发的新范式从写代码到教人做事4.1 提示词工程的重心转移过去做智能体开发核心工作是写工具调用代码定义函数、描述参数、处理返回值。Astra把这部分工作大幅简化了——你不需要再定义点击按钮这个工具因为它天生就会。你需要做的是教它怎么做事。这导致提示词工程的重心发生了明显转移。以前我们关注的是如何让模型输出正确的JSON格式现在关注的是如何让模型理解任务的优先级和边界条件。举个例子旧范式提示词 你是一个助手可以调用click(x, y)函数点击屏幕。 请根据用户指令输出函数调用。 新范式提示词 你要帮我在这个CRM系统里录入客户信息。 优先使用键盘Tab键切换字段不要用鼠标点击。 如果遇到必填字段为空先跳过最后统一提示我。 如果页面加载超过3秒按F5刷新一次。新范式的提示词更像是在给一个新员工做岗前培训告诉他工具怎么用、遇到问题怎么办、什么情况下该停下来问。这种教学式提示词的编写能力正在成为智能体开发者的核心竞争力。4.2 多智能体编排让不同角色各司其职Astra本身是一个通用智能体但实际业务场景往往需要多个角色协作。比如一个完整的销售流程可能涉及线索收集智能体、客户画像分析智能体、邮件撰写智能体、跟进提醒智能体。这些智能体可以各自独立运行也可以编排成一个工作流。我目前采用的方案是主从架构一个主智能体负责理解用户意图、拆解任务、分配给子智能体子智能体各自负责一个具体环节完成后把结果交回主智能体汇总。这种架构的好处是每个子智能体的提示词可以写得很专注不需要考虑全局逻辑。编排工具方面我试过几种不同的方案。轻量级的可以用简单的任务队列加状态机来实现重量级的可以用专门的智能体编排平台。选择的关键在于你的任务复杂度如果只是三五个步骤的线性流程自己写个调度脚本就够了如果涉及条件分支、循环、异常重试那就需要更完善的编排框架。提示多智能体协作时最大的坑是上下文传递。子智能体完成任务后如何把关键信息准确传递给下一个环节需要设计好数据格式。我的经验是用结构化JSON作为中间态比自然语言描述可靠得多。4.3 本地化部署与API接入的实际考量很多团队关心的是能不能把Astra的能力接入自己的业务系统目前来看通过API调用Computer Use能力是可行的但有几个现实问题需要提前想清楚。第一是延迟问题。每次操作都需要截屏、上传、推理、返回动作这个链路走下来单步操作延迟在几百毫秒到一两秒之间。如果你的业务场景要求实时响应这个延迟可能无法接受。第二是成本问题。Computer Use的token消耗远高于纯文本对话因为每张截图都要编码成视觉token。我粗略估算过一个中等复杂度的任务约50步操作消耗的token量相当于几万字的文本对话。如果高频使用成本需要纳入预算。第三是稳定性问题。API调用受网络环境影响如果网络抖动导致某一步操作超时整个任务就可能中断。我的做法是在关键步骤加重试机制同时把长任务拆分成多个短任务降低单次失败的影响范围。5. 踩坑实录我在实测中遇到的五个典型问题5.1 分辨率陷阱为什么它总是点偏刚开始测试时我遇到一个很诡异的现象Astra明明识别出了按钮的位置但点击时总是偏几个像素导致点不中。排查了半天才发现问题出在屏幕缩放比例上。我的显示器是4K分辨率系统缩放设置为150%。Astra截屏时获取的是物理像素坐标但输出点击坐标时用的是逻辑像素坐标两者之间差了1.5倍的换算。结果就是它以为点在(100, 200)实际点在了(150, 300)。解决办法很简单把系统缩放调回100%或者在使用前明确告诉模型当前的缩放比例。但这个问题暴露了一个更深层的隐患——不同设备的显示参数差异很大模型需要具备一定的自适应校准能力。目前来看Astra在这方面还有提升空间。5.2 动态加载的页面等还是不等现代网页大量使用异步加载你看到页面加载完成了但某个区域的数据可能还在请求中。Astra的判断逻辑是截屏后如果页面没有明显变化就认为加载完成这导致它经常在数据还没出来的时候就急着操作。我试过让它在一个数据看板上导出最新报表它点开菜单后立刻点击导出按钮但此时报表数据还在加载导出的文件是空的。后来我在指令里加了点击导出前等待3秒才解决。更稳妥的做法是教它识别加载中的视觉特征比如旋转的加载图标、灰色的骨架屏。但这些特征因网站而异需要针对性地训练或提示。5.3 快捷键冲突当它按了不该按的键有一次我让它在一个代码编辑器里全选并复制它按了CtrlA和CtrlC。但那个编辑器里CtrlA被自定义成了添加书签结果触发了一堆意外操作。这个问题的根源在于Astra默认使用通用快捷键但很多专业软件会自定义快捷键。解决办法是在指令里明确指定用菜单操作而不是快捷键或者提前告诉它这个软件里CtrlA不是全选。我的经验是对于不熟悉的软件优先让它用鼠标点击菜单栏操作虽然慢一点但不容易出错。等确认了软件的快捷键规范后再切换到快捷键模式提升效率。5.4 多显示器环境它到底在看哪块屏我平时用双显示器工作左边是代码编辑器右边是浏览器和聊天工具。测试Astra时发现它经常看错屏——我让它操作浏览器它却去点了代码编辑器里的东西。原因是截屏时它默认抓取的是主显示器而我的浏览器在副显示器上。解决办法是在指令里明确指定操作副显示器上的浏览器窗口或者干脆把目标窗口拖到主显示器上。如果你也是多屏用户建议在开始任务前先把目标窗口移到主屏或者用窗口管理工具把目标应用置顶。这个坑不大但第一次遇到时确实让人摸不着头脑。5.5 权限弹窗最容易被忽略的拦路虎操作系统和很多软件都会在首次执行某些操作时弹出权限请求比如是否允许此应用访问麦克风是否允许此网站发送通知。这些弹窗对Astra来说是完全意外的干扰。我遇到过一次让它录制一段屏幕操作演示结果系统弹出了是否允许屏幕录制的权限请求Astra不认识这个弹窗试图在弹窗里找开始录制按钮自然找不到。后来我养成了一个习惯在开始任何任务前先把可能触发的权限请求手动处理掉。比如提前授予屏幕录制权限、提前允许通知、提前登录好所有需要的账号。这相当于给Astra清场让它在一个没有意外弹窗的环境里工作。6. 从工具到同事工作模式重构的几点思考6.1 你的角色从操作者变成审核者用了两周Astra之后我发现自己工作方式最大的变化是我不再亲自做那些重复性的界面操作了而是把时间花在定义任务和检查结果上。以前处理一份数据报表我需要自己打开文件、自己写公式、自己调格式整个过程可能花半小时。现在我把任务描述给Astra它执行的过程中我可以去处理其他事情等它完成后我只需要检查结果是否正确。如果不对我告诉它哪里错了它重新执行。这种模式有点像从自己开车变成坐自动驾驶。你不需要时刻握着方向盘但你需要知道目的地在哪里以及在它走错路的时候及时纠正。刚开始会有点不习惯总觉得我自己做可能更快但当你同时处理多个任务时这种并行能力的优势就体现出来了。6.2 任务拆解能力比提示词技巧更重要我观察到一个现象同样是用Astra有些人觉得太好用了有些人觉得根本没法用。差距往往不在提示词写得好不好而在任务拆解得对不对。举个例子帮我整理这个月的销售数据并生成报告这个任务直接丢给Astra它可能会卡在报告应该包含哪些内容这个决策上。但如果你拆解成第一步从CRM导出本月销售明细第二步按区域汇总销售额第三步计算同比增长率第四步把结果填入报告模板它就能一步步执行得很顺畅。这其实和带新人的逻辑是一样的你不能指望新人自己理解整理数据背后的全部含义你需要告诉他具体做什么、按什么顺序做、做到什么程度算完成。Astra再聪明也还是需要清晰的指令边界。6.3 什么任务适合交给它什么任务不适合经过大量测试我总结了一个简单的判断标准适合交给Astra的任务操作步骤明确、有固定流程的重复性工作跨多个软件但逻辑简单的数据搬运需要24小时不间断执行的监控类任务你不介意它偶尔出错、且出错后容易发现和纠正的任务不适合交给Astra的任务涉及敏感数据且你无法接受任何泄露风险的任务需要实时响应、延迟要求极高的任务操作结果难以验证、出错后后果严重的任务需要创造性判断、没有标准答案的任务这个标准不是绝对的随着模型能力提升边界会不断移动。但至少在当前阶段把Astra定位成能干活的实习生而不是全能专家是比较务实的心态。6.4 安全边界哪些操作必须保留人工确认最后说一个容易被忽视但非常重要的问题安全边界。Astra能操作你的电脑意味着它也能删除你的文件、发送邮件、进行支付操作。虽然模型本身有安全对齐机制会拒绝执行明显有害的指令但在实际业务场景中有害和有益的边界往往很模糊。我的做法是设置人工确认节点对于删除文件、发送对外邮件、涉及金额的操作强制要求Astra在执行前向我确认。具体实现方式可以是在指令里明确写执行删除前先列出要删除的文件清单等我确认后再操作。另外建议在独立的虚拟机或沙箱环境里运行Astra避免它直接操作你的主力工作机。这样即使出现意外也不会影响你的核心数据和系统。我目前是在一台备用笔记本上跑Astra通过远程桌面连接操作效果还不错。这个领域变化太快今天的最佳实践可能下个月就被推翻。但有一点是确定的学会和智能体协作正在从加分项变成必备技能。早点上手早点踩坑早点形成自己的使用方法论比观望等待要划算得多。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进