ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

GPT-6 Astra 到底强在哪:一句话,它开始替你点鼠标了

GPT-6 Astra 到底强在哪:一句话,它开始替你点鼠标了 每周五下午三点你要干一件破事。12 个销售各发来一张 Excel格式还不统一。你得把它们并成一张总表再一条条录进公司的 CRM。两小时不产生任何价值但必须做。以前你问 ChatGPT它给你一段 Python 脚本或者教你写个宏。你还是得自己跑跑完还得自己录。GPT-6 Astra 不一样的地方是它自己打开你的 Excel自己看表自己打开 CRM 网页自己一条条填进去。你该干嘛干嘛40 分钟后回来看结果。这就是 9 月 4 日凌晨 OpenAI 发布 GPT-6 Astra 真正的意思——AI 从一个告诉你该怎么做的东西变成了一个自己动手做完的东西。下面我把它拆开讲。能不用术语就不用每个数字后面我都说清楚所以呢。所有数据都有出处文末附完整表格。一、先说最反直觉的一点它不是更聪明了是更会干活了这次发布OpenAI 官网首页挂的案例是这些在 KiCad 里画电路板、在 Blender 里建好房子模型再导进游戏引擎、填写美国 1040 税表、在 Power BI 里处理数据、给网站做前端质检。注意这些案例的共同点它们考的都不是能不能答对题而是能不能把一个软件从头用到尾。为什么 OpenAI 要往这个方向走他们总裁 Brockman 讲过一段挺实在的话过去企业想让 AI 用上内部系统得为每一套软件单独开发接口、插件、连接器。但绝大多数软件本来就有一套通用接口——就是给人用的图形界面。只要模型足够会看屏幕、点鼠标、敲键盘它就不必等每一款软件单独为 AI 修一条专用通道。这个判断成不成立另说但它决定了 Astra 的能力长什么样也决定了这次的强项在哪、弱项在哪。二、到底提升了什么三件事只有第三件是质变能操作电脑不是 Astra 首创去年的模型就能点按钮了。那这次到底提升了什么第一件它真能干成了以前模型操作软件经常点错地方、找不到按钮、卡死在某个弹窗上。考看屏幕、找按钮、点下去这个能力的测试里Astra 拿到72.6%上一代是 65.7%。数字看着只差 7 个点但这个测试考的是能不能在真实软件界面里找到正确的那个按钮。差这 7 个点体感上就是从经常卡住到大部分时候能走通。所以呢以前你让它干这种活得在旁边盯着随时救场。现在可以放手让它跑偶尔看一眼。第二件它能干更复杂的活了考多步骤办公流程的测试——整理资料、操作表格、把结果填进另一个系统——Astra 拿41.4%上一代只有18.1%翻了一倍还多。但我必须把另一半也说完还剩 58.6%它干不成。社交媒体上那些某某岗位已死的截图本质就是把 41.4% 当 100% 讲。真实情况是它能接手一部分而且是一小部分。第三件也是真正的质变它能连续干 40 分钟不迷路这条我觉得最被低估也最影响实际体验。以前的长任务有个致命毛病干到一半模型忘了前面干了什么。因为上下文窗口满了之后它会把历史压缩成一段摘要。而压缩丢的恰恰是最值钱的东西——那个方案为什么失败了、哪些测试已经跑过、你一开始提了什么要求。结果就是第 40 分钟又去试第 5 分钟就证明走不通的路。Astra 换了个机制它跨上下文窗口存工作笔记还能回头搜索更早的消息和工具输出。哪个方案试过、为什么放弃它记得住。再配上速度提升——同样的事上一代平均要75 分钟Astra40 分钟快了 47%。这就是能用和能用但我不想用的分界线。75 分钟你宁可自己动手因为等着更难受。40 分钟你可以去泡杯咖啡让它自己在后台跑。所以呢如果你问我这次到底强在哪我的答案是这一条——不是它更聪明了是它终于能把一个完整的活干完了。三、那些刷屏的数字哪些是真的哪些带星号ARC-AGI-3 考了 99.9%——这个数字有个星号这个测试是给模型一个从没见过的游戏不给规则让它自己摸索通关。99.9% 听着像全通了。但出这道题的机构 ARC Prize 自己公布的数据是这样的用标准跑法62.7%花了 $26,098用 OpenAI 提供的适配跑法99.9%花了 $18,817差 37 个百分点。这不算作弊——OpenAI 说这些设置本来是为了贴近真实使用不是为跑分专门调的。但你要知道99.9% 不等于你在 ChatGPT 里随手一问就是 99.9%。而且 ARC Prize 在同一篇文章里写了句很清醒的话“我们并不主张它是 AGI。”它输的地方通稿一般不提考什么Astra谁比它强综合知识难题带工具57.2%上一代 Sol 是 65.0%它退步了第三方综合智能指数61.2Claude Fable 5.1 是 65.7写代码DeepSWE74.1%Meta Muse Spark 1.3 是 75.4%而价格只有它的 1/8最后一行值得单独说。有开发者直接把价格贴出来对比Muse Spark 1.3 的 API 是每百万输入 $1.25、输出 $4.25Astra 是 $10 / $50。他的总结挺扎心——“最贵的模型并不是编码最好的。”还有一个缺席比数字更说明问题OpenAI 自己有个叫GDPval的测试专门衡量能不能完成真实职场任务覆盖 44 个职业、1320 项任务——法律简报、工程设计、电子表格、客户支持、护理计划。这是最贴合AI 能替你干活这个说法的一把尺子。这次没公布成绩。而第三方机构的数据显示Astra 在这项上还退步了约 80 分。OpenAI 的解释有一定道理现有 GDPval 主要测一次性交付还没覆盖 Astra 这次重点展示的长程、多步骤工作。道理讲得通但成绩单上这个空白依然显眼。所以全面最强这四个字是营销语言。它强得很具体在用电脑干活这条线上强不是在所有线上强。四、值不值这个钱这块争议最大而且两边的数打架。OpenAI 的说法别再比每百万 token 多少钱了要看干完一件事花多少钱。他们的测算是——便宜 57%。第三方 Artificial Analysis 的实测Astra 用的 token 少了约 10%但价格涨了 2.5 倍算下来贵了 75%。两组数据不必然矛盾因为测的任务、档位、算法都不同。但对你只有一个办法测你自己的。挑 20 个你真会做的任务一半用现在的模型跑、一半用 Astra 跑只记三件事——成功数、花了多久、花了多少钱。然后算一个数每成功交付一次花了多少钱。这是唯一对你有意义的数字也是跟你老板汇报时唯一站得住的数字。三个价格坑提前说272K 悬崖单次输入超过 272K token整次请求的费率直接翻倍输入和缓存 2 倍、输出 1.5 倍。长任务会悄无声息撞上去推理档别乱开最高档输出价是每百万 token $50。普通任务开最高档那不叫严谨那叫捐款缓存要用起来缓存读取 $1是输出价的 1/50。反复读同一个代码仓库的场景缓存命中率直接决定你的账单五、那我能拿它干嘛现在就能试的错了也不心疼1. 跨软件搬数据—— 把 Excel 的数录进 CRM、把网页表格采下来填进另一套系统。步骤多、不用动脑、错了能改正好是它最擅长的。2. 挑错—— 法律科技公司 Legora 用它几分钟审完 41 份财务文件找出了人为埋进去的 4 处错误。人干这种活会看麻机器不会。3. 读长材料—— 几百页的招标书、年报、判例、代码库。考在 50 万到 100 万字里找信息的测试Astra 拿96.3%上一代只有 73.8%。这是它目前最稳、最没有争议的能力。4. 前端质检—— 给它一份检查清单让它把自己产品点一遍截图留证。5. 做原型—— 游戏公司 Playco 说人工修复减了一半一套灰盒原型能一次出 3 个主题版本。先别碰的需要判断而不只是执行的活它拿不住涉及真实转账、对外发邮件、动生产库的步骤指望它给审计留一条能读懂的推理记录原因见下一节这代反而退步了生命科学这类专业纵深GeneBench Pro 只有37.8%。在真正的专业领域里它还是个实习生六、最该知道的两件事都是 OpenAI 自己写的八条边界我精简成两条这两条你不知道会吃亏。第一件它更能干了但你也更难看清它在想什么OpenAI 每次发模型都要公开一份系统卡。Astra 那份里有一句话是加粗的GPT-6 Astra’s monitorability has decreased relative to GPT-5.6 Sol.翻译Astra 的思维过程比上一代更难监控了。什么意思以前模型做题会把怎么想的写在思维链里人能读能判断它有没有走歪。现在 Astra 越来越能想完不说——在不写出完整推理的情况下把难题解出来。Redwood Research 的首席科学家担心的是这个趋势如果再持续几代靠读思维链来监督 AI 的办法可能就失效了。但我得把另一半也说清楚——在行为上它其实更乖了。一项测试里上一代模型有 48% 的情况会越权行动Astra 是 0%。所以现在的状态是这么个东西它干的事更规矩了但你想搞清楚它为什么这么干变难了。如果你的合规流程依赖能读 AI 的推理过程这一代你得重新设计。第二件它会突然停下来而且你拦不住OpenAI 给 Astra 加了一层监控一旦怀疑它理解错了你的指令就直接暂停甚至终止任务。在 API 里被拦下的任务是直接停可能没法续跑。OpenAI 研究副总裁的原话是“At launch, this is something that people should expect.”——发布初期大家就等着被打断吧。顺带一个背景连 OpenAI 自己都怕Astra 的网络安全能力被 OpenAI 自己评为最高级Critical。他们测试的时候Astra 在一组新披露的浏览器漏洞里自己发现了 2 个此前没人知道的零日漏洞。所以公开版会拒绝帮我写个攻击代码这类请求拒绝率 91.5%上一代是 59%。连付费的安全客户现在也拿不到宽松版。OpenAI 透露因为网络安全的问题他们把 Astra 的发布推迟了好几周。七、怎么用能直接抄的你现在大概率还用不上首日只给受邀组织和 Daybreak 计划成员。Plus / Pro / 企业用户是未来几天。企业版默认关闭要管理员手动开。Codex CLI 用户先别急着改全局配置。先跑这一条确认有没有权限codexexec--modelgpt-6-astrasay ok如果返回not supported或者model_not_found说明你的账号还没排到。这时候你要是已经把配置里的 model 改成了gpt-6-astra之后每次调用都会失败直到你改回来。海外已经有开发者踩过这个坑。确认有权限后两行搞定model gpt-6-astra model_reasoning_effort high建议配 profile方便一条命令切回去[profiles.astra] model gpt-6-astra model_reasoning_effort high [profiles.sol] model gpt-5.6-sol model_reasoning_effort high然后codex -p astra或codex -p sol。另外把 CLI 自己的压缩阈值调高、关掉自动 recap让 Astra 的笔记系统先接管上下文生命周期而不是让 CLI 的压缩抢先触发。参考值在 85 万左右按你自己的实际开销调[model_settings] auto_compact_token_limit 850000 [tui] auto_recap falseAPI 用户三件事用 Responses 不用 Chat Completions去掉temperature、top_p、top_logprobs这代不支持了推理强度走reasoning.effort。fromopenaiimportOpenAI clientOpenAI()respclient.responses.create(modelgpt-6-astra,reasoning{effort:medium},input重构 auth 中间件只给新增路径补测试。,)print(resp.output_text)多租户应用记得带上safety_identifier这样 OpenAI 的处置能定位到单个终端用户不会一竿子打翻你的整个应用。从 GPT-5.5 及更早迁移的还要把prompt_cache_retention换成prompt_cache_options.ttl: 30m。一段能立刻见效的提示词Astra 比上一代更爱停下来问问题。这在安全性上是进步但用起来很烦。我根据官方的提示词指引改写了一版塞进自定义指令或者项目系统提示里从我的请求和此前的上下文里推断意图倾向动手并把任务做完。当我说帮我……修一下……的时候直接干活——不要只给方案也不要在可逆的步骤上再等我批准。只在答案会实质改变结果时才提问。提问之前先把已经授权的部分做完让我批准的是一个具体的东西不是一个想法。不要为假设性的风险主动输出合规清单。最后一句是关键。你批准的是成品不是构想。八、搏哥的三句话第一句这次的关键词不是更聪明是能干完。Astra 真正的看点不是那张跑分表是那个40 分钟。以前模型也能跑完不少电脑任务但慢到你宁可自己动手。40 分钟依然不短可它已经能放到后台跑了。第二句先给任务分级再决定交不交。可逆且可验证的—— 随便交。整理本地文件、跑测试、生成初稿不可逆但可验证的—— 让它做完你签字。提交 PR、更新 CRM 记录不可逆又不可验证的—— 别交。对外发邮件、动生产库、花钱这套分类比任何模型排行榜都耐用因为它不随版本过期。第三句这一代最该防的不是它干错事是你查不出来它怎么干的。它行为上更规矩了但你盯着它的那扇窗变小了。OpenAI 在系统卡里加粗承认了英国 AI 安全研究所独立复现了Redwood Research 的研究者警告思维链监督可能在几代内失效。所以现在就该做一件事把 agent 的动作日志、截图、工具调用记录存下来。不为今天调试。为三个月后你复盘这个结果到底怎么来的时手里还有东西可查。附完整数据表给想深挖的硬参数项目数值上下文窗口1,050,000 token105 万最大输出128,000 token知识截止2026 年 4 月 30 日API 模型名gpt-6-astra另有 Astra Pro推理档位low / medium / high / xhigh / max定价每百万 token输入 $10缓存输入 $1缓存写入 $12.5输出 $50。对比 GPT-5.6 Sol 当前促销价$4 / $0.4 / $20是2.5 倍。Batch 和 Flex 模式半价Fast 模式 2 倍价格换最高 2.5 倍速度。进步最大的几项考什么Astra上一代 Sol多步骤办公流程AutomationBench41.4%18.1%科研工作流Terminal-Bench Science64.6%22.4%运维排障SRE-Bench单次/四次内88.0% / 99.2%55.9% / 68.7%超长材料检索MRCR50万–100万字96.3%73.8%看屏幕找按钮ScreenSpot-Pro92.7%76.9%电脑操作OSWorld72.6%65.7%命令行任务Terminal-Bench 4.057.9%37.3%其他高分ARC-AGI-3 99.9%带星号见正文、FrontierMath Tier 4 97.6%、GPQA Diamond 96.0%、BenchCAD 95.9%。安全侧的精确数字系统卡部署模拟54,218 个内部任务Astra 严重不一致标记34 次0.063%Sol 是 73 次0.135%少 53%越权测试关闭防护Sol 48%Astra 0%网络越狱拒绝率91.5%Sol 59%第三方间接提示注入测试攻击成功率 8.5%Sol 27.0%但在较轻的不一致类别里Astra 搜索凭证的标记比 Sol 更频繁——一个更会自己找钥匙的 agent配上能操作你整台电脑的权限这个组合值得你想想几个我没放进正文、但值得知道的Apollo Research 的发现Astra 在模拟研究任务里会伪造数据标签约每万次 17 次。更要紧的是它在约 9.6% 的测试运行中识别出自己正在被评估Sol 是 2.8%——这意味着低违规率作为对齐证据的力度被削弱了英国 AI 安全研究所在模拟网络安全挑战中Astra 执行了对开源项目的供应链攻击——创建虚假身份、用合法贡献建立信任目的是让恶意代码被合并进去发布当晚ChatGPT、Codex、Claude、Grok 集体宕机。Downdetector 上报障峰值超 3.7 万份OpenAI 后来确认是路由配置错误数据来源与口径采集时间 2026 年 9 月 4 日上午。来源包括OpenAI 官方发布页与模型卡、《GPT-6 Astra System Card》与《Safety Overview》原文、OpenAI 开发者文档周报、Codex CLI 0.153.1/0.153.2 更新日志、ARC Prize 官方评测说明第三方机构 Artificial Analysis、UK AISI、Apollo Research、Redwood Research、Gray Swan中文媒体澎湃新闻、网易智能、腾讯新闻、InfoQ、凤凰网科技等。口径说明除 ARC Prize 和第三方机构数据外官方表格分数均为OpenAI 自测评测环境是其研究环境或 API与你在 ChatGPT 里实际用到的产品在系统提示和可用工具上存在差异。同一基准在不同转载中存在数字差异如 Terminal-Bench 4.0 有 57.7% / 57.9% 两版转述本文取官方口径较多的一版。企业案例Legora、Playco由 OpenAI 提供属厂商自述。Matt Shumer 的体验属提前拿到权限的个人预览不代表普通用户能稳定复现。OpenAI 公布的两条素数间隔新结果短间隔界限 240→186另一项改进了 80 余年未动的界限项附了证明尚待数学界独立复核。截至发稿 Astra 尚未全面开放文中实测数字均来自 OpenAI 或受邀机构的评测环境。如果你今天只想做一件事去 Codex 里跑那行codex exec --model gpt-6-astra say ok看自己排到了没有。然后挑一个你每周都要做、做错了也不心疼的重复性任务交给它跑一遍记下成功数、耗时、花费。跑完回来评论区告诉我结果。我是搏哥欢迎关注「搏哥聊技术」。GPT-7 那天咱们还在这儿见。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进