ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

问迹AI TrackBook:自主编程Agent赛道分析,Cursor、Claude Code、Codex谁在卖能交PR的AI程序员

问迹AI TrackBook:自主编程Agent赛道分析,Cursor、Claude Code、Codex谁在卖能交PR的AI程序员 开发者要买的是能接仓库、规划多步任务、改代码、跑测试、开出 PR 的端到端 Agent不是又一个补全插件。钱已经按 ARR 与估值砸进来真正的分歧是你按人头买一个坐在 IDE 里陪你写的助手还是按任务买云端交出来、能验收的 PR。问迹AI TrackBook · Agent 编程 IDE · 自主编程 Agent · 2026-09-22先别从产品名看这个市场。拿一条真实的开发任务交给 Agent它要读懂仓库找准改动范围进可跑的环境改代码、补测试开出合并请求再处理评审意见。整条链路跑得通才叫自主编程 Agent只会在编辑器里续写几行不算。资本已经按这条任务链定价。Cognition在 2026 年 9 月融资约 20 亿美元、估值约 480 亿美元公司称年化 run-rate 接近 9 亿美元Cursor则在 8 月正式并入 SpaceX交易口径约 600 亿美元。高价格证明工程团队愿意采购不代表 Agent 已经能独立接管大型版本迭代。39.1%· 大型版本升级的最高完成率RoadmapBench中位任务改约3700行、51个文件480亿美元· Cognition最新估值2026-09融资约20亿美元公司称run-rate近9亿美元600亿美元· Cursor收购口径2026-08完成并入SpaceX三组数字放在一起看需求和估值已经很大复杂任务的稳定交付仍是空缺。01 从开单到合并中间有六处容易断掉赛道边界就藏在这条链里产品必须接真实 repo能连续调用工具、改多文件、运行验证并把结果交成补丁、PR 或可部署产物。纯行内补全、只卖 coding model API 的上游厂商、IDE 教程与评测站都不在核心范围。买方验收的是改动能否合并不是回答看起来像不像资深工程师。01 需求先变成可执行计划Agent 要识别需求、隐含约束和验收条件再决定先读哪些文件。Devin、Factory的Droids与TRAE SOLO都把长任务拆解当产品核心。计划错了后面跑得越快返工越多。02 Repo 不是一摞文本文件索引、符号关系、依赖图和历史改动决定 Agent 能否找到真正的影响面。Augment Agent强调大仓 Context EngineAmp承接 Sourcegraph 的代码检索脉络Cursor也把仓库上下文放在日常工作面里。03 Sandbox 决定代码能不能真的运行依赖、密钥、网络和构建镜像必须可复现。云端路线由Devin和Codex代表本地终端路线由Claude Code、Aider和Cline代表。OpenAI在 2026 年把 harness、托管沙箱和自托管执行器一起开放说明执行环境已经从配套设施变成商品层。04 写代码只是链条中段真正的 harness 还要处理上下文压缩、工具调用、失败重试、会话恢复和多个子任务之间的改动冲突。多 Agent 可以增加吞吐也可能让两个会话同时改坏同一处接口并行数本身没有商业价值。05 测试把演示变成工程单测、类型检查、lint、浏览器冒烟和安全扫描必须在同一环境里运行。测试红了以后能否定位并再改一次比首轮代码生成分数更接近客户体验。没有这一步所谓交付只是一个需要工程师重新审写的草稿。06 合并请求和代码评审才是验收关口最终产物要带变更说明、验证记录和可审查 diff评审意见还要回到任务里。GitHub Copilot Coding Agent占据代码托管入口Replit Agent把运行与托管接在后面。独立产品若无法进入现有审批流能力再强也会停在个人试用。自主性不是一个开关。人在哪一步必须接手决定了产品卖席位、卖任务还是卖一支需要人工看护的外包队。02 同一条开发任务在 IDE、CLI 和云端队列里是三门生意01 IDE人一直在场Agent 贴着编辑器运行开发者随时改方向。上手快、日活高交付责任仍大多留在人身上。02 CLI接近现有工具链不要求团队换编辑器能直接碰终端、测试和脚本。优势是灵活企业治理要另外补。03 云端队列先委派再验收任务在隔离环境异步运行适合并发和长任务。沙箱成本、权限边界与结果验收都由供应商承担更多。三种工作面会互相渗透但采购理由不同个人习惯、工程基础设施、可委派产能。Cognition收购Windsurf把云端委派与 IDE 入口放到一家公司Cursor同时做本地 Agent 和 Cloud AgentsOpenAI则把Codex背后的运行时开放给第三方。边界正在融合但玩家不能用一个总下载量掩盖三种完全不同的使用深度。异步委派与企业工程平台主产品能在远程环境接任务并交付可验收工程结果。Cognition / Devin阶段2026-09 E轮工作面云端队列 IDE最新规模口径融资约20亿美元估值约480亿run-rate近9亿主要抓手自主执行、强化学习、并入Windsurf入口Factory阶段2026-09新一轮工作面企业Droids平台最新规模口径融资约2亿美元估值约50亿主要抓手模型路由、治理、受监管环境部署Augment Agent阶段B轮后工作面企业仓结对 Agent最新规模口径2024 B轮2.27亿美元估值约9.77亿主要抓手大型多仓索引与长程任务Amp阶段2025分拆工作面CLI 远程环境最新规模口径从Sourcegraph独立主要抓手远程Agent与协作预览估值最高的两家公司都在扩大交付面大仓索引、治理与远程环境仍给较小玩家留下企业采购位置。IDE 与国内大厂入口人留在编辑器里Agent 连续改仓部分产品再向异步任务延伸。Cursor归属SpaceX产品形态Agentic IDE Cloud Agents公开信号2025-06 ARR超5亿2026-08完成收购采购优势开发者习惯、云任务与算力Windsurf归属Cognition产品形态Agentic IDE公开信号收购时约8200万美元ARR、350企业客户采购优势与云端自主工程师整合TRAE / SOLO归属字节系产品形态AI IDE 端到端模式公开信号公开称超60亿行采纳、日均约150万Query采购优势中文产品与大厂分发通义灵码归属阿里云产品形态插件 智能体公开信号云厂商账号与企业渠道采购优势多文件修改、云原生工具链CodeFlicker归属快手产品形态AI原生IDE公开信号公测与积分制采购优势Jam Agent、自研模型与中文场景国内产品未必走独立融资路线云账号、集团研发场景和本地部署能力本身就是分发资产。CLI、开源与托管平台它们未必以独立 Agent 公司融资却直接压低中间层价格。Claude Code入口终端收费方Anthropic订阅/API公开信号2026-02年化run-rate超25亿美元对创业公司的压力模型厂商直接拿开发者预算Codex / OpenAI入口终端 云端指挥面收费方Token与工具公开信号Agents API将harness与沙箱开放对创业公司的压力运行时成为可采购基础设施Cline / Aider / Continue入口插件或CLI收费方自托管、订阅或自带Key公开信号开源社区分发对创业公司的压力薄封装难保住席位溢价GitHub Copilot Coding Agent入口代码托管收费方GitHub席位公开信号Issue后台执行并交PR对创业公司的压力掌握任务入口与评审入口Replit Agent入口云IDE收费方平台订阅公开信号从需求到运行应用对创业公司的压力编码、部署与托管一体独立公司的对手不只在同类融资表里还包括模型供应商、代码托管平台和开源工具。03 谁承担返工和事故决定收入算软件还是算服务自主性最容易在 demo 里被高估。METR 的时长指标显示前沿 Agent 能完成的任务越来越长但其任务大多定义清楚、可自动判分而且 METR 明确提示现有套件对 16 小时以上的测量不可靠。RoadmapBench 把场景换成真实版本升级中位任务要改约 3700 行、51 个文件最强模型完成率仍只有 39.1%。这更接近企业为什么不敢把整个迭代直接外包给 Agent。01 返工由开发者承担卖席位个人 Pro 和团队订阅增长最快。Agent 提建议、开发者负责核对供应商不用承诺每张任务单都成功。代价是客户很容易在Cursor、Claude Code、Cline与其他工具之间切换留存依赖日常工作面。02 返工由供应商承担卖任务按任务或结果收费更像新增产能却会把需求含糊、测试缺失、环境故障和人工兜底一起装进成本。合同若只写成功案例、不写接管次数与返工边界收入看似是软件实际毛利里藏着交付团队。03 事故由企业承担先买治理大客户先问 SSO、私有化索引、密钥隔离、审批闸门、审计日志和数据驻留。Factory把受控部署和 Agent Effectiveness 做成平台Augment Agent强调企业代码库上下文。对受监管行业这些功能往往比再提高一点 benchmark 分数更早进入采购清单。04 算力账单由谁承担决定毛利长任务会消耗 Token、沙箱机时和多轮验证。席位制下重度用户可能吞掉毛利按量收费又让客户难做预算。OpenAI按 Token 与工具为 Agents API 计费Factory则称模型路由可降低 Token 支出。两条路都在说明成本控制已经进入产品而不是财务部门事后优化。企业续费应当能在自己的系统里查到四项数一是 PR 合并率二是人工平均接管次数三是合并后的回滚或事故率四是每个成功任务的模型与沙箱成本。只公布生成代码行数、Query 数或注册人数无法证明供应商真的承担了更多工程责任。04 600 亿美元并购以后入口、算力和模型合同被放到同一张表Cursor并入 SpaceX 后强调 GPU 供给不到两周OpenAI又宣布拟在 2026 年 11 月停止向其供应模型。这两个动作揭示了独立 IDE 的真实结构一头需要高频开发者入口一头依赖昂贵算力和多个模型供应关系。入口值钱上游合同也足以改变产品菜单。Cognition以接近 9 亿美元 run-rate 获得 480 亿美元估值约为该口径的 53 倍Factory在五个月内从约 15 亿美元升至约 50 亿美元估值。前者已经用收入速度证明需求后者押注企业会把治理与模型路由留给中立平台。两者价格都要求增长继续很快也要求推理和沙箱成本不能同步吞掉收入。种子轮买的是哪一段时间差第一笔钱通常来自四个可解释的窗口。一是基座模型刚够用旧式补全与多步执行之间出现新品类二是程序员成本高买方容易估算节省的工时三是竞赛型或大厂工程团队能较快做出演示早期投资人愿意抢团队四是 IDE、终端和代码托管入口尚未完全合并创业公司仍有机会先占一个工作面。a16z、Accel、Thrive、Khosla、Sequoia 等财务 VC 反复下注买的是增长与退出不等于项目已经证明复杂仓库的稳定合并率。产业方另有算盘云厂商、代码托管平台和算力提供方更在意 Token 消耗、GPU 利用率与研发入口。Cursor并入 SpaceX 属于产业整合不能与财务 VC 的成长轮混作一种背书。成长轮会查哪些底账后续持续融资至少要摊开五本账。1、留存是否对应合并率和接管次数而非账号增长2、Token 与沙箱成本占收入多少3、失败与修复轨迹能否在客户授权下回到评估和训练4、公司是否控制 IDE、CLI、托管或企业治理中的一个工作面5、单一模型供应商改变合同后任务成功率和毛利会不会一起掉。Claude Code在 2026 年 2 月年化 run-rate 已超 25 亿美元说明模型公司可以直接拿走应用层预算OpenAI把 harness 商品化则压低了只做编排壳的价格。发布会说能交 PR合同却不肯记录返工产品页写自主执行客户仍要高级工程师全程盯着融资材料把 GitHub、云厂商和模型公司假设成永远中立的上游——这些做法的问题不在措辞而在收入质量会被错误计算。并购和供应合同变化已经给出了可核对的反例。05 通用入口已经昂贵新公司要接别人不愿背的任务责任新入局要避开什么正面战场三个位置已经很难正面打。一是再做一个通用 Agentic IDECursor握有习惯与品牌SpaceX 又补算力TRAE、通义灵码与CodeFlicker背后有国内大厂分发。二是复制通用云端软件工程师Devin与Factory已经用融资和企业销售建立信任门槛。三是只做任意模型加提示词的薄封装Aider、Continue等开源工具加上模型厂商直营 CLI会持续压低价格。01 接下难验收的垂直任务包Java 迁移、合规修复、嵌入式驱动、游戏客户端、数据管道和行业套件二次开发都有专项预算。机会不在换一个聊天界面而在把验收规则、测试环境和回滚流程做成产品让买方敢把某一类重复开发任务持续交出去。02 给企业补权限与证据链私有化索引、策略引擎、密钥隔离、审批闸门和审计记录可以单独卖给平台工程与安全团队。它们不与Claude Code或Codex争生成能力而是让企业敢扩大使用范围。03 把每个成功任务的成本做成可预测模型路由、缓存、早停、失败分类和按风险切换人工能够直接降低 Token 与沙箱开销。客户若已经大量使用通用 Agent却无法预测月度账单这一层有明确买方前提是用同一任务集证明成本下降时合并率没有掉。04 守住本地部署和行业采购金融、政务、车企供应链和研发保密场景需要专有云、国产模型编排与本地审计。大厂能提供账号和模型新公司仍可在具体行业的 repo 连接器、审批流与交付 SLA 上建立位置。新团队可以用三项条件决定是否下场第一指出一个头部通用 Agent 反复失败、买方却愿意持续付费的任务包第二说明专有数据、执行环境或采购渠道为何不会自然流向Cursor、Devin或Claude Code第三在 6 至 12 个月内用合并率、人工接管次数、事故率和单任务成本证明优势。缺少其中一项就很难避开通用入口的价格战。自主编程 Agent 最终卖的不是写代码更快而是少让人在任务中间反复接手。谁能把仓库、环境、测试、评审和事故记录一起管住谁才有资格把收入从效率插件抬到工程产能谁还把返工甩给客户估值再高也只能当席位工具被换掉。本文整理自问迹AI TrackBook。数字与融资口径来自公开报道文中已写明年份与机构便于核对。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进