ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

AI 写代码能验证,写科学不能:一位前 DeepMind 科学家说瓶颈根本不在模型

AI 写代码能验证,写科学不能:一位前 DeepMind 科学家说瓶颈根本不在模型 目录 开场为什么Coding Agent 是最成功的商业闭环 一个必须先分清的术语AI4S ≠ AI4AI ≠ RSI⚡ 为什么是现在两个前提同时成熟 AI 在科研里的两个角色别搞混 A-Lab 的硬数据自动化实验室到底能走多远 实验选择一个搜索问题 三个真正的卡点 三大实验室的路线差异️ 验证瓶颈这个判断对企业落地同样成立 一个可以直接用的判断清单 写在最后 开场为什么Coding Agent 是最成功的商业闭环这期《硅谷101》的切入角度很特别。主持人问曹原AI for Science 这几步里技术上最难的是哪一步他几乎没犹豫verification验证。但他的论证方式是从反方向来的——从 coding 讲起。曹原的逻辑是这样的Coding agent 之所以是目前 AI 里最成功的商业闭环、唯一产生指数级增长的形态是因为它能闭环。程序员写完一段程序马上能知道对不对。不用等不用外部方裁定。就在那个反馈瞬间用户才敢把整个任务外包给 AI。科学做不到这一点。科学的验证在物理世界里。然后是这期访谈里最锋利的一句判断如果理想情况下每分钟能拿到一次实验验证AI4S 就退化成了一个数据生成问题——模型可以无限生成假设、即时验证、即时更新。所以卡住科学的不是AI 不够聪明而是反馈太慢、太贵。核心逻辑科学不是更复杂而是反馈更贵。 一个必须先分清的术语AI4S ≠ AI4AI ≠ RSI这期节目里曹原把三个常被混用的词做了极清晰的区分值得单独列出来因为很多行业讨论就是从概念混淆开始的术语定义区别在哪AI4SAI for Science把 AI 当研究员研究科学问题目标不同AI4AIAI for AI把 AI 当研究员研究AI 自身例如在限定 GPU 预算下提高训练效果、搜索 Transformer 之外的架构、寻找不需要反向传播的优化器RSI递归式自我改进模型基于自身输出的反馈不断迭代改进这不是任务是一种方法——可同时用于 AI4S 与 AI4AI这个区分为什么重要因为RSI 是方法不是目标。很多公司说我们在做递归式自我改进实际上只是在描述一个技术手段而不是在描述一个可交付的价值。而 AI4S 和 AI4AI 的区分则决定了商业路径AI4AI 的客户是模型厂商自己AI4S 的客户是药企、材料企业、能源公司。后者的销售周期、决策链条、验证要求都完全不同。⚡ 为什么是现在两个前提同时成熟曹原认为 2026 年的爆发有两个前提同时到位第一大模型在数学和编程上的推理能力已经过验证。第二agent harness 体系成熟。所谓 harness就是把工作流一步步串起来的挽具——包括记忆管理、工具调用、失败迭代这些基础设施。这两项能力迁移到科学问题上模型就可以做三件事能力对应的科学动作推理提出下一个实验假设编程能力写代码分析实验数据迭代根据异常结果自我修正用曹原自己的话说“现在就是一个天时地利人和该到了我们用 AI for Science 的时候了。”不过要补一句这个领域并非突然出现。在爆发之前已经有缓慢铺垫——AlphaFold、RoseTTAFold 这一系列模型已经是先行者。 AI 在科研里的两个角色别搞混曹原把 AI 在科研中的角色分成两类这个区分很实用角色代表做什么共同科学家co-scientistClaude Science 这类 workbench加速科学家自己的分析与实验设计自主发现者AlphaFold、AlphaEvolve自主发现新算法、新结构而他反复强调一个限制问题定义仍必须由人给出。“AI 目前还做不到说自己有这个品位去找出合适的问题。”他能做的是把问题结构化——辅助搜索文献、整理假设。什么样的问题适合交给 AI曹原给的三个判据非常干脆可计算能被干净地建模能被快速验证AlphaFold 是典型输入氨基酸序列输出三维结构问题定义明确且验证相对容易。反过来说新药到底有没有效就不满足第三条——不到最后环节很难真正知道效果核聚变装置设计的实验代价可能极高。为什么生物制药跑在最前面这一点值得单独讲因为答案可能和大多数人想的不一样。曹原说得很直接“传统上生物技术、生命科学和药物发现就是一个巨大的市场——这跟 AI 没关系。”也就是说生物制药领先不是因为 AI 更适合它而是因为它本身就足够值钱新药研发动辄数年、成本数亿美元AI 无论加速哪个中间环节还是降低失败成本价值都巨大。领域市场与价值链流程结构AI 可捕捉的价值生物制药/药物发现市场巨大研发耗时长、成本数亿美元起标准化、数据丰富靶点与分子结构等中间产物已可商业化材料市场大但高度碎片化金属、皮革、生医材料、半导体、稀土各有上下游依应用而异难标准化价值链过碎难以整体捕捉 AI 创造的价值芯片设计、电池、量子新兴探索阶段尚未成型多处于早期研究“做大容易做小难”这个判断在这里也成立——材料科学的价值链太碎你很难用一个标准化流程把 AI 创造的价值整体捞出来。 A-Lab 的硬数据自动化实验室到底能走多远曹原提到的具体参照是 Google DeepMind 与劳伦斯伯克利国家实验室合作的 A-Lab17 天内执行了 353 次实验57 个目标材料中合成出 36 个。他指出自动化实验室当前的瓶颈在机器人的操作精度与速度。相比之下in silico数字模拟因为容易衡量进步进展远快于物理侧。这个对比很值得记住我们能可靠度量进展的那一侧模拟发展快不能可靠度量进展的那一侧湿实验发展慢。而能不能可靠度量进展这件事本身就是科学的核心难题。他给出的理想测试是一个假设性标准如果一分钟能拿到一次实验验证AI4S 就退化成一个数据生成问题。 实验选择一个搜索问题这期节目里有一段技术密度很高的分析值得完整拆出来。曹原把下一个实验做什么本质上定义为一个搜索问题每个候选方案是搜索树上的一个节点模型用一个价值函数value function即直觉分评估节点的潜在回报再叠加**这条路径已经被采样多少次的惩罚**在exploitation深耕当前最好方案与exploration探索不确定但可能突破的方案之间取得平衡他的类比是这与后训练中的强化学习机制一致。这个框架的价值在于——它把科研选题这件看起来很玄的事翻译成了一个有工程解的问题。而 RL 里关于探索-利用平衡的那套方法论是可以直接借用的。但紧接着他给了另一条更本质的判断关于表征representation“如果你没法测量就没法表征。”以及一条对做工程的人更有用的原则——表征取决于模型在架构中的位置模型类型例子角色表征限制通用模型GPT、Gemini“实验室主管”orchestrator驱动整个科研流程可内化任何格式的多模态输入垂直模型AlphaFold、GNoME、MatterGen某领域的专家工具只能接受特定格式的表征 三个真正的卡点卡点一验证最大瓶颈回到开头的判断。曹原的原话“最难对于 AI for Science肯定是 verification。它是一个瓶颈一旦这个瓶颈被打破了你就可以很快地迭代。”他的论证里有一个我觉得很关键的层次划分coding agent 为什么成功因为验证是即时的——写完马上知道对错。科学为什么不行药物是否有效可能要等上市才知道核聚变装置的实验成本高到无法反复试错。AI4S 的迭代速度完全取決于验证速度。卡点二因果与元递归因果建模有悠久的历史Judea Pearl、Do-Calculus但曹原认为语言模型目前不可靠它对因果的理解依赖于输入的措辞与语序因为训练资料只涵盖最常见的表述方式。一旦换一种说法、或引入反事实干预“如果把某个变量调高会怎样”模型就可能出错。出路之一是他认同 Yann LeCun 的判断——需要世界模型让模型的理解独立于语言表征。他还补充了闭环里常被忽略的一环——元递归meta-recursive模型不仅自己要改进自己的假设还要改进自己的工作流本身——包括何时更新自己的代码、如何调整 agent harness。这一条对做 Agent 平台的人特别有参考价值它意味着改 prompt和改架构是两种不同层级的迭代而后者才是真正的杠杆。卡点三概念抽象“最后一英里”这是曹原认为更深的那道坎。他给出的判断相当直接当前模型擅长在既有知识、定义、定理内部搜索但难以像顶尖科学家那样抽象出新的数学对象、定义和理论。他称这种概念抽象能力是 AGI 的最后一英里甚至补充说——可能不一定在图灵可计算的范围内。商业化的判断是分层的阶段判断药物开发的中间产物靶点、分子结构已经可以市场化了以AI 自主做出诺贝尔奖级发现为标准至少还需二三十年他还引用了诺奖得主、CRISPR 基因编辑科学家 Jennifer Doudna 的话作为佐证“我们也用 AI但是从 AI 给我们的 proposal 里面没有一个是我们之前不知道的。”曹原的转述是目前 AI 的发现多半是在既有知识空间里做排列组合。要同时满足有创新性与可行是当前模型能力上一个尚未解决的挑战。⚠️ 需要说明的是Doudna 这句话是节目转引本文中未找到她的原始出处或上下文。请把它当作访谈观点的转述而不是她完整的正式表态。顺带说一个值得警惕的信号曹原提到一个当下的现象数学界已经从证明稀缺进入了证明过剩的时代——收集未解问题的网站上每个问题下面堆了几十个 AI 生成的解法但没有人类专家愿意去验证它们。他补的那半句更难一个正确的结果不自动是一个值得拥有的正确结果。即使自动验证说它成立仍然要有人理解它、判断它。因为人携带价值判断。这些问题里可能已经有答案了。缺的只是人类去检查的时间、精力和能力。这段话的现实意义可能比技术讨论更大AI 生成能力的提升速度已经超过了人类验证能力的提升速度。这个剪刀差会在越来越多的领域出现。 三大实验室的路线差异节目把 Google、OpenAI、Anthropic 的 AI4S 布局做了对比。这部分对想理解行业格局的人有用公司布局深度代表动作结构性约束Google/DeepMind最早、最深、最广Alpha 系列、Co-Scientist、Gemini for Science、Isomorphic Labs、A-LabGemini 必须先达到 SOTA商业优先顺序挤压长期研究OpenAI激进追赶GPT-5 白皮书、GPT-Rosalind、GPT-5 Ginkgo 闭环实验、2027 年自动 AI 科学家目标、Astra 数学模型产品线过长广告、硬件、企业版AI4S 团队并入 Codex押注通用模型Anthropic后发追赶Claude Science 平台2026 年 7 月中旬、vibe physics、BioMysteryBench、挖角 John Jumper尚无垂直科学模型短期优先在 coding 与上市OpenAI 这条线最值得单独说因为它最激进也最值得警惕。原本负责 AI4S 的负责人Kevin Weil 在 2026 年 4、5 月间离职之后 AI4S 的努力被并入 Codex 团队——等于赌通用 GPT 模型 agent 自然会解决科学问题。但同期 OpenAI 正在扩张广告、硬件、企业版多条产品线。曹原的判断是“战略和管理的优先顺序会是问题。”还有一个细节值得记Astra 模型在论文中声称解决了 10 个前沿数学问题但科学界对此有争议——这涉及数学可靠性的问题。而 Anthropic 的John JumperAlphaFold 共同发明人、诺奖得主加入被外界看作 Anthropic 终于要补上垂直生物医药模型这块拼图。不过要注意这些布局的描述反映的是访谈时点2026 年 8 月的情况不是长期定论。半年后再看优先级很可能又变了。️ 验证瓶颈这个判断对企业落地同样成立聊到这儿可以往企业侧推一步了。曹原这个验证决定迭代速度的框架跟企业做 AI 落地是同一个结构。我把对照关系列出来科研的约束企业 AI 落地的对应可操作的设计含义湿实验慢且贵 → 迭代慢业务上线慢、验证周期长先找出那个每次都要等三天才能判断对错的环节它就是你的湿实验一分钟一次验证 数据生成问题反馈越快模型迭代越快投资方向应该是缩短反馈周期不是换更大的模型in silico 进展快于湿实验离线评测跑得漂亮一上线就崩因为离线指标容易被优化到失真——你需要线上真实反馈表征取决于模型在架构中的位置同一份数据喂给不同环节价值不同数据要按给谁用分层不是按从哪来分层元递归模型改自己的工作流Agent 要能改自己的流程而不只是改 prompt架构级的迭代杠杆远大于 prompt 级探索-利用平衡RL 类比探索新场景 vs 深耕已知场景要给探索留预算否则系统只会在已知场景里局部最优“没法测量就没法表征”指标没定义清楚数据就白采指标定义要前置到采集之前不是之后最有价值的一条找到你的湿实验如果把这期访谈压缩成一句可执行的话就是你那条业务线的迭代速度不取决于你用多强的模型而取决于你的验证要等多久。这不是抽象判断是可以直接算的。举两个对照环节验证周期同等模型下的迭代速度一个纯代码/规则变更改一行、跑测试、看结果几分钟快一个依赖新数据积累的判断比如投放素材效果三天慢两个数量级同一个模型、同样的 Agent迭代速度差两个数量级。差别不在模型能力在于验证的成本。这个判断一旦接受投入方向就变了❌ 不是换一个更强的模型✅ 而是怎么把这条线的反馈周期从三天压到三小时——哪怕只是先建立一个能自动出报表的流程再说一遍边界SPARK 融合平台在这套逻辑里的位置是把数据从哪来、怎么对齐、谁能看到变成可执行、可追溯的流程——iPaaS 接数据治理中心把质量校验和口径统一前置到入库之前全域守卫划权限边界。而**“多快算一次有效验证”什么结果算成功这两个判断平台做不了。** 这恰恰是曹原说的那类问题——问题定义必须由人给出。平台能做的是当专家定义了标准之后让这个标准被一致地执行且每一步都留得下痕迹。标准由专家定执行和追溯由平台保——这条边界和前四篇讲的完全一致。 一个可以直接用的判断清单先量出你的验证周期。不是模型响应时间是从做出一个改动到能判断它对不对的完整时间。这个数字决定了你的迭代速度上限。别在瓶颈上投资。如果反馈要等三天把模型从 Opus 换到本地小模型不会有任何帮助。要投的是缩短反馈周期。区分能不能被快速验证。曹原的三条判据——可计算、可干净建模、可快速验证——可以直接拿来筛项目。三个都不满足的别指望 AI 闭环。警惕离线指标。离线跑得漂亮而线上失真科研里的对应就是in silico 进展快于湿实验。因为前者容易被优化到失真后者才是真相。看项目是在搜索既有知识还是在创造概念。前者 AI 已经很强了可以商业化后者还需要二三十年。别把两者的进展速度混为一谈。留探索预算。如果你的系统只在已知场景里做局部最优指标会很好看但能力不长进。这在 RL 里是探索-利用问题在业务里是同一回事。 写在最后这期访谈最让我反复想的是那个Coding Agent 是最成功的商业闭环的观察。因为它揭示了一个大部分人忽略的因果链不是 coding 任务更容易而是 coding 任务的验证成本足够低。低到用户愿意把整个任务外包。低到模型可以在几分钟内知道自己错在哪、然后立刻改。而科学没有这个便利。这不是因为科学更复杂而是因为科学要穿过物理世界那一层。曹原把这个层次讲得很直白宇宙的基本元素是信息、物质和能量。AI 做数学、做编码都活在信息层即使 AI 做科学——提出假设、跑模拟——仍然是信息。但要做科学你必须到达物质层。你必须跑湿实验。一家公司的一条业务线跑动的速度不是你的模型有多快是你的验证有多快、多贵。这个判断有一个很实际的推论你最该投资的地方可能不是模型能力而是让验证变便宜。自动化实验室、更好的表征、更便宜的材料——这些方向看起来都很科研但它们解决的是同一个问题如何把反馈周期从几个月压到几分钟。而这跟前四篇讲的东西都指向同一个方向技术能不能落地取决于反馈回路的长度不取决于技术演示的漂亮程度。触手可及的那个按钮、真实的那一次点击、线上那一条真实的数据、SCI 论文里那一次同行评议——反馈回路越短迭代越快。这个朴素得近乎无聊的规律在这五个不同的话题里重复出现了五次。参考资料《硅谷 101》对话前 DeepMind 曹原AI for Science 爆发一个新时代到来了2026-08-15 上线片长 109 分钟Silicon Valley 101 Episode 262 官方页面A-LabGoogle DeepMind 与劳伦斯伯克利国家实验室合作实验数据Intismeran autogene 三期数据见本系列第4 篇受访者观点为节目口述文中标注的存疑处Jennifer Doudna 引语已说明为访谈转引未找到原始出处
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进