ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

CTIFoundry:面向网络威胁情报的代理原生语料库脚手架

CTIFoundry:面向网络威胁情报的代理原生语料库脚手架 大家读完觉得有帮助记得关注和点赞摘要网络威胁情报CTI越来越多地不是由人类分析师消费而是由LLM代理在查询时组合多步调查来消费。这一转变的工具链侧已经迅速成熟规划循环、工具协议、上下文管理但语料库侧却没有威胁报告和漏洞数据库仍然以检索增强生成的模式打包作为嵌入索引后的不透明块。我们认为这个基底而非模型能力是代理化CTI调查的瓶颈并提出了CTIFoundry一个代理原生的语料库脚手架。在构建时CTIFoundry将CTI语料库的潜在结构物化一个确定性本体图覆盖四个权威知识库CVE、CWE、CAPEC、ATTCK其官方交叉引用成为类型化的、可遍历的边一个跨度锚定的报告层其规范的、别名解析后的跨供应商实体索引了带有溯源信息的块以及混合稠密词汇检索表面。在查询时这个结构通过七个类型化工具和三个程序化技能暴露挂载在一个标准的、广泛使用的开源代理工具链上。在公开的CTIConnect基准九个任务涵盖实体链接、归因和多文档综合上仅交换动作表面使用gpt-5.4时同一工具链的代理从0.610的整体F1提升到0.829使用claude-haiku-4-5时从0.470提升到0.745一个在CTIFoundry上的小模型超过了旗舰模型在平面基底上的表现。这种精度不是用搜索努力换来的在两个Claude模型上脚手架化的代理在约一半的工具调用次数下更准确。消融研究归因了这些收益类型化结构承担了更大的份额程序化技能将结构转化为纪律两者组合具有超加性技能只绑定到存在的结构上。构建时验证保证零捏造标识符脚手架支持1,168次端到端调查每次约2.6美分。1 引言网络威胁情报CTI调查本质上是多步骤的。同一个对手在不同供应商报告中有不同名称Lazarus、Hidden Cobra、APT38因此关于它的任何问题首先需要将别名解析为一个规范实体。一个行为描述然后必须链接到权威分类法CVE、CWE、CAPEC、ATTCK通常通过官方交叉引用CVE记录命名其CWE弱点CAPEC模式命名其映射到的ATTCK技术。而一个活动档案分散在多个供应商中每个持有片段。解析、遍历、收集、核对这正是大语言模型LLM代理被构建来组合的那种工具中介过程。交织的推理-行动循环Yao等人2023和习得的工具调用Schick等人2023已经固化为开源工具链的商品化堆栈Yang mini-swe-agent contributors2025Anthropic2024Anthropic2025bAnthropic2025a而专门构建的代理-计算机接口在其他地方已经取得了显著成果Yang等人2024。这种进展是不平衡的。工具链随着每次发布而改进但将一个更有能力的代理放入垂直领域并不会产生一个有能力的领域调查员代理继承该领域语料库被打包成的任何基底。在CTI中这种打包继承自检索增强生成RAG——单一相似性搜索接口后面的不透明块Lewis等人2020带来三个后果。供应商别名从未被解析因此关于同一个行为者的报告分散在名称之间没有共享表面词汇权威地回答实体链接问题的官方交叉引用仅作为记录块内的文本存留派生的主张没有跨度级别的溯源因此没有东西能将权威交叉引用与文本共现区分开。在其上放置一个代理并不能修复任何问题在一个不透明基底上的迭代只会重新检索无法恢复索引丢弃的结构。公开的CTIConnect基准Cheng等人2026b测量了后果在我们自己的运行中一个状态实践的、基于平面语料库的工具链甚至无法遵循官方交叉引用即使它已经检索到了携带它的记录附录E.4。我们将这些差距提炼为四个挑战C1–C4§2。约束性瓶颈是基底而非代理。我们提出CTIFoundry一个代理原生的语料库脚手架分为两半。在构建时它将语料库的潜在结构物化为类型化的、经过验证的工件表4一个确定性本体图其节点是四个权威知识库的条目其类型化边是它们的官方交叉引用在零捏造不变式下构建C1一个跨度锚定的报告层将供应商报告分块并带有精确字符偏移溯源并将类型化提及确定性信号优先解析为规范跨供应商实体这些实体作为块的键C2以及混合检索表面融合稠密和词汇搜索带有一个术语过滤器其池大小反馈代理可以引导C3。在查询时这通过七个类型化工具暴露每个覆盖一个不重叠的能力并自带使用指导和成本说明以及三个编码调查纪律的程序化技能先解析再搜索先遍历官方边再信任文本相似性验证每个候选C4。我们在CTIConnect的九个任务上评估采用刻意受控的方法论两条臂都运行在mini-swe-agentYang mini-swe-agent contributors2025上基线使用其原生bash工具在平面文件转储的语料库上CTIFoundry臂仅交换动作表面。循环、步预算、温度和模型完全相同因此任何差距都可归因于基底。交换将gpt-5.4的整体F1从0.610提升到0.829将claude-haiku-4-5从0.470提升到0.745在四个模型、两个提供商的组合上提升了0.19到0.28表2图1(a)。形状和规模同样重要收益集中在基准定位为RAG瓶颈的地方在唯一没有权威结构可物化的任务上消失。结构还部分替代了规模CTIFoundry上的小模型超过了平面文件上的旗舰模型并且不是用搜索努力换来的在两个Claude模型上脚手架化的代理在约一半的工具调用次数下更准确。贡献。基底瓶颈。 在一个固定的第三方工具链下其中动作表面是唯一的实验变量我们证明代理化CTI调查的约束性瓶颈是语料库基底而非代理能力在平面基底上的迭代无法恢复其打包所丢弃的结构§2§4.1。一个代理原生的语料库脚手架。 我们定义了脚手架和工具链边界并将其实现为一个构建时流水线本体图、跨度锚定的规范实体、混合检索在经过验证的零捏造不变式下通过七个类型化工具和三个程序化技能暴露§3。一项实证研究及其推广。 在九个任务上交换将F1提升了0.19到0.28零捏造标识符约一半的工具调用§4一个2×2消融显示两半具有超加性组合§4.5结构使正确的调查成为可能程序使其可靠两者不可互相替代。这一教训可推广到任何语料库携带权威参考结构的领域。2 背景与动机运营CTI知识存在于两种形状迥异的来源中。四个社区维护的分类法构成了参考骨干CVE漏洞实例、CWE弱点类、CAPEC攻击模式和MITRE ATTCK对手技术Strom等人2018关键是它们不是四个独立的列表它们官方地相互交叉引用——一个CVE记录命名它实例化的CWE一个CAPEC模式列出它利用的CWE和它映射到的ATTCK技术。对于一大类分析师问题这些策划的边是权威答案“哪个弱点构成这个漏洞的基础”不是文本相似性问题而是一个记录的边。第二个来源是安全供应商编写的叙述层其核心实体威胁行为者、恶意软件家族、活动带有供应商特定的命名因此关于一个活动的情报分散在共享表面词汇的各份报告中附录B。CTIConnectCheng等人2026b将这个工作流操作化为一个公开基准并且是迄今为止唯一一个评估LLM具有对领域知识源的检索访问而非闭卷的CTI基准1,859个专家验证的问题覆盖四个知识库加上321份报告摘要九个任务分为三个家族实体链接EL、实体归因EA和多文档综合MDS。其评估仅限于RAG设置其作者将语料库上的代理化设计命名为开放方向。其已发表的诊断确立了LLM-over-CTI失败的地方我们基于这些测量而非重复它们附录C跨源语义差距随着任务必须桥接的异质性而扩大将黄金证据推出典型top-k窗口通过别名化、叙述散文与分类学术语之间的语域不匹配以及词汇相邻条目之间的兄弟混淆——这些失败是结构性的而非偶然的因为通用检索升级仅能恢复词汇和实体结构干预所能恢复的一小部分。再加上运营CTI添加的两个要求每个主张都可追溯到声明它的供应商和句子以及分析师的程序纪律在语料库中无处可写它们给出了代理面向的基底必须满足的四个挑战每个由CTIFoundry的一个组件回答C1 物化潜在结构。 规范的跨供应商别名和官方交叉引用必须成为类型化记录和可遍历的边而非通过相似性搜索重新发现的短语从源头关闭别名化和兄弟混淆差距。⇒ 确定性本体图和规范实体层§3.2。C2 将每个派生断言锚定在溯源中。 提取的实体和接地必须指向带有供应商归属的精确源跨度以便代理和构建验证器可以验证而非信任。⇒ 跨度锚定的块在零捏造验证体制下§3.2。C3 同时使用两种检索语言。 稠密搜索桥接释义词汇过滤锁定稀有判别性标记CTI问题常规地需要两者每个覆盖另一个的失败模式——上面测量的语域不匹配。⇒ 混合稠密BM25表面带有可引导的术语过滤器§3.2。C4 将分析师的程序随接口一起交付。 首先调用哪个工具何时官方边优先于文本匹配如何验证候选这种纪律是语料库特定的必须随脚手架一起提供而非每个查询重新发现。⇒ 每任务家族程序化技能基于自描述的类型化工具§3.3§3.3。CTIFoundry的构建时层回答C1–C3其查询时技能层回答C4。下一节介绍两者。3 CTIFoundry图1 (a) 基底买来什么以及什么产生它。(a) 相同工具链代理在平面基底和CTIFoundry上的每任务F1每个模型一个雷达图§4.3。(b) CTIFoundry架构一个构建时流水线和一个查询时表面包含七个类型化工具和每任务家族技能§3。3.1 问题表述我们研究代理原生的语料库脚手架给定一个领域语料库和一个固定代理循环构建语料库的派生表示以及其上的动作表面以最大化调查准确性而不修改代理。每个已部署系统已经有这样的表示无论多么单薄平面文件是退化的一种经典RAG的稠密索引是弱的一种保留相似性几何而丢弃语料库携带的所有其他结构因此变化的不是是否存在脚手架而是语料库有多少保持可达。其上的代理循环日益成为商品§5其下的语料库由领域给定这些我们固定。语料库。 一个CTI语料库是 C R ∪ K其中R是一组供应商报告自由文本带供应商元数据K K_cve ∪ K_cwe ∪ K_capec ∪ K_att 是一组知识库记录覆盖四个权威分类法每个记录携带一个规范标识符和对其他分类法的交叉引用。定义1脚手架。 一个语料库C上的脚手架是一个派生的、经过验证的、索引化的表示代理通过它访问语料库其中本体图 G (V, E) 覆盖KB记录及其类型化官方交叉引用边溯源携带的块X每个是一个带有字符偏移的文档跨度规范实体ℰ每个是一个报告提及的簇带有供应商归属的别名集和在V中的可选接地实体索引Π: ℰ → 2^X以及稠密和词汇索引ℐ。如果它不捏造标识符ids(S(C)) ⊆ ids(C)则它是可接受的。定义2工具链和动作表面。 一个工具链是一个代理循环 L⟨m, b, A⟩一个固定的控制程序由模型m、步预算b和动作表面A参数化A是它可对脚手架调用的操作。它是语料库无关的L, m, b不携带从C派生的知识因此语料库派生的工件仅通过A或通过提示注入的程序文本技能σ到达代理。3.2 脚手架构建在单一规则下产生定义1的三个工件机制跟随证据。语料库已记录答案的地方构建解析它没有生成性介入只有散文携带的地方上下文提取在确定性守卫包围下运行问题仅释义其证据的地方匹配委托给商品嵌入模型。附录A逐阶段给出流水线包括工件计数、解析算法和操作符提示。本体图C1。 回答实体链接问题的交叉引用由分类法维护者策划并在发布记录中附带提供因此这一层的任务是无损保存——从固定快照确定性解析没有模型在循环中。两个不变式关闭它。零捏造由构造而非事后过滤保证标识符仅在针对快照验证后才写入。对发布语料库的闭包每条边都源自基线也检索的KB记录因此这一层贡献的是表示而非信息§4.5单独定价了该表示。报告层C2。 供应商散文没有显式记录任何内容因此在本体层保存结构的地方这一层必须恢复它。两个承诺将其与它所基于的提取线Cheng等人2025区分开来。输出模式由消费者——一个调查代理——决定代理检索实体并读取块文本因此该层发出类型化提及、TTP接地和实体→块索引而不发出关系三元组因为下游不会跟随任何三元组。每个生成步骤在确定性可用时都被确定性守卫包围因此模型贡献的是召回率构建保证的是有效性携带标识符的提及由正则表达式捕获每个T-id针对ATTCK快照验证实体解析是一个并查集其顺序使确定性证据占主导只有精确且跨度验证的别名证据进入并查集——这正是阻止不同国家行为者坍缩成超大簇的原因§4.2。检索表面C3。 剩余的访问模式是解析结构和提取实体都无法服务的释义其证据的问题。释义匹配是一种商品委托给现成的嵌入模型脚手架贡献的是其周围的表面。知识库搜索通过倒数排名融合Cormack等人2009Robertson Zaragoza2009融合稠密和BM25排名调用者可传递must_terms一个合取过滤器并读回存活的池大小。这一个字段使表面可引导太多命中意味着添加一个术语零意味着交换同义词将一个一次性排名转变为代理控制的运算符并关闭纯粹稠密检索在此失败的模式一个与查询共享稀有判别性标记但在嵌入空间中远离它的黄金条目。3.3 动作表面脚手架通过七个类型化工具被消费这些工具使正确的调查成为可能以及三个程序化技能使调查可靠。两者不是独立的贡献A受S约束因此规定“遍历官方边”的技能在没有该边存在时是无效的——§4.5测量了这种交互。七个类型化工具。 访问通过七个类型化工具附录D进行设计遵循三条规则。不重叠每个暴露恰好一个脚手架能力解析、记录获取、本体遍历、KB搜索、块搜索、实体索引收集、文档读取因此工具选择从不模糊。自描述每个说明何时使用及其成本Anthropic2025d。结构优先于相似性描述编码了基底优先级顺序在查询前解析名称只要已知标识符就优先选择权威边而非文本搜索因此构建使之可能的顺序就是表面广告的顺序。程序化技能。 没有语料库写下分析师的程序C4。CTIFoundry将其作为三个markdown技能文件交付每个任务家族一个注入到用户轮次中。它们是建议而非工作流引擎但编码了从代理失败轨迹分析中提炼的纪律对于实体链接永远不要首先搜索目标分类法因为问题释义了一个源条目其官方交叉引用给出答案对于归因用目标分类法的惯用语重新表述每个行为并发出一个校准的最小覆盖集因为在标识符F1下一个虚假标识符的成本与漏报相同对于综合穷举覆盖报告簇并按供应商逐字段合并。每个处方都命名了构建使之可用的一个动作通过构造绑定两个查询时层。操作手册见附录H。4 评估我们在公开的CTIConnect基准Cheng等人2026b上提出四个问题构建是否可靠RQ1§4.2它是否使相同工具链的代理在模型家族和规模上更准确RQ2§4.3这种准确性是否以搜索努力为代价成本多少RQ3§4.4以及哪一半——类型化结构还是程序化技能——承载了收益RQ4§4.5附录E增加了1.7倍问题量下的准确性和成本以及两条臂上的单条轨迹追踪。4.1 实验设置基准、语料库和工具链。 CTIConnect包含1,859个专家验证的问题覆盖九个任务、三个家族§2实体链接ELRCMWIMATDESD、归因EAATAVCA和多文档综合MDSCSCTAPMLA覆盖四个知识库和321份报告摘要计数见表4。我们遵循其双集协议主集691个问题承载受控比较RQ1RQ2RQ4规模集1,168个问题承载成本和体量研究RQ3附录E.2提示、工具和技能在保留的开发切片上冻结。对“我们的代理胜出”主张的明显威胁是工具链针对所提议基底进行了调优我们通过构造消除了它两条臂都运行库存的mini-swe-agentYang mini-swe-agent contributors2025DefaultAgent使用完全相同的语料库。基础代理是开箱即用的工具链其原生单bash表面在磁盘转储的语料库上——今天从业者得到的CTIFoundry代理是相同的工具链仅将动作表面替换为§3.3的七个类型化工具和三个技能。循环、提示风格、步预算20、温度和模型完全相同因此动作表面是唯一的自变量。面板跨越两个提供商和两个层级gpt-5.4、gpt-5.4-mini、claude-sonnet-4-6、claude-haiku-4-5构建在固定操作符下编译一次因此每个CTIFoundry行读取字节相同的工件。指标。 所有查询时分数都是基准的对每条臂相同计算。EL和EA使用标识符归一化F1最终答案中的标识符被归一化大小写、前缀、子技术后缀T1059.001 vs T1059为一个预测集并与黄金集比较。两个属性在下面具有重要性指标是集合值的因此多答案归因逐元素评分并且在错误类型上对称因此一个额外的标识符的成本与漏报完全相同召回率不能通过未解决候选来购买附录E.4。MDS由基准的声明级评判员gpt-5.4评分固定提示跨臂在我们下面审计的分辨率下读取。总体是九个任务未加权均值。努力和成本是被测量的而非预算的每个运行序列化其轨迹我们从中重新计算每个问题的调用次数和提供商报告的令牌数按列表价格计费。4.2 RQ1构建时质量结构有效性。 从321份报告和四个KB快照构建物化了6,044个本体节点、7,097条官方边、688个溯源携带块和4,868个规范实体。验证器在三个违规类别上阻止构建捏造标识符、孤立边和跨度违规记录的偏移量不能逐字节针对冻结源重新验证且发布的构建通过零违规。第一类由构造不可能而非事后过滤每个标识符在写入时针对快照检查。端到端构建成本为1.42M令牌$1.86与语料库大小线性相关。实体解析。 针对基准的50个以对手为中心的报告簇仅用作标签从不在构建时使用我们为每个黄金簇g选择其报告集最能匹配g的规范实体ε并报告覆盖率|R(ε)∩g|/|g|纯度|R(ε)∩g|/|R(ε)|以及它们的调和均值。CTIFoundry达到0.900/0.927F1 0.913其中27个簇被精确重建对比基准随附的提取图的0.840/0.920F1 0.878和21个。收益是纯度不变的覆盖率这是非平凡的方向提高覆盖率的廉价方式是传递合并而这正是§3.2的合并纪律所禁止的——只允许精确且跨度验证的别名证据进入并查集排除了使基准图沉没的超大簇失败模式其最佳APT42实体跨越九份报告纯度为0.33。跨操作符的提取质量。 表1在六个模型上变化提取操作符协议见附录E.1旗舰达到F1 0.859/0.792实体/TTP小操作符落后10–20点但几乎完全在召回率上它们提取不足而非捏造——构建流水线可以吸收的唯一退化模式因为遗漏提及损失覆盖率而捏造则违反整个脚手架所依赖的不变式。表1不同算子模型下的构建时提取质量。best 和 second 分别标注每列的最佳和次佳算子。算子模型实体提取TTP 关联精确率召回率F1精确率召回率F1gpt-5.40.8460.8720.8590.7490.8410.792gpt-5.4-mini0.7080.7810.7430.6110.6920.649gpt-5.4-nano0.6910.7120.7010.5740.5800.577claude-opus-4-10.8490.7480.7950.7270.7350.731claude-sonnet-4-60.7780.7710.7750.6270.8060.705claude-haiku-4-50.7800.6530.7110.5510.5990.574评判员可靠性。 两名具有3年以上专业CTI经验审计员独立对50个MDS项目样本重新评分对评判员的判决盲化。一致性很高Pearson r 0.85每个项目平均绝对差异0.06均值0.705 vs 0.713即在排名上达成一致没有严格性偏移。因此MDS数字在单一评判员下跨配置可比较——这是我们唯一做的比较——0.06是我们下面读取MDS差距的分辨率。4.3 RQ2查询时质量表2两种操作面下的主集子任务得分同一模型内的框架、模型、预算和温度保持一致。最佳值标注了每个模型和任务下的较优配置。模型配置ELEAMDS总体RCMWIMATDESDATAVCACSCTAPMLAgpt-5.4基础0.5880.6600.3170.4250.5230.4970.8450.8300.8040.610CTIFoundry1.0000.7231.0000.9500.6310.6250.8740.8520.8020.829gpt-5.4-mini基础0.5750.5110.3170.3500.4560.6330.7760.7930.6980.568CTIFoundry0.9000.6810.9250.9250.5810.5330.7960.7930.6870.758claude-sonnet-4-6基础0.2780.7660.3260.6110.4730.3200.7530.7580.7450.559CTIFoundry0.9260.8080.8801.0000.4690.5930.8280.8400.6850.781claude-haiku-4-5基础0.4910.2130.1800.5000.3370.3600.6960.7850.6700.470CTIFoundry0.9440.5321.0001.0000.4980.4790.7930.8130.6490.745基底交换将整体F1提升了0.219gpt-5.40.610→0.829、0.190gpt-5.4-mini、0.222claude-sonnet-4-6和0.275claude-haiku-4-5表2图1(a)。头条不是幅度而是形状收益未能出现的任务与收益饱和的任务同样有信息量。收益追踪物化结构并在结构停止的地方停止。 在构建物化了官方交叉引用的三个前向EL任务上计划简化为解析-然后-遍历并接近天花板gpt-5.4RCM 0.59→1.00ATD 0.32→1.00ESD 0.43→0.95claude-haiku-4-5在ATD和ESD上达到完整的1.00——面板中最小的模型在旗舰在平面文件上分别得分为0.32和0.43的任务上达到饱和。在另一个极端MLA没有权威结构可物化任务简化为在任一表面下重写相同的报告文本两臂持平在评判员的每项0.06分辨率内。在MLA上的基底贡献也将是我们无法解释的结果它的缺席是论证所需的对照。即使在不持有答案的地方结构也有回报。 EA的答案不是记录的边脚手架只能锚定候选集代理随后必须在其中区分但它仍然在四个模型中的三个上产生了0.12到0.14的合并F1。唯一的例外gpt-5.4-mini在VCA上也是基础臂直接获胜的一个单元格。WIM从另一面说明了同样的观点它是唯一没有前向边的EL任务基础臂分数在面板上跨越0.66到0.21——在固定检索接口上0.45的跨度检索无法解释而参数化CVE记忆可以。CTIFoundry提升了每个模型无论它记住了什么将平面语料库只能从模型借用的能力转变为基底提供的能力。基底超过了能力层级。 跨行读取CTIFoundry上的claude-haiku-4-50.745和claude-sonnet-4-60.781都超过了平面基底上的旗舰gpt-5.40.610差距大于任一臂内旗舰与小模型之间的差距。在模型能力最小的地方效果最大0.275对比0.219因此脚手架在模型做的最少的地方做的最多同时在前沿仍然很大——以每次查询模型成本的一小部分获得相同的准确性一次性支付离线。显而易见的替代解释——CTIFoundry只是搜索得更努力——在下一节被测试并且没有在轨迹中存活。4.4 RQ3搜索努力与运营成本图2 查询时预算的去向。(a) 1,168个问题规模集上的每家族成本分布gpt-5.4每种颜色一个指标。(b) 每个工具和子任务的每次查询平均调用次数下方为技能首次调用遵从率。图3 同一运行的两个诊断视图。(a) 整体F1与每次查询工具调用次数主集向左上更好§4.4。(b) gpt-5.4在九个任务轴上的2×2消融§4.5。图3(a)将每个模型臂单元格放置在成本/准确性平面上。在GPT模型上移动基本上是垂直的gpt-5.4每次查询0.12次调用换取0.219 F1gpt-5.4-mini 0.21换取0.190因此3%的努力变化不会买来36%的准确性变化。在Claude模型上它完全反转claude-haiku-4-5在平面文件上每次查询发出12.33次调用而在CTIFoundry上为5.09次——不到一半——同时获得0.275 F1claude-sonnet-4-6从8.75→4.39获得0.222。因此平面基底代理不是搜索不足而是搜索过度缺乏可遍历结构它重新探测语料库仍然落在看似合理但错误的条目上。在每条臂内准确性随调用次数单调递减因此长调用序列标记代理无法解决的项目而非有回报的调查消融定位了机制因为w/o skill发出最多调用的配置4.53对比CTIFoundry的3.68仍然在整体上落后0.083。成本遵循相同的逻辑图2(a)每次调查约2.6美分和约7代理秒单次扫描即可多次回收一次性$1.86的构建成本每家族概况追踪的是设计而非语料库大小。图2(b)显示预期计划就是代理运行的计划前向EL是一个紧凑的search_kb→ontology_neighbors→get_entity主干而MDS依赖read_report和实体索引从不触碰本体工具结构在存在的地方被使用在不存在的地方被忽略没有任何路由器提示轨迹见附录E.4。4.5 RQ4消融表3对标准框架两项新增组件的2×2消融实验主集gpt-5.4全部关闭的配置即为mini-swe-agent本身。best和second分别标注每个任务的最佳和次佳配置。配置ELEAMDS总体RCMWIMATDESDATAVCACSCTAPMLACTIFoundry完整1.0000.7231.0000.9500.6310.6250.8740.8520.8020.829无技能0.8100.7870.6000.9750.5510.5500.8310.8370.7760.746无工具0.7500.6600.3500.5000.6230.6500.8760.8420.8010.672无技能与工具0.5880.6600.3170.4250.5230.4970.8450.8300.8040.610CTIFoundry向库存工具链精确添加了两样东西替代bash的类型化工具表面以及每任务技能在同一工具链、模型和指标上的2×2将它们分开表3图3(b)。单独来看两者都不是系统。仅程序恢复0.0620.672 vs 0.610其阅读和验证纪律转移到bash但其核心处方解析、遍历官方边、查阅别名集命名了平面表面无法执行的动作。仅结构达到0.746赤字恰好集中在纪律决定结果的地方ATD 0.60 vs 1.00RCM 0.81 vs 1.00一旦添加技能轨迹显示无纪律代理直接搜索目标分类法并落在看似合理但错误的条目上。组合是发现单独0.062和0.136但一起0.2190.610→0.746→0.829——超加性的而非独立贡献预测的0.198这是§3.3预期的交互也是为什么现成的技能库或更丰富的索引都不能替代另一半。一个部署发现也随之而来放置在系统提示中的相同技能文本被小模型遵循不足但在用户轮次中被可靠遵循我们将其归因于当前模型中的指令遵循不对称性而非任何CTI特定因素所有运行都在用户轮次中注入技能。5 相关工作结构化CTI。 将报告转化为结构已经从指标挖掘Liao等人2016通过专门的提取流水线Husari等人2017Zhu Dumitras2018Satvat等人2021Li等人2022Alam等人2023发展到基于LLM的构建Cheng等人2025同时有覆盖分类法本身的统一图Strom等人2018OASIS2021Hemberg等人2021。所有这些都将提取视为终点因此产品是一个静态分析资产。CTIFoundry将提取质量视为已解决的输入转而问结构必须采取什么形状才能被调查代理遍历。评估同时已从表示质量Ranade等人2021通过闭卷探测Alam等人2024发展到CTIConnectCheng等人2026b——我们不变采用的语料库接地设置。代理工具链和脚手架。 推理-行动循环Yao等人2023和习得的工具调用Schick等人2023已固化为专门构建的代理-计算机接口Yang等人2024Yang mini-swe-agent contributors2025Anthropic2024Anthropic2025dAnthropic2025a和可部署技能Anthropic2025cWang等人2024Zhang等人2025Cheng等人2026aWang等人2023Shinn等人2023自我进化代理现在为自己重写这些Lee等人2026Zhang等人2026Lou等人2026Lin等人2026Chen等人2026a。整个过程中可编辑层是工具链提示、技能、控制逻辑和工具代码而下面的基底保持语料库被打包成的任何样子。代理为自己写的工具只组合该基底所提供的东西它不能编写语料库从未物化的边。因此CTIFoundry固定工具链重建它所作用的对象。附录F将其置于代理化和深度研究检索、LLM增强数据管理和知识库构建以及会话记忆存储的背景下。6 结论CTI调查本质上是多步骤的现在被要求执行它的代理只取决于它们所调查的基底。本文提出了CTIFoundry一个代理原生的语料库脚手架在构建时物化分析师在查询时遍历的内容权威交叉引用边、带有跨度级溯源的规范跨供应商实体以及双重稠密词汇检索表面通过库存代理工具链上的类型化工具和程序化技能暴露。仅交换动作表面就在四个模型组合上将同一代理的整体F1提高了0.19到0.28在匹配或更低的搜索努力下消融完成了叙述结构使正确的调查成为可能程序使其可靠两者不可互相替代。这一主张超越了CTI对于任何其语料库携带权威参考结构的领域对代理质量的最高杠杆投资可能根本不是更好的代理而是为被调查而精心构建的语料库。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进