ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

[论文学习]自适应大语言模型监控:基于激活水印

[论文学习]自适应大语言模型监控:基于激活水印 Adaptively Robust LLM Monitoring via Activation Watermarking论文重点本文提出了一种名为激活水印Activation Watermarking, AWM的全新LLM监控范式通过在模型内部表征中嵌入密钥相关的检测信号使监控系统在面对具备完整监控方法知识但不知晓密钥的自适应攻击者时仍能保持较高的检测鲁棒性。实验表明在1%假阳性率下针对代理优化的自适应攻击对现有基线的规避率高达79%以上而AWM将规避率降至37%左右降幅超过一半。核心研究内容问题定义LLM服务提供商需要监控部署模型的使用行为以检测那些无法通过对齐和红队测试预先防范的滥用行为。然而现有的监控机制如各类护卫模型通常是确定性的且公开可用自适应攻击者可以在本地复制一份监控器离线搜索既能诱发有害行为又能规避检测的提示词。更棘手的是这种攻击对提供商而言完全不可见他们无法观测到滥用行为的发生也就无法事后修补防御。其核心挑战在于如何在保持对非自适应攻击检测率的同时抵抗自适应攻击者。创新方法AWM的核心思想是将监控信号从文本层面下沉到模型内部激活空间并通过密钥引入随机化密钥生成为每个目标层使用密钥采样一个高斯方向向量 ( w_\ell )作为秘密检测方向。水印嵌入对基座模型进行微调在有害响应时将激活向量拉向密钥方向 ( w_\ell )在良性响应时拉向反方向 ( -w_\ell )。微调同时通过KL散度约束保留基座模型的行为。检测方向与有害行为的表征被纠缠在一起使得攻击者难以在不损害模型效用或改变行为的情况下移除水印。检测阶段推理时提供商记录目标层的隐藏状态计算与密钥方向的余弦相似度并聚合为标量统计量超过预设阈值即触发告警。策略归因由于高维空间中随机采样的方向近似正交可以为每个监控策略分配独立的水印方向从而实现“哪个策略被违反”的归因。在20个策略的场景下AWM以80%的准确率识别被违反的策略而随机基线仅为5%。研究成果非自适应攻击在Jailbroken、DeepInception、Multilingual和AutoDAN四种越狱攻击下AWM在四种攻击中的三种上取得最低规避率AUROC达到0.92-0.96。激活空间的监控器AWM和ActProbe在所有攻击上均匹配或超越文本级护卫模型。自适应攻击在代理优化的自适应AutoDAN攻击下LlamaGuard的规避率达85%QwenGuard为79%ActProbe高达93%而AWM仅为37%±11%。跨密钥迁移实验中针对一个密钥优化的攻击迁移到其他密钥时规避率从100%降至24%-59%均值37%。集成多密钥的优化攻击也未能显著提升对未见过密钥的迁移效果。模型效用在BBH、IFEval、MMLU-PRO、TruthfulQA、GSM8K、MATH-Hard和HumanEval七个基准上AWM带来的效用损失极小BBH和MMLU-PRO几乎不变其他任务下降0.6-2.2个百分点。效率AWM在推理时无需额外的前向传播直接复用提供商已有的激活值计算余弦相似度几乎为零的推理开销。实际落地应用的可能性AWM的实用价值体现在三个层面轻量级部署无需额外的护卫模型复用LLM推理过程中已计算的激活值即可完成检测推理开销可忽略。策略归因能力提供商可以为不同政策如禁止生成恶意代码、禁止泄露隐私信息等分配独立的水印方向当违规发生时不仅知道“发生了违规”还能知道“违反了哪条政策”。这对于企业内部合规审计和多租户场景下的责任追溯具有直接价值。自适应攻击防御在基座模型公开可获取的场景下如Qwen、Llama等开源模型AWM提供了一种不依赖“保密”的密钥化防御机制。即使攻击者完全了解监控算法只要不知道密钥就无法可靠地构造规避攻击。技术细节水印嵌入损失函数AWM的微调过程包含两个损失项KL散度约束保持基座模型 ( M ) 的行为不变[\mathcal{L}{\text{KL}} D{\text{KL}}(p_{\theta}(\cdot \mid x) \parallel p_{\theta_0}(\cdot \mid x))]其中 ( \theta_0 ) 为冻结的基座模型参数。水印损失根据响应是否为有害内容将激活拉向或拉离密钥方向[\mathcal{L}{\text{wm}} -\lambda \cdot c_t \cdot \mathbb{1}{\text{harmful}} \lambda \cdot c_t \cdot \mathbb{1}{\text{benign}}]其中 ( c_t \sum{\ell \in L} \frac{\langle h_t^\ell, w_\ell \rangle}{|h_t^\ell|2 |w\ell|_2} ) 为跨层余弦相似度之和。水印损失仅应用于响应中有害内容起始偏移 ( \Delta ) 之后的token并采用线性递增权重将损失集中作用于后文token——因为有害行为通常在响应过程中变得越来越明确。检测统计量推理时检测统计量定义为所有助手token的加权平均余弦相似度[T_k(\pi, x) \frac{1}{\sum_{t \in J’} w_t^{\text{det}}} \sum_{t \in J’} w_t^{\text{det}} c_t]其中 ( J’ ) 为响应中的助手token集合( w_t^{\text{det}} ) 为检测阶段的递增权重。阈值 ( \tau_k ) 在持有良性数据上预先校准以匹配目标假阳性率。多策略归因对 ( N ) 个监控策略为每个策略 ( j ) 分配独立采样的密钥方向 ( w^{(j)} )。检测时计算响应激活与所有 ( N ) 个方向的相似度 ( \bar{c}_j )取 argmax 判定违反的策略。由于高维空间中随机方向近似正交不同策略的水印信号互不干扰。研究设定基座模型Qwen2.5-7B-Instruct。对比基线LlamaGuard-3-8B文本级护卫模型Qwen3Guard-Gen-8B文本级护卫模型ActProbe基于隐藏状态的监督探针数据集训练和验证BeaverTails有害/良性提示-响应对攻击构造从XSTest的有害子集出发使用EasyJailbreak生成四种越狱变体攻击类型模板型Jailbroken、DeepInception、Multilingual优化型AutoDAN基于遗传搜索的提示优化评估指标规避率ASR在固定假阳性率下有害响应未被检测到的比例AUROC阈值无关的检测性能汇总七项标准基准测试评估模型效用保留威胁模型假设攻击者知晓全部监控算法和密钥分布拥有无限的API查询预算和计算资源可模拟任意数量的代理检测器但不知道部署所用的真实密钥。这一假设遵循Kerckhoffs原则——安全性应依赖密钥而非算法的保密。综合分析为什么AWM有效从信息论角度看AWM的有效性源于密钥引入的检测器不确定性。确定性监控器如护卫模型是一个固定函数攻击者可以在本地精确复制并优化规避策略。而AWM的检测边界依赖于一个高维随机密钥攻击者针对一个密钥优化的攻击在另一个密钥下几乎不转移——实验显示跨密钥规避率从100%降至24%-59%。从表征学习角度看AWM将水印信号与有害行为的表征纠缠在一起。这意味着攻击者无法简单地通过“移除水印”来规避检测因为移除水印的同时也会改变模型处理有害内容的方式。这种纠缠设计使水印具有了鲁棒性——它不能被轻易移除而不损害模型效用。与现有工作的本质差异现有护卫模型LlamaGuard、QwenGuard是在文本表面做分类攻击者可以通过改写、编码、角色扮演等方式改变文本形式而不改变语义。ActProbe虽然也在激活空间工作但其检测方向是从数据中学习得到的攻击者可以重新训练一个代理探针来模拟并规避。AWM的检测方向则是密钥派生的攻击者无法通过数据重训练来恢复因为嵌入过程已经将水印与有害行为耦合。局限性与未解决的问题经验性证据论文的鲁棒性证据是经验性的覆盖了具体的自适应攻击类型但理论上是否存在针对AWM的更强大攻击如能够推断密钥或解耦水印与有害行为仍有待探索。效用-安全权衡AWM在数学和编码任务上造成约1-2个百分点的性能下降。这种代价是否可接受取决于具体部署场景——对于代码生成类应用可能需要更谨慎的权衡。阈值校准的静态性阈值在部署前一次性校准并在所有攻击评估中保持固定。在非平稳环境中攻击分布的变化可能导致假阳性率漂移。实践应用适用场景开源模型托管平台如TogetherAI、OpenRouter等托管开源LLM的服务商基座模型本身公开可获取无法依赖“模型保密”来防御自适应攻击。AWM提供的密钥化检测是这类场景的理想选择。企业内部多策略合规企业可以针对不同政策如数据泄露防护、有害内容过滤、知识产权保护等分配独立的水印方向实现精细化的行为审计。红队测试与安全运营在红队测试中AWM可以作为一个“检测器”来评估越狱攻击的有效性在生产环境中它可以作为护卫模型的补充或替代提供一层密钥化的纵深防御。部署建议训练阶段在基座模型上执行轻量级微调LoRA或全参数微调均可将水印嵌入到目标层。训练数据需要包含有害/良性的配对数据如BeaverTails。阈值校准使用部署环境中的真实良性流量数据校准检测阈值以匹配业务可接受的假阳性率。密钥管理密钥的安全管理是AWM有效性的前提。建议采用硬件安全模块HSM或密钥管理服务KMS存储密钥并定期轮换。多策略配置为每个监控策略分配独立密钥方向时可利用高维空间的近似正交性。策略数量增加时需确保维度足够大以避免方向间串扰。监控与告警AWM的检测统计量可以直接集成到现有的可观测性管道中无需额外模型推理推理开销可忽略。参考资料来源原始论文https://arxiv.org/html/2603.23171
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进