ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

【人工智能每日精选】AI评委也怕打分尺度

【人工智能每日精选】AI评委也怕打分尺度 AI评委也怕打分尺度当我们让大语言模型给答案打分时常会先纠结提示词怎么写、模型够不够强却容易忽略一个看起来很普通的设置评分范围到底是 0 到 5、0 到 10还是 0 到 100我最近读到一组关于“模型评委”的对照实验最大的收获是评分尺度并非换个数字单位那么简单。它可能改变模型如何理解评分标准也会改变它和人类评审的校准方式。对自动评测来说量表设计本身就属于实验设计。一分数范围会改变评委的判断实验覆盖六类任务包括语义相似度、毒性识别、道德判断、事实性、指令遵循和摘要质量。研究者让 12 名人类评审和 6 个语言模型评审对同一批样本打分并比较 0–5、0–10、0–100 三种**连续分值范围**。人和模型都可以给小数分所以这里考察的是数值范围和端点校准不是“5个离散选项”和“10个离散选项”的差别。为了衡量人和模型是否给出相近分数作者使用了组内相关系数ICC和归一化平均绝对误差。简单说ICC关注的是绝对一致程度能发现系统性的偏高、偏低或分数波动范围不匹配误差指标则告诉我们人和模型平均差了多少。整体汇总后0–5 的人机一致度最高0–10 最低。一个很容易被误解的点是人类评审内部一致、模型评审内部一致并不代表两组彼此一致。两组都稳定地给分却仍可能用不同尺度理解“好答案”。二汇总分数会掩盖任务差异在相对客观的任务上例如语义相似度和毒性判断模型与人类的评分更容易对齐在开放式的回答质量、摘要评价等主观任务上模型自身跨尺度的一致性和人机一致性都更容易下降。事实性任务也有特殊挑战评审者自身的知识背景不同分歧未必只是模型校准造成的。这让我想到一个常见误区只报告一个总体一致性指标可能会让评测看起来比实际更可靠。若客观任务在汇总数据里贡献了更明显的差异整体数值就可能显得漂亮而主观任务里的不稳定被平均掉了。因此我更希望看到按任务、按评审模型拆开的结果而不是只看总分。文中还观察到不同性别评审群体与模型的对齐模式有所差别。不过每组只有 6 名人类评审这更适合作为需要进一步检验的信号不能直接推广成人群规律。三我会怎样设计一次模型评测如果我用语言模型做自动评审我会先把评分规则固定下来再把尺度作为明确的配置记录而不是临时写进提示词后就不再提。若任务主观性较强我会在一部分样本上让人类与模型使用同一标准评分分别报告 ICC 和平均分差并按任务类别检查结果。0–5 在这组实验的总体结果中表现最好但它不是所有任务、所有评审模型上的普遍最优选项。样本范围也有限完整模型跨尺度分析有 5,497 条任务样本人机对照只抽取了 150 条每个基准 25 条人类评审来自研究生群体。研究测试的是连续数值范围不能直接推出离散 Likert 量表的结论。如果某个成熟的人类量表已经固定并经过验证我也不会为了追求这组实验里的总体一致度就擅自换尺度。更稳妥的做法是针对具体任务做校准并公开尺度、端点定义和分层一致性结果这样后续读者才知道分数究竟能比较到什么程度。四评分规则也是模型的一部分“让 AI 来打分”并没有消除评测中的主观选择只是把一部分选择藏进了提示词、模型和分值范围里。选一个更合适的评分尺度可能提升人机对齐同时按任务拆解指标才能发现总体数字背后的不一致。所以我会把量表和评分端点当作评测方法的一部分认真记录。一个模型评委是否可信不只取决于它说得像不像人也取决于我们有没有把它如何打分这件事设计清楚。参考资料Li, W., Zhao, M., Dong, W.et al.Grading scale impact on LLM-as-a-judge: human-LLM alignment is highest on 0–5 grading scale.npj Artif. Intell.(2026)
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进