ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

InferenceX评测体系内幕:GSM8K、GPQA与厂商自定义Eval如何嵌入CI自动评分

InferenceX评测体系内幕:GSM8K、GPQA与厂商自定义Eval如何嵌入CI自动评分 人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载InferenceX 是一个开源 AI 加速器研究平台它的 CI 评测体系自动为每次推理性能优化打上质量闸门GSM8K 数学题、GPQA 研究生级科学问答以及 Kimi、MiniMax 等厂商自定义评测都会被自动选中、运行并对照阈值自动评分任何精度回退都会让 CI 直接失败。为什么推理平台需要评测闸门 推理框架天天在优化吞吐量换量化精度、调并发、改 TP/EP 并行、上投机解码MTP/DSpark……但这些优化可能悄悄损害模型精度。InferenceX 的解法是吞吐跑分之外额外挑一批配置运行带评分的 QA 任务用分数下限卡住回归。这套逻辑写在 EVALS.md 中核心规则只有三句固定序列场景只测 8k1k输入 8192 / 输出 1024每个模型、运行框架、精度组合取最高并发和中间并发各跑一次Agent 场景每个模型默认选最高并发跑 GSM8K厂商场景Kimi K3 和 MiniMax M3 的每个生成点自动附带完整厂商评测套件。评测矩阵选择mark_eval_entries 如何挑行生成 sweep 矩阵后mark_eval_entries()位于 infx/matrix/generate.py负责给矩阵行打上需要评测的标记场景选择策略阈值准入单节点固定序列每组模型运行框架精度序列长度…取最高和中间并发并发 ≥ 16多节点固定序列每种并行拓扑取最高合格并发并发 ≥ 16Agent GSM8K每组最高并发作为独立 eval-only 作业并发 ≥ 16不足时取该部署最高并发兜底厂商套件Kimi/MiniMax 全部生成点自动带上无条件自动关键设计评测作业与吞吐跑分完全分离。Agent 场景的 GSM8K 是单独的 eval-only 作业所以每个吞吐数据点都照常跑评测不会吃掉任何吞吐覆盖同时按app eval 身份去重同一配置只存一条结果避免互相覆盖。三大评测框架一条命令统一调度所有评测都由同一条入口命令触发python3 -m infx.bench eval框架注册表在 infx/bench/eval/init.py 中一览无余——除了lm-eval还有三个厂商框架全部由EVAL_FRAMEWORK/EVAL_SUITE环境变量选择。GSM8K 与 GPQAlm-eval 任务定义GSM8K 和 GPQA 走 EleutherAI 的 lm-eval harness任务定义是两个 YAMLinfx/evals/gsm8k.yaml5-shot 数学应用题模型被要求以#### 数字结尾提供strict-match和flexible-extract两种正则过滤器分别对应结果表中的EM Strict / EM Flexible两列infx/evals/gpqa_diamond.yamlGPQA Diamond 四选一科学题用正则抽取回答中最后一个独立 A–D 选项做精确匹配。lm-eval 请求会按模型原生上下文上限自动裁剪请求预算lm_eval.py并对 thinking 类模型打了运行时补丁infx/evals/patches/lm_eval_sitecustomize.py处理reasoning_content空内容等兼容问题。厂商自定义 EvalKimi 工具调用与 MiniMax 提供方兼容这是整个体系最有意思的部分——InferenceX 直接运行厂商自己的官方验证器而不是自研测试Kimi K3kimi_vendor_eval.py 驱动 Moonshot 官方 Kimi-Vendor-Verifier 的固定版本源码kimi_tool_call_schema_full套件覆盖204 个工具调用 schema 用例 × 流式/非流式 408 项检查每个kimik3Agent 生成点自动运行MiniMax M3minimax_m3_full_eval.py 运行 MiniMax 官方 Provider Verifier 的全部102 个提供方兼容用例含请求超时、重试、SHA256 哈希校验等完整供应链管控BFCL面向 OpenAI 兼容接口的工具调用基准4 用例 smoke 作为显式选项接入可手动选中诊断。三者共用 infx/bench/eval/vendor.py 中PROVIDERS表里的一个通用 runner自动准备隔离 Python 环境、安装锁定的验证器依赖、执行套件、把厂商原生报告投影成统一的inferencex-eval-v1兼容结果格式——这样厂商评测和 lm-eval 结果走同一条收集、聚合、看板链路。评测与跑分的协作流程模式环境变量行为组合模式RUN_EVALtrue, EVAL_ONLYfalse起服务 → 跑吞吐 → 同一服务跑评测纯评测模式EVAL_ONLYtrue起服务评测专用配置→ 跳过吞吐 → 跑评测全量评测--all-evals每个合格点的固定序列Agent 评测都跑部署冒烟--trim-conc只保留每种部署形态的最低并发评测跟着搬多节点all-evals时EVAL_CONC支持空格分隔的并发列表eval 命令会在同一个运行中的引擎上顺序批量跑多个并发点产物带_concN后缀区分。自动评分thresholds.yaml 是质量闸门的核心 评测跑完后validate_scores.py 作为独立 CI 步骤把分数对照 infx/evals/thresholds.yaml 校验。阈值分两层最具体的优先resolve_threshold()default: gsm8k: 0.90 # 全局兜底 gpqa_diamond_cot_n_shot: 0.30 models: glm5: { gsm8k: 0.94 } # 模型级阈值覆盖全局 qwen3.5: { gsm8k: 0.94 } minimaxm2.5: { gsm8k: 0.92 } dsv4: { gsm8k: 0.91 }几个值得注意的细节模型前缀自动识别验证器从meta_env.json读出本次运行的模型前缀自动套用该模型的阈值无需人工指定厂商套件阈值设为 0.0它们目前定位为诊断性——分数照收照看板但不卡 CI真正会失败的是集成故障依赖缺失、传输超时、输出畸形、样本数不对这类失败会走零有效样本错误路径让作业失败基础设施失败 ≠ 模型质量差聚合时失败行保留score: null且标记infrastructure_success: false保证看板不会把端点挂了误读成模型变笨了。结果收集从产物到汇总表CI 的collect-evals作业下载全部eval_*产物后由 collect_eval_results.py 聚合每个作业目录以meta_env.json为锚取时间戳最新的 lm-eval 结果输出agg_eval_exp.json并生成包含 Hardware / Framework / Precision / TP / Conc / Task / Score / EM Strict / EM Flexible / N(eff) 的汇总表发布到 CI 页面。批量评测还会核对期望/完成/失败三个并发清单缺一个并发点都会报 FAIL。快速上手关键文件路径清单 想了解什么看哪里评测体系总览inferencex-e2e/infx/evals/EVALS.md评测怎么选行infx/matrix/generate.py任务定义gsm8k.yaml、gpqa_diamond.yaml评分阈值infx/evals/thresholds.yaml阈值校验逻辑infx/evals/validate_scores.py框架调度入口infx/bench/eval/init.py厂商验证器接入infx/bench/eval/vendor.py结果聚合infx/results/collect_eval_results.py一句话总结InferenceX 把评测什么矩阵选择→ 用什么评lm-eval / 厂商验证器→ 怎么算过分层阈值 基础设施/质量失败二分三条链路完全程序化让推理优化的每一次吞吐提升都在 CI 里附带一份可信的精度背书。赞分享人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载相关推荐从Tailwind到BootstrapJetstrap让Laravel界面开发提速50%从Tailwind到BootstrapJetstrap让Laravel界面开发提速50% Jetstrap是一个轻量级的Laravel 8扩展包专注于将Latiny11builder两条 PowerShell 脚本把 Windows 11 装进 8GBtiny11builder两条 PowerShell 脚本把 Windows 11 装进 8GB 在一台 4GB 内存的老笔记本上实测原版 Windows操作系统pigpio性能优化技巧提升树莓派GPIO响应速度的5个方法pigpio性能优化技巧提升树莓派GPIO响应速度的5个方法 pigpio是一款针对树莓派的强大GPIO控制C库它允许开发者精确控制通用输入输出引脚。对于需物联网嵌入式创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进