ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

如何10分钟上手InferenceX:免费性能Dashboard与首次基准测试完整指南

如何10分钟上手InferenceX:免费性能Dashboard与首次基准测试完整指南 人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载InferenceX 是一款采用 Apache 2.0 开源许可的推理性能研究平台专门用于持续基准测试 vLLM、SGLang 等主流 LLM 推理框架在真实 GPU 上的表现。它最大的亮点是免费公开的性能 Dashboard——无需自己部署就能实时查看 DeepSeek、Kimi、Qwen 等热门模型在 B200、H200、MI300X 等硬件上的推理吞吐与延迟曲线。本指南带你 10 分钟内完成从「看 Dashboard」到「跑通第一次基准测试」的完整上手。 说明本仓库为只读镜像文中所有命令均在你自己的环境中执行。一、InferenceX 是什么先搞懂核心定位InferenceX前身 InferenceMAX是一个自动化推理基准测试平台。它的核心思路是推理软件栈每天都在优化固定时间点测出的基准很快过时因此它通过持续、近乎实时的测试来捕捉推理性能的每一次进步。平台由几个子模块组成各司其职子模块作用inferencex-e2e/ 端到端推理服务基准测试核心collectivex/ 网络与集合通信基准测试实验性operatorx/⚙️ 算子与内核级基准测试实验性power_model/⚡ 系统级功耗建模shared/ 共享组件experimental/ 各类实验官方已支持B200、B300、H200、H100、MI300X、MI355X、GB200 NVL72等主流硬件完整覆盖情况见项目首页的 README_zh.md。二、免费性能 Dashboard先看结果再动手InferenceX 在官网免费公开了一个实时性能 Dashboard开源任何人都可以直接访问、筛选对比无需部署任何环境。在 Dashboard 上你可以直接看到性能曲线不同并发度下各框架 / 硬件组合的吞吐tokens/s与延迟变化帕累托前沿Pareto Frontier自动筛出「又快又稳定」的最优配置点跨模型 / 跨硬件对比例如同一模型在 Blackwell 与 Hopper 上的差距Agentic 多轮真实流量AgentX 场景下的端到端交互性指标 建议第一次接触时先打开 Dashboard 浏览感兴趣的模型曲线建立「结果长什么样」的直觉再进入下面的动手环节。三、10 分钟上手首次基准测试的三种方式按你的环境从最轻量的方式开始即可。方式一对已有推理服务直接压测最快无需 GPU 集群如果你已经用 vLLM / SGLang 起了一个OpenAI 兼容的推理服务可以直接用官方的AgentX 客户端CLI 名为aiperf对它压测不需要 CI 或 Slurm。完整的安装与运行命令见 agentx-standalone.md核心两步用uv创建虚拟环境并安装 AgentX 客户端执行aiperf profile --scenario agentx ...通过--url指向你的服务地址如http://127.0.0.1:8000agentx预设会自动完成预热、共享报告与运行时配置你只需提供模型名、tokenizer、并发数、输出目录四个输入。默认随机种子为42复现结果时请保持不变。方式二本地生成基准测试矩阵理解测试逻辑想深入理解 InferenceX「测什么、怎么测」可以用本地工具从主配置生成一份基准测试矩阵JSON整个过程不消耗 GPU进入inferencex-e2e/目录用uv sync --locked安装工具运行matrix generate指定主配置与模型前缀例如针对 DeepSeek-R1 的dsr1生成后检查矩阵字段模型、框架、精度、并发、拓扑等确认无误ci-procedures.md 提供了完整的生成与过滤示例可按--model-prefix、--seq-lens、--min-conc/--max-conc等参数精确裁剪测试范围。主配置的结构与字段含义参考 CONFIGS.md。方式三官方 CI 全自动跑最省心如果你希望完全托管InferenceX 提供了端到端的 CI 流程会自动完成「矩阵生成 → 校验 → 派发 → 收集 → 发布到 Dashboard」的全链路。派发与监控细节见 ci-procedures.md 的「Manual end-to-end dispatch」章节。 三种方式对应不同深度看 Dashboard0 分钟→ 本地压测10 分钟→ 生成矩阵理解原理→ CI 全自动完全托管按需选择即可。四、读懂你的第一次基准测试结果跑完后重点关注以下几类指标详见 results-and-ingestion.md吞吐throughputtput_per_gpu、input_tput_per_gpu、output_tput_per_gpu——单卡吞吐是核心对比指标⚡交互性interactivity反映用户侧每秒可获得的输出 token 数越高越好⏱️延迟TTFT首 token 时间与 TPOT每 token 间隔intvty即交互性的倒数对于 Agentic 场景平台使用E2E 归一化交互性作为主指标兼顾排队 / 预填充时间与解码节奏其定义见 MODELS.md。五、下一步继续深入 InferenceX➕ 想新增一个模型或 GPU 基准 → 从 CONFIGS.md 开始️ 想了解整体架构与「配置到结果」的流转 → 阅读 architecture.md️ 想搭建自己的 Runner → 参考 RUNNER_SETUP.md 想建模系统功耗 → 试用 power_model/ 的命令行工具 所有任务的路由入口 → docs/index.md✅上手小结先看免费 Dashboard 建立直觉 → 用aiperf压测一个已有服务 → 本地生成矩阵理解测试逻辑 → 最后接入 CI 完全托管。10 分钟你就已经跑通了 InferenceX 的完整闭环。赞分享人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载相关推荐数据库性能测试终极指南10分钟快速上手YCSB基准测试数据库性能测试终极指南10分钟快速上手YCSB基准测试 想要评估不同数据库系统的性能表现Yahoo! Cloud Serving BenchmarkYCS性能测试5个Sagan性能优化技巧缓存策略与数据库查询优化终极指南5个Sagan性能优化技巧缓存策略与数据库查询优化终极指南 Sagan是Spring官方站点和参考应用作为一个高性能的Spring Boot应用它采用了多后端如何快速上手Phoronix Test Suite10分钟完成第一个基准测试如何快速上手Phoronix Test Suite10分钟完成第一个基准测试 Phoronix Test Suite简称PTS是一款功能强大的开源跨平台自开发工具运维创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进