![lm-evaluation-harness 如何安装基础包并用 lm_eval[hf]、lm_eval[vllm] 等 extras 单独安装模型后端](http://pic.xiahunao.cn/yaotu/lm-evaluation-harness 如何安装基础包并用 lm_eval[hf]、lm_eval[vllm] 等 extras 单独安装模型后端)
lm-evaluation-harness 如何安装基础包并用 lm_eval[hf]、lm_eval[vllm] 等 extras 单独安装模型后端【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harnesslm-evaluation-harness 是一个用于语言模型 few-shot 评测的框架。从 README 的 Latest News2025/12 条目开始它的安装方式做了拆分基础包不再自带transformers和torch只提供核心评测框架要跑具体的模型后端必须用可选 extras 单独安装例如lm_eval[hf]、lm_eval[vllm]、lm_eval[api]。本文说明如何安装基础包、按要运行的模型类型安装对应 extras并验证安装与后端是否可用。操作依据是项目内的 README.md、pyproject.toml 与 docs/interface.md。前提条件Python 3.10来自 pyproject.toml 的requires-python 3.10。基础包依赖datasets、numpy、evaluate、jinja2、rouge-score、sacrebleu、scikit-learn等随pip install -e .自动安装不需要预装任何模型相关库。若要在本地模型上跑评测--device参数支持cuda、cuda:0、cpu、mps默认值是cuda见 docs/interface.md 的参数表无 GPU 的机器需要显式传--device cpu。安装基础包README 的 Install 章节给出的是仓库内可编辑安装git clone --depth 1 https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness cd lm-evaluation-harness pip install -e .--depth 1表示浅克隆README 原文使用其 GitHub 仓库地址这里按镜像地址给出步骤相同。安装完成后会注册两个入口lm-eval与lm_evalpyproject.toml 的[project.scripts]也可以用python -m lm_eval运行。按需安装模型后端 extras基础安装只提供核心框架README 明确要求 “Model backends must be installed separately”。README 的快速安装命令如下# HuggingFace transformers 模型 pip install lm_eval[hf] # vLLM 推理 pip install lm_eval[vllm] # API 模型OpenAI、Anthropic 等 pip install lm_eval[api] # 多个后端一起装 pip install lm_eval[hf,vllm,api]如果你是用pip install -e .安装的基础包README 的 “Optional Extras” 章节给出的对应形式是pip install -e .[hf] pip install -e .[hf,vllm,api]两种方式都来自 README只是所在章节不同基于本地克隆仓库开发时-e .[...]形式把额外依赖加到同一个可编辑安装上依赖与本地代码保持一致。各 extras 实际引入的依赖以 pyproject.toml 的[project.optional-dependencies]为准Extra依赖用途hftransformers4.1、torch1.8、accelerate0.26.0、peft0.2.0用--model hf跑 HuggingFace Transformers 模型vllmvllm0.18用--model vllm做快速推理apirequests、aiohttp、tenacity、tqdm、tiktokenOpenAI、Anthropic、本地 OpenAI 兼容服务器等 API 模型gptq/gptqmodelauto-gptq[triton]0.6.0/gptqmodel1.0.9在hf后端加载 GPTQ 量化模型onnxruntime-genaionnxruntime-genai、transformers、numpyONNX Runtime GenAI 后端CPU/CUDA/DirectML/NPUonnxruntimeonnxruntime1.23、transformers、numpy原始 ONNX Runtime 后端额外支持 ROCm/MIGraphXoptimum/habana/ipex/ibm_watsonx_aioptimum[openvino]/optimum-habana/optimum-intel/ibm_watsonx_ai1.1.22、python-dotenvOpenVINO、Intel Gaudi、Intel IPEX、watsonx.ai 后端sparsifysparsify模型 steeringsteered模型类型后端之外pyproject 还定义了任务依赖 extrastasks聚合全部任务依赖另有math、ifeval、longbench、ruler、multilingual、japanese_leaderboard等和工具类 extraswandb、zeno、hf_transfer、unitxt、sentencepiece、dev。它们在跑对应任务或工具时才需要不是安装模型后端的前提。两点边界说明README 的 extras 表中列出的neuronx、winml、sae_lens三项目前在 pyproject.toml 中没有定义为可安装的 extrasae_lens行被注释注释说明 sae-lens 要求datasets 3.0Windows ML 后端则是 README 中手动安装依赖包pip install wasdk-Microsoft.Windows.AI.MachineLearning[all] ...不走 extra。pyproject.toml 的[tool.uv] conflicts声明了gptq与vllm互斥acpbench与math/tasks互斥用 uv 管理环境时不能同时选择这两组。验证安装安装完成后先确认 CLI 和任务注册表可用lm-eval -h # 显示 run / ls / validate 三个子命令 lm-eval run -h # 显示 run 子命令的完整参数 lm-eval ls tasks # 列出可用任务也可以对任务配置做预校验docs/interface.md 的lm-eval validate章节lm-eval validate --tasks hellaswag该命令检查任务存在性、配置语法、数据集访问、必填字段、指标定义与 filter 链。跑一次最小评测确认后端可用hf后端docs/interface.md Quick Start 中的示例lm-eval run --model hf --model_args pretrainedgpt2 --tasks hellaswag无 GPU 时加--device cpu--device默认cuda。快速冒烟测试可加--limit 10只跑前 10 条样本文档明确标注--limit仅供测试使用。README 中的旧式单命令形式如lm_eval --model hf --tasks hellaswag仍然兼容CLI 会自动插入run子命令。vllm后端同样来自 Quick Start 示例lm-eval run --model vllm --model_args pretrainedEleutherAI/gpt-j-6B --tasks arc_easy arc_challenge --num_fewshot 5保存结果时加--output_path和--log_sampleslm-eval run --model hf --model_args pretrainedgpt2 --tasks hellaswag --output_path ./results/ --log_samples结果判断看产出文件而不是固定数值。仓库测试样例 tests/testdata/hellaswag-v0-res.json文档示例展示了结果 JSON 的结构顶层results字段下按任务名给出acc、acc_norm及其 stderr另有versions字段。指标数值取决于模型与数据仓库中该文件里的数值只是示例不能作为固定预期。边界与下一步后端 extras 与任务 extras 相互独立装好hf后端后运行依赖math等 extra 的任务时仍需单独安装对应任务依赖。非 CPU 的 ONNX 后端要求把onnxruntime-genai/onnxruntime换成与硬件匹配的 wheel如onnxruntime-genai-cuda、onnxruntime-rocm二者互斥见 README 对应章节。全部 CLI 参数参考 docs/interface.mdYAML 配置文件用法参考 docs/config_files.mdPython API 参考 docs/python-api.md。【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考