ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

MiniCPM5-2B 端侧大模型实战指南:Llama 架构、131K 长上下文与多框架部署全解析

MiniCPM5-2B 端侧大模型实战指南:Llama 架构、131K 长上下文与多框架部署全解析 人工智能大模型基础模型【免费下载链接】MiniCPM5-2BMiniCPM5-2B 是一款面向端侧、本地部署和资源受限场景的 2B 稠密 Transformer能够达到同尺寸开源模型 SOTA 水平。项目地址https://ai.gitcode.com/OpenBMB/MiniCPM5-2B点击查看免费下载本篇技术指南以 OpenBMB 开源的 MiniCPM5-2B 为对象系统讲解这款面向端侧与资源受限场景的 2B 稠密 Transformer 的架构规格、评测表现、SFT/RL/OPD 训练配方以及基于 vLLM、SGLang、llama.cpp、Transformers 等主流推理引擎的完整部署与工具调用方案。读完本文你将掌握 MiniCPM5-2B 的选型依据、采样参数调优技巧、DSpark 投机采样加速方法以及如何在本地端侧快速拉起一个可用的 OpenAI 兼容推理服务。模型定位与核心亮点MiniCPM5-2B 是 MiniCPM5 系列继 MiniCPM5-1B 之后发布的第二个模型面向本地助手local assistant、coding agent、工具调用流程tool-use workflow以及需要紧凑模型的推理场景。它以较小的部署成本提供原生长上下文能力是 MiniCPM5 系列中把端侧可部署与强推理能力结合的 2B 级代表。模型主体说明位于仓库根目录的 README-cn.md英文版本见 README.md。根据官方说明其核心亮点可概括为三点同尺寸开源模型 SOTA在与 LFM2.5-2.6B、Qwen3.5-2B、Gemma-4-E2B-it 等同尺寸模型的对比中MiniCPM5-2B 平均分 53.9达到该对比范围内的 SOTA 水平同时整体表现可与 4B 级模型竞争对比组内 4B 级最高分为 51.1在代码、数学、长文本、工具调用和 Agent 任务上优势明显。开放高质量数据与模型同步开源其训练数据均属于 UltraData 数据体系包括高质量网页预训练数据集 UltraX-Preview、L0–L3 分级代码治理数据集 UltraData-Code、50 万条 Agent 训练样本 UltraData-SFT-Agent-2609以及覆盖数学、代码、通用知识与长文本推理的超 8 万条 RL 训练样本 UltraData-RL-2609。标准架构零门槛接入模型使用标准LlamaForCausalLM架构主流推理引擎可直接加载无需自定义算子也无模型代码 fork。模型版本与格式清单按运行环境选型MiniCPM5-2B 发布了完整的训练阶段 checkpoint 与多种推理格式覆盖从量化部署到草稿模型加速的各类场景。其中 BF16 正式版即当前仓库所承载的版本经 RL OPD 后训练。MiniCPM5-2B 系列Hugging Face 标识 openbmb/MiniCPM5-2BModelScope 标识 OpenBMB/MiniCPM5-2B版本格式 / 说明MiniCPM5-2BBF16 正式版经 RL OPD 后训练MiniCPM5-2B-SFTBF16 SFT 单独 checkpointRL / OPD 之前MiniCPM5-2B-MidtrainBF16 mid-training checkpointSFT 之前MiniCPM5-2B-BaseBF16 base checkpoint仅预训练MiniCPM5-2B-GGUFGGUF适用于 llama.cpp / Ollama / LM StudioMiniCPM5-2B-MLXMLX / 4bit适用于 Apple SiliconMiniCPM5-2B-GPTQGPTQ / 4bit 量化模型MiniCPM5-2B-DSparkDSpark 草稿模型用于推理加速MiniCPM5-2B-DSpark-GGUFGGUF 版本的 DSpark 草稿模型MiniCPM5-2B-LiteRTMiniCPM5-2B 的 LiteRT-LM 版本MiniCPM5-1B 系列同步提供 BF16 正式版、SFT、Base、GGUF、MLX 等版本供更低资源预算的场景选用。从部署角度看追求极致小内存用 GGUF / GPTQ / MLX 量化版需要最快解码速度可用 DSpark 草稿模型配合 SGLang 投机采样需要在手机、桌面、IoT 等端侧运行时加载则选择 LiteRT-LM 版本。技术规格从配置到权重的源码级核对README 中给出的模型信息可以在仓库的 config.json 中逐一得到验证。下表汇总了模型的核心规格配置项数值config.json 对应字段类型Causal Language Model因果语言模型model_type: llama架构标准LlamaForCausalLMarchitectures: [LlamaForCausalLM]总参数量2,516,756,480由 model.safetensors.index.json 中的权重分片汇总非嵌入参数量1,981,982,720同上不含 token embedding 与 lm_head层数42num_hidden_layers: 42注意力头GQA16 个 Q heads / 2 个 KV headsnum_attention_heads: 16、num_key_value_heads: 2上下文长度131,072max_position_embeddings: 131072从 config.json 还可以获得更多细节隐藏层维度hidden_size: 2048FFN 中间维度intermediate_size: 6144注意力头维度head_dim: 128激活函数hidden_act: siluSwiGLU 结构RoPE 频率基数rope_theta: 5000000500 万且rope_scaling: null说明 131K 长上下文是原生长上下文能力不依赖额外的位置插值或缩放技巧这一点也呼应了 README 中在较小部署成本下提供原生长上下文能力的表述词表大小vocab_size: 130560tie_word_embeddings: falseembedding 与 lm_head 不共享数值精度torch_dtype: bfloat16对应 README 中BF16 正式版的说明特殊 tokenbos_token_id: 0、pad_token_id: 1、eos_token_id: [1, 130073]即/s与|im_end|双结束符。权重文件方面model.safetensors.index.json 显示total_size: 5033512960约 5.03 GB对应 2.5B 参数 × 2 字节的 BF16 存储全部参数存放于单个分片 model-00000-of-00001.safetensors 中。权重清单涵盖 42 层的q_proj / k_proj / v_proj / o_proj、gate_proj / up_proj / down_proj、两层 LayerNorm以及embed_tokens与lm_head与标准 Llama 结构完全一致。默认采样配置仓库中的 generation_config.json 预置了官方推荐的采样参数do_sample: true、temperature: 1.0、top_p: 0.95。这与 README 中生成时建议使用 temperature1.0, top_p0.95, min_p0.0的建议保持一致。评测结果与 2B / 4B 级模型的横向对比官方选取LFM2.5-2.6B、Qwen3.5-2B、Gemma-4-E2B-it作为同尺寸对比模型同时列出Qwen3.5-4B、granite-4.2-3B、Nemotron-3-Nano-4B、Gemma-4-E4B-it、LFM2.5-8B-A1B等更大规模模型作为参考。评测覆盖九个能力维度。以下按维度整理完整数据分数取自 README-cn.md带 † 标记的分数取自 Artificial Analysis 官方公布值其余为内部复现结果。平均分对比组内 SOTA指标MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1B平均分53.933.228.024.651.142.732.631.228.4代码推理基准MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1BLiveCodeBench v669.142.120.242.956.458.950.753.939.8LCB-Pro 25Q2 (Easy)68.030.910.327.158.354.651.645.827.8LCB-Pro 25Q2 (Medium)17.50.00.00.07.05.35.31.80.0OJBench32.511.22.611.624.821.820.019.08.2SciCode (wbg)†26.314.22.820.916.124.916.424.47.8数学推理基准MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1BAIME 202586.541.929.631.778.879.456.337.146.0AIME 202686.545.229.039.882.783.562.145.056.7HMMT Feb 202663.833.720.517.864.060.851.330.138.5MATH-50094.689.685.885.499.097.091.688.293.2指令遵循基准MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1BIFBench66.359.046.025.759.073.058.328.351.0IFEval86.793.477.531.490.293.788.044.490.8Multi-IF71.876.857.140.373.675.965.945.971.4综合知识基准MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1BMMLU-Pro70.865.264.356.078.065.865.768.363.1MMLU-Redux84.780.080.071.888.778.979.883.780.0HLE†8.96.22.64.89.96.64.93.86.9GPQA-Diamond†70.255.845.643.377.155.951.357.651.3SuperGPQA40.826.238.630.352.839.937.838.734.5长文本131K 上下文的直接验证基准MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1BAA-LCR†59.05.328.717.061.024.317.333.00.0NoLiMa68.10.717.13.943.55.11.12.30.5LongBenchPro44.823.78.242.258.434.827.953.519.6LongBench v243.730.324.933.247.336.032.042.730.4工具调用基准MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1Bτ³-Bench Banking†20.87.22.13.96.85.61.24.13.4τ²-Bench Telecom97.190.469.0†20.8†92.1†40.928.1†20.8†16.1†BFCL v466.661.143.636.656.852.243.747.049.2代码智能体基准MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1BSWE-bench Verified46.46.05.02.033.636.83.015.00.4SWE-bench Pro14.40.60.80.028.212.30.13.30.4Terminal-Bench v2.1†8.64.53.00.425.813.93.81.91.9搜索智能体基准MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1BBrowseComp-ZH43.59.818.24.739.621.13.37.013.2BrowseComp Top10039.713.719.36.033.319.04.76.39.7GAIA Text-10388.749.547.930.178.657.326.539.541.1通用智能体基准MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1BGDPval-AA v2†19.64.50.00.011.70.0†0.00.00.0Claw-Gym59.219.325.531.351.660.033.737.92.7WildClaw23.910.29.28.917.020.08.914.34.5QwenClaw42.919.318.214.537.136.416.816.74.5表中加粗为对应行最优结果含 4B 级模型。综合来看MiniCPM5-2B 的优势集中在代码推理、数学推理、长文本、工具调用与多个智能体任务上在 NoLiMa、τ²-Bench Telecom、SWE-bench Verified、GAIA Text-103 等基准上它甚至超过了所有参与对比的 4B 级模型。训练流程UltraData 分级数据体系下的三阶段配方MiniCPM5-2B 的训练是UltraData 分级数据管理体系的一次完整实践覆盖 base training、mid-training 与后训练三个阶段。Base training预训练采用逐级推进的训练配方包含 stable training 与 decay training用于建立基础语言能力与训练稳定性。Mid-training中期训练进一步强化目标能力并适配目标数据分布。训练语料来自同步开源的 Ultra-FineWeb、Ultra-FineWeb-L3、UltraX-Preview、UltraData-Code 与 UltraData-Math 等数据集。Post-training后训练分为SFT → RL → OPD三步。后训练阶段是这套配方的精髓SFT先使用 400B tokens 的 deep-thinking SFT 建立深度思考和通用对话能力相关数据同步开源为 UltraData-SFT-2605 与 50 万条的 UltraData-SFT-Agent-2609RL针对数学、代码、Agent、写作等方向训练专用 RL teacher使用 JustRL II 阐述的 critic-based 算法大幅提升训练稳定性数据开源为超 8 万条的 UltraData-RL-2609OPDOn-Policy Distillation在线策略蒸馏将各 RL teacher 的能力蒸馏回同一个发布模型实现能力合并。RL OPD 带来了什么在官方列出的基准上RL OPD 使推理与通用能力平均提升 ↑10.96 分Agent 能力平均提升 ↑6.96 分OPD 细节OPD 阶段合并了 16 个 RL 训练得到的专家模型含 5 个 agentic 专家模型的能力。训练方式上在 response 序列的每个位置分别对学生模型和教师模型的 logits 计算全词表的反向 KL 散度作为优势估计值替代原有的 verification-based advantage数据复用OPD 直接复用各 RL teacher 训练时的 prompt 作为蒸馏数据无需额外构造语料。这套一个模型 多个 RL 专家 蒸馏合并的思路使最终发布模型能够在单一权重内同时具备数学、代码、工具调用与通用 Agent 能力这也是其在评测表中多项 Agent 任务领先的直接原因。快速上手采样参数与四套主流部署方案官方建议的采样参数组合如下不同推理框架对采样参数的支持程度有所差异标准配置temperature1.0, top_p0.95, min_p0.0遇到重复输出时temperature1.0, top_p0.95, min_p0.0, repetition_penalty1.05其中min_p值得特别留意llama.cpp 默认min_p0.05会过滤掉概率低于最高概率 token 5% 的 token这种过滤反而可能引发重复——它恰恰过滤掉了模型摆脱重复循环所需的 token因此官方明确建议设为0.0以禁用该过滤。vLLM 部署pip install vllm0.21 vllm serve openbmb/MiniCPM5-2B --port 8000启动后即可通过 OpenAI 兼容接口调用curl http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: openbmb/MiniCPM5-2B, messages: [{role: user, content: 你是谁可以简单介绍一下自己吗}], max_tokens: 128, temperature: 1.0 }SGLang 部署pip install sglang[srt]0.5.16 python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --port 30000curl http://localhost:30000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: openbmb/MiniCPM5-2B, messages: [{role: user, content: 你是谁可以简单介绍一下自己吗}], max_tokens: 128, temperature: 1.0 }DSpark 投机采样加速SGLang官方同步开源了为 MiniCPM5-2B 训练的 DSpark 草稿模型MiniCPM5-2B-DSpark。在 SGLang 中启用后可以加速解码且不改变目标模型的输出python -m sglang.launch_server \ --model-path openbmb/MiniCPM5-2B \ --trust-remote-code \ --speculative-algorithm DSPARK \ --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark \ --speculative-dspark-block-size 7 \ --port 30000关键参数说明--speculative-algorithm DSPARK指定投机采样算法--speculative-draft-model-path指向草稿模型--speculative-dspark-block-size 7设置 DSpark 的块大小官方推荐值。llama.cpp 部署GGUFllama-server -m MiniCPM5-2B-F16.gguf -a MiniCPM5-2B --port 8080 -ngl 99 -c 8192 --jinja-c 8192设置上下文长度为 8192可以根据需要修改模型原生支持最长 131072-ngl 99表示尽可能将层卸载到 GPU--jinja启用 Jinja 模板对应本仓库根目录下的 chat_template.jinja。curl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d { model: MiniCPM5-2B, messages: [{role: user, content: 11?}], temperature: 1.0, top_p: 0.95, min_p: 0.0, max_tokens: 256 }Transformers 本地推理pip install -U transformers5.6 accelerate torchfrom transformers import AutoModelForCausalLM, AutoTokenizer model_id openbmb/MiniCPM5-2B tokenizer AutoTokenizer.from_pretrained(model_id) model AutoModelForCausalLM.from_pretrained( model_id, torch_dtypeauto, device_mapauto, ) messages [{role: user, content: 你是谁可以简单介绍一下自己吗}] inputs tokenizer.apply_chat_template( messages, tokenizeTrue, add_generation_promptTrue, enable_thinkingTrue, # 开启深度思考模式think 思维链 return_dictTrue, return_tensorspt, ).to(model.device) outputs model.generate(**inputs, max_new_tokens128) print(tokenizer.decode(outputs[0][inputs[input_ids].shape[-1]:], skip_special_tokensTrue))注意enable_thinkingTrueMiniCPM5-2B 使用think.../think结构承载推理过程是否开启思考会直接影响输出格式这个参数由 chat_template.jinja 中的模板逻辑控制enable_thinking is false时输出空 think 块enable_thinking is true时开启 think 前缀。工具调用XML 协议与 SGLang 原生解析MiniCPM5-2B 的工具调用推荐使用 SGLang。模型以XML 格式产出工具调用SGLang 内置的minicpm5parser 会自动将其转换为 OpenAI 兼容的tool_calls字段python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --port 30000 \ --tool-call-parser minicpm5 # 或--tool-call-parser auto工具调用的底层协议仓库根目录的 chat_template.jinja 完整定义了工具调用协议从中可以看到三个关键机制工具定义注入当 messages 中携带tools时模板将每个工具以 JSON 序列化后放入tools.../toolsXML 标签并注入 system 提示说明可调用零个或多个函数无调用时直接正常作答XML 调用格式模型产出形如function name函数名param name参数名参数值/param/function的调用多行或包含、、换行符的参数值自动包裹 CDATA 块多轮工具响应工具执行结果以tool_response.../tool_response包裹并作为 user 消息回填支持连续多步工具调用。tokenizer 层面tokenizer_config.json 与 special_tokens_map.json 中注册了完整的协议 tokenthinkid 8、/thinkid 9、tool_responseid 10、/tool_responseid 11、toolsid 12、/toolsid 13、functionid 18、/functionid 19、paramid 20、/paramid 21以及 ChatML 风格的|im_start|id 130072与|im_end|id 130073同时是 eos token。部署与微调生态主流框架全覆盖由于使用标准LlamaForCausalLM架构且无需自定义算子与模型代码 forkMiniCPM5-2B 可被主流推理引擎直接加载。官方为各后端提供了详细的逐步部署说明cookbook以及面向 Cursor / Claude Code 类 coding agent 的 Agent Skills 资源。部署后端一览后端模型格式 / 适用场景TransformersBF16 / FP16本地 Python 推理GPU CPUvLLMBF16 / FP16 OpenAI serverSGLangBF16 / FP16 OpenAI server推荐用于 tool callingllama.cppGGUFCPU/GPU 本地推理OllamaGGUF本地端侧运行LM StudioGGUFMac 桌面应用与 OpenAI serverMLXMLX / 4bitApple Silicon 本地推理ArcLightGGUF 本地端侧 / CPU / 桌面 / 服务器vLLM AscendBF16 / FP16 OpenAI serverLiteRT-LM.litertlm端侧运行时Android / iOS / 桌面 / IoTCPU GPU微调框架一览框架适用场景TRL PEFTLoRA / SFT 微调LLaMA-Factory通用微调ms-swift通用微调unsloth通用微调多芯片部署FlagOS 生态除上述框架外MiniCPM5-2B 还支持通过FlagOS进行多芯片部署。FlagOS 社区致力于打造面向多种 AI 芯片的统一开源系统软件栈涵盖大型算子库、统一 AI 编译器、并行训推框架、统一通信库等核心项目目标是一次开发、跨芯迁移。基于 FlagOS 的多芯片统一 AI 系统软件栈MiniCPM5-2B 已适配9 种不同的 AI 芯片并在 FlagOS 团队的 FlagRelease 平台上发布了多芯片版本覆盖 Nvidia、Hygon海光、Metax沐曦、Iluvatar天数智芯、Zhenwu真武、Mthreads摩尔线程、Kunlunxin昆仑芯、Ascend昇腾、ARM-v9 等厂商。在 Nvidia 上体验性能加速有两种途径从 FlagRelease 开始推荐FlagRelease 已内置相关软件包无需用户安装从零开始需要 Python 3.12、GLIBC 2.39、GLIBCXX 3.4.33、CXXABI 1.3.15 环境。安装 FlagGems 算子库后在 vLLM 推理源码中加入以下导入即可开启加速pip install flag-gems4.2.1rc0 pip install triton3.5.1import flag_gems flag_gems.enable(recordTrue, onceTrue, path/root/gems.txt)vllm serve ${model_path} \ --trust-remote-code \ --dtype bfloat16 \ --enforce-eager \ --port ${Port} \ --served-model-name ${model_name} \ --gpu-memory-utilization 0.85此外vllm-plugin-FL是基于 FlagOS 统一多芯片后端为 vLLM 构建的插件用于扩展 vLLM 在多种硬件环境下的功能与性能。局限性、开源协议与引用局限性声明本模型不具备自主意识或法律主体资格其输出仅为基于统计模式的文本生成结果可能不准确、有偏见或具冒犯性也可能被精心设计的提示词越狱操纵而产生不符合预期的内容。对政治、健康、金融、法律等敏感话题的回答未经专家审核不应视为专业建议。模型按现状提供不附带任何明示或默示担保使用者应仅将其用于合法、合规且符合伦理的目的自行配置必要的安全措施并按当地要求标识 AI 生成内容。开源协议MiniCPM 模型权重与相关代码依照 Apache-2.0 协议发布。引用方式article{minicpm4, title{Minicpm4: Ultra-efficient llms on end devices}, author{MiniCPM, Team}, journal{arXiv preprint arXiv:2506.07900}, year{2025} }小结什么时候选 MiniCPM5-2B综合以上分析MiniCPM5-2B 适合以下场景需要在端侧或资源受限环境部署、但又不愿牺牲推理与 Agent 能力的应用需要原生 131K 长上下文不依赖位置插值的文档级理解任务需要以 2B 体积与 4B 级模型竞争的代码、数学或工具调用工作流。仓库文件本身即是部署清单模型权重见 model-00000-of-00001.safetensors架构与超参见 config.json采样默认值见 generation_config.json对话与工具协议见 chat_template.jinja。按本文的 vLLM / SGLang / llama.cpp / Transformers 四套命令即可完成从服务端到端侧的快速部署。赞分享人工智能大模型基础模型【免费下载链接】MiniCPM5-2BMiniCPM5-2B 是一款面向端侧、本地部署和资源受限场景的 2B 稠密 Transformer能够达到同尺寸开源模型 SOTA 水平。项目地址https://ai.gitcode.com/OpenBMB/MiniCPM5-2B点击查看免费下载相关推荐MiniCPM5-2B 端侧大模型完整实战指南架构、RLOPD 训练配方与多框架部署微调MiniCPM5 2B 端侧大模型完整实战指南架构、RLOPD 训练配方与多框架部署微调 MiniCPM5 2B 是 OpenBMB 开源社区 MiniCP大模型本地部署模型量化微调LoRA工具调用openBMBAscend端侧部署 MiniCPM5-2B / MiniCPM5-1B基于 LiteRT-LM 的 .litertlm 单包跨端实战指南端侧部署 MiniCPM5 2B / MiniCPM5 1B基于 LiteRT LM 的 .litertlm 单包跨端实战指南 本篇指南完整讲解如何在 And大模型本地部署模型量化微调LoRA工具调用openBMBAscendMiniCPM5-2B 技术全解析稠密小模型架构、RLOPD 训练配方与端侧部署微调实战基于 OpenBMB/MiniCPM 开源仓库MiniCPM5 2B 技术全解析稠密小模型架构、RLOPD 训练配方与端侧部署微调实战基于 OpenBMB/MiniCPM 开源仓库 本篇技术指南以大模型本地部署模型量化微调LoRA工具调用openBMBAscend创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进