ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

阿里云大模型ACP认证模拟卷(一)精解:RAG、微调与推理部署核心考点

阿里云大模型ACP认证模拟卷(一)精解:RAG、微调与推理部署核心考点 阿里云大模型ACP认证最近在技术社区里的热度起来得非常快身边搞算法、做云原生、甚至从前端转到AI应用层的朋友都在问同一个问题这个证到底考什么怎么复习才有效率。我第一次翻这类模拟题时也有点懵项目做了不少但真要落到卷面上很多概念还是会晃人一下。这篇文章是一套按真实考试重难点整理的模拟卷一核心覆盖模型原理、RAG检索增强、微调训练、推理部署和评测这五块主干内容。每条题目不只给答案我会把每个选项为什么对、为什么错都拆开讲清楚。已经报名的同学可以直接拿来摸底还没报但准备进入大模型工程方向的朋友也能靠它检查自己的知识盲区。1. 阿里云大模型ACP认证的考察边界考什么、为什么值得考1.1 证书定位与适用人群阿里云大模型ACP认证面向的是“能上手干活”的工程型人才不是纯理论考核。它的定位更接近大模型应用工程师、AI平台开发者和云上模型服务运维人员。换句话说你不仅需要知道Transformer和注意力机制是怎么回事更要能回答“在云平台上怎么把一个大模型用起来”“知识库为什么召回不准”“GPU显存不够怎么办”“效果评估到底看哪些指标”这类落地场景问题。适合考这个证书的人大概有三类做企业级AI应用开发的工程师日常需要调用模型API、搭建RAG流程想系统梳理一遍知识体系算法工程师或数据分析师研究方向偏模型训练但对云上部署、服务化部分不够熟运维和平台工程师想了解大模型上云后的资源规划、推理优化、安全合规等问题。如果你只是刚看过几篇大模型科普文章建议先补一点基础概念再来刷这套题否则有些术语会成为阅读理解瓶颈。1.2 从真实考点倒推出来的六个知识域我把手头能接触到的公开大纲、样题以及社区里考过同学的反馈做了交叉比对发现考点高度集中在以下六个方向知识域核心内容常见考查形式大模型基础Transformer结构、Tokenizer、上下文窗口、温度与采样参数单选、判断Prompt工程角色设定、Few-shot、思维链、结构化输出约束单选、实操案例RAG与知识库文档解析、切片、向量化、召回、重排、查询改写单选、多选、案例微调训练全参微调、LoRA、数据清洗、训练策略、过拟合单选、多选推理部署GPU选型、显存估算、vLLM、Batch推理、性能调优单选、案例评测与安全自动化指标、人工评测、幻觉治理、内容安全单选、案例从权重上看RAG和知识库相关题目出现频率最高其次是微调和推理部署。这三块既是实际工作的核心也是考试里最容易拉开分差的地方。后面每套模拟题我都会围绕这个权重来安排题量。2. 模拟卷一选择题与判断题精解2.1 作答节奏与审题要点正式考试的题量不算少时间压力主要来自案例分析题。我的建议是选择题控制在每题一分钟左右遇到卡壳的题目先标记不要恋战。尤其是包含“不正确”“不包括”“最不可能”这类否定词的题一定要圈出来很多人丢分不是不会而是看题太快。下面这套选择题是我按真题风格设计的难度略高于平均水平这样模拟出来的成绩更有参考价值。先自己做一遍再看解析别直接滑到答案区。2.2 大模型基础认知题第1题单选关于大模型文本生成时的解码策略下列说法正确的是A. temperature参数设置得越高生成结果越稳定适合信息抽取类任务B. top_p参数的作用是控制生成序列的最大长度C. temperature和top_p可以在同一次推理中联合调整共同影响采样结果D. 只要把temperature降到0模型就一定不会产生幻觉解析答案是C。temperature的本质是对模型输出的概率分布做“软化”或“锐化”数值越低分布越尖锐采样时更容易选中高概率词结果更稳定数值越高分布越平滑采样更随机多样。A把“越高越稳定”说反了。top_p也叫核采样它会在每一步从累积概率达到p的最小词集合里采样管的是候选范围而不是序列长度。长度由max_tokens这类参数负责B是典型的概念错位。D也错幻觉问题不是单纯靠降低temperature能解决的它涉及训练数据质量、检索增强、系统提示词等多方面因素。这类题在卷子里出现频率不低考的就是参数语义的精确理解。我的建议是把每个采样参数当成一个“旋钮”去记temperature管随机性top_p管候选池max_tokens管长度stop管终止条件。第2题单选当你需要判断一个模型是否具备处理超长文档如几万字合同的能力时最应该关注的模型属性是A. 模型参数量B. 上下文窗口长度C. 词表大小D. 训练Batch的大小解析答案是B。上下文窗口长度决定了模型一次能“看到”的token数量。即使模型有几千亿参数如果上下文窗口只有2K那几万字的合同也只能切片分段处理。参数量影响的是模型的知识容量和复杂模式拟合能力词表大小影响编码效率训练Batch大小是训练期概念和推理时能读多长文档没有直接关系。这道题看起来很基础但实际在工作中特别容易踩坑。很多人选完模型才发现上下文不够用然后又去临时改RAG切片逻辑。考试里如果出现类似场景题先找“长文本”“全文”“多长文档”这些短语基本就是在考上下文窗口。第3题判断大模型训练完成后模型内部的参数仍然会在推理过程中继续更新。解析错误。推理阶段模型参数是冻结的前向传播计算完输出就结束不会反向传播更新权重。只有训练和微调阶段才会更新参数。2.3 RAG检索增强题第4题单选在一个基于知识库的问答系统中用户反馈部分细节问题“总是答不到点上”你需要优先排查的方向是A. 向量化模型的Embedding维度是否足够高B. 文档切片粒度和召回策略是否匹配查询场景C. 大模型本身是否支持中文D. 知识库总文档数是否超过10万篇解析答案是B。“答不到点上”这个现象绝大多数情况下是检索环节出了问题文档切得太碎关键信息被拆散向量检索找不到完整语义或者切得太大一块文本里混了好几个主题embedding向量被“平均化”召回结果不够精确。高维Embedding不一定能解决语义覆盖问题模型不支持中文这种选项在现代主流模型里已经不太可能出现。文档总数多有时候反而要通过更好的索引策略去处理但它不是直接原因。这题背后是RAG链路的一个核心矛盾切分粒度和语义完整性之间的权衡。考试里RAG题基本都围绕这条链来出后面案例部分我会展开讲。第5题多选当用户以自然语言提问且查询条件比较复杂时以下哪些方式可以有效提升检索召回质量A. 先对用户查询做改写或拆解将复杂问题拆成多个子查询B. 对初次召回的候选文档使用Rerank模型重新排序C. 同时使用向量检索和关键词检索再做结果融合D. 把所有文档全部拼接进Prompt让大模型自行判断哪些内容相关解析答案是ABC。A是现在RAG系统里的标准做法用户的原始query往往口语化、指代不明模型先把它改写成更适合检索的表达能明显提升召回率。B说的是二阶排序向量检索先粗排Rerank再用交叉编码器精排精度更高但计算量大所以一般只用在top 20到top 50的重排阶段。C指混合检索关键词检索能抓住精确术语向量检索能抓住语义相似两者互补。D看起来简单粗暴实际不可行上下文窗口有上限文档量大时必然溢出而且无关内容多了反而会稀释模型注意力干扰回答质量。多选在ACP考试里是失分重灾区原因是少选多选都不得分。这类题想拿分只能靠对技术方案的完整理解死记选项没有用。2.4 微调训练题第6题单选你准备用一份只有几千条数据的中小型业务数据集对一个大模型做微调已知算力资源有限以下哪种方案最合理A. 对模型所有参数进行全量微调B. 使用LoRA等参数高效微调方法只训练低秩适配器C. 不训练模型只修改模型的Tokenizer词表D. 扩大词表后重新从零预训练模型解析答案是B。LoRA通过在原始权重旁边增加低秩矩阵来近似参数更新训练时原始权重冻结显存占用和训练时间都大幅降低尤其适合算力有限、数据量不大的场景。全量微调在几千条数据上非常容易过拟合而且7B以上的模型做全参微调需要多名显卡支撑很多团队不具备这个条件。C和D都是改词表类操作词表通常只在预训练阶段确定从零预训练的成本在这四个选项里最高。这里我多提醒一句LoRA的秩rank选择也很关键。秩太小模型学不到复杂模式秩太大训练参数量增加收益却不明显。考试一般不考到这么细但实际项目里这个参数值得花时间调。第7题多选对于一份用于微调的训练数据清洗和质量控制阶段通常需要做哪些事情A. 去除包含明显事实错误或互相矛盾的样本B. 处理超长样本统一截断或过滤极端长度内容C. 检查是否存在标签泄露即输入中包含答案信息D. 把所有文本统一改成大写保证格式整齐解析答案是ABC。数据质量直接决定微调效果这是考试重点。A是常识脏数据进了训练集模型学到的就是噪声。B涉及训练效率问题超长样本会拉长单步训练时间还可能超出模型上下文限制。C很隐蔽比如构造问答对时把答案写进了系统提示词里模型根本不用学推理只跟着读答案就行这种数据必须是审查重点。D是错误的大模型有自己稳定的词表统一大小写反而破坏原始语义中文场景更是完全没必要。2.5 推理部署题第8题单选生产环境中大模型推理响应越来越慢在GPU显存条件不变的情况下优先级最高的优化手段是A. 增加Batch SizeB. 使用vLLM这类推理框架启用Continuous Batching和PagedAttentionC. 换一个参数量更大的模型D. 将max_tokens设置为无限大解析答案是B。vLLM的Continuous Batching能做到一个微批次请求结束就立刻有新的请求进入计算而不是像传统方式那样等整批结束流式场景下吞吐提升非常明显。PagedAttention则是借鉴操作系统虚拟内存的思路管理KV Cache减少显存碎片允许更高并发。A和B目的一样都是提高吞吐但单靠调大Batch可能把显存打爆。C反向优化模型更大只会更慢。D把限制去掉会导致生成长度失控进一步拖慢响应。这类部署优化题越来越常出现在案例题里因为现阶段大模型上云的第一诉求就是“怎么把服务跑稳跑省”。考试复习时建议把vLLM、TGI、TensorRT-LLM这几种推理框架的优化原理都过一遍重点记它们的核心机制。3. 模拟卷一案例分析与实践操作题详解3.1 案例A基于百炼平台构建企业知识库问答系统背景某企业准备把上百份产品文档、运维手册和客服话术放在一起做一个内部知识问答助手。文档格式包括PDF、Word、Markdown里面有大量表格、代码片段和产品名词缩写。用户提问方式口语化经常会出现“登录不了怎么办”“怎么改密码”这类模糊表达。问题1在文档预处理和切片阶段为了减少表格内容在向量化后的信息丢失正确的做法是什么参考答案把PDF等非结构化文档先转换成结构化文本表格部分按行列关系进行格式化保留对代码片段做单独的语言类型标记切片策略上不要使用统一的固定长度而是结合文档原有标题结构做层级切分先按一级目录划分大块再根据段落语义切成小块每个切片保留所属章节的上下文信息。表格是文档问答里常见的“重灾区”。表格内容一旦被当作普通文本拉平行列对应关系就丢失了比如“价格”和“规格”这两列本来一一对应拉平后向量检索很难还原这个问题。实际处理时我会把表格转成带标记的文本块或者用专门的结构化解析工具抽取后再单独建索引。这个细节在考试案例题里经常隐藏得很深。问题2用户提问“我们部门的账号最近突然收不到验证码了怎么处理”知识库召回结果不理想请写出优化思路。参考答案增加查询改写模块把原问题拆分成“账号收不到验证码”“验证码未收到”“短信通道异常”等多个子查询使用混合检索让关键词精确匹配“验证码”这类专有词同时向量检索负责语义扩展对召回结果做Rerank重排把真正包含解决步骤的文档提到前面最终把重排后的top内容交给大模型生成答案并保留引用来源。这个问题在考试中的得分点是“链路完整性”只写改动写不写重排会丢一半分。真实项目里查询改写和Rerank是RAG效果提升最明显的两个环节优先级都不低。3.2 案例BGPU资源选型与推理服务部署背景需要部署一个约70亿参数的模型权重用FP16存储面向内部50个并发用户的问答场景单条请求平均输入约1000 token输出约500 token。问题1请估算单卡显存的基本需求并说明部署选型思路。参考答案70亿参数乘以2字节模型权重本身需要约14GB显存。推理过程中还要为每条并发请求分配KV Cache和中间激活值50个并发下预留6GB到10GB比较稳妥。因此单张24GB显存的推理优化型GPU可以承载该服务如果并发进一步扩大或输出长度增长就需要横向扩展到两张卡配合张量并行把权重切分到多卡上。不能只按“14GB模型权重”来选卡还得预留padding、beam search或多个采样候选的开销。实际选型时我习惯多留20%到30%的显存余量。大模型服务的流量曲线很难预测产品上线前和上线后两三个月的token消耗量可能翻倍与其后面频繁迁移不如第一次就留足空间。问题2上线后发现GPU利用率不稳定白天高峰期响应平均8秒夜间空闲时只有2秒从成本角度给出两种优化策略。参考答案策略一是部署弹性伸缩的Serverless推理服务只在高并发时间段扩容GPU实例低峰期缩容到较小规格或置零按实际调用付费策略二是在推理框架中开启动态Batch和流式输出把并发请求尽量合并计算提高单卡吞吐减少GPU实例数量。两种方式可以叠加使用。这个案例题在卷面上可能以“资源配置不合理”的形式出现实际考察的是对弹性计算、按量付费、推理吞吐这组概念的理解。单纯答“加几张卡”拿不到高分必须带上成本意识。3.3 案例C生成效果评测与安全治理背景模型微调完成后需要上线前做效果验收。评测数据包括1000条用户真实问题以及对应的标准答案。问题1请设计一套同时包含自动指标和人工评分的评测方案。参考答案自动指标层面生成类任务用ROUGE、BLEU等文本相似度指标做初筛检索类任务用RecallK、MRR评估召回质量同时设置一组可量化的“能力维度”指标包括准确性、完整性、有害内容拒答率。人工评分层面采用双人独立打分加仲裁机制按“回答是否正确”“是否引用过时或不存在的信息”“是否符合安全规范”三个维度打分。自动指标和人工评分结果交叉对比既能发现极端差样本也能校准自动指标的偏差。RAG场景里还要单独测“无答案问题”的处理能力知识库里没有答案时模型应该明确说不知道而不是编造。这个点经常在考试评测题里出现属于幻觉治理的重要部分。问题2评测中发现模型会对部分包含个人隐私的提问进行真实输出应如何处理参考答案在输入侧增加敏感信息识别与脱敏模块对手机号、身份证号、地址等实体做Mask或拦截在输出侧叠加内容安全审核对模型生成结果做实时过滤和二次校验同时在系统提示词中明确隐私保护策略引导模型拒绝回答与个人隐私相关的越权查询。安全合规和内容审核往往是很多工程师忽略的考点但正式考试里占了不少比例。尤其涉及知识库问答场景用户上传的企业文档里可能包含敏感信息必须做权限控制和隔离。这个意识要在复习阶段就建立起来不要等上考场才临时补。4. 高频失分点复盘错题中的常见误区与纠正4.1 模型能力与提示词混淆第一类高频错题是把模型能力不足的问题全部归结为提示词写得不好。我见过考生在案例分析里回答“用户问题答错了就换一个更长的提示词”这个思路在概念上是错的。提示词确实能约束输出格式、引导回答风格、提供少量示例但它不能凭空补足模型缺失的知识也不能修复训练数据带来的偏见。考试遇到“模型回答错误”的场景先判断错误类型如果是知识过期或不在训练范围内优先考虑加RAG或者重新微调如果是理解偏差优先改查询改写和上下文组织如果只是格式不对才应该调整系统提示词。按这个顺序去作答案例分析题基本不会跑偏。4.2 平台资源与模型服务口径不清阿里云相关的题目有一个特殊性它会把产品能力混在通用模型知识里考。比如百炼平台、ModelScope魔搭社区这些工具的使用场景和一些纯算法概念并列在一起基础不扎实的人容易搞混。我总结的规律是凡是涉及“如何快速调用一个模型API”优先考虑平台托管模型服务和SDK方式而不是先买GPU自己部署只有微调和私有化部署才需要申请GPU资源。这种选型题的考点不在“会不会调用”而在“什么时候该用平台什么时候该自建”。把平台能力边界搞清楚这类题目就能拿稳。4.3 训练参数与推理参数的张冠李戴这是最容易扣分的一类概念题。学习率、epoch、warmup、batch size属于训练阶段temperature、top_p、max_tokens、stop属于推理阶段。我见过有同学在回答推理服务调优时写“降低学习率”这明显是把训练参数搬到推理场景里属于概念硬伤。为方便记忆我自己整理了一张速查分类阶段参数/手段作用训练/微调学习率Learning Rate控制参数更新步长训练/微调epoch、warmup控制训练轮次和预热策略训练/微调LoRA Rank、Target Modules控制微调范围和复杂度推理temperature、top_p控制生成随机性与候选范围推理max_tokens、stop控制生成长度和终止条件推理Continuous Batching、PagedAttention提高吞吐减少显存碎片这章表格建议直接保存一份考前多扫几遍比临时刷十道题都管用。4.4 案例题只写结论不写推导案例题最常见的失分原因不是答案错误而是过程缺失。比如问题问“为什么知识库检索准确率低”有人只写“切片有问题”但没有说清楚是切大了还是切小了、影响的是哪一步、怎么验证和调整。阅卷视角很容易给这种答案判半对。我的答题模板是先说现象归因再给排查路径最后给验证方式。还拿切片举例可以答“先查看召回结果中切片文本的长度分布如果大量切片超过模型上下文一半推测是切得太大然后对比不同chunk_size下的召回效果选择准确率最高的参数”。考试不是写论文但必须让阅卷人看出你真的理解排查过程而不只是背过答案。5. 模拟卷一考后复盘正确率与冲刺策略5.1 如何计算当前水平这套模拟题做完之后我建议按下面的标准给自己定位正确率在80%以上基础比较扎实接下来多做案例题和实操题巩固正确率在60%到80%存在明显知识漏洞优先看错题集中在哪一章正确率低于60%别急着继续刷题先把RAG、微调、推理部署这三块的原理性内容重新过一遍。错题整理不要只标一个正确答案了事。我个人的习惯是每道错题旁边写三行错误选项为什么错、正确选项为什么对、这个知识点在项目里对应什么场景。写完之后再去做下一套模拟效果比盲目重复刷题好得多。5.2 从模拟到考场的三种复习动作第一把模拟卷里出现的所有平台类术语过一遍确保每个名词都知道它是什么、解决什么问题、和周边产品的边界在哪里。第二亲手跑通一个最小的RAG项目哪怕只是本地读取几十个文本文件做一遍切片、向量化、检索、生成全流程印象会非常深刻。第三列一个“一句话解释”清单用一句话解释LoRA、用一句话解释向量检索、用一句话解释连续批处理。如果写不出来说明理解还不够透彻需要回去补。5.3 下一套模拟的准备方向按照考点的出题权重下一套模拟我会把重点放在两个方向一个是更复杂的RAG场景包括多轮对话中如何维持检索上下文、私有化部署时知识库如何做权限隔离另一个是微调与评测的交叉题比如如何通过评测指标判断一次LoRA微调是否成功以及微调之后如何在测试集上避免“记忆”带来的虚高分数。这两个方向也是真实项目里最容易反复修改的部分值得用整套卷子的篇幅来拆。我个人考证的真实体会是刷题只能帮你发现漏洞真正让分数提升的是每个错题背后那一段亲手验证过的工程实践。如果时间允许尽量在考试前自己做一次模型微调、部署一轮推理服务、搭一个带知识库的问答应用。做完这三件事再回头看模拟题你会发现很多题目从“记忆题”变成了“常识题”。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进