ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

【HCIA- AI(正课)】练习题和解析

【HCIA- AI(正课)】练习题和解析 判断题PyTorch、MindSpore等Al开发框架通常提供内置的数据处理功能用于数据采集、数据清洗、特征选择和归一化等操作。✅LSTM是改进版RNN。序列很长的时候RNN 记不住很早之前的信息。LSTM 专门解决原生 RNN长序列训练时的梯度消失问题擅长学习长距离的时序信息。原文要点PyTorchtorch.utils.data、torchvision.transforms 提供数据加载、清洗、归一化等预处理MindSporemindspore.dataset 数据集引擎内置数据变换、归一化、数据增强流水线。AI开发框架不只是搭建神经网络自带一整套数据处理能力。记忆方法框架自带数据预处理工具箱归一化、数据变换都是内置功能。LSTM的遗忘门决定了从细胞状态中丢弃哪些信息,丢弃弃的信息将其系数置为0,保留的信息系数置为1。❌原文要点LSTM 遗忘门通过 Sigmoid 激活函数输出 0 到 1 之间的数值是连续值不是只有 0 和 1。数值大小代表保留信息的比例不是单纯置 0 或置 1。记忆方法口诀遗忘门是软开关0 到 1 连续算不是非 0 即 1 硬判断区分硬开关只有 0/1LSTM 门控是 Sigmoid 输出小数代表保留程度。量化是一种模型压缩技术,可以减少模型存储占用和推理理延迟。✅原文要点模型量化是典型模型压缩技术降低参数精度减小模型存储空间加快推理速度降低推理延迟常用于端侧、昇腾硬件部署。记忆方法口诀量化降精度体积变小推理变快一句话记忆量化 压缩模型省空间、跑得快。RNN中不同时刻的权重参数是共享的。✅RNN 循环神经网络是专门处理序列数据的深度学习网络。序列数据就是有先后顺序的数据句子文字、语音波形、股票时间序列。普通神经网络每次输入独立RNN 自带记忆隐藏状态 hidden state处理当前输入的时候会带上前面时刻学到的信息。原文要点RNN 在序列不同时间步之间共享权重参数。权重共享让 RNN 参数量不会随序列长度增加而变大能够提取时序特征。记忆方法口诀RNN 时间步共用一套权重联想读一句话里每个字用同一个神经网络去处理不用单独给每个字单独造一个网络。容易混淆CNN 也有权重共享卷积核滑动RNN 是时序维度权重共享。5.MindSpore中构建神经网络类,需要继承nn.Module。❌原文要点MindSpore 中 Cell 是神经网络的基础单元自定义网络类需要继承 nn.CellPyTorch 才使用 nn.Module 作为网络基类。一句话区分PyTorch → 继承 nn.Module前向写 forward()MindSpore → 继承 nn.Cell前向写construct()使用MindSpore构建神经网络时,应继承Module类,并重写_init一方法与forward方法。❌K-折交叉验证中,k一般大干等干2.实际操作时一般从3开始取,只有在原始数据集合数据量小的时候才会尝试取2。❌数据集很小的时候不能用 k2小数据集反而应该取更大的 k比如留一法 LOOk 等于样本总数L1正则化添加的成本与权重系数的平方成正比。❌原文要点L1 正则化在损失函数中增加权重绝对值的惩罚项可以产生稀疏权重实现特征选择L2 正则增加权重平方的惩罚项使权重趋向变小不会产生稀疏权重。记忆口诀L1 绝对值L2 平方值L1 能稀疏L2 缩权重。多层感知机具备非线性分类的能力,这种能力来自类似f(x)ax这样的激活函数和多层网络结构。❌(f(x)ax) 是线性函数一次函数。原文要点多层网络如果全部采用线性激活函数则多层网络可以化简为单层线性变换不具备非线性表达能力。多层感知机的非线性拟合能力来源于非线性激活函数而不是线性函数。多层结构配合非线性激活才能学习复杂非线性边界。记忆口诀线性激活叠多层仍然只是线性模型非线性激活加多层才有非线性分类能力。MindSpore中的损失函数可以分为内置的损失函数和自定义损失函数数,其中自定义损失函数需要通过继承nn.Cell或者nn.LossBase来实现。✅原文要点MindSpore 提供多种内置损失函数同时支持自定义损失函数。自定义损失函数既可以继承基础网络基类nn.Cell也可以继承损失专用基类nn.LossBase并重写construct方法实现损失计算逻辑。记忆口诀损失两类内置、自定义自定义二选一继承 Cell 或者 LossBase。K折交叉验证是指将训练集划分成K-1个子数据集。❌原文要点K 折交叉验证将原始数据集划分为 K 个互不相交的子集。每次选取其中 1 个子集作为验证集其余 K-1 个子集作为训练集迭代K 次取平均评估结果。数据集总共划分成 K 份不是 K-1 份。记忆口诀K 折就是切成 K 块每次留 1 块做验证剩下 K-1 块训练。Dropout会在训练过程中,随机丢弃大部分神经元,此时丢弃部分对应的参数不会更新。✅原文要点Dropout 是深度学习中防止过拟合的正则化手段。仅在训练阶段生效随机屏蔽部分神经元本轮被屏蔽神经元不参与前向与反向计算对应参数本轮不更新。测试阶段所有神经元全部激活循环神经网络可以捕捉序列化数据中的动态信息,t-1时刻前的每一时刻信息对下一时刻信息同等重要。❌RNN循环神经网络能够处理序列数据把前面时刻的信息传递到后面。但是前面所有时刻的信息并不是同等重要距离当前时刻越近的信息影响通常更大久远的历史信息会随着时间步不断衰减RNN 长期依赖问题梯度消失。原文要点循环神经网络 RNN 适合处理序列数据可以保存历史时序信息。但 RNN 存在梯度消失问题较早时刻的信息会不断衰减不同时刻的信息对下一时刻的贡献并不相同。记忆口诀RNN 记序列远近不一样近的影响大远的会遗忘信息不同权不是同等强。John想要将TensorFlow框架训练的模型迁移到PyTorch中,他可以火将模型保存为ONNX格式。✅ONNXOpen Neural Network Exchange开放神经网络交换是跨框架的模型中间格式。原文要点ONNX 是一种通用模型文件格式支持在不同深度学习框架之间转换模型。TensorFlow、PyTorch、PaddlePaddle 等主流框架都支持导出 / 导入 ONNX用于模型跨框架迁移。MindlE是华为推出的一个部署框架,底层可以对接PyTorch和MindSpore。✅MindIE昇腾推理引擎华为昇腾的高性能推理部署框架原文要点MindIE 是华为昇腾推出的推理部署框架提供多框架适配能力可对接 MindSpore 和 PyTorch 模型在昇腾硬件上实现统一高性能推理。屏思MindSpore是一个全场景深度学习框架,提供了MindAKG用于算子优化,提升框架执行性能。✅MindSpore昇思是华为推出的端边云全场景深度学习框架。MindAKGMindSpore AKG是 MindSpore 配套的算子编译器负责算子自动生成与优化挖掘硬件算力提升框架执行性能。深度学习中前向传播和反向传播,都依赖于矩阵运算,所以在AI开发框架中矩阵为基础数据结构。✅损失函数与激活函数是一类函数。❌原文要点激活函数用于给网络引入非线性损失函数用于评估预测值与真实标签的误差二者功能不同不是同一类函数。John在实现图像分割模型时,为了增加开发效率使用了动态图的形式开发。在部署时为了提升执行效率,应该使用静态图模式进行部署。✅原文要点动态图便于调试开发静态图预先完成计算图编译优化执行效率更高适合模型部署场景。记忆口诀动态图好调试开发写代码静态图先编译部署速度佳。当问题的解决方案很复杂,或者问题可能涉及到大量的数据却没有明确的数据分布函数时,比较适合使用机器学习方法。✅原文要点传统程序依赖人工定义规则与数据分布机器学习适合规则复杂、数据量大、难以得到明确数据分布函数的场景从数据中自动学习规律。数据样本不平衡问题是指数据集中存在矛盾的、有差异的记录是。❌在Self-Attention计算过程中,Query、Key和Value都是由输入序存列通过不同的线性变换得到的。✅CPU不适合做Al计算的原因是因为单个算术逻辑单元的算力较弱,而NPU和GPU的较强。❌不是 CPU 单个计算单元弱而是CPU 计算单元数量太少并行能力差。卷积神经网络中的卷积层可以实现参数共享减少网络参数。参数共享是指在同一层中使用的全部卷积核参数一致不同层使用的卷积核参数是不同的。❌卷积神经网络中,卷积核的大小通常为奇数。✅Seq2Seq 模型常用于机器翻译、文本摘要等序列生成任务。✅ReLU激活函数在x0时导数为1,可缓解梯度消失问题。✅随机森林是一种集成学习算法通过多个决策树的投票得到最终结果。✅DeepSeek-R1 是特定领域大语言模型的 AI仅能完成语言相关任务属于弱人工智能专注单一任务强 / 通用 / 超人人工智能目前尚未实现。❌“仅能完成语言相关任务” 这句话不对。Atlas系列产品覆盖训练、推理场景,服务器、边缘计算、加速模块等产品形态。✅关于机器学习算法的理性认识其本质就是得到一个输出使得输出与真实结果尽可能的接近。✅使用mindspore.nn.Conv2d (1,3,5, has_biasFalse, weight_init‘normal’)接口,可以创建输入通道数为1、输出的通道数为5、卷积核大小为3*3、使用normal算子初始化参数的卷积层。错单层感知机无法解决 XOR 问题成为了阻碍深度学习发展的一个重要原因。✅XOR异或是一个二输入逻辑运算两个输入不一样 → 输出 1两个输入一样 → 输出 0AIGC 会对殡葬业增加连接设计。❌对于 AI 业务应用来说训练环节不会对模型进行压缩而推理部署环节则需要。❌原文模型压缩分为训练阶段压缩与训练后推理部署前压缩。训练阶段可采用量化感知训练、训练剪枝、知识蒸馏等方式完成模型轻量化推理部署阶段也可以做训练后量化、剪枝。因此模型压缩并非只存在推理部署环节。RNN 跟前馈神经网络最大的区别在于每次都会将前一时刻的计算结果带到下一时刻的隐藏层中一起训练。前馈神经网络FNN多层感知机MLP、卷积神经网络CNN信息单向流动输入层 → 隐藏层 → 输出层。信号只向前传不会回头、不会把上一轮结果存下来传给下一组输入没有循环回路。无记忆RNN 循环网络有记忆把前一时刻隐藏状态传给下一时刻Softmax 回归是逻辑回归的一般化只适用于二分类的问题。❌原文Softmax 回归是逻辑回归的一般化推广。逻辑回归解决二分类问题Softmax 回归适用于多分类任务可以输出各个类别的概率分布。都属于分类算法用于算出样本属于各个类别的概率。特征选择过滤法的局限性过滤方法倾向于选择冗余的变量因为它们没有考虑特征之间的关系。✅昇腾 AI 处理器中 AI Core 控制单元包含标量指令处理队列和向量指令处理队列。✅tanh 激活函数输出关于 0 点对称相比于 Sigmoid 函数可以加快模型的收敛。✅张量无法进行加减乘等算术运算。❌为防止过拟合在训练过程中可以插入验证集数据的测试。当发现验证集数据的 Loss 上升时提前停止训练。✅Self-Attention 和 RNN 功能类似可以处理时序相关问题同时它们计算时的并行度相对都不高。❌CANN 中提供了 DVPP 和 AIPP前者使用昇腾 AI 处理器中的 DVPP 模块对图像进行处理后者使用 AICore 对图像进行处理。✅朴素贝叶斯算法假设样本特征之间相互独立且对于样本缺失值较为敏感。❌朴素贝叶斯是概率分类算法机器学习是深度学习的一部分人工智能也是深度学习的一部分。❌Sigmoid、tanh 和 Softsign 这些激活函数在网络层数加深时都不能避免梯度消失的问题。✅数据降维的目的是减少数据量增加模型的准确度。❌SVM、k-NN 和 k-means 都属于非参数模型。❌原文参数模型拥有固定数量的模型参数非参数模型参数数量会随训练样本数量变化。k-NN、核 SVM属于非参数模型k-means、线性回归属于参数模型。昇腾 AI 处理器只提供了 DDR 接口可以外接 DDR4 内存。❌这句话错误关键点在“只提供 DDR 接口”。AscendCL 可以基于第三方框架开发推理类应用但是需要通过 ATC 工具先对模型进行转换。✅AI 芯片会针对矩阵运算做加速设计。✅当前 AI 开发框架动态计算图和静态计算图语法兼容可以直接进行相互转换。❌前馈神经网络接收前一层的输出并输出给下一层。采用一种单向多层结构每一层包含若干个神经元同一层的神经元之间没有互相连接层间信息的传送只沿一个方向进行。✅异常数据在模型训练过程中不需要删除,大量的异常数据可以提升升模型的泛化能力。❌John 在使用 PyTorch 框架实现 AI 模型训练时他应该先通过 set_context 设置模型训练相关参数如设备 ID、计算图模式等。❌理论上训练时的精度会随着模型复杂度的上升和训练时间的增加不断减小。❌与 FPGA 相比相同工艺下基于 ASIC 的 AI 芯片功耗更大因此不适合用于手机等终端设备上。❌CPU 可以通过提高频率的方式提升 AI 计算性能。✅CPU 主频代表单位时间能执行指令的次数。提高 CPU 频率单位时间内可以完成更多运算因此 AI 计算性能会得到提升。AI 开发框架的功能是对开发者提供网络模型接口模型训练过程中的前向传播和反向传播需要开发者自己完成。❌MoE 是一种混合专家模型这种方案可以有效增强模型的容量和能力同时在推理时能够动态决定哪些专家模型工作。✅Self-Attention 机制无法捕捉到序列的位置信息因此在 Transformer 模型中需要添加位置编码。✅在随机森林中基学习器所使用的特征衡量指标需要是基尼系数。❌原文随机森林基学习器为决策树分类时可选用基尼系数或者信息熵回归使用方差并非必须使用基尼系数。DeepSeek V3 是一个基于 GPT 结构的多模态模型较 V2 版本相比其训练成本和推理速度都有很大的提升。❌多选题单选题
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进