
机器学习常见的指标及其解释机器学习中的评估指标种类繁多没有“万能指标”选择完全取决于你所解决的任务类型分类、回归、聚类、排序等以及业务关注的重点。一、回归任务预测连续数值这类任务评估的是“预测值”与“真实值”之间的偏差程度。指标英文全称计算公式/含义核心特点与适用场景MAE平均绝对误差1n∑∣yi−y^i∣\frac{1}{n}\sum|y_i - \hat{y}_i|n1∑∣yi−y^i∣直观表示平均差多少。对异常值不敏感适合业务解释如房价预测。MSE均方误差1n∑(yi−y^i)2\frac{1}{n}\sum(y_i - \hat{y}_i)^2n1∑(yi−y^i)2放大较大误差对异常值非常敏感。常用于优化目标梯度更平滑。RMSE均方根误差MSE\sqrt{MSE}MSE量纲与原始数据一致比MSE更直观。对异常值敏感不适合含大量离群点的数据。MAPE平均绝对百分比误差100%n∑∣yi−y^iyi∣\frac{100\%}{n}\sum|\frac{y_i - \hat{y}_i}{y_i}|n100%∑∣yiyi−y^i∣相对百分比直观易懂适合不同尺度数据的对比如销量预测。⚠️致命弱点真实值为0时无意义且实际值很小时会异常放大。SMAPE对称平均绝对百分比误差改进版MAPE分母取$(y_i| |\hat{y}_i|)/2$R² (决定系数)Coefficient of Determination1−SSresSStot1 - \frac{SS_{res}}{SS_{tot}}1−SStotSSres模型解释力取值(-∞, 1]。衡量模型比简单均值好多少。负值说明模型还不如直接取平均值。二、分类任务预测离散标签这是机器学习最庞大的评估体系包含二分类、多分类和特殊的不平衡分类场景。1. 基础指标基于混淆矩阵指标核心公式通俗理解适用场景准确率 (Accuracy)(TPTN)/Total整体猜对的比例适合各类别样本数量大致均衡的场景如手写数字识别。精确率 (Precision)TP/(TPFP)“宁缺毋滥”预测为正例的样本中有多少是真正的正例。垃圾邮件过滤宁愿漏掉不愿误把正常邮件放垃圾箱。召回率 (Recall)TP/(TPFN)“宁可错杀一千”所有真实正例中有多少被成功找出来。疾病筛查、金融风控漏掉一个病人的后果比误判严重。F1-Score(2 * (P * R) / (P R))精确率和召回率的调和平均。需要同时兼顾P和R且数据存在不均衡时如信用卡欺诈。2. 高级指标不均衡数据专用AUC-ROC衡量模型对正负样本排序能力的阈值无关指标。AUC0.5相当于随机猜越接近1越好。它对正负样本比例不敏感是不均衡分类的首选标准。AUC-PR (PR曲线下面积)当负例极多正例极少时PR曲线比ROC曲线更能反映模型表现因为ROC可能因TN多而虚高。三、聚类任务无监督无标签评估聚类效果通常分为内部评估无需真实标签和外部评估需要真实标签。指标适用类型核心逻辑轮廓系数 (Silhouette Score)内部评估最常用综合衡量簇内紧密内聚度和簇间分离分离度取值[-1, 1]越大越好。戴维斯-布尔丁指数 (DBI)内部评估衡量簇内距离与簇间距离之比越小代表聚类效果越好。调整兰德指数 (ARI)外部评估需真实标签衡量两个数据划分的相似程度已校正随机性取值[-1, 1]。互信息 (NMI)外部评估衡量真实标签与聚类标签的共享信息量取值[0, 1]越大越好。四、排序与推荐系统Top-K场景评估模型返回的前K个结果的优劣。指标核心含义适用场景NDCGK归一化折损累计增益考虑排序位置的顺序权重排名越靠前权重越大。搜索引擎、电商推荐用户更关心首页前几名的结果。MRR平均倒数排名关注第一个正确答案出现的位置。问答系统、导航查询只关心最匹配的那一个。Hit Rate (RecallK)前K个推荐结果中是否包含了用户真实喜欢的物品。粗略评估推荐系统的命中覆盖能力。五、生成式AI / 大语言模型文本生成这类任务有独特的评估方式但也是争议最大的。指标核心逻辑缺点困惑度 (Perplexity)衡量模型对测试数据预测概率的倒数越低代表模型越不“困惑”。只反映模型自信度与生成文本的实际质量通顺、逻辑关联不大。BLEU衡量生成文本与参考译文之间的N-gram精确匹配侧重精确率。惩罚短句不擅长同义词识别只适合机器翻译。ROUGE衡量生成文本与参考文本的N-gram重叠率侧重召回率。主要用于文本摘要评估。BERTScore / GPTScore利用BERT/GPT等预训练模型计算语义向量相似度。算力消耗大但比BLEU更能捕捉语义最新趋势。 如何快速做出选择决策树业务是预测具体数值→ 选MAE易解释或RMSE放大错误若需要百分比看MAPE确保Y没有0。业务是分类且类别均衡→准确率足够但建议附带混淆矩阵。业务是分类且正负样本极度不均如欺诈、癌症→ 舍弃准确率紧盯召回率Recall和AUC-ROC或使用F1。业务是推荐/搜索→ 关注NDCGK和Hit RateK。业务是无监督聚类→ 首选轮廓系数。