
03 类别不平衡下如何选择评估指标Accuracy 为什么会失效在现实数据中类别经常并不平衡。例如信用卡欺诈 正常交易 99.9% 欺诈交易 0.1% 设备故障 正常状态 99% 故障状态 1% 罕见病筛查 健康人 99.5% 患者 0.5%这类问题被称为Imbalanced Classification 类别不平衡分类此时单纯使用 Accuracy 往往非常危险。一、一个 Accuracy 99% 的“垃圾模型”假设总样本10000 正常样本9900 异常样本100现在构造一个最简单的模型永远预测 Normal那么TN 9900 FN 100 TP 0 FP 0Accuracy 为Accuracy9900100000.99Accuracy\frac{9900}{10000}0.99Accuracy1000099000.99也就是99%但是这个模型一个异常都没有发现因此Recall001000Recall\frac{0}{0100}0Recall010000这说明在严重类别不平衡的数据中高 Accuracy 可能完全没有意义。二、选择指标的核心不是“哪个指标最好”真正的问题应该是哪一种错误更加不能接受对于二分类模型最重要的两种错误是FP FN因此指标选择应该从错误代价开始。三、什么时候更加关注 RecallRecall 为RecallTPTPFNRecall\frac{TP}{TPFN}RecallTPFNTP如果 FN 的代价非常高就应该更加关注 Recall。例如癌症筛查 危险设备故障 欺诈交易初筛 安全风险检测 火灾报警在癌症筛查中FN 患者有病但模型认为没病这可能比FP 健康人被建议进一步检查更加严重。因此通常希望FN 尽可能少 Recall 尽可能高四、什么时候更加关注 PrecisionPrecision 为PrecisionTPTPFPPrecision\frac{TP}{TPFP}PrecisionTPFPTP如果 FP 的代价非常高就应该更加关注 Precision。例如自动封禁账号 自动删除内容 高成本人工复核 高价值客户营销 刑事风险预警假设模型用于自动封禁用户FP 正常用户被错误封禁那么 FP 的业务成本非常高。此时希望模型只有非常确定时 才预测 Positive也就是强调 Precision。五、Precision vs TPR为什么有时必须看 PrecisionRecall 也叫TPR True Positive Rate公式TPRTPTPFNTPR\frac{TP}{TPFN}TPRTPFNTPTPR 只关注真实 Positive它并不知道负样本到底有多少。这在类别极度不平衡时会产生问题。六、一个关键例子假设Positive 100 Negative 99900某模型得到TP 90 FN 10 FP 999 TN 98901那么TPR901000.9TPR\frac{90}{100}0.9TPR100900.9也就是Recall 90%同时FPR999999000.01FPR\frac{999}{99900}0.01FPR999009990.01FPR 只有1%表面上看似乎很好TPR 90% FPR 1%但是 Precision 为Precision9090999≈0.0826Precision\frac{90}{90999}\approx0.0826Precision9099990≈0.0826只有约 8.3%也就是说模型预测出来的 Positive 中超过 90% 都是假警报。原因就在于Negative 的数量远远超过 Positive即使 FPR 很低也可能产生大量 FP。因此在严重类别不平衡问题中Precision 往往比单独观察 TPR 和 FPR 更直观。七、为什么 ROC 在极端不平衡数据上也要谨慎ROC 使用TPR FPR由于FPRFPFPTNFPR\frac{FP}{FPTN}FPRFPTNFP当 Negative 数量特别大时即使 FP 数量已经很多FPR 仍然可能很小因此 ROC 曲线可能看起来很好。但是对于“预测出来的正样本到底有多少是真的”这个问题Precision 更直接。所以极端不平衡任务中经常同时关注Precision Recall F1 PR Curve PR-AUC而不是只看 Accuracy 或 ROC-AUC。八、F1 什么时候合适F1 为F12×Precision×RecallPrecisionRecallF12\times\frac{Precision\times Recall}{PrecisionRecall}F12×PrecisionRecallPrecision×Recall如果Precision 很重要 Recall 也很重要而且希望用一个数综合比较模型可以使用 F1。但是需要注意F1 不考虑 TN。因此当正确识别负样本本身也非常重要时不能只看 F1。九、Specificity 什么时候重要Specificity 为SpecificityTNTNFPSpecificity\frac{TN}{TNFP}SpecificityTNFPTN它关注真正的 Negative 中有多少被正确排除。在医学检测中经常同时报告Sensitivity Specificity其中Sensitivity → 能不能找到患者 Specificity → 能不能正确排除健康人十、可以从“错误成本”选择指标一个非常实用的思路任务重点更值得关注两类数量接近错误代价类似Accuracy尽量不要漏掉正类Recall / Sensitivity预测为正时必须可靠Precision正类、负类都希望兼顾F1 Specificity Confusion Matrix希望比较阈值变化ROC / PR Curve极度类别不平衡Precision、Recall、F1、PR-AUC医疗筛查Sensitivity Specificity自动高风险动作Precision十一、不要把指标选择和阈值选择混为一谈假设模型输出概率0.91 0.73 0.55 0.42 0.21默认使用threshold 0.5并不意味着0.5 就一定是最佳阈值降低阈值通常会Recall ↑ Precision 可能 ↓提高阈值通常会Precision ↑ Recall 可能 ↓因此真实模型部署中经常需要两步第一步训练模型 第二步根据业务成本选择 threshold十二、推荐的评估思维不要问这个模型 Accuracy 是多少而应该问正类占比是多少 混淆矩阵是什么 FP 和 FN 分别是多少 Precision 是多少 Recall 是多少 Specificity 是多少 模型的 threshold 是多少 这个 threshold 为什么合理这套问题能够大幅减少对分类模型的误判。十三、总结类别不平衡时最重要的原则是不要让多数类别把少数类别的问题“淹没”。尤其是Accuracy 99%并不意味着模型好。真正需要理解的是模型漏掉了多少关键正样本 模型产生了多少假警报 这些错误各自的代价是什么下一篇将进一步讨论 threshold 改变时模型表现如何变化以及 ROC Curve 和 AUC 如何用于模型比较。