some basic concepts

ROC AUC初步理解

ROC

定义：

ROC曲线：接收者操作特征曲线(receiver operating characteristic curve)，是反映敏感性和特异性连续变量的综合指标，roc曲线上每个点反映着对同一信号刺激的感受性。

ROC AUC初步理解

横坐标：1-Specificity，伪正类率(False positive rate， FPR)，预测为正但实际为负的样本占所有负例样本 的比例；
纵坐标：Sensitivity，真正类率(True positive rate， TPR)，预测为正且实际为正的样本占所有正例样本 的比例。

理解：

在一个二分类模型中，假设采用逻辑回归分类器，其给出针对每个实例为正类的概率，那么通过设定一个阈值如0.6，概率大于等于0.6的为正类，小于0.6的为负类。对应的就可以算出一组(FPR,TPR)，在平面中得到对应坐标点。随着阈值的逐渐减小，越来越多的实例被划分为正类，但是这些正类中同样也掺杂着真正的负实例，即TPR和FPR会同时增大。阈值最大时，对应坐标点为(0,0)，阈值最小时，对应坐标点(1,1)。

也即这个曲线上的每一点，都是对应一个阈值，不同的阈值所得到的(FPR,TPR)都不一样，最好的点应该在左上角，即FPR为0，TPR为1

ROC AUC初步理解

怎么得到ROC曲线？

可参考https://zhwhong.cn/2017/04/14/ROC-AUC-Precision-Recall-analysis/

AUC

定义

AUC (Area Under Curve) 被定义为ROC曲线下的面积，显然这个面积的数值不会大于1。又由于ROC曲线一般都处于y=x这条直线的上方，所以AUC的取值范围一般在0.5和1之间。使用AUC值作为评价标准是因为很多时候ROC曲线并不能清晰的说明哪个分类器的效果更好，而作为一个数值，对应AUC更大的分类器效果更好。

理解：

ROC AUC初步理解

AUC值越大的分类器，正确率越高。

为啥要用ROC/AUC？

既然已经这么多评价标准，为什么还要使用ROC和AUC呢？

因为ROC曲线有个很好的特性：当测试集中的正负样本的分布变化的时候，ROC曲线能够保持不变。在实际的数据集中经常会出现类不平衡(class imbalance)现象，即负样本比正样本多很多(或者相反)，而且测试数据中的正负样本的分布也可能随着时间变化。下图是ROC曲线和Precision-Recall曲线的对比：
ROC AUC初步理解

在上图中，(a)和©为ROC曲线，(b)和(d)为Precision-Recall曲线。(a)和(b)展示的是分类其在原始测试集(正负样本分布平衡)的结果，©和(d)是将测试集中负样本的数量增加到原来的10倍后，分类器的结果。可以明显的看出，ROC曲线基本保持原貌，而Precision-Recall曲线则变化较大。

为什么Precision-Recall曲线的误差会辣么大？究其原因还是因为当class imbalance的时候，Precision/Recall的分母部分会剧烈变化，导致曲线也巨变

ROC AUC初步理解

文章目录

some basic concepts

ROC

定义：

理解：

怎么得到ROC曲线？

AUC

定义

理解：

为啥要用ROC/AUC？

相关推荐