相关文章推荐

Sklearn.metrics下面的r2_score函数用于计算R²(确定系数:coefficient of determination)。它用来度量未来的样本是否可能通过模型被很好地预测。分值为1表示最好,但我们在使用过程中,经常发现它变成了负数,多次手动调参只能改变负值的大小,却始终不能让该值变成正数。
本文将这一问题进行一些初步探讨,希望能起到够抛砖引玉的作用。
R²的定义如下:![Alt] 在这里插入图片描述 从公式来看,即使我们不使用任何模型,仅仅用目标集标签的平均值,就能让R2_score为0,如果值为负数,则表示我们预测的结果还不如测试集中的y_label的平均值准确。下面我们最简单的模型去测试一下R2_score到底跟什么有关系。
首先,我们先在三维空间里构建两个数据集。一个是z=y的一次平面,数据集在这个平面上。另外一个是z=x x+y y的二次抛物曲面,数据来自这个平面上。废话不多说,上代码:

import sklearn
from sklearn import preprocessing
from sklearn import linear_model
from sklearn.metrics import r2_score#R square
from sklearn.svm import SVR

构建z=y平面

X1_train = [[0,0],[0,1],[1,0],[1,1],[2,0],[-2,0],[1,-3],[-1,-1]]
y1_train = [0,1,0,1,0,0,-3,-1]
X1_test = [[2,-1],[0,2],[-1,-2],[1.5,1.5],[-1.5,-1.5]]
y1_test = [-1,2 ,-2,1.5,-1.5]

构建z= xx+yy平面

X2_train = [[0,0],[0,1],[1,0],[1,1],[2,0],[-2,0],[1,-3],[-1,-1]]
y2_train = [0,1,1,2,4,4,10,2]
X2_test = [[2,-1],[0,2],[-1,-2],[1.5,1.5],[-1.5,-1.5]]
y2_test = [5,4 ,5,4.5,4.5]

调用sklearn中的SVR回归模型,并使用R2_score进行预测结果的评测。

#clf_SVR = SVR(kernel='poly',C=10,degree=2)
#clf_SVR = SVR(kernel='poly',C=10)
#clf_SVR = SVR()
clf_SVR = SVR(kernel='linear',C=10)
clf_SVR.fit(X_train, y_train)
y_train_forcast = clf_SVR.predict(X_train)
print ('SVR_train_model prediction is', sklearn.metrics.r2_score(y_train,y_train_forcast))
y_test_forcast = clf_SVR.predict(X_test)
print('y_test_forcast are',y_test_forcast)
print ('SVR_test_model prediction is', sklearn.metrics.r2_score(y_test,y_test_forcast))

将上面的各个模型跑一边就会发现不同的结果。
1、当我们使用z= xx+yy平面数据集时,如果用clf_SVR = SVR(kernel=‘linear’,C=10)参数预测,输出结果为:

SVR_train_model prediction is 0.617986574585546
y_test_forcast are [ 6.04290571 -1.24293971  6.899932    0.47141886  5.61418858]
SVR_test_model prediction is -69.93813277070895

从上面的预测结果看,y_test_forcast与真实的y2_test = [5,4 ,5,4.5,4.5]差别巨大。下面我们换用一次的z=y平面数据集进行一次测试,结果如下:

SVR_train_model prediction is 0.9965217391304347
y_test_forcast are [-1.     1.85  -1.95   1.375 -1.475]
SVR_test_model prediction is 0.9968984962406015

这次再看y_test_forcast与真实的y2_test = [5,4 ,5,4.5,4.5],结果出奇的好。为什么会这样呢?仔细看一下我们使用的SVR核函数为linear,所以,这个模型是用来拟合一次线性关系的数据的模型,所以我们把二次曲面z= xx+yy平面数据在这个模型上去拟合,就会出现预测误差非常大的情况,R2_score,居然为负数。

希望这个实验能给大家一些启发,kernel模型的选取对最终的模型是否成功关系巨大,有兴趣的网友还可以试试z= xx+yy平面数据在SVR()默认参数(即高斯核),在SVR(kernel=‘poly’,C=10,degree=2)和SVR(kernel=‘poly’,C=10)的情况下,R2_score结果对比情况。

综上所述,sklearn.svm参数模型非常好用,但是一定要注意自己模型的大概情况,并且要使用与数据分布类似的核函数去模拟,不可以直接拿SVM的默认值当黑盒一样,直接无脑调用fit()函数,那么很可能预测的结果与我们的期望大相径庭。

网络训练中,loss曲线非常奇怪交叉熵怎么会有负数。经过排查,交叉熵不是有个负对数吗,当网络输出的概率是0-1时,正数。可当网络输出大于1的数,就有可能变成负数。所以加上一行就行了out1 = F.softmax(out1, dim=1)补充知识:在pytorch框架下,训练model过程中,loss=nan问题时该怎么解决?当我在UCF-101数据集训练alexnet时,epoch设为100,跑... R2_score = 1,样本中预测值和真实值完全相等,没有任何误差,表示回归分析中自变量对因变量的解释越好。R2_score不是r的平方,也可能为负数(分子>分母),模型等于盲猜,还不如直接计算目标变量的平均值。R2_score,即决定系数,反映因变量的全部变异能通过回归关系被自变量解释的比例。即估计值与平均值的误差,反映自变量与因变量之间的相关程度的偏差平方和。即平均值与真实值的误差,反映与数学期望的偏离程度。即估计值与真实值的误差,反映模型拟合程度。表示真实观测值的平均值,用。表示真实的观测值,用。 回归模型的性能的评价指标主要有:RMSE(平方根误差)、MAE(平均绝对误差)、MSE(平均平方误差)、R2_score。但是当量纲不同时,RMSE、MAE、MSE难以衡量模型效果好坏。这就需要用到R2_score,实际使用时,会遇到许多问题,今天我们深度研究一下。预备知识搞清楚R2_score计算之前,我们还需要了解几个统计学概念。若用 表示真实的观测值,用 表示真实观测值的平均值,用 表示预测... 在建立回归模型时需要对模型的效果进行评测,选择哪一种指标作为评估指标也会影响最终模型的效果。这里选择Scikit Learn自带的回归模型评估指标进行详细讲解。explained_variance_score(y_true, y_pred) Explained variance regression score functionmean_absolute_error(y_true, y_pred)... 函数声明: precision_score(y_true, y_pred, labels=None, pos_label=1, average=’binary’, sample_weight=None) 其中较为常用的参数解释如下: y_true:真实标签 y_pred:预测标签 average:评价值的平均值的计算方式。可以接收[None, ‘binary’ (default), ‘micro’, ‘macro’, ‘samples’, ‘weighted’]对于多类/多标签目标需要此参数。下面进行详细说明: 如果是None,则返回每个类的分数。否则,这决定了对数据进行平均的类型用下面几种统 y_true:真实的数据值 y_pred:回归模型预测的数据值 explained_variance_score:解释回归模型的方差得分,其值取值范围是[0,1],越接近于1说明自变量越能解释因变量 的方差变化,值越小则说明效果越差。 mean_absolute_error:平均绝对误差(Mean Absolute... 在评测回归模型时,是一个常用的指标(其出现最早可追溯到初中时期...)。印象里的的取值为[0,1],的值越接近1,说明回归模型对数据的拟合程度越好。 问题源自一次使用sklearn做线性回归的实验,笔者使用了内置的计算的函数,惊奇地发现得到的居然是一个负数。一方面说明回归模型失败了[捂脸],而另一方面也令人颇为不解——为什么可以为负呢? 带着强烈的好奇心,笔者从sklearn的文档开始读起,弄明白了这是怎么回事。随手记录下来供大家参考。 先说结论: 确实有两种不同的定义,其中一种的定义域包含负值 时间序列预测常用的方法有移动平均法,指数平均法,AR,MA,ARMA等,这类方法比较适用于小规模,单变量的预测,比如某门店的销量预测等,但是这些都要求序列是平稳的。 弱平稳序列 如果一个时间序列 xtx_txt​ 满足以下两个条件,则它是弱平稳的: 对于所有的时刻ttt ,有E[xt]=μE[x_t]=\muE[xt​]=μ ,其中μ\muμ是一个常数。 对于所有的时刻ttt和任意的间隔kkk, ... def calPerformance(y_true,y_pred):'''模型效果指标评估y_true:真实的数据值y_pred:回归模型预测的数据值explained_variance_score:解释回归模型的方差得分,其值取值范围是[0,1],越接近于1说明自变量越能解释因变量的方差变化,值越小则说明效果越差。mean_absolute_error:平均绝对误差(Mean Absolute ... 回归分析为许多机器学习算法提供了坚实的基础。在这篇文章中,我们将总结 10 个重要的回归问题和5个重要的回归问题的评价指标。线性回归有四个假设残差是指预测值与观测值之间的误差。它测量数据点与回归线的距离。它是通过从观察值中减去预测值的计算机。残差图是评估回归模型的好方法。它是一个图表,在垂直轴上显示所有残差,在 x 轴上显示特征。如果数据点随机散布在没有图案的线上,那么线性回归模型非常适合数据,否则我们应该使用非线性模型。两者都是回归问题的类型。两者的区别在于他们训练的数据。线性回归模型假设特征和标签之间存 http://scikit-learn.org/stable/modules/generated/sklearn.linear_model.LinearRegression.html#sklearn.linear_model.LinearRegression http://scikit-learn.org/stable/modules/generated/sklearn.metrics.r2_s...
 
推荐文章