机器学习中,数据的分布是指什么呢?

  统计/机器学习 概率分布    浏览次数:11699        分享
2

经常在各种地方看到“输入数据和输出数据分布相同”,“训练集和测试集分布相同”的说法,请问这里的分布具体指什么呢?

 

dzzxjl   2018-09-05 10:16



   1个回答 
13

对于supervised learning,分布是指关于特征$X$和结果$Y$的联合分布$F(X,Y)$或者条件$F(Y|X)$。

我们说训练集和测试集服从同分布的意思是训练集和测试集都是由服从同一个分布的随机样本组成的,也就是

$$(X_{train},Y_{train}), (X_{test},Y_{test}) \text{ i.i.d. }~\sim F(X,Y)$$


对于unsupervised learning,分布是指特征$X$的分布$F(X)$,也就是

$$X_{train}, X_{test} \text{ i.i.d. }~\sim F(X)$$


补充几句:

但是现实中比较难做到这点,特别是当训练集是过去的数据,测试集是当下的数据,由于时间的因素,它们很可能不是完全同分布的,这就增加了预测难度。

这也是为什么一般交叉验证的误差往往小于实际的测试误差。因为交叉验证中每折数据都是来自训练集,它们肯定是同分布的。

如果训练集和测试集的分布风马牛不相及,那么根据训练集学习得到的模型在测试集上就几乎没有什么用了。所以我们训练模型和应用模型时一个重要的前提假设就是训练集和测试集是同分布的。

另外一个方面是牵涉到过拟合问题,即使训练集和测试集是同分布的,由于数据量的问题,训练集的分布可能无法完整体现真实分布,当我们过分去学习训练集分布的时候,我们反而会远离真实分布(以及测试集的分布),造成预测不准确,这就造成过拟合。

SofaSofa数据科学社区DS面试题库 DS面经

kidd23   2018-09-05 23:09

解释地很清晰,谢谢! - dzzxjl   2018-09-06 10:02


  相关讨论

二项分布的正态近似

log-normal分布实际有什么用?

odds和odds ratio的定义是什么?

怎么理解tweedie分布?

长尾分布、肥尾分布、重尾分布?

X,Y 独立并且,X~U(0,2)以及Y∼U(1,3)。求max(X,Y) 的期望。

怎么判断一个数据集是双峰分布的?

两个独立的正态随机变量的乘积服从什么分布?

均匀分布的上限的最大似然估计

强大数定律和弱大数定律有什么区别?

  随便看看

怎么给plt.subplot加一个主标题?

numpy.full这个函数有什么用?

把tf.Tensor转换为numpy array

软聚类,硬聚类?

怎么利用permutation importance来解释xgboost模型的特征?