个人笔记:实用机器学习(b站李沐)4.2
4.2过拟合和欠拟合虽然模型会有很好的精度但是在实际情况中可能会有很大的问题在数据上取得比较好的成绩与在实际应用中做的好不好中间是有比较大的代沟的训练误差模型在训练数据上的错误泛化误差模型在新数据上的错误过拟合over fitting训练数据背得太熟新数据不行欠拟合under fitting什么都没学到模型复杂度要和数据复杂度相匹配模型的复杂度定义模型能拟合多复杂的数据模式衡量的两个指标可学习参数的数量参数越多模型越复杂参数的取值范围参数可以取多大值跨模型比较的困难决策树树的深度、叶子节点数神经网络层数、每层神经元数、参数量线性模型特征数量更精确的度量VC 维度定义模型能完美分类任意标签组合的样本点的最大数量。比如二维空间中线性分类器的 VC 维度 3可视化训练误差和泛化误差随着模型复杂度的变化最好的地方是泛化误差最低的点但是就算是最好的情况可能还是会有overfitting数据的复杂度决定因素1.样本的数量样本数越多数据就越复杂一点2.每个样本有多少个元素3.数据中是否有时间或空间的结构股票有时间的结构图片是有空间结构的4.多样性多样性更大样本就更复杂一点当然也是很难比较两个数据集的复杂程度图片数据集与文本数据集“像素与字符比较”但是可以比较类似数据的复杂程度不一样的话很多时候要靠直觉。模型选择选择合适的模型调参