机器学习:数据的标注
1.4数据的标注1.监督学习有输入和输出在已知输入和输出的情况下通过训练建立起输入到输出的映射模型应用最广的机器学习方法可进一步分为分类和回归两类算法2.无监督学习没有输出学习过程中只有输入数据没有对应的输出数据作为参考通过模型自我归纳自我改进来获得数据中隐含的结构信息优点不需要进行繁重的人工数据标注半监督学习少量标注数据 大量未标注数据本质利用未标注数据的分布信息来辅助决策边界的学习。三大假设连续性假设Continuity assumption特征相似的样本更可能有相同标签聚类假设Cluster assumption数据存在内在的聚类结构同一簇的样本倾向于同标签流形假设Manifold assumption数据实际分布在一个低维流形上远低于输入空间维度Self-training自学习用模型自己的高置信度预测来自举更多训练数据核心挑战是如何控制伪标签的噪声。让模型预测未被标记的标签*选择置信度高的与标记好的标签合并再次训练模型重复过程Active-learning主动学习模型主动筛选最有价值的未标注样本来请人标注合并已标注数据继续训练模型循环往复。*主动学习的关键是如何定义最有价值的样本不确定性采样Uncertainty Sampling选择模型最不确定的样本去标注判断标准模型对某样本的最高类预测概率接近随机猜测1/nn 为类别数自学习主动学习弱监督学习在标注数据不完全、不确切或不精确等场景下构建模型泛化能力强半自动地生成标签 不需要人工逐条标注而是用规则、启发式方法批量产生标签。用启发式程序Heuristic Programs来分配标签典型来源关键词搜索Keyword search模式匹配Pattern matching第三方模型Third-party models