
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
《机器学习实战:基于 Scikit-Learn、Keras 和 TensorFlow》(第三版)第一章练习题答案
一个被标记的训练数据集是指其中每个训练实例(或样本)都同时包含了:输入数据(特征,Features):描述该实例的一组属性。期望输出(标签,Label 或 目标,Target):我们希望模型为该输入预测的正确结果。例如:在一个垃圾邮件分类器中,一个被标记的数据集包含成千上万封邮件。对于每一封邮件:**输入(特征):**可能是邮件的发件人、标题、正文内容等。
1.5机器学习的主要挑战
如果你的训练数据充满错误、异常值和噪声(例如,低质量的测量产⽣的数据),系统将更难检测到底层模式,也就更不太可能表现良好。花时间清洗训练数据通常是⾮常值得的。假设你正在国外旅游,被出租⻋司机敲诈。你可能会说那个国家的所有出租⻋司机都是⼩偷。只有当训练数据包含⾜够多的相关特征并且没有太多⽆关特征时,系统才能够进⾏学习。当模型太简单⽽⽆法学习数据的底层结构时,就会发⽣⽋拟合。练习:使用scikit-l
到底了







