用 “学生做题考试” 的例子

训练集:“上课做的练习题”

  • 作用:给模型 “学习知识” 用的。
  • 类比:老师上课讲知识点,让你做的课后练习题 —— 模型通过训练集里的数据,学习 “输入特征(比如气温、当日感染数)和输出目标(第三天感染数)之间的规律”。
  • 比如:训练集里有 “纽约州,气温 20 度,当日感染 1000 人→第三天感染 1500 人”,模型会从这些数据里学 “气温 20 度 + 当日 1000 人时,第三天大概是多少”。

测试集:“期末考试卷”

  • 作用:检验模型 “学的好不好”。
  • 类比:期末考试的题目 —— 这些题老师没讲过,但和练习题是一个类型,用来测你到底会不会。模型用训练集学完后,用测试集的数据做预测,再对比真实值,看预测准不准。
  • 比如:测试集里有 “加州,气温 25 度,当日感染 800 人→第三天真实感染 1200 人”,模型预测出 1100 人,说明学的还不错。

预测集:“未来的新题目”

  • 作用:让模型 “解决实际问题” 用的。
  • 类比:考试完了,老师给你一套新题,让你用学过的知识做 —— 这些数据没有 “第三天感染数”(是你要预测的目标),模型用之前学的规律,直接输出预测结果。
  • 比如:预测集里只有 “德州,气温 18 度,当日感染 900 人”,模型直接算出 “第三天大概感染 1300 人”,这就是你最终要的结果。

核心逻辑:

  • 训练集→让模型 “学会”;
  • 测试集→让你知道模型 “学没学好”;
  • 预测集→让模型 “干活”。

这三类数据集必须分开,就像考试不能用上课做过的题,否则测不出真实水平~

更多推荐