B 币安 · 全球最大的加密货币交易所币安 注册 → AD OKX OKX · 全球领先的加密货币交易所OKX 注册 → AD
🤖 人工智能基础 · 第2讲 / 10

机器学习入门:数据、模型、训练、评估

机器学习就是收集数据、选定模型、通过训练让误差变小,再用没见过的数据来评估。最后的评估最重要。

⏱ 约15分钟 ✍️ 练习题 4 道 更新 2026-10-08
🎯 本讲学习目标
  • 能按顺序说明机器学习的四个步骤(数据、模型、训练、评估)
  • 能举例说出监督学习与无监督学习的区别
  • 能说明为什么要把训练数据和评估数据分开
  • 能说出什么是过拟合、它为什么不好

1.机器学习的四个步骤

第1讲说过,机器学习是让机器从示例数据中找出规律的方式。把这个过程再细分一下,几乎所有机器学习项目都要经过同样的四步:收集数据;决定要找什么形状的规律(模型);根据数据调整模型(训练);用没见过的数据检查它预测得有多准(评估)。

比如,考虑用公寓面积预测价格的问题。把已成交公寓的面积和价格汇总成表,这就是数据。“价格等于面积乘以某个数再加上某个数”这条直线形状的规律,就是模型。不断改变要乘的数和要加的数,找出使预测与实际价格差距最小的值,这就是训练。最后,用没参与训练的成交记录衡量预测有多准,这就是评估。

用房价预测看四个步骤
步骤做什么在房价预测中
数据把输入和正确答案配对收集起来面积(输入)和实际成交价格(正确答案)
模型确定要找的规律是什么形状价格 = a × 面积 + b 形式的直线
训练调整模型里的数字,让误差变小不断改变a和b,缩小预测与实际的差距
评估用没见过的数据衡量性能用没参与训练的成交记录检查预测有多准

2.数据:带答案的示例和不带答案的示例

用每个输入都附有正确答案(标签)的数据来学习,叫作监督学习。也就是用人标好答案的示例来学,比如“这封邮件是垃圾邮件”“这张照片是猫”“这套房子5亿韩元”。分类(是不是垃圾邮件)和数值预测(是多少,也叫回归)是典型的监督学习问题。

只给数据、不给答案,让机器把相似的东西归到一起或找出结构,叫作无监督学习。例如网店只看顾客的购买记录,把口味相近的顾客分成一组。因为没有人规定什么是正确答案,机器分出来的组有没有意义,最终要由人来判断。

无论哪种方式,数据的质量决定结果的质量。答案标错的示例、偏向一边的示例、数量太少的示例,都会让模型相应地变差。这就是人们常说“垃圾进,垃圾出”的原因。

  • 监督学习:用带答案的示例学习——垃圾邮件分类、房价预测、照片分类
  • 无监督学习:不用答案,自己找结构——顾客分组、归集相似文档
  • 强化学习:学习如何让行动带来的奖励变多——游戏、机器人控制

3.训练:一点点减小误差的过程

训练就是反复做一件事:用数字衡量“错了多少”,再朝着让这个数字变小的方向,一点点修改模型里的数字。衡量错误程度的标准叫作损失(误差)。预测离正确答案越远,损失越大。

机器一开始用随便设定的数字起步:先预测,再算损失,把数字朝损失变小的方向挪一点,然后再预测。这个过程重复几千到几百万次,就会接近损失不再下降的那个点。计算数字该往哪个方向挪才能让损失变小的方法,就是「数学基础 第10讲」介绍的梯度(梯度下降法)。

例题模型是“价格 = a × 面积”,一套面积为30个单位的公寓实际价格是6亿韩元。如果从a = 0.1(亿韩元/面积单位)开始,训练应该把a往哪个方向调?
  1. 当前预测:0.1 × 30 = 3亿韩元
  2. 比实际价格6亿韩元低估了3亿韩元,所以损失很大。
  3. 需要把预测调高,所以把a朝变大的方向挪一点。例如a = 0.15时,预测为4.5亿韩元,更接近实际。
  4. 只看这一笔交易的话,a = 0.2时预测正好是6亿韩元(0.2 × 30 = 6)。实际训练会同时看大量交易,找出使总损失最小的a。
答案把a朝变大的方向(从0.1往0.2那边)调。

4.评估:用没见过的题来考试

不能用训练时用过的数据来衡量性能。那等于用已经看过答案的题考试,分数会比实际高。所以一开始就要把数据分开:大部分用于训练,另外留出一部分,等训练结束后只用于评估。

评估标准因问题而异。分类问题看答对了多少(准确率),但只看准确率很容易被骗。如果100封邮件里只有5封是垃圾邮件,一个胡乱回答“全部正常”的模型,准确率也有95%。所以还要一起看“垃圾邮件抓出了几封”“判为垃圾邮件的里面有几封真是垃圾邮件”。

例题100封邮件中有5封是垃圾邮件。某个模型把所有邮件都判为“正常”。它的准确率和抓出垃圾邮件的比例分别是多少?
  1. 95封正常邮件全部判对,5封垃圾邮件全部判错。
  2. 准确率 = 答对数 ÷ 总数 = 95 ÷ 100 = 95%
  3. 抓出垃圾邮件的比例 = 抓出的垃圾邮件 ÷ 全部垃圾邮件 = 0 ÷ 5 = 0%
  4. 准确率虽高,但作为垃圾邮件过滤器毫无用处。
答案准确率95%,垃圾邮件检出率0%

5.过拟合:只背了历年考题的学生

有的模型在训练数据上几乎完美,到了没见过的数据上却一塌糊涂,这叫过拟合。就像只把历年考题答案整个背下来的学生,题目换了几个数字就不会做了。模型不仅记住了规律,连偶然的噪声也一起背了下来。

相反,模型太简单,连训练数据都预测不好,叫作欠拟合。好的模型在两者之间:训练数据预测得不错,没见过的数据也预测得差不多。训练分数和评估分数差距很大时,就要怀疑是过拟合。

这个原理对使用AI的人也有意义。AI在某个例子上表现出色,并不保证它在所有类似的事上都出色。用符合自己工作的新例子亲自测试,才是最准确的评估。

减少过拟合最典型的方法,是收集更多、更多样的数据。也可以把模型做得简单些,或在适当的时候停止训练。

📌 要点总结

  • 机器学习由数据 → 模型 → 训练 → 评估四个步骤组成
  • 监督学习用带答案的示例学习,无监督学习不用答案、自己找结构
  • 训练就是反复衡量损失(错了多少),并朝损失变小的方向修改数字
  • 评估一定要用没参与训练的数据——只看准确率可能会被骗
  • 过拟合是把训练数据背下来、遇到新数据就不行的状态

✍️ 练习题

请先自己作答,再展开“答案与解析”。

Q1. 只凭顾客的购买记录、在没有答案的情况下把相似顾客分到一组,这属于哪种学习?

⭕ 回答正确

❌ 再想一想

答案与解析
答案 ② 无监督学习

没有答案(标签),而是寻找数据的结构,所以是无监督学习。

Q2. 评估模型时不能直接用训练数据,最主要的原因是什么?

⭕ 回答正确

❌ 再想一想

答案与解析
答案 ② 这些数据已经见过,性能会显得比实际好

这就像用提前看过答案的题考试,无法知道模型在没见过的数据上的真实性能。

Q3. 一个模型在训练数据上准确率99%,在评估数据上只有60%,它最可能处于什么状态?

⭕ 回答正确

❌ 再想一想

答案与解析
答案 ② 过拟合

这是典型的过拟合:过度贴合训练数据,在新数据上性能大幅下降。

Q4. 1,000名患者中有10人患病。一个把所有人都判为“健康”的模型,准确率是多少?

答案与解析
参考答案 99%

判对了990人,所以990 ÷ 1000 = 99%。但10名患者一个也没找出来,这个模型毫无用处。在寻找少见情况的问题中,不能只凭准确率判断。

🤖 可以这样问 AI

复制后把 [ ] 部分换成你的情况。不要直接相信回答,请与正文对照核实。

想大致判断自己的工作能不能用上机器学习时

我在做[工作或问题的说明]。如果用机器学习来解决这个问题,输入数据、正确答案(标签)和评估标准分别应该怎么定?请给出建议,并告诉我收集数据时可能出现哪些偏差。

想确认自己是否真正理解了概念时

请把过拟合比作备考来讲解。然后出三道区分过拟合和欠拟合的题,我回答后请帮我批改。
参考
  • 韩国高中《人工智能基础》课程内容(韩国教育部公布的课程标准)
  • 机器学习入门教材中的一般性说明(监督学习、无监督学习、过拟合)

达成全部学习目标后,请点击完成。

🤖 人工智能基础

  1. 1什么是AI:规则与学习
  2. 2机器学习入门:数据、模型、训练、评估
  3. 3神经网络的直观理解:小计算汇聚成判断
  4. 4大语言模型是怎样生成文字的
  5. 5提示词基础:把想要的东西说准确
  6. 6提示词进阶:角色、示例、步骤、格式
  7. 7幻觉与核查:学会怀疑“像样”
  8. 8个人信息、版权与伦理:负责任地使用
  9. 9与AI一起工作:交办、核对、串联
  10. 10AI时代的学习策略:基础决定提问
📚 推荐阅读
🧠What Generative AI Does and Where It Fails→ ✍️How to Write a Good Prompt→ 🔍Checking AI Answers→ 📚Using AI for Study and Work Without Plagiarism→
← AI时代基础学力课程