1.机器学习的四个步骤
第1讲说过,机器学习是让机器从示例数据中找出规律的方式。把这个过程再细分一下,几乎所有机器学习项目都要经过同样的四步:收集数据;决定要找什么形状的规律(模型);根据数据调整模型(训练);用没见过的数据检查它预测得有多准(评估)。
比如,考虑用公寓面积预测价格的问题。把已成交公寓的面积和价格汇总成表,这就是数据。“价格等于面积乘以某个数再加上某个数”这条直线形状的规律,就是模型。不断改变要乘的数和要加的数,找出使预测与实际价格差距最小的值,这就是训练。最后,用没参与训练的成交记录衡量预测有多准,这就是评估。
| 步骤 | 做什么 | 在房价预测中 |
|---|---|---|
| 数据 | 把输入和正确答案配对收集起来 | 面积(输入)和实际成交价格(正确答案) |
| 模型 | 确定要找的规律是什么形状 | 价格 = a × 面积 + b 形式的直线 |
| 训练 | 调整模型里的数字,让误差变小 | 不断改变a和b,缩小预测与实际的差距 |
| 评估 | 用没见过的数据衡量性能 | 用没参与训练的成交记录检查预测有多准 |
2.数据:带答案的示例和不带答案的示例
用每个输入都附有正确答案(标签)的数据来学习,叫作监督学习。也就是用人标好答案的示例来学,比如“这封邮件是垃圾邮件”“这张照片是猫”“这套房子5亿韩元”。分类(是不是垃圾邮件)和数值预测(是多少,也叫回归)是典型的监督学习问题。
只给数据、不给答案,让机器把相似的东西归到一起或找出结构,叫作无监督学习。例如网店只看顾客的购买记录,把口味相近的顾客分成一组。因为没有人规定什么是正确答案,机器分出来的组有没有意义,最终要由人来判断。
无论哪种方式,数据的质量决定结果的质量。答案标错的示例、偏向一边的示例、数量太少的示例,都会让模型相应地变差。这就是人们常说“垃圾进,垃圾出”的原因。
- 监督学习:用带答案的示例学习——垃圾邮件分类、房价预测、照片分类
- 无监督学习:不用答案,自己找结构——顾客分组、归集相似文档
- 强化学习:学习如何让行动带来的奖励变多——游戏、机器人控制
3.训练:一点点减小误差的过程
训练就是反复做一件事:用数字衡量“错了多少”,再朝着让这个数字变小的方向,一点点修改模型里的数字。衡量错误程度的标准叫作损失(误差)。预测离正确答案越远,损失越大。
机器一开始用随便设定的数字起步:先预测,再算损失,把数字朝损失变小的方向挪一点,然后再预测。这个过程重复几千到几百万次,就会接近损失不再下降的那个点。计算数字该往哪个方向挪才能让损失变小的方法,就是「数学基础 第10讲」介绍的梯度(梯度下降法)。
- 当前预测:0.1 × 30 = 3亿韩元
- 比实际价格6亿韩元低估了3亿韩元,所以损失很大。
- 需要把预测调高,所以把a朝变大的方向挪一点。例如a = 0.15时,预测为4.5亿韩元,更接近实际。
- 只看这一笔交易的话,a = 0.2时预测正好是6亿韩元(0.2 × 30 = 6)。实际训练会同时看大量交易,找出使总损失最小的a。
4.评估:用没见过的题来考试
不能用训练时用过的数据来衡量性能。那等于用已经看过答案的题考试,分数会比实际高。所以一开始就要把数据分开:大部分用于训练,另外留出一部分,等训练结束后只用于评估。
评估标准因问题而异。分类问题看答对了多少(准确率),但只看准确率很容易被骗。如果100封邮件里只有5封是垃圾邮件,一个胡乱回答“全部正常”的模型,准确率也有95%。所以还要一起看“垃圾邮件抓出了几封”“判为垃圾邮件的里面有几封真是垃圾邮件”。
- 95封正常邮件全部判对,5封垃圾邮件全部判错。
- 准确率 = 答对数 ÷ 总数 = 95 ÷ 100 = 95%
- 抓出垃圾邮件的比例 = 抓出的垃圾邮件 ÷ 全部垃圾邮件 = 0 ÷ 5 = 0%
- 准确率虽高,但作为垃圾邮件过滤器毫无用处。
5.过拟合:只背了历年考题的学生
有的模型在训练数据上几乎完美,到了没见过的数据上却一塌糊涂,这叫过拟合。就像只把历年考题答案整个背下来的学生,题目换了几个数字就不会做了。模型不仅记住了规律,连偶然的噪声也一起背了下来。
相反,模型太简单,连训练数据都预测不好,叫作欠拟合。好的模型在两者之间:训练数据预测得不错,没见过的数据也预测得差不多。训练分数和评估分数差距很大时,就要怀疑是过拟合。
这个原理对使用AI的人也有意义。AI在某个例子上表现出色,并不保证它在所有类似的事上都出色。用符合自己工作的新例子亲自测试,才是最准确的评估。
📌 要点总结
- 机器学习由数据 → 模型 → 训练 → 评估四个步骤组成
- 监督学习用带答案的示例学习,无监督学习不用答案、自己找结构
- 训练就是反复衡量损失(错了多少),并朝损失变小的方向修改数字
- 评估一定要用没参与训练的数据——只看准确率可能会被骗
- 过拟合是把训练数据背下来、遇到新数据就不行的状态
🤖 可以这样问 AI
复制后把 [ ] 部分换成你的情况。不要直接相信回答,请与正文对照核实。
想大致判断自己的工作能不能用上机器学习时
我在做[工作或问题的说明]。如果用机器学习来解决这个问题,输入数据、正确答案(标签)和评估标准分别应该怎么定?请给出建议,并告诉我收集数据时可能出现哪些偏差。
想确认自己是否真正理解了概念时
请把过拟合比作备考来讲解。然后出三道区分过拟合和欠拟合的题,我回答后请帮我批改。
- 韩国高中《人工智能基础》课程内容(韩国教育部公布的课程标准)
- 机器学习入门教材中的一般性说明(监督学习、无监督学习、过拟合)
达成全部学习目标后,请点击完成。
此浏览器无法保存记录,仅在当前页面显示。