1.一个人工神经元做什么
“人工神经网络”这个名字借自大脑的神经细胞,但它实际做的是非常简单的计算。一个人工神经元接收多个输入,给每个输入乘上一个“重要程度”,全部加起来,再把这个和过滤一次后输出。这个重要程度叫作权重,相乘再相加得到的值叫作加权和。
最后“过滤”的这一步叫作激活。最常用的方式之一是:和小于0就输出0,大于等于0就原样输出。正是有了这个简单的“折弯”,把神经元叠成多层时,才能表示一条直线表达不了的复杂关系。
- 加权和 = 0.6 × 4 + 3 × 0.5 + (−2)
- = 2.4 + 1.5 − 2 = 1.9
- 激活:1.9大于0,所以原样输出1.9。
- 如果降雨概率是0.1、外出1小时,则为0.4 + 0.5 − 2 = −1.1,输出为0。
2.权重就是学到的内容
在上面的例子里,降雨概率的权重4表示“降雨概率对判断影响很大”,偏置−2表示把默认值调低,即“一般情况下倾向于不带伞”。这些数字如果由人来定,就是基于规则的程序;如果让机器看着数据来定,就是学习。
神经网络的训练,归根结底就是调整这些权重和偏置。就像第2讲讲过的那样,衡量预测与正确答案的差距(损失),再朝着损失变小的方向把所有权重一点点修改。真实的神经网络里,这样的权重少则几千个,大模型则超过几千亿个。所以训练需要大量数据和计算。
重要的是,训练好的神经网络里并没有存着“猫的耳朵是尖的”这样的句子。学到的内容分散在大量权重的数值里。人很难说清神经网络为什么那样判断,原因就在这里。
3.把层叠起来会有什么不同
把多个神经元并排放在一起就成了一层;把一层的输出交给下一层作为输入,就成了多层神经网络。接收输入的层与给出结果的层之间的那些层叫作隐藏层;用隐藏层很多的神经网络来学习,叫作深度学习。“深度”指的是层数多。
层数加深后,就能逐级捕捉更复杂的特征。分析识别照片的神经网络时可以观察到这样的倾向:靠前的层对线条、边缘等简单纹理有反应,中间的层对眼睛、车轮等局部有反应,靠后的层对人脸、汽车等整体形状有反应。这并不是人让它“去找边缘”,而是在训练过程中自然分工形成的。
| 位置 | 主要对什么有反应 | 比喻 |
|---|---|---|
| 靠前的层 | 线条、边缘、颜色的边界 | 字的笔画 |
| 中间的层 | 眼睛、耳朵、车轮等局部 | 词语 |
| 靠后的层 | 人脸、猫、汽车等整体 | 句子的意思 |
4.手算一个小小的神经网络
“把层叠起来”实际上是怎样的计算?我们用一个非常小的神经网络亲自算一遍:2个输入 → 2个隐藏神经元 → 1个输出。数字是为了讲解而设定的。隐藏神经元使用前面讲的激活(负数变0,否则原样输出),输出神经元直接输出加权和。
计算顺序始终一样:前一层的输出就是下一层的输入,每个神经元只做“相乘相加,再过滤”。像这样从输入往输出方向依次计算,叫作前向传播。第二道例题是看了结果后把权重修改一次——也就是训练的一步。
- 第1步:h₁的加权和:1 × 0.5 + 2 × 1 + (−1) = 0.5 + 2 − 1 = 1.5。为正数,所以h₁ = 1.5。
- 第2步:h₂的加权和:1 × (−2) + 2 × 0.5 + 0 = −2 + 1 = −1。为负数,经过激活后h₂ = 0。
- 第3步:输出:1.5 × 2 + 0 × 3 + (−1) = 3 + 0 − 1 = 2。
- 验算:h₂变成了0,所以h₂的权重3这次对结果没有影响。输入一变,h₂就可能被点亮并参与结果。根据输入不同、被点亮的神经元也不同,这正是激活的作用。
- 第1步:当前预测:3 × 2 = 6。误差是6 − 10 = −4,损失是(−4)² = 16。
- 第2步:w稍微变化时损失的变化程度(梯度)是2 × 误差 × 输入 = 2 × (−4) × 2 = −16。为负数,所以要把w调大,损失才会变小。
- 第3步:新w = w − 学习率 × 梯度 = 3 − 0.05 × (−16) = 3 + 0.8 = 3.8。
- 第4步:新预测:3.8 × 2 = 7.6。误差是−2.4,损失是(−2.4)² = 5.76。
- 验算:损失从16降到了5.76。反复用同样的方法,w会接近能准确算出正确答案的5(5 × 2 = 10)。
5.神经网络不是大脑
因为名字的缘故,人们很容易误以为神经网络是在原样模仿大脑。实际上,它只是借用了大脑中“大量单元相互连接、传递信号”这个想法,运作方式差别很大。人工神经元是做乘法和加法的式子,训练也是与人的经验不同的数学优化。
所以,说神经网络像人一样理解或感受,是不准确的。反过来,以“不过是计算而已,没什么了不起”为由小看它,也不准确。简单的计算汇聚到巨大的规模,就会产生令人惊讶的精细结果。同时记住这两点都是事实,才是平衡的理解。
📌 要点总结
- 人工神经元 = 把输入 × 权重全部相加(加权和),再用激活过滤的计算
- 训练就是为了让损失变小,把权重和偏置一点点修改
- 计算是从输入往输出方向、逐层重复“相乘相加再过滤”的前向传播;训练则根据结果的损失来修改权重
- 学到的内容不是以句子形式,而是分散存储在大量权重数值里
- 用层数很深的神经网络来学习就是深度学习,每一层捕捉越来越复杂的特征
- 神经网络是只借用了大脑想法的数学模型,不是大脑的复制品
🤖 可以这样问 AI
复制后把 [ ] 部分换成你的情况。不要直接相信回答,请与正文对照核实。
想通过手算掌握原理时
请以一个有3个输入、2个隐藏神经元、1个输出神经元的小神经网络为例,把权重设成简单的整数,一步步展示一个输入如何一路算到输出。请用表格整理,方便我自己跟着算。
想知道比喻在多大程度上成立时
请用表格整理人工神经网络和人脑的三个相似点和五个不同点。不确定的内容请标注“不确定”。
- 深度学习入门教材中的一般性说明(人工神经元、激活函数、层)
- 韩国高中《人工智能基础》课程内容(韩国教育部公布的课程标准)
达成全部学习目标后,请点击完成。
此浏览器无法保存记录,仅在当前页面显示。