B 바이낸스 · 전 세계 1위 암호화폐 거래소바이낸스 가입 → AD OKX OKX · 글로벌 대형 암호화폐 거래소OKX 가입 → AD
🤖 인공지능 기초 · 2강 / 10

머신러닝 기본 — 데이터·모델·학습·평가

머신러닝은 데이터를 모으고, 모델을 정하고, 오차를 줄이도록 학습시키고, 처음 보는 데이터로 평가하는 과정입니다. 마지막 평가가 가장 중요합니다.

⏱ 약 15분 ✍️ 확인 문제 4개 업데이트 2026-10-08
🎯 이 강의의 학습 목표
  • 머신러닝의 네 단계(데이터·모델·학습·평가)를 순서대로 설명할 수 있다
  • 지도학습과 비지도학습의 차이를 예를 들어 말할 수 있다
  • 학습 데이터와 평가 데이터를 나누는 이유를 설명할 수 있다
  • 과적합이 무엇이며 왜 나쁜지 말할 수 있다

1.머신러닝의 네 단계

1강에서 머신러닝은 기계가 예시 데이터에서 규칙성을 찾는 방식이라고 했습니다. 이 과정을 조금 더 나누어 보면 거의 모든 머신러닝 프로젝트가 같은 네 단계를 거칩니다. 데이터를 모으고, 어떤 모양의 규칙을 찾을지(모델) 정하고, 데이터에 맞게 모델을 조정하고(학습), 처음 보는 데이터로 얼마나 잘 맞히는지 확인합니다(평가).

예를 들어 아파트의 넓이로 가격을 예측하는 문제를 생각해 봅시다. 이미 거래된 아파트의 넓이와 가격을 모은 표가 데이터입니다. '가격은 넓이에 어떤 수를 곱하고 어떤 수를 더한 값'이라는 직선 모양의 규칙이 모델입니다. 곱할 수와 더할 수를 이리저리 바꿔 가며 실제 가격과의 차이가 가장 작아지는 값을 찾는 것이 학습입니다. 마지막으로 학습에 쓰지 않은 거래 기록으로 예측이 얼마나 맞는지 재는 것이 평가입니다.

집값 예측으로 본 네 단계
단계하는 일집값 예측에서는
데이터입력과 정답을 짝지어 모은다넓이(입력)와 실제 거래 가격(정답)
모델찾을 규칙의 모양을 정한다가격 = a × 넓이 + b 꼴의 직선
학습오차가 작아지게 모델의 숫자를 조정한다a와 b를 바꿔 가며 예측과 실제의 차이를 줄임
평가처음 보는 데이터로 성능을 잰다학습에 안 쓴 거래로 예측이 얼마나 맞는지 확인

2.데이터: 정답이 붙은 예시와 붙지 않은 예시

입력마다 정답(레이블)이 붙은 데이터로 배우는 것을 지도학습이라고 합니다. '이 메일은 스팸', '이 사진은 고양이', '이 집은 5억 원'처럼 사람이 답을 달아 둔 예시로 배우는 방식입니다. 분류(스팸인가 아닌가)와 수치 예측(얼마일까, 회귀라고도 합니다)이 대표적인 지도학습 문제입니다.

정답 없이 데이터만 주고 비슷한 것끼리 묶거나 구조를 찾게 하는 것은 비지도학습입니다. 쇼핑몰이 고객의 구매 기록만 보고 비슷한 취향의 손님끼리 묶는 일이 그 예입니다. 무엇이 정답인지 아무도 정해 주지 않았으므로, 기계가 찾아낸 묶음이 의미 있는지는 결국 사람이 판단해야 합니다.

어느 방식이든 데이터의 질이 결과의 질을 정합니다. 정답이 잘못 달린 예시, 한쪽으로 치우친 예시, 너무 적은 예시는 모두 모델을 그만큼 나쁘게 만듭니다. 흔히 '쓰레기를 넣으면 쓰레기가 나온다'고 말하는 이유입니다.

  • 지도학습: 정답이 붙은 예시로 배운다 — 스팸 분류, 집값 예측, 사진 분류
  • 비지도학습: 정답 없이 구조를 찾는다 — 고객 묶기, 비슷한 문서 모으기
  • 강화학습: 행동의 결과로 받는 보상을 늘리도록 배운다 — 게임, 로봇 제어

3.학습: 오차를 조금씩 줄여 가는 과정

학습은 '틀린 정도'를 숫자로 재고, 그 숫자가 작아지는 방향으로 모델 안의 숫자를 조금씩 고치는 일의 반복입니다. 틀린 정도를 재는 기준을 손실(오차)이라고 부릅니다. 예측이 정답에서 멀수록 손실이 커집니다.

기계는 처음에 아무렇게나 정한 숫자로 시작합니다. 예측해 보고, 손실을 재고, 손실이 줄어드는 쪽으로 숫자를 살짝 옮기고, 다시 예측합니다. 이 과정을 수천에서 수백만 번 되풀이하면 손실이 더 줄지 않는 지점에 가까워집니다. 숫자를 어느 방향으로 옮겨야 손실이 줄어드는지 계산하는 방법이 수학 기초 10강에서 다루는 기울기(경사 하강법)입니다.

예제모델이 '가격 = a × 넓이'이고, 넓이 30평 아파트의 실제 가격이 6억 원입니다. a = 0.1(억 원/평)로 시작했다면 학습은 a를 어느 쪽으로 움직여야 할까요?
  1. 현재 예측: 0.1 × 30 = 3억 원
  2. 실제 가격 6억 원보다 3억 원 낮게 예측했으므로 손실이 큽니다.
  3. 예측을 올려야 하므로 a를 키우는 방향으로 조금 움직입니다. 예를 들어 a = 0.15이면 예측은 4.5억 원으로 실제에 가까워집니다.
  4. 이 한 건만 보면 a = 0.2일 때 예측이 정확히 6억 원이 됩니다(0.2 × 30 = 6). 실제 학습은 수많은 거래를 동시에 보며 전체 손실이 가장 작은 a를 찾습니다.
답a를 키우는 방향(0.1 → 0.2 쪽)으로 움직입니다.

4.평가: 처음 보는 문제로 시험을 본다

학습에 쓴 데이터로 성능을 재면 안 됩니다. 이미 답을 본 문제로 시험을 보는 셈이라 점수가 실제보다 높게 나옵니다. 그래서 데이터를 처음부터 나눕니다. 대부분을 학습용으로 쓰고, 일부는 따로 떼어 두었다가 학습이 끝난 뒤 평가에만 씁니다.

평가 기준은 문제에 따라 다릅니다. 분류 문제는 몇 개를 맞혔는지(정확도)를 보는데, 정확도만 보면 속기 쉽습니다. 메일 100통 중 스팸이 5통뿐이라면 '모두 정상'이라고 답하는 엉터리 모델도 정확도가 95%입니다. 그래서 '스팸 중 몇 통을 잡아냈나', '스팸이라고 한 것 중 진짜 스팸은 몇 통인가'를 함께 봅니다.

예제메일 100통 중 스팸이 5통입니다. 어떤 모델이 모든 메일을 '정상'이라고 판정했습니다. 정확도와, 스팸을 잡아낸 비율은 각각 얼마일까요?
  1. 정상 메일 95통은 모두 맞혔고, 스팸 5통은 모두 틀렸습니다.
  2. 정확도 = 맞힌 수 ÷ 전체 = 95 ÷ 100 = 95%
  3. 스팸을 잡아낸 비율 = 잡아낸 스팸 ÷ 전체 스팸 = 0 ÷ 5 = 0%
  4. 정확도는 높지만 스팸 필터로서는 전혀 쓸모가 없습니다.
답정확도 95%, 스팸 검출률 0%

5.과적합: 기출문제만 외운 학생

학습 데이터에서는 거의 완벽한데 처음 보는 데이터에서는 형편없는 모델이 있습니다. 이것을 과적합이라고 합니다. 기출문제의 답만 통째로 외운 학생이 숫자만 바뀐 새 문제를 못 푸는 것과 같습니다. 모델이 규칙성뿐 아니라 우연한 잡음까지 외워 버린 상태입니다.

반대로 모델이 너무 단순해서 학습 데이터조차 잘 못 맞히는 상태는 과소적합이라고 합니다. 좋은 모델은 그 중간, 즉 학습 데이터도 꽤 맞히고 처음 보는 데이터도 비슷하게 맞히는 모델입니다. 학습 점수와 평가 점수의 차이가 크게 벌어지면 과적합을 의심합니다.

이 원리는 AI를 쓰는 사람에게도 의미가 있습니다. AI가 어떤 예시에서 훌륭했다고 해서 모든 비슷한 일에서 훌륭하리라는 보장은 없습니다. 내 일에 맞는 새 예시로 직접 시험해 보는 것이 가장 정확한 평가입니다.

과적합을 줄이는 대표적인 방법은 데이터를 더 많이, 더 다양하게 모으는 것입니다. 모델을 단순하게 만들거나 학습을 적당한 시점에서 멈추는 방법도 씁니다.

📌 핵심 정리

  • 머신러닝은 데이터 → 모델 → 학습 → 평가의 네 단계로 이루어진다
  • 지도학습은 정답이 붙은 예시로, 비지도학습은 정답 없이 구조를 찾는다
  • 학습은 손실(틀린 정도)을 재고 그것이 줄어드는 방향으로 숫자를 고치는 반복이다
  • 평가는 반드시 학습에 쓰지 않은 데이터로 한다 — 정확도 하나만 보면 속을 수 있다
  • 과적합은 학습 데이터를 외워 버려 새 데이터에 약해진 상태다

✍️ 확인 문제

먼저 풀어 본 뒤 '정답과 해설'을 펼치세요.

Q1. 고객의 구매 기록만 가지고 정답 없이 비슷한 고객끼리 묶는 것은 어떤 학습일까요?

⭕ 정답입니다

❌ 다시 생각해 보세요

정답과 해설
정답 ② 비지도학습

정답(레이블)이 없이 데이터의 구조를 찾으므로 비지도학습입니다.

Q2. 모델 평가에 학습용 데이터를 그대로 쓰면 안 되는 가장 큰 이유는 무엇일까요?

⭕ 정답입니다

❌ 다시 생각해 보세요

정답과 해설
정답 ② 이미 본 데이터라 성능이 실제보다 좋게 나와서

답을 미리 본 문제로 시험을 보는 것과 같아서, 처음 보는 데이터에서의 진짜 성능을 알 수 없습니다.

Q3. 학습 데이터에서는 정확도 99%인데 평가 데이터에서는 60%인 모델은 어떤 상태일 가능성이 높을까요?

⭕ 정답입니다

❌ 다시 생각해 보세요

정답과 해설
정답 ② 과적합

학습 데이터에만 지나치게 맞춰져 새 데이터에서 성능이 크게 떨어지는 전형적인 과적합입니다.

Q4. 환자 1,000명 중 질병이 있는 사람이 10명입니다. 모두 '건강'이라고 판정하는 모델의 정확도는 몇 %일까요?

정답과 해설
정답 99%

990명을 맞혔으므로 990 ÷ 1000 = 99%입니다. 하지만 환자 10명을 한 명도 찾지 못하므로 쓸모없는 모델입니다. 드문 경우를 찾는 문제에서는 정확도만으로 판단하면 안 됩니다.

🤖 AI에게 이렇게 물어보세요

복사해서 [ ] 부분을 내 상황으로 바꿔 쓰세요. 답을 그대로 믿지 말고 본문과 비교해 확인하세요.

내 일에 머신러닝을 쓸 수 있을지 감을 잡고 싶을 때

나는 [업무나 문제 설명]을 하고 있어. 이 문제를 머신러닝으로 푼다면 입력 데이터, 정답(레이블), 평가 기준을 각각 무엇으로 정해야 할지 제안해 줘. 데이터를 모을 때 생길 수 있는 치우침도 함께 알려 줘.

개념을 제대로 이해했는지 확인하고 싶을 때

과적합을 시험공부에 비유해서 설명해 줘. 그다음 과적합과 과소적합을 구별하는 문제를 세 개 내고, 내가 답하면 채점해 줘.
참고
  • 고등학교 「인공지능 기초」 교과 내용(교육부 고시 교육과정)
  • 머신러닝 입문 교재의 일반적 설명(지도학습·비지도학습·과적합)

학습 목표를 모두 이뤘다면 완료를 눌러 진도에 기록하세요.

🤖 인공지능 기초

  1. 1AI란 무엇인가 — 규칙과 학습
  2. 2머신러닝 기본 — 데이터·모델·학습·평가
  3. 3신경망 직관 — 작은 계산이 모여 판단이 된다
  4. 4대규모 언어모델은 어떻게 말을 만들까
  5. 5프롬프트 기초 — 원하는 것을 정확히 말하기
  6. 6프롬프트 심화 — 역할·예시·단계·형식
  7. 7환각과 검증 — 그럴듯함을 의심하는 법
  8. 8개인정보·저작권·윤리 — 책임 있게 쓰기
  9. 9AI와 일하는 법 — 맡기고, 확인하고, 엮기
  10. 10AI 시대 학습 전략 — 기초가 질문을 만든다
📚 함께 읽으면 좋은 글
🧠생성형 인공지능이 하는 일과 한계→ ✍️질문(프롬프트) 잘 쓰는 법→ 🔍인공지능 답변 검증하기→ 📚공부·업무에 쓰는 법과 표절 주의→
← AI 시대 기초 학력 강의