B 바이낸스 · 전 세계 1위 암호화폐 거래소바이낸스 가입 → AD OKX OKX · 글로벌 대형 암호화폐 거래소OKX 가입 → AD
📐 수학 기초 · 9강 / 10

데이터 읽기 — 그래프의 함정

숫자는 거짓말을 하지 않지만, 숫자를 보여 주는 방식은 쉽게 오해를 만듭니다. 축, 기준, 표본, 비교 대상을 확인하는 습관이 데이터를 바르게 읽는 힘입니다.

⏱ 약 16분 ✍️ 확인 문제 4개 업데이트 2026-10-08
🎯 이 강의의 학습 목표
  • 세로축이 잘린 그래프에서 실제 차이를 다시 계산할 수 있다
  • 상관관계와 인과관계를 구분하고 숨은 요인을 떠올릴 수 있다
  • 표본이 치우쳤는지 판단하는 질문을 던질 수 있다
  • 절대수와 비율, 상대적 변화와 절대적 변화를 바꾸어 계산할 수 있다

1.축 자르기 — 작은 차이를 크게 보이게

막대그래프의 막대 높이는 값의 크기를 눈으로 비교하라고 있는 것입니다. 그런데 세로축이 0이 아닌 곳에서 시작하면 막대 높이의 비율이 실제 값의 비율과 달라집니다. 작은 차이가 몇 배의 차이처럼 보이게 됩니다.

세로축을 자르는 것이 늘 잘못은 아닙니다. 체온이나 주가처럼 0 근처로 내려갈 일이 없는 값의 작은 변화를 보는 꺾은선그래프에서는 흔히 축을 자릅니다. 문제는 막대의 길이로 크기를 비교하게 만들면서 축을 자르는 경우입니다. 그래프를 보면 먼저 세로축의 시작값과 눈금을 확인하세요.

예제예시: A 제품의 만족도 점수는 100, B 제품은 104입니다. 세로축을 98부터 시작한 막대그래프에서 B의 막대는 A의 몇 배로 보일까요? 실제 차이는 몇 %일까요?
  1. 1단계 그래프에 보이는 막대 높이: A는 100 − 98 = 2칸, B는 104 − 98 = 6칸.
  2. 2단계 보이는 비율: 6 ÷ 2 = 3배.
  3. 3단계 실제 비율: 104 ÷ 100 = 1.04, 즉 B가 A보다 4% 높을 뿐입니다.
  4. 검산: 세로축을 0부터 그리면 막대 높이는 100과 104로, 눈으로 거의 구별하기 어려운 차이입니다.
답그래프에서는 3배로 보이지만 실제 차이는 4%입니다

2.상관은 인과가 아니다

두 값이 함께 오르내리는 것을 상관관계라고 합니다. 여름에는 아이스크림 판매량이 늘고 물놀이 사고도 늘어납니다. 둘 사이에는 뚜렷한 상관이 있지만, 아이스크림이 사고를 일으키는 것은 아닙니다. 기온이라는 제3의 요인이 둘을 함께 움직입니다. 이런 숨은 요인을 교란 변수라고 합니다.

상관을 인과로 읽기 전에 세 가지를 물어보세요. 숨은 공통 원인은 없는가? 원인과 결과의 방향이 거꾸로일 수는 없는가(운동하는 사람이 건강한 것인지, 건강한 사람이 운동을 더 하는 것인지)? 우연히 겹친 것은 아닌가? 인과를 확인하는 가장 확실한 방법은 무작위로 나눈 두 집단을 비교하는 실험이지만, 언제나 그런 실험이 가능한 것은 아닙니다.

  • 공통 원인: 기온 → 아이스크림 판매, 기온 → 물놀이 사고
  • 방향 반대: '병원에 자주 가는 사람이 더 아프다' — 아파서 병원에 가는 것
  • 우연: 관계없는 두 통계도 기간을 잘 고르면 비슷하게 움직일 수 있다

3.표본 편향 — 누구에게 물었는가

전체를 다 조사할 수 없으니 일부(표본)를 뽑아 전체를 추정합니다. 이때 표본이 전체를 닮지 않으면 아무리 많이 모아도 결과가 치우칩니다. 어떤 앱 안에서만 한 설문은 그 앱을 쓰는 사람의 의견이고, 응답을 자원한 사람만 모은 설문은 그 주제에 관심이 많은 사람의 의견에 가깝습니다.

살아남은 것만 보는 것도 표본 편향입니다. '성공한 사람들은 모두 새벽에 일어났다'는 말에는 새벽에 일어났지만 성공하지 못한 사람들이 빠져 있습니다. 데이터를 볼 때는 숫자보다 먼저 '누가, 어떻게 뽑혔고, 누가 빠졌는가'를 물어야 합니다. 표본의 크기보다 뽑는 방법이 더 중요할 때가 많습니다.

AI도 같은 문제를 안고 있습니다. 학습 데이터가 특정 집단에 치우치면 AI의 판단도 그쪽으로 치우칩니다. 인공지능 기초 과정에서 다루는 데이터 편향이 바로 이 표본 편향입니다.

4.비율과 절대수, 상대적 변화와 절대적 변화

인구가 100만 명인 도시와 10만 명인 도시의 사고 건수를 그대로 비교하면 큰 도시가 늘 많아 보입니다. 공정하게 비교하려면 인구 10만 명당처럼 같은 기준으로 바꾼 비율을 봐야 합니다. 반대로 비율만 보고 절대수를 놓치면 실제 규모를 오해합니다.

'위험이 두 배로 늘었다'는 말도 같은 문제를 품고 있습니다. 상대적 변화(두 배, 100% 증가)는 크게 들리지만, 원래 위험이 아주 작았다면 절대적 변화는 미미할 수 있습니다. 둘을 함께 보아야 판단할 수 있습니다.

예제예시: 도시 A는 인구 1,000,000명에 한 해 사고 500건, 도시 B는 인구 100,000명에 사고 100건입니다. 인구 10만 명당 사고 건수로 비교하세요.
  1. 1단계 도시 A: 500 ÷ 1,000,000 × 100,000 = 50건.
  2. 2단계 도시 B: 100 ÷ 100,000 × 100,000 = 100건.
  3. 3단계 절대수로는 A가 5배 많지만, 인구 대비로는 B가 2배 높습니다.
  4. 검산: A는 10만 명 묶음이 10개이고 500 ÷ 10 = 50, B는 1개라 100. 같은 결과입니다.
답10만 명당 A 50건, B 100건 — 비율로는 B가 2배
예제예시: 어떤 부작용이 10,000명 중 2명에서 4명으로 늘었습니다. 상대적 변화와 절대적 변화를 각각 구하세요.
  1. 1단계 상대적 변화: (4 − 2) ÷ 2 = 1 → 100% 증가(두 배).
  2. 2단계 절대적 변화: 2 ÷ 10,000 = 0.02%에서 4 ÷ 10,000 = 0.04%로, 0.02%p 증가.
  3. 검산: 0.04 − 0.02 = 0.02%p이고, 10,000명 기준으로 2명이 더 생긴 것과 같습니다.
답상대적으로는 두 배(100% 증가), 절대적으로는 0.02%p(10,000명 중 2명) 증가

5.평균과 묶음의 함정

평균 수심이 1 m인 강을 걸어서 건널 수 있을까요? 가장자리가 얕고 가운데가 3 m라면 평균은 1 m여도 건널 수 없습니다. 평균은 퍼짐과 최댓값을 알려 주지 않습니다. 8강에서 본 것처럼 평균 옆에는 중앙값과 퍼짐을 함께 놓아야 합니다.

묶어서 본 결과와 나누어 본 결과가 정반대가 되는 경우도 있습니다. 이를 심슨의 역설이라고 합니다. 아래 예시에서 병원 X는 쉬운 수술과 어려운 수술 모두에서 Y보다 성공률이 높지만, 합쳐 보면 Y가 훨씬 높아 보입니다. X가 어려운 수술을 훨씬 많이 맡았기 때문입니다.

예시: 가상의 두 병원 수술 성공률
쉬운 수술어려운 수술전체
병원 X9/10 (90%)30/90 (약 33%)39/100 (39%)
병원 Y85/100 (85%)3/10 (30%)88/110 (80%)
예제위 표에서 두 병원의 전체 성공률을 직접 계산하고, 왜 결론이 뒤집히는지 설명하세요.
  1. 1단계 X 전체: (9 + 30) ÷ (10 + 90) = 39 ÷ 100 = 39%.
  2. 2단계 Y 전체: (85 + 3) ÷ (100 + 10) = 88 ÷ 110 = 80%.
  3. 3단계 X는 환자 100명 중 90명이 어려운 수술, Y는 110명 중 10명만 어려운 수술입니다. 전체 성공률은 각 병원이 맡은 환자 구성의 영향을 크게 받습니다.
  4. 검산: 쉬운 수술 90% > 85%, 어려운 수술 약 33.3% > 30%로 두 묶음 모두 X가 높습니다. 그런데 전체는 39% < 80%입니다.
답X 39%, Y 80% — 환자 구성(어려운 수술 비중)이 달라서 묶으면 결론이 뒤집힙니다
데이터 읽기 점검표: 축의 시작값은? 기준(분모)은? 누구를 조사했나? 비율인가 절대수인가? 묶어서 본 것인가, 나누어 본 것인가? 다른 설명(숨은 요인)은 없나?

📌 핵심 정리

  • 막대그래프의 세로축이 0에서 시작하지 않으면 차이가 부풀려 보인다
  • 상관관계는 인과관계가 아니다 — 공통 원인, 방향, 우연을 먼저 의심한다
  • 표본은 크기보다 뽑는 방법이 중요하다 — 누가 빠졌는지 묻는다
  • 절대수와 비율, 상대적 변화와 절대적 변화를 함께 본다
  • 평균 하나로는 퍼짐을 알 수 없고, 묶은 결과는 나눈 결과와 반대일 수 있다

✍️ 확인 문제

먼저 풀어 본 뒤 '정답과 해설'을 펼치세요.

Q1. 예시: 세로축이 90부터 시작하는 막대그래프에서 A는 95, B는 100입니다. B의 막대는 A의 막대보다 몇 배 길어 보일까요?

⭕ 정답입니다

❌ 다시 생각해 보세요

정답과 해설
정답 ② 2배

보이는 높이는 A가 95 − 90 = 5, B가 100 − 90 = 10이라 2배로 보입니다. 실제 비율은 100 ÷ 95 ≈ 1.05배입니다.

Q2. 커피를 많이 마시는 사람일수록 수면 시간이 짧다는 상관관계가 관찰되었습니다. 이것만으로 할 수 있는 말로 가장 알맞은 것은 무엇일까요?

⭕ 정답입니다

❌ 다시 생각해 보세요

정답과 해설
정답 ② 잠이 부족한 사람이 커피를 더 마시는 것일 수도 있다

상관만으로는 인과의 방향을 알 수 없습니다. 잠이 부족해서 커피를 더 마시는 반대 방향이나, 야근 같은 공통 원인도 가능합니다.

Q3. 예시: 인구 200,000명인 도시에서 한 해 사고가 60건 났습니다. 인구 10만 명당 사고는 몇 건일까요?

정답과 해설
정답 30건

60 ÷ 200,000 × 100,000 = 30건입니다. 10만 명 묶음이 2개이므로 60 ÷ 2 = 30으로도 구할 수 있습니다.

Q4. 쉬운 일과 어려운 일 두 묶음 모두에서 A팀의 성공률이 B팀보다 높은데, 전체 성공률은 B팀이 높게 나왔습니다. 가장 그럴듯한 이유는 무엇일까요?

⭕ 정답입니다

❌ 다시 생각해 보세요

정답과 해설
정답 ② A팀이 어려운 일을 훨씬 많이 맡았다

심슨의 역설입니다. 묶음별 비중이 다르면 전체 성공률은 실력보다 맡은 일의 구성에 크게 좌우됩니다.

🤖 AI에게 이렇게 물어보세요

복사해서 [ ] 부분을 내 상황으로 바꿔 쓰세요. 답을 그대로 믿지 말고 본문과 비교해 확인하세요.

기사나 보고서의 그래프를 비판적으로 읽고 싶을 때

다음 그래프(또는 수치) 설명을 보고, 축 자르기·기준(분모)·표본 편향·상관과 인과·비율과 절대수·묶음 통계의 함정 중 해당할 수 있는 것을 점검표로 짚어 줘. 각 항목마다 확인하려면 어떤 추가 정보가 필요한지도 적어 줘. 내용: [붙여 넣기]

그래프 함정을 연습하고 싶을 때

가상의 숫자로 오해를 부르는 그래프 설명 5개를 만들어 줘. 각각 어떤 함정이 숨어 있는지는 숨기고, 내가 찾아낸 뒤에 정답과 바른 계산을 보여 줘. 실제 통계처럼 보이지 않게 '예시'라고 꼭 표시해 줘.

AI가 만든 데이터 요약을 받았을 때

방금 요약에 쓴 수치마다 출처와 기준(무엇을 분모로 했는지)을 밝혀 줘. 출처를 확인할 수 없는 수치는 따로 표시해 줘.
참고
  • 고등학교 수학 교과서의 일반적 내용(통계, 표본조사)
  • 기초 통계학 교재의 일반적 설명(상관과 인과, 심슨의 역설)

학습 목표를 모두 이뤘다면 완료를 눌러 진도에 기록하세요.

📐 수학 기초

  1. 1수와 연산 — 분수와 소수 다시 보기
  2. 2비와 비율 — 퍼센트를 바르게 읽기
  3. 3방정식 — 모르는 수를 찾는 저울
  4. 4함수와 그래프 — 변화를 읽는 눈
  5. 5지수와 로그 — 곱해서 커지는 세계
  6. 6기하 기초 — 넓이와 피타고라스
  7. 7확률 — 불확실함을 숫자로
  8. 8통계 — 평균·중앙값·분산
  9. 9데이터 읽기 — 그래프의 함정
  10. 10AI를 이해하는 수학
📚 함께 읽으면 좋은 글
🧠생성형 인공지능이 하는 일과 한계→ ✍️질문(프롬프트) 잘 쓰는 법→ 🔍인공지능 답변 검증하기→ 📚공부·업무에 쓰는 법과 표절 주의→
← AI 시대 기초 학력 강의