B 바이낸스 · 전 세계 1위 암호화폐 거래소바이낸스 가입 → AD OKX OKX · 글로벌 대형 암호화폐 거래소OKX 가입 → AD
🤖 인공지능 기초 · 4강 / 10

대규모 언어모델은 어떻게 말을 만들까

대규모 언어모델은 '지금까지의 글 다음에 올 가장 그럴듯한 조각'을 고르는 일을 한 조각씩 반복해 문장을 만듭니다. 이 원리를 알면 AI의 장점과 약점이 한꺼번에 이해됩니다.

⏱ 약 18분 ✍️ 확인 문제 4개 업데이트 2026-10-08
🎯 이 강의의 학습 목표
  • 토큰이 무엇이며 글이 어떻게 토큰으로 나뉘는지 설명할 수 있다
  • 언어모델이 다음 토큰 예측을 반복해 답을 만든다는 것을 설명할 수 있다
  • 사전 학습과 대화용 추가 학습의 차이를 말할 수 있다
  • 문맥 길이와 확률적 생성이 사용에 주는 영향을 설명할 수 있다

1.글은 토큰이라는 조각으로 나뉜다

언어모델은 글을 글자 그대로 읽지 않습니다. 먼저 글을 토큰이라는 조각으로 자릅니다. 토큰은 단어 하나일 수도 있고, 단어의 일부나 글자 몇 개, 문장 부호일 수도 있습니다. 자주 쓰이는 말은 한 토큰으로, 드문 말은 여러 토큰으로 쪼개지는 경향이 있습니다.

그다음 각 토큰을 숫자 목록(벡터)으로 바꿉니다. 이 숫자 목록은 학습을 거치며 뜻이 비슷한 토큰끼리 비슷한 값을 갖도록 조정됩니다. 그래서 모델 안에서 '강아지'와 '개'는 가깝고 '강아지'와 '세금'은 멉니다. 수학 기초 10강에서 다루는 벡터의 유사도가 바로 이 개념입니다.

토큰은 실용적인 의미도 있습니다. 많은 AI 서비스가 한 번에 읽을 수 있는 글의 양과 사용량을 토큰 수로 셉니다. 같은 내용이라도 언어와 표현에 따라 토큰 수가 달라집니다.

예제「오늘 날씨가 정말 좋네요」라는 문장이 어떻게 토큰으로 나뉠 수 있는지 예를 들어 보세요.
  1. 토큰을 나누는 방식은 모델마다 다르므로 아래는 설명을 위한 예시입니다.
  2. 예: 「오늘」 「 날씨」 「가」 「 정말」 「 좋」 「네요」
  3. 자주 쓰는 '오늘', '날씨' 같은 말은 통째로, 어미나 조사는 따로 떨어지는 식입니다.
  4. 모델은 이 조각들을 각각 숫자 목록으로 바꾼 뒤 계산합니다.
답단어·단어 일부·조사 단위의 조각들로 나뉘며, 정확한 나눔은 모델마다 다릅니다.

2.핵심 원리: 다음 토큰 예측

언어모델이 하는 일을 한 문장으로 줄이면 '지금까지의 토큰을 보고, 다음에 올 토큰의 확률을 계산한다'입니다. 「하늘이 참」 다음에는 「맑다」, 「푸르다」, 「흐리다」 같은 토큰이 각기 다른 확률로 올 수 있습니다. 모델은 이 확률 분포를 계산하고, 그중 하나를 골라 글 뒤에 붙입니다.

그러고는 방금 붙인 토큰까지 포함한 글을 다시 입력으로 삼아 그다음 토큰을 예측합니다. 이것을 답이 끝날 때까지 반복합니다. 긴 답변도 결국 이 한 조각씩의 선택이 수백, 수천 번 이어진 결과입니다.

다음 토큰을 잘 예측하려면 문법뿐 아니라 사실, 논리, 말투, 맥락까지 함께 알아야 합니다. 「대한민국의 수도는」 다음을 맞히려면 지리를 알아야 하고, 수학 풀이의 다음 줄을 맞히려면 계산 규칙을 알아야 합니다. 거대한 양의 글로 이 예측을 훈련하는 과정에서 모델은 놀랄 만큼 많은 지식과 패턴을 익히게 됩니다.

입력: 「하늘이 참」
다음 토큰 확률(예시): 맑다 0.41 · 푸르다 0.33 · 흐리다 0.12 · 높다 0.08 · …
하나를 고른다 → 「하늘이 참 맑다」 → 다시 다음 토큰 예측 → …
위의 확률 숫자는 원리를 보여 주기 위해 지어낸 예시입니다. 실제 확률은 모델과 앞뒤 문맥에 따라 달라집니다.

3.짧은 답 하나가 만들어지는 과정 따라가기

원리를 한 번에 따라가 봅시다. 사용자가 '비 오는 날을 한 문장으로 묘사해 줘'라고 입력했다고 하겠습니다. 모델은 이 질문을 토큰으로 자르고, 그 뒤에 이어질 첫 토큰부터 하나씩 고릅니다. 아래 확률은 모두 설명을 위해 지어낸 숫자입니다.

고르는 방법에도 선택지가 있습니다. 매번 확률이 가장 높은 토큰만 고르면 같은 질문에 늘 같은 답이 나오지만 표현이 밋밋해지기 쉽습니다. 확률에 비례해 가끔 덜 유력한 토큰도 고르면 표현이 다양해지는 대신 답이 매번 조금씩 달라집니다. 많은 서비스는 이 무작위성의 정도를 정하는 설정을 두고 있습니다.

흔한 오해 하나도 여기서 풀립니다. 모델은 완성된 답을 머릿속에 먼저 써 두고 그것을 보여 주는 것이 아닙니다. 앞에서 고른 토큰이 뒤의 선택을 계속 좁혀 가며 답이 만들어집니다. 그래서 처음 몇 토큰이 엉뚱한 방향으로 가면 뒤에서 그 흐름을 이어 가며 틀린 내용을 그럴듯하게 덧붙일 수 있습니다.

예제'비 오는 날을 한 문장으로 묘사해 줘'라는 요청에 모델이 답을 만드는 과정을 단계별로 적어 보세요. (확률은 예시입니다)
  1. 입력 전체를 토큰으로 자르고 각각을 숫자 목록으로 바꿉니다.
  2. 첫 토큰의 확률을 계산합니다. 예: 「창밖」 0.30 · 「빗방울」 0.25 · 「회색」 0.15 · … 그중 「빗방울」을 고릅니다.
  3. 「빗방울」까지 붙인 글을 다시 입력으로 삼아 다음 토큰을 계산합니다. 예: 「이」 0.60 · 「소리」 0.20 · … 「이」를 고릅니다.
  4. 같은 일을 반복해 「빗방울이 유리창을 두드리고 거리는 회색으로 젖어 간다.」까지 이어 씁니다.
  5. 다음 토큰으로 '답이 끝났음'을 뜻하는 특별한 토큰의 확률이 가장 높아지면 그것을 고르고 생성을 멈춥니다.
답토큰으로 자르기 → 다음 토큰 확률 계산 → 하나 고르기 → 붙여서 다시 예측을 반복하고, 끝을 뜻하는 토큰이 나오면 멈춥니다.

4.사전 학습과 대화용 추가 학습

대규모 언어모델은 보통 두 단계로 만들어집니다. 첫 단계인 사전 학습에서는 책, 웹 문서, 코드 같은 방대한 글에서 다음 토큰 예측을 반복하며 언어와 지식의 패턴을 익힙니다. '대규모'라는 말은 학습한 글의 양과 모델 속 가중치의 수가 매우 많다는 뜻입니다.

사전 학습만 마친 모델은 글을 이어 쓰는 데는 능숙하지만, 질문에 친절하게 답하는 데는 서툽니다. 그래서 두 번째 단계에서 '질문과 좋은 답'의 예시로 추가 학습을 하고, 사람이 여러 답 중 더 나은 것을 고른 평가를 반영해 다듬습니다. 이 과정을 거쳐 지시를 따르고, 대화하고, 위험한 요청을 거절하는 모델이 됩니다.

중요한 결과가 하나 있습니다. 모델의 지식은 학습 데이터를 모은 시점에서 멈춥니다. 그 이후의 사건은 따로 검색 기능을 붙이거나 사용자가 자료를 넣어 주지 않는 한 알지 못합니다. 최신 정보가 필요한 질문에서는 이 점을 꼭 기억해야 합니다.

5.문맥 창: 한 번에 볼 수 있는 글의 양

언어모델은 대화할 때 지금까지의 대화와 붙여 넣은 자료를 통째로 입력으로 받습니다. 한 번에 받을 수 있는 토큰의 최대량을 문맥 창(컨텍스트 윈도)이라고 합니다. 모델은 기본적으로 대화를 '기억'하는 것이 아니라, 매번 앞의 대화 전체를 다시 읽고 다음 답을 만듭니다.

그래서 대화가 아주 길어져 문맥 창을 넘으면 앞부분이 잘려 나가거나 덜 반영될 수 있습니다. 중요한 조건은 대화 초반에 한 번 말하고 끝내기보다, 필요할 때 다시 짧게 상기시키는 편이 안전합니다. 또 새 주제는 새 대화에서 시작하는 것이 결과가 깔끔합니다.

6.원리에서 나오는 장점과 약점

다음 토큰을 확률로 고르기 때문에 같은 질문에도 답이 조금씩 달라질 수 있습니다. 이 성질은 아이디어를 여러 개 얻을 때는 장점이고, 정확히 같은 결과가 필요할 때는 약점입니다.

또 모델은 '그럴듯한 다음 말'을 고르는 것이지 사실을 확인하는 것이 아닙니다. 학습 데이터에 잘 나타난 내용은 대개 정확하지만, 드물거나 최신이거나 숫자가 많은 내용에서는 그럴듯하지만 틀린 문장을 자연스럽게 만들어 낼 수 있습니다. 이것이 7강에서 다룰 환각입니다.

반대로 글의 형식을 바꾸고, 요약하고, 설명을 쉽게 풀고, 여러 관점을 펼치는 일처럼 '언어 패턴'이 핵심인 일에서는 매우 강합니다. 원리를 알면 맡길 일과 확인할 일을 구분할 수 있습니다.

다음 토큰 예측이라는 원리에서 나오는 성질
성질좋게 쓰면조심할 점
확률적으로 고른다아이디어를 여러 개 얻는다같은 질문에도 답이 달라진다
그럴듯함을 따른다자연스러운 문장, 형식 변환틀린 사실도 자연스럽게 말한다
학습 시점에서 지식이 멈춘다널리 알려진 지식은 잘 안다최신 정보는 모를 수 있다
문맥 창 안의 글만 본다자료를 붙여 넣으면 그 자료를 근거로 답한다아주 긴 대화의 앞부분은 덜 반영될 수 있다

📌 핵심 정리

  • 언어모델은 글을 토큰으로 쪼개고 각 토큰을 숫자 목록(벡터)으로 바꿔 계산한다
  • 답은 '다음 토큰 확률 계산 → 하나 고르기'를 끝까지 반복해 만들어진다
  • 사전 학습으로 언어와 지식을 익히고, 추가 학습으로 지시를 따르는 대화 모델이 된다
  • 모델의 지식은 학습 시점에서 멈추며, 문맥 창 안의 글만 보고 답한다
  • 그럴듯함과 사실은 다를 수 있다 — 숫자·최신 정보·드문 사실은 확인한다

✍️ 확인 문제

먼저 풀어 본 뒤 '정답과 해설'을 펼치세요.

Q1. 대규모 언어모델이 답을 만드는 기본 방식으로 가장 알맞은 것은 무엇일까요?

⭕ 정답입니다

❌ 다시 생각해 보세요

정답과 해설
정답 ② 다음에 올 토큰의 확률을 계산해 하나씩 이어 붙인다

언어모델은 지금까지의 글을 보고 다음 토큰의 확률을 계산해 하나를 고르는 일을 반복합니다.

Q2. 모델이 어제 일어난 일을 잘 모르는 가장 근본적인 이유는 무엇일까요?

⭕ 정답입니다

❌ 다시 생각해 보세요

정답과 해설
정답 ② 모델의 지식이 학습 데이터를 모은 시점에서 멈추기 때문에

학습 이후의 정보는 검색 기능이나 사용자가 넣어 준 자료가 없으면 알 수 없습니다.

Q3. 같은 질문을 두 번 했는데 답이 조금 달랐습니다. 가장 알맞은 설명은?

⭕ 정답입니다

❌ 다시 생각해 보세요

정답과 해설
정답 ② 모델이 다음 토큰을 확률적으로 고르기 때문이다

확률 분포에서 토큰을 고르므로 같은 입력에도 다른 선택이 나올 수 있습니다. 답이 다르다고 어느 하나가 반드시 틀린 것은 아닙니다.

Q4. 언어모델이 한 번에 읽을 수 있는 토큰의 최대량을 무엇이라고 부를까요?

정답과 해설
정답 문맥 창(컨텍스트 윈도)

대화와 붙여 넣은 자료를 합친 양이 문맥 창을 넘으면 일부가 반영되지 않을 수 있습니다.

🤖 AI에게 이렇게 물어보세요

복사해서 [ ] 부분을 내 상황으로 바꿔 쓰세요. 답을 그대로 믿지 말고 본문과 비교해 확인하세요.

최신 정보가 필요한 질문을 할 때

다음 질문에 답하기 전에, 이 내용이 너의 학습 시점 이후에 바뀌었을 가능성이 있는지 먼저 알려 줘. 바뀌었을 수 있는 부분은 내가 어디에서 최신 정보를 확인해야 하는지도 함께 말해 줘. 질문: [질문]

긴 자료를 근거로 답을 받고 싶을 때

아래 자료만 근거로 답해 줘. 자료에 없는 내용은 추측하지 말고 '자료에 없음'이라고 써 줘. 답의 각 문장 끝에 근거가 된 자료의 문단 번호를 괄호로 달아 줘.
[자료 붙여 넣기]
질문: [질문]
참고
  • 자연어 처리 입문 교재의 일반적 설명(토큰화·언어모델·문맥)
  • 고등학교 「인공지능 기초」 교과 내용(교육부 고시 교육과정)

학습 목표를 모두 이뤘다면 완료를 눌러 진도에 기록하세요.

🤖 인공지능 기초

  1. 1AI란 무엇인가 — 규칙과 학습
  2. 2머신러닝 기본 — 데이터·모델·학습·평가
  3. 3신경망 직관 — 작은 계산이 모여 판단이 된다
  4. 4대규모 언어모델은 어떻게 말을 만들까
  5. 5프롬프트 기초 — 원하는 것을 정확히 말하기
  6. 6프롬프트 심화 — 역할·예시·단계·형식
  7. 7환각과 검증 — 그럴듯함을 의심하는 법
  8. 8개인정보·저작권·윤리 — 책임 있게 쓰기
  9. 9AI와 일하는 법 — 맡기고, 확인하고, 엮기
  10. 10AI 시대 학습 전략 — 기초가 질문을 만든다
📚 함께 읽으면 좋은 글
🧠생성형 인공지능이 하는 일과 한계→ ✍️질문(프롬프트) 잘 쓰는 법→ 🔍인공지능 답변 검증하기→ 📚공부·업무에 쓰는 법과 표절 주의→
← AI 시대 기초 학력 강의