1.글은 토큰이라는 조각으로 나뉜다
언어모델은 글을 글자 그대로 읽지 않습니다. 먼저 글을 토큰이라는 조각으로 자릅니다. 토큰은 단어 하나일 수도 있고, 단어의 일부나 글자 몇 개, 문장 부호일 수도 있습니다. 자주 쓰이는 말은 한 토큰으로, 드문 말은 여러 토큰으로 쪼개지는 경향이 있습니다.
그다음 각 토큰을 숫자 목록(벡터)으로 바꿉니다. 이 숫자 목록은 학습을 거치며 뜻이 비슷한 토큰끼리 비슷한 값을 갖도록 조정됩니다. 그래서 모델 안에서 '강아지'와 '개'는 가깝고 '강아지'와 '세금'은 멉니다. 수학 기초 10강에서 다루는 벡터의 유사도가 바로 이 개념입니다.
토큰은 실용적인 의미도 있습니다. 많은 AI 서비스가 한 번에 읽을 수 있는 글의 양과 사용량을 토큰 수로 셉니다. 같은 내용이라도 언어와 표현에 따라 토큰 수가 달라집니다.
- 토큰을 나누는 방식은 모델마다 다르므로 아래는 설명을 위한 예시입니다.
- 예: 「오늘」 「 날씨」 「가」 「 정말」 「 좋」 「네요」
- 자주 쓰는 '오늘', '날씨' 같은 말은 통째로, 어미나 조사는 따로 떨어지는 식입니다.
- 모델은 이 조각들을 각각 숫자 목록으로 바꾼 뒤 계산합니다.
2.핵심 원리: 다음 토큰 예측
언어모델이 하는 일을 한 문장으로 줄이면 '지금까지의 토큰을 보고, 다음에 올 토큰의 확률을 계산한다'입니다. 「하늘이 참」 다음에는 「맑다」, 「푸르다」, 「흐리다」 같은 토큰이 각기 다른 확률로 올 수 있습니다. 모델은 이 확률 분포를 계산하고, 그중 하나를 골라 글 뒤에 붙입니다.
그러고는 방금 붙인 토큰까지 포함한 글을 다시 입력으로 삼아 그다음 토큰을 예측합니다. 이것을 답이 끝날 때까지 반복합니다. 긴 답변도 결국 이 한 조각씩의 선택이 수백, 수천 번 이어진 결과입니다.
다음 토큰을 잘 예측하려면 문법뿐 아니라 사실, 논리, 말투, 맥락까지 함께 알아야 합니다. 「대한민국의 수도는」 다음을 맞히려면 지리를 알아야 하고, 수학 풀이의 다음 줄을 맞히려면 계산 규칙을 알아야 합니다. 거대한 양의 글로 이 예측을 훈련하는 과정에서 모델은 놀랄 만큼 많은 지식과 패턴을 익히게 됩니다.
3.짧은 답 하나가 만들어지는 과정 따라가기
원리를 한 번에 따라가 봅시다. 사용자가 '비 오는 날을 한 문장으로 묘사해 줘'라고 입력했다고 하겠습니다. 모델은 이 질문을 토큰으로 자르고, 그 뒤에 이어질 첫 토큰부터 하나씩 고릅니다. 아래 확률은 모두 설명을 위해 지어낸 숫자입니다.
고르는 방법에도 선택지가 있습니다. 매번 확률이 가장 높은 토큰만 고르면 같은 질문에 늘 같은 답이 나오지만 표현이 밋밋해지기 쉽습니다. 확률에 비례해 가끔 덜 유력한 토큰도 고르면 표현이 다양해지는 대신 답이 매번 조금씩 달라집니다. 많은 서비스는 이 무작위성의 정도를 정하는 설정을 두고 있습니다.
흔한 오해 하나도 여기서 풀립니다. 모델은 완성된 답을 머릿속에 먼저 써 두고 그것을 보여 주는 것이 아닙니다. 앞에서 고른 토큰이 뒤의 선택을 계속 좁혀 가며 답이 만들어집니다. 그래서 처음 몇 토큰이 엉뚱한 방향으로 가면 뒤에서 그 흐름을 이어 가며 틀린 내용을 그럴듯하게 덧붙일 수 있습니다.
- 입력 전체를 토큰으로 자르고 각각을 숫자 목록으로 바꿉니다.
- 첫 토큰의 확률을 계산합니다. 예: 「창밖」 0.30 · 「빗방울」 0.25 · 「회색」 0.15 · … 그중 「빗방울」을 고릅니다.
- 「빗방울」까지 붙인 글을 다시 입력으로 삼아 다음 토큰을 계산합니다. 예: 「이」 0.60 · 「소리」 0.20 · … 「이」를 고릅니다.
- 같은 일을 반복해 「빗방울이 유리창을 두드리고 거리는 회색으로 젖어 간다.」까지 이어 씁니다.
- 다음 토큰으로 '답이 끝났음'을 뜻하는 특별한 토큰의 확률이 가장 높아지면 그것을 고르고 생성을 멈춥니다.
4.사전 학습과 대화용 추가 학습
대규모 언어모델은 보통 두 단계로 만들어집니다. 첫 단계인 사전 학습에서는 책, 웹 문서, 코드 같은 방대한 글에서 다음 토큰 예측을 반복하며 언어와 지식의 패턴을 익힙니다. '대규모'라는 말은 학습한 글의 양과 모델 속 가중치의 수가 매우 많다는 뜻입니다.
사전 학습만 마친 모델은 글을 이어 쓰는 데는 능숙하지만, 질문에 친절하게 답하는 데는 서툽니다. 그래서 두 번째 단계에서 '질문과 좋은 답'의 예시로 추가 학습을 하고, 사람이 여러 답 중 더 나은 것을 고른 평가를 반영해 다듬습니다. 이 과정을 거쳐 지시를 따르고, 대화하고, 위험한 요청을 거절하는 모델이 됩니다.
중요한 결과가 하나 있습니다. 모델의 지식은 학습 데이터를 모은 시점에서 멈춥니다. 그 이후의 사건은 따로 검색 기능을 붙이거나 사용자가 자료를 넣어 주지 않는 한 알지 못합니다. 최신 정보가 필요한 질문에서는 이 점을 꼭 기억해야 합니다.
5.문맥 창: 한 번에 볼 수 있는 글의 양
언어모델은 대화할 때 지금까지의 대화와 붙여 넣은 자료를 통째로 입력으로 받습니다. 한 번에 받을 수 있는 토큰의 최대량을 문맥 창(컨텍스트 윈도)이라고 합니다. 모델은 기본적으로 대화를 '기억'하는 것이 아니라, 매번 앞의 대화 전체를 다시 읽고 다음 답을 만듭니다.
그래서 대화가 아주 길어져 문맥 창을 넘으면 앞부분이 잘려 나가거나 덜 반영될 수 있습니다. 중요한 조건은 대화 초반에 한 번 말하고 끝내기보다, 필요할 때 다시 짧게 상기시키는 편이 안전합니다. 또 새 주제는 새 대화에서 시작하는 것이 결과가 깔끔합니다.
6.원리에서 나오는 장점과 약점
다음 토큰을 확률로 고르기 때문에 같은 질문에도 답이 조금씩 달라질 수 있습니다. 이 성질은 아이디어를 여러 개 얻을 때는 장점이고, 정확히 같은 결과가 필요할 때는 약점입니다.
또 모델은 '그럴듯한 다음 말'을 고르는 것이지 사실을 확인하는 것이 아닙니다. 학습 데이터에 잘 나타난 내용은 대개 정확하지만, 드물거나 최신이거나 숫자가 많은 내용에서는 그럴듯하지만 틀린 문장을 자연스럽게 만들어 낼 수 있습니다. 이것이 7강에서 다룰 환각입니다.
반대로 글의 형식을 바꾸고, 요약하고, 설명을 쉽게 풀고, 여러 관점을 펼치는 일처럼 '언어 패턴'이 핵심인 일에서는 매우 강합니다. 원리를 알면 맡길 일과 확인할 일을 구분할 수 있습니다.
| 성질 | 좋게 쓰면 | 조심할 점 |
|---|---|---|
| 확률적으로 고른다 | 아이디어를 여러 개 얻는다 | 같은 질문에도 답이 달라진다 |
| 그럴듯함을 따른다 | 자연스러운 문장, 형식 변환 | 틀린 사실도 자연스럽게 말한다 |
| 학습 시점에서 지식이 멈춘다 | 널리 알려진 지식은 잘 안다 | 최신 정보는 모를 수 있다 |
| 문맥 창 안의 글만 본다 | 자료를 붙여 넣으면 그 자료를 근거로 답한다 | 아주 긴 대화의 앞부분은 덜 반영될 수 있다 |
📌 핵심 정리
- 언어모델은 글을 토큰으로 쪼개고 각 토큰을 숫자 목록(벡터)으로 바꿔 계산한다
- 답은 '다음 토큰 확률 계산 → 하나 고르기'를 끝까지 반복해 만들어진다
- 사전 학습으로 언어와 지식을 익히고, 추가 학습으로 지시를 따르는 대화 모델이 된다
- 모델의 지식은 학습 시점에서 멈추며, 문맥 창 안의 글만 보고 답한다
- 그럴듯함과 사실은 다를 수 있다 — 숫자·최신 정보·드문 사실은 확인한다
🤖 AI에게 이렇게 물어보세요
복사해서 [ ] 부분을 내 상황으로 바꿔 쓰세요. 답을 그대로 믿지 말고 본문과 비교해 확인하세요.
최신 정보가 필요한 질문을 할 때
다음 질문에 답하기 전에, 이 내용이 너의 학습 시점 이후에 바뀌었을 가능성이 있는지 먼저 알려 줘. 바뀌었을 수 있는 부분은 내가 어디에서 최신 정보를 확인해야 하는지도 함께 말해 줘. 질문: [질문]
긴 자료를 근거로 답을 받고 싶을 때
아래 자료만 근거로 답해 줘. 자료에 없는 내용은 추측하지 말고 '자료에 없음'이라고 써 줘. 답의 각 문장 끝에 근거가 된 자료의 문단 번호를 괄호로 달아 줘. [자료 붙여 넣기] 질문: [질문]
- 자연어 처리 입문 교재의 일반적 설명(토큰화·언어모델·문맥)
- 고등학교 「인공지능 기초」 교과 내용(교육부 고시 교육과정)
학습 목표를 모두 이뤘다면 완료를 눌러 진도에 기록하세요.
이 브라우저에서는 저장할 수 없어 이 화면에서만 표시됩니다.