B バイナンス · 世界最大級の暗号資産取引所バイナンス 登録 → AD OKX OKX · 世界の大手暗号資産取引所OKX 登録 → AD
🤖 AIの基礎 · 第4講 / 10

大規模言語モデルはどうやって言葉をつくるのか

大規模言語モデルは、「ここまでの文章の次に来る最ももっともらしい断片」を選ぶことを一つずつ繰り返して文章をつくります。この仕組みがわかると、AIの長所と短所がまとめて理解できます。

⏱ 約18分 ✍️ 確認問題 4問 更新 2026-10-08
🎯 この講義の学習目標
  • トークンとは何か、文章がどのようにトークンに分けられるかを説明できる
  • 言語モデルが次のトークンの予測を繰り返して答えをつくることを説明できる
  • 事前学習と対話向けの追加学習の違いを説明できる
  • 文脈の長さと確率的な生成が、使い方にどう影響するかを説明できる

1.文章はトークンという断片に分けられる

言語モデルは、文章を文字どおりに読んでいるわけではありません。まず文章をトークンという断片に切り分けます。トークンは一つの単語のこともあれば、単語の一部や数文字、句読点のこともあります。よく使われる言葉は一つのトークンに、まれな言葉は複数のトークンに分かれる傾向があります。

次に、それぞれのトークンを数の並び(ベクトル)に変えます。この数の並びは学習を通じて、意味の似たトークン同士が似た値を持つように調整されます。そのため、モデルの中では「子犬」と「犬」は近く、「子犬」と「税金」は遠くにあります。「数学の基礎 第10講」で扱うベクトルの類似度が、まさにこの考え方です。

トークンには実用的な意味もあります。多くのAIサービスは、一度に読める文章の量や利用量をトークンの数で数えます。同じ内容でも、言語や表現によってトークンの数は変わります。

例題「今日は本当にいい天気ですね」という文が、どのようにトークンに分けられうるか、例を挙げてみてください。
  1. トークンの分け方はモデルごとに異なるので、以下は説明のための例です。
  2. 例:「今日」「は」「本当に」「いい」「天気」「ですね」
  3. よく使う「今日」「天気」のような言葉はひとまとまりで、助詞や語尾は別に切り離される、といった具合です。
  4. モデルはこれらの断片をそれぞれ数の並びに変えてから計算します。
答え単語・単語の一部・助詞の単位の断片に分けられ、正確な分け方はモデルごとに異なります。

2.中心となる仕組み:次のトークンの予測

言語モデルがしていることを一文にまとめると、「ここまでのトークンを見て、次に来るトークンの確率を計算する」です。「空がとても」の次には、「澄んでいる」「青い」「曇っている」といったトークンが、それぞれ異なる確率で来る可能性があります。モデルはこの確率分布を計算し、その中から一つを選んで文章の後ろにつなげます。

そして、いまつなげたトークンまで含めた文章をあらためて入力とし、その次のトークンを予測します。これを答えが終わるまで繰り返します。長い回答も、結局はこの一つずつの選択が数百回、数千回と続いた結果です。

次のトークンをうまく予測するには、文法だけでなく、事実、論理、口調、文脈まであわせて知っている必要があります。「日本の首都は」の次を当てるには地理を知らなければならず、数学の解答の次の行を当てるには計算のルールを知らなければなりません。膨大な量の文章でこの予測を訓練する過程で、モデルは驚くほど多くの知識とパターンを身につけていきます。

入力:「空がとても」
次のトークンの確率(例):澄んでいる 0.41 · 青い 0.33 · 曇っている 0.12 · 高い 0.08 · …
一つを選ぶ → 「空がとても澄んでいる」 → ふたたび次のトークンを予測 → …
上の確率の数値は、仕組みを示すためにつくった例です。実際の確率は、モデルや前後の文脈によって変わります。

3.短い答え一つができあがる過程をたどる

仕組みを通してたどってみましょう。ユーザーが「雨の日を一文で描写して」と入力したとします。モデルはこの質問をトークンに切り分け、そのあとに続く最初のトークンから一つずつ選んでいきます。以下の確率はすべて説明のためにつくった数値です。

選び方にも選択肢があります。毎回確率がいちばん高いトークンだけを選べば、同じ質問にはいつも同じ答えが出ますが、表現が平凡になりがちです。確率に比例して、ときどき有力でないトークンも選ぶようにすると、表現が多様になる代わりに答えが毎回少しずつ変わります。多くのサービスには、このランダムさの度合いを決める設定があります。

よくある誤解の一つもここで解けます。モデルは完成した答えを先に頭の中で書いておき、それを見せているわけではありません。前に選んだトークンが後ろの選択を次々に絞り込みながら、答えができあがっていきます。そのため、最初のいくつかのトークンがおかしな方向へ進むと、後ろでその流れを引き継ぎ、間違った内容をもっともらしく付け足してしまうことがあります。

例題「雨の日を一文で描写して」という依頼に対して、モデルが答えをつくる過程を段階ごとに書いてみてください。(確率は例です)
  1. 入力全体をトークンに切り分け、それぞれを数の並びに変えます。
  2. 最初のトークンの確率を計算します。例:「窓の外」0.30 · 「雨粒」0.25 · 「灰色」0.15 · … その中から「雨粒」を選びます。
  3. 「雨粒」までつなげた文章をあらためて入力とし、次のトークンを計算します。例:「が」0.60 · 「の音」0.20 · … 「が」を選びます。
  4. 同じことを繰り返し、「雨粒が窓ガラスをたたき、通りは灰色にぬれていく。」まで書き続けます。
  5. 次のトークンとして「答えが終わった」ことを表す特別なトークンの確率がいちばん高くなったら、それを選んで生成を止めます。
答えトークンに切り分ける → 次のトークンの確率を計算する → 一つ選ぶ → つなげてふたたび予測する、を繰り返し、終わりを表すトークンが出たら止まります。

4.事前学習と対話向けの追加学習

大規模言語モデルは、ふつう二つの段階でつくられます。第一段階の事前学習では、本、ウェブ上の文書、プログラムのコードといった膨大な文章で次のトークンの予測を繰り返し、言語と知識のパターンを身につけます。「大規模」とは、学習した文章の量とモデルの中の重みの数が非常に多いという意味です。

事前学習だけを終えたモデルは、文章の続きを書くのは得意ですが、質問に親切に答えるのは苦手です。そこで第二段階で「質問とよい答え」の例を使って追加学習を行い、さらに人が複数の答えの中からよりよいものを選んだ評価を反映させて磨き上げます。この過程を経て、指示に従い、対話し、危険な依頼を断るモデルになります。

ここから重要な結果が一つ出てきます。モデルの知識は、学習データを集めた時点で止まっています。それ以降の出来事は、検索機能を別に付けるか、ユーザーが資料を入れない限りわかりません。最新の情報が必要な質問では、このことを必ず覚えておく必要があります。

5.文脈ウィンドウ:一度に見られる文章の量

言語モデルは対話の際、それまでの会話と貼り付けた資料を丸ごと入力として受け取ります。一度に受け取れるトークンの最大量を文脈ウィンドウ(コンテキストウィンドウ)といいます。モデルは基本的に会話を「記憶」しているのではなく、毎回それまでの会話全体を読み直して次の答えをつくっています。

そのため、会話が非常に長くなって文脈ウィンドウを超えると、前半が切り捨てられたり、あまり反映されなくなったりすることがあります。大事な条件は、会話の最初に一度言って終わりにするより、必要なときにもう一度短く念を押すほうが安全です。また、新しい話題は新しい会話で始めたほうが、結果がすっきりします。

6.仕組みから生まれる長所と短所

次のトークンを確率で選ぶため、同じ質問でも答えが少しずつ変わることがあります。この性質は、アイデアをたくさん得たいときには長所であり、まったく同じ結果が必要なときには短所です。

また、モデルは「もっともらしい次の言葉」を選んでいるのであって、事実を確かめているわけではありません。学習データによく出てくる内容はたいてい正確ですが、まれな内容や最新の内容、数字の多い内容では、もっともらしいけれど間違った文を自然につくり出してしまうことがあります。これが第7講で扱うハルシネーションです。

反対に、文章の形式を変える、要約する、説明をやさしく言い換える、いくつもの観点を広げるといった、「言語のパターン」が中心となる仕事にはとても強いのです。仕組みがわかれば、任せる仕事と確かめる仕事を区別できます。

次のトークンの予測という仕組みから生まれる性質
性質うまく使えば注意すべき点
確率的に選ぶアイデアをたくさん得られる同じ質問でも答えが変わる
もっともらしさに従う自然な文章、形式の変換間違った事実も自然に語る
学習時点で知識が止まる広く知られた知識はよく知っている最新の情報は知らないことがある
文脈ウィンドウ内の文章だけを見る資料を貼り付ければ、その資料を根拠に答えるとても長い会話の前半は反映されにくくなることがある

📌 要点まとめ

  • 言語モデルは文章をトークンに分け、各トークンを数の並び(ベクトル)に変えて計算する
  • 答えは「次のトークンの確率を計算 → 一つ選ぶ」を最後まで繰り返してつくられる
  • 事前学習で言語と知識を身につけ、追加学習で指示に従う対話モデルになる
  • モデルの知識は学習時点で止まっており、文脈ウィンドウ内の文章だけを見て答える
  • もっともらしさと事実は違うことがある — 数字・最新の情報・まれな事実は確かめる

✍️ 確認問題

まず自分で解いてから「解答と解説」を開いてください。

Q1. 大規模言語モデルが答えをつくる基本的な方法として、最も適切なものはどれでしょうか。

⭕ 正解です

❌ もう一度考えてみましょう

解答と解説
正解 ② 次に来るトークンの確率を計算し、一つずつつなげていく

言語モデルは、ここまでの文章を見て次のトークンの確率を計算し、一つを選ぶことを繰り返します。

Q2. モデルが昨日起きた出来事をよく知らない、最も根本的な理由は何でしょうか。

⭕ 正解です

❌ もう一度考えてみましょう

解答と解説
正解 ② モデルの知識が、学習データを集めた時点で止まっているから

学習以降の情報は、検索機能やユーザーが入れた資料がなければ知ることができません。

Q3. 同じ質問を二回したら、答えが少し違いました。最も適切な説明はどれでしょうか。

⭕ 正解です

❌ もう一度考えてみましょう

解答と解説
正解 ② モデルが次のトークンを確率的に選んでいるからだ

確率分布からトークンを選ぶので、同じ入力でも違う選択が出ることがあります。答えが違うからといって、どちらかが必ず間違っているわけではありません。

Q4. 言語モデルが一度に読めるトークンの最大量を何と呼ぶでしょうか。

解答と解説
解答例 文脈ウィンドウ(コンテキストウィンドウ)

会話と貼り付けた資料を合わせた量が文脈ウィンドウを超えると、一部が反映されないことがあります。

🤖 AIにはこう聞いてみましょう

コピーして [ ] の部分を自分の状況に書き換えて使います。答えはそのまま信じず、本文と比べて確かめましょう。

最新の情報が必要な質問をするとき

次の質問に答える前に、この内容があなたの学習時点以降に変わっている可能性があるかどうかを先に教えてください。変わっている可能性がある部分については、私がどこで最新の情報を確認すべきかもあわせて教えてください。質問:[質問]

長い資料を根拠に答えてほしいとき

以下の資料だけを根拠に答えてください。資料にない内容は推測せず、「資料になし」と書いてください。答えの各文の末尾に、根拠となった資料の段落番号を括弧で付けてください。
[資料を貼り付け]
質問:[質問]
参考
  • 自然言語処理の入門書における一般的な説明(トークン化・言語モデル・文脈)
  • 高校の教科「人工知能の基礎」の内容(教育省告示の教育課程)

学習目標をすべて達成できたら完了を押しましょう。

🤖 AIの基礎

  1. 1AIとは何か — ルールと学習
  2. 2機械学習の基本 — データ・モデル・学習・評価
  3. 3ニューラルネットワークの直観 — 小さな計算が集まって判断になる
  4. 4大規模言語モデルはどうやって言葉をつくるのか
  5. 5プロンプトの基礎 — 望むことを正確に伝える
  6. 6プロンプトの応用 — 役割・例・段階・形式
  7. 7ハルシネーションと検証 — もっともらしさを疑う方法
  8. 8個人情報・著作権・倫理 — 責任をもって使う
  9. 9AIと働く方法 — 任せる、確かめる、つなげる
  10. 10AI時代の学習戦略 — 基礎が質問をつくる
📚 あわせて読みたい
🧠生成AIができることと限界→ ✍️質問(プロンプト)の上手な書き方→ 🔍AIの回答を検証する→ 📚勉強・仕事での使い方と剽窃の注意→
← AI時代の基礎学力講座