1.ハルシネーションとは何か
ハルシネーションとは、AIが事実ではない内容をまるで事実のように語る現象を指します。存在しない本のタイトルと著者、ない法律の条文、間違った日付、実際とは異なる引用文を、なめらかな文章でつくり出します。英語で「幻覚」を意味する言葉から、こう呼ばれています。
ハルシネーションが危ないのは、間違った答えが間違っているように見えないからです。正しい答えと同じ自信のある口調、同じ整った形式で出てきます。文章が自然であることは、内容が正しいことの証拠にはなりません。
2.なぜ起こるのか
第4講で、言語モデルは次に来る最ももっともらしいトークンを選ぶと述べました。モデルは「この文は事実か」を確かめる仕組みではなく、「この文はもっともらしいか」を計算する仕組みです。広く知られた事実は学習データに何度も出てくるので、もっともらしさと事実がほぼ一致します。しかし、まれな事実、学習以降の出来事、正確な数字のように、データにあまり出てこない内容では、両者がずれることがあります。
たとえば、あまり知られていない研究の著者を尋ねると、モデルはその分野で「もっともらしい名前」と「もっともらしい学術誌の名前」を組み合わせて答えることがあります。わからないと言うより、もっともらしい答えを書き続けるほうが、モデルにとって自然な場合があるからです。モデルやサービスをつくる側も、こうしたことを減らすためにさまざまな仕組みを加えていますが、原理上、完全にはなくせないと考えておくのが安全です。
3.ハルシネーションが起こりやすい質問
すべての答えを同じように疑う必要はありません。危ない質問の種類を知っておけば、確認にかける労力を節約できます。
| 質問の種類 | 危険度 | 理由 |
|---|---|---|
| 出典・引用・参考文献・リンク | 高い | もっともらしいタイトルと著者を組み合わせてつくり出すことがある |
| 正確な数字・日付・統計 | 高い | 似た数字が多く、混ざりやすい |
| 最近の出来事・最新の制度・価格 | 高い | 学習以降の情報は知らない |
| あまり知られていない人物・小さな地域・特定の会社の事情 | 中〜高 | 学習データにあまり出てこなかった |
| 法律・医療・税金のように、間違えると被害が大きい情報 | 高い(被害の大きさが基準) | 小さな誤りでも影響が大きい |
| 文章の手直し・要約・形式の変換 | 低い | 与えた資料の範囲で作業するので、つくり話の余地が少ない(それでも要約が原文と合っているかは見る) |
4.答えを確かめる五つの習慣
確認は難しくありません。重要な答えにだけ以下の習慣を当てはめても、かなりのハルシネーションを取り除くことができます。
- 一次資料で確かめる:法律は法令の原文、制度は担当機関の公式な案内、統計は公表した機関の資料で確かめる
- 出典は自分で探す:AIが教えてくれた本・論文・記事のタイトルを検索し、本当に存在するか、その内容が正しいかを見る
- 数字は計算し直す:計算結果は計算機や表で自分で検算する(数学の基礎の講座がここで役立つ)
- 聞き方を変えてもう一度尋ねる:質問を変えたり、新しい会話でもう一度尋ねたりして、答えが揺れる部分を探す
- 根拠を求める:答えの根拠と確かでない部分を示させ、その部分から確かめる
- 出典・引用はハルシネーションの危険が高い種類だということを、まず思い出します。
- タイトルと著者を学術検索や図書館の検索で探し、本当に存在するかを確かめます。
- 存在するなら、原文の要旨だけでも読んで、AIが要約した内容と同じかどうかを比べます。
- 見つからない研究は報告書から外し、確認できたものだけを出典とともに書きます。
5.自分でやってみる検証 — 数字を一つたどる
五つの習慣を、実際の答えの一つに当てはめてみましょう。以下の答えは説明のためにつくった例です。こうした答えは文章がなめらかで計算の根拠まで付いているので、そのまま信じてしまいがちです。
AIの答えが間違う理由が、すべてハルシネーションというわけではありません。原因が違えば確かめ方も変わるので、間違った答えに出会ったら、どんな種類の誤りなのかもあわせて考えるとよいでしょう。
- 計算ミス:段階が長くなるほど、数字を書き写す途中で間違えやすい — 計算機や表計算ソフトで検算する
- 古い情報:学習以降に変わった制度・価格・人物の情報を、以前の基準で語る — 日付の入った公式資料で確かめる
- 質問の誤解:聞いていないことに答えたり、条件を一つ落としたりする — 質問の条件を答えと一つずつ照らし合わせる
- 与えた資料の読み違い:貼り付けた資料にない内容を要約に混ぜる — 要約の各文が原文のどの部分に当たるかを示させる
- 手順1:危ない種類かどうかを見ます:正確な数字を尋ねる質問なので、確認が必要です。
- 手順2:自分で計算し直します:複利では毎年1.05を掛けます。1,000,000 × 1.05 = 1,050,000、× 1.05 = 1,102,500、× 1.05 = 1,157,625円。
- 手順3:違いの原因を探します:115万円は、元本にだけ利息を付ける単利の計算(1,000,000 × (1 + 0.05 × 3) = 1,150,000)です。答えの中の「毎年5万円ずつ」という言葉が、すでに単利だというサインでした。
- 手順4:正してもう一度尋ねます:「単利ではなく複利で、毎年掛けていく過程を表で見せてください」と頼めば、過程を一行ずつ照らし合わせられます。
6.ハルシネーションを減らすプロンプト
確認とあわせて、最初からハルシネーションが起こりにくいように尋ねる方法もあります。最も効果的なのは、根拠となる資料を直接渡すことです。信頼できる資料を貼り付けて「この資料の範囲でだけ答え、なければないと言ってください」と頼めば、つくり話の余地は大きく減ります。
わからないと言ってもよいと許可することも役に立ちます。「確かでなければ、わからないと答えてかまいません」「推測した部分には(推測)と示してください」のように書けば、答えの中の不確かな部分が見えてきます。反対に、「必ず五つそろえてください」のように個数を強いると、知っていることが三つしかないとき、残りの二つをつくり出す危険が大きくなります。
- 誤り: このテーマに関する統計を五つ教えて。正しい: このテーマに関して、あなたが比較的確かに知っている統計があれば教えてください。それぞれ公表した機関と基準の年もあわせて書いてください。確かでなければ、個数をそろえようとせずに「要確認」と書いてください。個数を強いず、出典と不確かさを示させれば、確かめるべき点がはっきりします。
📌 要点まとめ
- ハルシネーションとは、AIが事実ではない内容を事実のように自信をもって語る現象である
- 原因は、モデルが事実ではなく、もっともらしさを計算しているからである
- 出典・数字・最新の情報・まれな事実・被害の大きい情報は、必ず確かめる
- 一次資料での確認、出典の自分での検索、数字の検算、聞き直し、根拠の要求が基本の習慣である
- 根拠となる資料を渡し、わからなければわからないと言わせ、個数を強いなければ、ハルシネーションは減る
🤖 AIにはこう聞いてみましょう
コピーして [ ] の部分を自分の状況に書き換えて使います。答えはそのまま信じず、本文と比べて確かめましょう。
重要な答えをもらう前に、不確かさを明らかにしたいとき
次の質問に答えてください。ただし、答えの各文の末尾に、確かさの度合いを(確実)/(ほぼ確実)/(推測)のいずれかで示し、私が自分で確かめるべき項目と確かめる先(どんな種類の機関や資料か)を、最後に箇条書きでまとめてください。質問:[質問]
すでにもらった答えを点検したいとき
あなたがいま出した答えのうち、事実関係が間違っている可能性が高い部分を三か所選び、理由とともに教えてください。特に、数字、日付、名前、出典を中心に見てください。
資料だけを根拠に答えてほしいとき
以下の資料だけを根拠に答えてください。資料にない内容は決して付け加えず、「資料になし」と書いてください。答えたあとで、それぞれの内容が資料のどの文から来たのかを、そのまま引用してください。 [資料] 質問:[質問]
- 生成AI活用ガイドの多くに共通して載っている、事実確認の原則の一般的な内容
- 自然言語処理の分野で使われる「ハルシネーション(幻覚)」という概念の一般的な定義
学習目標をすべて達成できたら完了を押しましょう。
このブラウザでは保存できないため、この画面でのみ表示されます。