生成AIのハルシネーションはなぜ起こる?原因・対策・検証方法を研究者向けに解説

生成AIは、文章の要約や文献調査、コード作成を大きく効率化できます。その一方で、存在しない論文、誤った数値、根拠にない説明を、自然で説得力のある文章として示すことがあります。これが一般にハルシネーション(hallucination)と呼ばれる現象です。
結論から言えば、ハルシネーションを完全にゼロにするのは難しいものの、回答を検証可能な単位へ分解し、一次情報・計算ツール・棄権条件を組み合わせることで、研究開発で扱える水準までリスクを下げられます。
この記事では、ハルシネーションが生じる理由、RAGを使っても残る誤り、研究者が確認すべきポイントを解説します。さらに、企業データを使わない架空の材料科学文書とローカルAIによる実測例を示します。
生成AIのハルシネーションとは
ハルシネーションとは、生成AIが事実や与えられた資料に裏づけられていない内容を、もっともらしく生成することです。NIST(米国国立標準技術研究所)の生成AI向けリスク管理文書では、「confabulation(作話)」という語を用い、誤った内容を自信ありげに出力するリスクを整理しています[1]。
重要なのは、ハルシネーションが「完全な作り話」だけを指すわけではないことです。研究開発では、次のような小さな不整合も意思決定へ影響します。
- 実在しない論文タイトル、著者、DOIを示す
- 論文は実在するが、その論文に書かれていない結論を付け加える
- 温度、濃度、単位、試料数、測定条件を取り違える
- 表から数値を正しく抽出した後、比率や丸めを誤る
- 相関を因果関係として説明する
- 質問で求められた重要条件を回答から落とす
つまり、研究者にとっての評価軸は「文章が自然か」ではなく、各主張が根拠と対応し、同じ条件で再確認できるかです。
なぜ生成AIはハルシネーションを起こすのか
1.基本動作は「次に続きやすい語」の予測だから
大規模言語モデルは、入力された文脈に続く語を確率的に予測して文章を作ります。学習時に個々の文が真か偽かを表すラベルが常に与えられているわけではありません。したがって、流暢な文章を作る能力と、すべての記述が事実であることは同じではありません。
専門用語、著者名、年、雑誌名、数値が同時に並ぶと、読者には信頼できる文章に見えます。しかし、その組み合わせが学習データや参照資料に存在するとは限りません。
2.学習データは不完全で、知識には時点があるから
モデルが学習した情報には、欠落、古い記述、相互に矛盾する説明が含まれます。また、学習後に公開された論文や更新された規格は、外部検索を使わない限り参照できません。ニッチな材料名や社内固有の略語のように、十分な学習例がない対象では不確実性が高くなります。
3.「分からない」より推測が評価されやすかったから
2025年の研究報告と、その後2026年にNatureへ掲載された研究では、正答率だけを重視する評価が、モデルに棄権より推測を選ばせる誘因になると論じられています[2][3]。研究用途では、正答率だけでなく、誤答率と適切な棄権率を分けて測ることが重要です。
4.質問の前提が誤っていても、回答を作ろうとするから
「この論文で報告された200サイクル後の強度は?」と聞かれると、モデルは「論文に200サイクルの値がある」という前提を受け入れて回答しやすくなります。実際には100サイクルまでしか記載がない場合、望ましい回答は数値の推測ではなく、資料内で確認できないと伝えることです。
5.複数の処理段階で誤りが重なるから
RAGやAIエージェントでは、最終回答の前に検索、文書分割、順位づけ、抽出、計算、ツール実行などが行われます。各段階が正しくても、次の段階で情報が欠落することがあります。したがって、最終回答だけでなく処理段階ごとの評価が必要です。
ハルシネーションの主な種類
| 種類 | 研究開発での例 | 主な確認方法 |
|---|---|---|
| 事実の誤り | 材料の結晶構造や相転移温度を誤る | 一次論文、標準、データベースと照合 |
| 引用の誤り | 存在しない論文やDOIを示す | 出版社、Crossref、PubMed等で実在確認 |
| 忠実性の誤り | 検索文書にない主張を付け加える | 主張と根拠箇所を一対一で照合 |
| 数値・単位の誤り | MPaとGPa、wt%とmol%を混同する | 原表、測定条件、単位換算を確認 |
| 計算の誤り | 保持率、平均、信頼区間、丸めを誤る | Python、R、表計算で再計算 |
| 推論の誤り | 相関から原因を断定する | 研究デザインと代替仮説を確認 |
| 要求漏れ | 温度や保持時間など重要条件を落とす | 要求項目チェックリストで採点 |
RAGを使えばハルシネーションはなくなるのか
RAGは、質問に関係する文書を検索し、その内容を生成AIへ渡して回答させる仕組みです。モデルの内部知識だけに頼らず、社内文書や最新論文を根拠にできるため、ハルシネーション低減に有効です。
ただし、RAGは「正しい文書を見つける処理」と「その文書に忠実な回答を作る処理」の組み合わせです。約18,000件のRAG応答を人手で注釈したRAGTruthでも、取得文書にない主張や、取得内容と矛盾する主張が残ることが示されています[4]。
RAGで確認すべき代表的な失敗点は次のとおりです。
- 必要な文書が検索対象に登録されていない
- 検索語と文書表現が異なり、正解文書を取得できない
- チャンク分割で条件と結果が別々になる
- 古い版と最新版が同時に取得される
- 正しい数値を抽出しても、計算や丸めを誤る
- 根拠がない質問に対して棄権できない
導入時は、研究開発データ向けRAGの設計手順で解説したように、検索精度、回答忠実性、計算、要求網羅性、棄権を別々に評価すると原因を特定しやすくなります。
材料科学の疑似文書を使ったローカル検証
ここでは、実在企業の材料や機密情報を含まない架空の月面レゴリス模擬土の報告書3件を使った、説明用の小規模試験を示します。一般モデルの優劣を決めるベンチマークではなく、どこで誤りが生じるかを確認するための実験です。
質問
月面レゴリス模擬土LS-01について、−150℃から120℃までの熱サイクルを100回与えた後の圧縮強度が確認できる焼結条件を示してください。初期強度、熱サイクル後強度、強度保持率、出典も示してください。資料にない値は推測しないでください。
正解文書に含まれる情報
- 焼結条件:マイクロ波焼結1100℃、20分
- 初期圧縮強度:48.3 MPa
- 100サイクル後:34.1 MPa
- 計算上の保持率:34.1 ÷ 48.3 × 100 = 70.6004…%、小数第1位で70.6%
- 出典:文書ID B
実行条件
| 項目 | 設定 |
|---|---|
| 実行日 | 2026年9月30日(日本時間) |
| 実行基盤 | Ollama 0.34.4、CPU |
| 生成モデル | qwen3:1.7b |
| 埋め込みモデル | qwen3-embedding:0.6b |
| 類似度 | コサイン類似度 |
| 生成設定 | temperature 0、seed 42、context 4096 tokens |
| 単純RAG | 80文字、overlap 0、top-k 1 |
| 改善RAG | 1報告書1チャンク、material_codeで絞り込み、top-k 1 |
| 反復 | 各条件5回 |
モデルblobのSHA-256
生成モデル:3d0b790534fe4b79525fc3692950408dca41171676ed7e21db57af5c65ef6ab6
埋め込みモデル:06507c7b42688469c4e7298b0a1e16deff06caf291cf0a5b278c308249c3e439
結果:検索成功後にも二つの誤りが残った
80文字固定チャンクでは、正解文書由来の断片が検索1位になったものの、100サイクル後の値がチャンク外に分断され、完全正答は0/5回でした。
1報告書を1チャンクとした改善RAGでは、初期強度48.3 MPa、100サイクル後34.1 MPa、出典Bを5/5回で抽出できました。一方、回答は5回とも次の二点を誤りました。
- 質問で求めた焼結条件「1100℃、20分」を回答から落とした
- 保持率を70.5%と計算した。正しくは小数第1位で70.6%
つまり、正解文書がtop-1に入ったことと、最終回答が正しいことは別です。検索、抽出、計算、要求網羅性を分けて採点する必要があります。
答えのない質問では棄権できた
同じ文書群に対して「200サイクル後の値」を尋ねたところ、文書単位RAGは5/5回で「資料内に記載がない」と回答しました。この試験では棄権指示が有効に働いています。
| 評価項目 | 改善RAGの結果 | 次の対策 |
|---|---|---|
| 正解文書の検索 | 成功 | 検索評価を継続 |
| 生データ抽出 | 主要数値は5/5で成功 | 引用箇所を併記 |
| 派生値計算 | 丸め誤り | 決定論的な計算ツールへ渡す |
| 要求網羅性 | 焼結条件を欠落 | 構造化出力と必須項目検査 |
| 回答不能時の棄権 | 5/5で成功 | 誤棄権も含めて継続評価 |
研究者向け:回答を検証する7ステップ
ステップ1.回答を「検証可能な主張」に分ける
段落全体を正しい・誤りの二択で判断せず、論文の実在、材料名、処理条件、測定値、統計結果、因果解釈などへ分解します。1つの文に複数の主張がある場合も分けます。
ステップ2.引用文献の実在と書誌情報を確認する
タイトル、著者、雑誌、年、巻号、ページ、DOIを出版社サイトやCrossrefなどで照合します。DOIがリンクとして開くことだけでなく、リンク先のタイトルと著者が一致することまで確認します。
ステップ3.一次情報の該当箇所へ戻る
レビューやAIの要約だけで結論を確定せず、原著論文の本文、表、補足資料、標準規格の該当箇所を確認します。引用文が実在しても、前後の条件によって意味が変わることがあります。
ステップ4.数値、単位、条件を一組で確認する
数値だけを転記せず、試料、測定法、温度、時間、濃度、単位、試料数と結びつけます。材料科学では、同じ物性名でも測定方向、雰囲気、熱履歴によって値が変わります。
ステップ5.計算は決定論的なツールで再実行する
比率、回帰、統計検定、単位換算はPython、R、表計算などで再計算します。生成AIには式とコードの候補を作らせても、最終値は実行結果から取得します。統計解析については、生成AIによる統計解析の誤りと検証方法も参考になります。
ステップ6.要求項目と棄権を採点する
「正しかった項目」だけでなく、「求めたのに書かれなかった項目」「資料にないのに答えた項目」を記録します。回答不能問題を混ぜ、適切に棄権できるかも確認します。
ステップ7.再現条件を保存する
モデル名と版、実行日、システムプロンプト、ユーザープロンプト、temperature、seed、検索方式、埋め込み、チャンク、top-k、取得文書、回答全文を保存します。モデルや検索インデックスが更新されるため、結果だけでは再現できません。
ハルシネーションを減らす実践的な設計
根拠と回答を同じ形式で出す
自由文だけでなく、次のような列を持つ表で回答させると確認しやすくなります。
| 主張 | 根拠文書 | 根拠箇所 | 確信度 | 確認状況 |
|---|---|---|---|---|
| 圧縮強度は34.1 MPa | 文書B | 結果表2、100サイクル行 | 高 | 原表確認済み |
棄権条件を明示する
「資料にない値は推測しない」「根拠箇所を示せない主張は未確認とする」「複数資料が矛盾する場合は両方を示す」と指示します。回答率を高くすることより、誤った断定を減らす設計が研究用途には適しています。
計算・検索・文献照合をツールへ分ける
言語モデルは文章の整理へ、計算機は数値計算へ、文献データベースは書誌確認へ使い分けます。MCP、API、RAG、AIエージェントの違いを理解すると、どの処理を外部ツールへ渡すべきか整理しやすくなります。
評価用データセットを業務に合わせて作る
一般ベンチマークだけでなく、実務で重要な質問を次のように含めます。
- 一つの文書で答えられる質問
- 複数文書を統合する質問
- 版の新旧を区別する質問
- 単位換算や派生値計算を含む質問
- 資料内に答えがない質問
- 質問の前提そのものが誤っている質問
そのまま使える検証プロンプト
以下の回答を検証してください。回答を原子的な主張に分解し、各主張について、①根拠資料、②根拠箇所、③資料に明記された事実か計算・推論か、④数値と単位、⑤矛盾する情報、⑥確認状況を表で示してください。根拠を確認できない場合は「未確認」とし、推測で補完しないでください。計算が必要な項目は式を示し、言語モデル内で確定せず、実行可能なコードも提示してください。最後に、回答全体を「確認済み」「要修正」「回答保留」のいずれかで判定してください。
ハルシネーション評価で見るべき指標
| 指標 | 意味 |
|---|---|
| 引用実在率 | 提示された文献・DOIのうち実在する割合 |
| 主張支持率 | 各主張が取得文書で支持される割合 |
| 数値一致率 | 値、単位、条件が原資料と一致する割合 |
| 要求網羅率 | 質問で求めた項目を満たした割合 |
| 検索再現率 | 正解根拠がtop-kへ含まれる割合 |
| 適切な棄権率 | 回答不能時に推測せず保留できた割合 |
| 誤棄権率 | 答えがあるのに回答しなかった割合 |
一つの総合点だけでは、検索、生成、計算のどこを直すべきか分かりません。指標を分けることで、チャンク設計、プロンプト、ツール連携など具体的な改善につながります。
研究開発での使い分け
私は10年以上の素材開発経験と、8年以上のインフォマティクス活用経験を持っています。その経験から、生成AIは「正解を無条件に受け取る装置」ではなく、調査・整理・仮説形成を速め、検証作業を構造化する道具として使うと価値を発揮すると考えています。
用途別の目安は次のとおりです。
- 比較的任せやすい:文章のたたき台、観点の列挙、既知資料の分類、コード案
- 根拠確認を前提に使う:文献要約、技術比較、実験条件の抽出
- 人と決定論的ツールで確定する:数値計算、統計判断、安全性、特許・規制、研究上の最終結論
研究プロセス全体での役割は、研究者の生成AI活用ガイドでも解説しています。
よくある質問
最新モデルならハルシネーションは起こりませんか?
新しいモデルほど誤答が減る傾向はありますが、ゼロにはなりません。モデル名だけで判断せず、自分の文書と質問で、誤答率・棄権率・引用実在率を測ることが重要です。
「出典を示して」と指示すれば十分ですか?
有効な出発点ですが、出典自体が誤って生成される場合があります。DOIやタイトルの実在確認と、原文が実際に主張を支持しているかの照合が必要です。
RAGとWeb検索はどちらが安全ですか?
目的が異なります。管理された社内文書へ答えを限定するならRAGが向き、最新の公開情報を調べるならWeb検索が役立ちます。どちらも取得内容の質と最終回答の忠実性を分けて評価します。
同じ質問を複数回すれば正しさを確認できますか?
回答の一貫性は参考になりますが、同じ誤りを繰り返すこともあります。多数決だけで確定せず、一次資料、計算実行、書誌データベースなど独立した根拠で確認します。
まとめ
生成AIのハルシネーションは、単なる偶発的な不具合ではなく、確率的な文章生成、不完全な知識、推測を促す評価、検索や計算を含む多段処理から生じます。
研究開発で重要なのは、生成AIを使わないことではなく、どの主張を、どの根拠と方法で確認するかを設計することです。RAG、一次情報、決定論的な計算ツール、構造化出力、棄権評価を組み合わせれば、便利さを保ちながら誤りを見つけやすい運用にできます。
参考文献
- National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. NIST AI 600-1, 2024.
- Kalai AT, Nachum O, Vempala SS, Zhang E. Why Language Models Hallucinate. arXiv:2509.04664, 2025.
- Kalai AT, Nachum O, Vempala SS, Zhang E. Evaluating large language models for accuracy incentivizes hallucinations. Nature. 2026;653:1047–1051.
- Niu C, Wu Y, Zhu J, et al. RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language Models. Proceedings of ACL 2024:10862–10878.
- Ji Z, Lee N, Frieske R, et al. Survey of Hallucination in Natural Language Generation. ACM Computing Surveys. 2023;55(12):1–38.
本記事の検証は、架空の疑似文書3件と小型ローカルモデルを用いた説明用試験です。特定モデル一般の性能や、実在材料の物性を示すものではありません。記事内容と参考文献は2026年10月2日時点で確認しています。





