生成AIは、わずか数年の間に「文章の続きを生成するモデル」から、文献を検索し、画像を読み、コードを実行し、複数の工程を進めるシステムへと発展しました。

そのため、Transformer、RAG、Chain of
Thought(CoT)、AIエージェントといった言葉を聞いても、何がモデルそのものの技術で、何が使い方やシステム構成の技術なのか分かりにくくなっています。

本記事では、生成AIの歴史を単なる製品年表ではなく、「どの課題を解決するために、どの技術が登場したのか」という流れで整理します。研究やデータ解析に生成AIを使う際、どこまで信頼し、何を検証すべきかを考えるための基礎にもなります。

この記事の結論
生成AIの進歩は、モデルを大きくした歴史だけではありません。「文脈を捉える」「少数の例からタスクに対応する」「人の指示に従う」「推論する」「外部知識を参照する」「道具を使って行動する」という能力を、学習方法とシステム設計の両面から拡張してきた歴史です。

最初に整理したい:生成AI技術は4つの層に分かれる

RAGとChain of
Thoughtを同じ種類の技術として並べると、生成AIの発展を理解しにくくなります。まずは、技術を次の4層に分けると整理できます。

技術の層代表例何を変えたか
モデル構造Transformer、Attention文中の関係を捉え、大規模な並列学習を可能にした
学習・調整方法事前学習、Instruction Tuning、RLHF知識と言語能力を獲得し、人の指示に沿いやすくした
推論時の方法Few-shot、Chain of Thought、Self-Consistency与えられた問題を分解し、回答精度を高めた
外部接続・システムRAG、ツール利用、ReAct、AIエージェント外部知識や計算機能を利用し、複数工程を実行可能にした

現在の生成AIサービスは、これらを組み合わせて作られています。したがって、性能向上のすべてを「モデルが賢くなった」と表現するのは正確ではありません。

生成AI技術の発展を年表で見る

時期主な発展解決しようとした課題
2017年Transformer長い系列の学習効率と並列計算
2018~2020年大規模事前学習、Scaling Laws、Few-shot Learning個別タスクごとの大量教師データへの依存
2020年RAG知識の更新、根拠の提示、モデル外情報の利用
2022年Instruction Tuning、RLHF、ChatGPT人の指示への追従と対話のしやすさ
2022年Chain of Thought、Self-Consistency多段階推論の精度
2022~2023年ReAct、Toolformer、Function Calling検索・計算・外部操作との連携
2023年以降マルチモーダル化文章以外の画像・音声などの理解と生成
2024年以降推論時の計算拡張、AIエージェント難しい問題への熟考、長い作業工程の実行

この年表は、ある技術が次の技術に完全に置き換わったことを意味しません。現在もTransformerを基盤に、RAGやツール利用、推論時の探索などを重ねる形で発展しています。

2017年:Transformerが現在の生成AIの土台を作った

現在の大規模言語モデルの転換点として、2017年の論文「Attention Is All
You
Need」が挙げられます。この論文では、再帰型ニューラルネットワークに依存せず、Attentionを中心に系列を処理するTransformerが提案されました。

Transformerの重要性は、単に文章をうまく扱えたことだけではありません。

  • 文中で離れた単語同士の関係を捉えやすい
  • 学習を並列化しやすい
  • モデル、データ、計算量を大きくする方向と相性がよい

という特徴が、その後の大規模化を支えました。

ただし、Attentionは「重要な部分を人間のように理解して注目している」という意味ではありません。入力中の要素間の関係を重み付けして情報を統合する計算機構と捉える方が正確です。

2018~2020年:事前学習と大規模化で汎用性が高まった

従来の自然言語処理では、分類、翻訳、要約など、タスクごとに教師データを準備してモデルを学習する方法が一般的でした。大規模な事前学習は、広い文章データから言語のパターンをあらかじめ学び、さまざまなタスクへ適応する方向を強めました。

2020年には、モデル規模、データ量、計算量と性能の関係を示すScaling
Lawsが報告されました。同年のGPT-3は、モデルをタスクごとに再学習しなくても、指示や少数の例を文脈に与えることで多様な課題に対応できるFew-shot
Learningの可能性を示しました。

ここで大切なのは、性能を決める要素がパラメーター数だけではないことです。

  • 学習データの量と質
  • 学習に使う計算量
  • モデル構造
  • 事前学習後の調整方法
  • 推論時に与える情報
  • 出力を評価・選択する仕組み

これらの組み合わせで、実際の性能は変わります。「モデルが大きいほど、あらゆる用途で優れている」とは限りません。

2020年:RAGがモデルを外部知識につないだ

大規模言語モデルが蓄えている知識は、基本的に学習データと学習時点に依存します。固有の社内文書や最新情報を知らないことに加え、回答の根拠を確認しにくい問題もあります。

Retrieval-Augmented
Generation(RAG)は、質問に関連する文書を検索し、その内容をモデルへ渡して回答を生成する考え方です。原論文では、モデルのパラメーターに保持された記憶と、外部文書を検索する非パラメトリックな記憶を組み合わせました。

研究開発では、例えば次の用途が考えられます。

  • 論文や特許を検索して比較表を作る
  • 過去の実験報告書から類似条件を探す
  • 社内の分析手順書を参照して回答する
  • 装置トラブルの事例と対処法を検索する

RAGを使っても誤りはなくならない

RAGはハルシネーションを自動的になくす仕組みではありません。検索対象に必要な情報がなければ答えられず、次のような新しい誤りも生じます。

RAGの詳しい仕組みと研究開発での検証例は「RAGとは何か?研究開発での活用方法と限界」で解説しています。

  • 適切な文書を検索できない
  • 文書の分割によって前後関係が失われる
  • 類似しているが無関係な文書を取得する
  • 古い版と新しい版が混在する
  • 取得した文書をモデルが誤読する
  • 引用と回答内容が一致しない

RAGの品質は、生成モデルだけでなく、文書整備、検索精度、アクセス権限、更新管理、回答後の検証によって決まります。

2022年:人の指示に従うためのInstruction
TuningとRLHF

文章の続きを予測する事前学習だけでは、「質問に簡潔に答える」「危険な依頼を断る」「指定された形式で出力する」といった人の意図に必ずしも沿いません。

Instruction
Tuningは、指示と望ましい回答の組み合わせを使ってモデルを調整する方法です。さらに、人が複数の回答を比較して付けた選好を利用するRLHF(Reinforcement
Learning from Human
Feedback)が、回答の有用性や指示追従を改善するために利用されました。

InstructGPTの研究では、単にモデルを大きくするだけでなく、人のフィードバックを使った調整が回答の好ましさを大きく変えることが示されました。その流れを対話形式で利用しやすくしたChatGPTが2022年11月に公開され、生成AIが専門家以外にも急速に普及しました。

一方で、人の選好に合わせることと、事実として正しいことは同じではありません。読みやすく自信のある回答が、誤っている可能性は残ります。

2022年:Chain of
Thoughtが多段階推論を改善した

Chain of
Thought(思考の連鎖、CoT)は、回答に至る中間的な推論ステップを例として示し、算術、常識、記号推論などの複数段階の問題を解きやすくする方法として報告されました。

例えば、複雑な計算問題にいきなり答えさせるのではなく、条件を整理し、途中の計算を経て結論を出す例を与えます。さらにSelf-Consistencyでは、複数の推論経路を生成し、一貫して得られる答えを選ぶことで性能を高めました。

Chain of
Thoughtについて注意したい3点

  1. CoTはTransformerに代わるモデル構造ではない
    主にプロンプトや推論時の出力・探索方法に関する技術です。

  2. 長く説明すれば正しくなるわけではない
    最初の前提が誤っていれば、整った説明のまま誤った結論に到達します。

  3. 表示された説明をモデル内部の忠実な記録とはみなせない
    出力された推論文は検証材料にはなりますが、モデル内部の全処理をそのまま可視化したものとは限りません。

研究で重要なのは、推論文の自然さではなく、使用したデータ、式、コード、仮定、引用元を外部から検証できることです。

2022~2023年:ReActとツール利用で「考えて行動する」方向へ

言語モデルは文章生成には強くても、正確な計算、最新情報の取得、データベース検索などでは専用ツールに及ばないことがあります。そこで、すべてをモデル内部で完結させず、必要に応じて外部ツールを使う方向へ発展しました。

ReActは、推論と行動を交互に行い、検索などで得た観察結果を次の判断に利用する枠組みです。Toolformerは、どのタイミングでどのAPIを呼び、その結果をどう利用するかを言語モデルに学習させる考え方を示しました。

例えば統計解析支援なら、次のような流れになります。

  1. 研究目的と実験単位を確認する
  2. データの列と欠損を調べる
  3. 適切な統計手法を提案する
  4. PythonやRで計算する
  5. 出力を読み取り、前提条件を検査する
  6. 必要に応じて解析を修正する

ここでは、LLMはすべてを暗算する存在ではなく、問題を整理し、適切な道具へ処理を割り振る役割に近づいています。

2023年以降:マルチモーダル化で扱える情報が広がった

生成AIが扱う対象は文章だけではありません。GPT-4の技術報告では、画像と文章を入力して文章を出力する大規模マルチモーダルモデルとして報告されました。その後、音声、動画、センサーデータなどを含む方向へ開発が広がっています。

研究開発では、次のような可能性があります。

  • グラフや顕微鏡画像について質問する
  • 装置画面や実験ノートを読み取る
  • 論文の図表と本文をまとめて解釈する
  • 画像と測定値を組み合わせて異常要因を整理する

ただし、画像を入力できることと、定量的な画像解析が正確であることは別です。画素値に基づく測定や再現可能な特徴量抽出が必要な場合は、専用の画像解析コードとの使い分けが必要です。

2024年以降:推論時の計算拡張とAIエージェント

事前学習に投入する計算量だけでなく、回答を作る段階で複数案を探索し、評価し、修正する「推論時の計算量」も重視されるようになりました。

単一の回答をすぐ返すのではなく、問題を分解し、候補を作り、検証器やツールで評価してから最終回答を選びます。Tree
of
Thoughtsのように複数の推論経路を探索する研究や、推論時の計算資源を課題に応じて配分する研究も、この流れに位置付けられます。

AIエージェントは、LLMを中心に、計画、ツール実行、結果の観察、再計画を繰り返すシステムです。

ただし、「自律的に動く」ほど安全になるわけではありません。工程が長くなると、小さな判断ミスが後工程へ伝播します。そのため、次の設計が重要になります。

  • 実行してよい操作と禁止操作を分ける
  • 人の承認が必要な段階を決める
  • 参照した情報と操作履歴を残す
  • 結果を再現できるようにする
  • 失敗時に停止・復旧できるようにする

研究開発では何が変わったのか

生成AI技術の発展によって、研究者の仕事がすべて自動化されたわけではありません。変わったのは、人とコンピューターの役割分担です。

技術研究開発で期待できること人が確認すべきこと
長文コンテキスト論文や報告書の横断的な整理読み落とし、文書間の矛盾
RAG社内知識や最新文献の参照検索漏れ、出典、文書の版
CoT・推論モデル仮説や解析手順の分解前提、計算、論理の飛躍
コード生成前処理、統計解析、可視化実験単位、リーク、再現性
マルチモーダル図表・画像・文章の統合定量精度、画像の取り違え
AIエージェント調査・分析の複数工程化権限、停止条件、監査記録

私は10年以上の素材開発と、8年以上の統計解析・マテリアルズインフォマティクスなどのインフォマティクス活用を経験してきました。その観点から見ると、生成AIの価値は「専門家の代わりに結論を出すこと」よりも、情報収集、仮説整理、コードのたたき台作成、見落としの確認を高速化することにあります。

一方、実験単位の定義、データの品質、評価指標、最終的な意思決定は、研究目的と現場条件を理解する人が責任を持つ必要があります。詳しくは「生成AIに統計解析を任せてよい?よくある誤りと検証方法」で、疑似データを使った検証例とともに解説しています。

生成AIの歴史から分かる、今後の見方

今後、新しいモデルやサービスが登場したときは、ランキングだけを見るのではなく、次の点を確認すると技術的な位置付けを理解しやすくなります。

  1. 基盤モデル自体が変わったのか
  2. 事前学習後の調整方法が変わったのか
  3. 推論時の探索や検証を増やしたのか
  4. RAGや外部ツールを追加したのか
  5. 入出力できるデータ形式が増えたのか
  6. 評価条件と比較対象は適切か
  7. 精度向上と計算コストの関係はどうか

この視点を持つと、「画期的な新モデル」という発表が、モデルそのものの革新なのか、推論システムや製品設計を含めた改善なのかを区別できます。

まとめ

生成AIは、Transformerを基盤に、事前学習と大規模化、指示への調整、Chain
of
Thoughtによる多段階推論、RAGによる外部知識の参照、ツール利用、マルチモーダル化、AIエージェントへと発展してきました。

ただし、それぞれは独立した流行語ではありません。

  • Transformerは基盤となるモデル構造
  • Instruction TuningやRLHFは人の指示へ近づける調整
  • CoTは推論時の問題分解を助ける方法
  • RAGは外部文書を検索して渡すシステム
  • エージェントは計画・実行・観察を繰り返す仕組み

という役割の違いがあります。

研究者が生成AIを使いこなすには、新しい技術を追うだけでなく、「どの課題を解決する技術か」「どの段階で誤りが入るか」「人が何を検証するか」を理解することが重要です。

生成AIの研究業務全体への活用方法は、「研究者の生成AI活用ガイド|論文調査・実験計画・データ解析・執筆の使い方」もご覧ください。

よくある質問

RAGとファインチューニングは何が違いますか?

RAGは、質問時に外部文書を検索してモデルへ渡す方法です。ファインチューニングは、追加学習によってモデルの振る舞いや特定タスクへの適応を変える方法です。最新情報や引用可能な社内文書の参照にはRAG、出力形式や分類方法などの安定化にはファインチューニングが向く場合があります。両者を組み合わせることも可能です。

Chain of
Thoughtを使えば回答は正確になりますか?

多段階の問題で改善する場合がありますが、常に正確になるわけではありません。誤った前提から長い説明を生成することもあります。数値、コード、引用元、論理を外部から確認する必要があります。

AIエージェントとチャットボットの違いは何ですか?

チャットボットは主に質問に回答します。AIエージェントは、目標に対して作業を計画し、検索やコード実行などのツールを使い、結果を確認して次の行動を決めます。ただし、明確な境界が統一されているわけではなく、製品によって定義は異なります。

生成AIの発展は、モデルの大規模化だけで続きますか?

大規模化は重要ですが、それだけではありません。データ品質、学習効率、推論時の探索、外部ツールとの連携、小型モデル、運用コスト、安全性、評価方法も主要な開発領域です。

参考文献

  1. Vaswani A, et al. Attention Is All You Need.
    2017.
  2. Kaplan J, et al. Scaling
    Laws for Neural Language Models
    . 2020.
  3. Brown TB, et al. Language
    Models are Few-Shot Learners
    . 2020.
  4. Lewis P, et al. Retrieval-Augmented Generation
    for Knowledge-Intensive NLP Tasks
    . 2020.
  5. Wei J, et al. Chain-of-Thought Prompting
    Elicits Reasoning in Large Language Models
    . 2022.
  6. Wang X, et al. Self-Consistency Improves Chain
    of Thought Reasoning in Language Models
    . 2022.
  7. Ouyang L, et al. Training
    Language Models to Follow Instructions with Human Feedback
    .
    2022.
  8. Yao S, et al. ReAct:
    Synergizing Reasoning and Acting in Language Models
    . 2022.
  9. OpenAI. Introducing
    ChatGPT
    . 2022.
  10. Schick T, et al. Toolformer: Language Models Can
    Teach Themselves to Use Tools
    . 2023.
  11. OpenAI. GPT-4 Technical
    Report
    . 2023.
  12. Yao S, et al. Tree of
    Thoughts: Deliberate Problem Solving with Large Language Models
    .
    2023.
  13. Snell C, et al. Scaling
    LLM Test-Time Compute Optimally Can Be More Effective than Scaling Model
    Parameters
    . 2024.
ABOUT ME
モス
材料開発・データ解析の実務経験と、ベンチプレス180kg到達までの実践をもとに、筋トレ・データサイエンス・英語の情報を発信しています。