Skip to content

GPT系譜(GPT-1からGPT-4oまで)

GPT の歴史は「次の語の予測を大きくするだけでどこまで行けるか」という 1 つの賭けを、世代ごとに掛け金を上げて検証してきた記録だ。GPT-1 が事前学習と微調整の型を作り、GPT-2 が教師なしの多任務性を示し、GPT-3 がコンテキスト内学習を発見し、InstructGPT が RLHF で対話の形を与え、GPT-4 以降がマルチモーダルへ広げた。各世代で何が賭けられ、何が分かったかを追う。

この章で読むもの

mini-GPT で作った骨格は GPT-2 相当だった。では GPT-1 から GPT-4o までの間に、何が変わってきたのか。パラメータ数の表だけ眺めても「大きくなった」以上のことは分からない。この章では各世代を「何を賭けて、何が分かったか」という実験として読み直す。ここで押さえた語彙(zero-shot、コンテキスト内学習、RLHF)は、後続の Claude・Gemini・オープンモデルの章でそのまま比較の軸になる。

GPT-1 (2018)  117M   事前学習 + 微調整という型
GPT-2 (2019)  1.5B   微調整なしの多任務性(zero-shot)
GPT-3 (2020)  175B   コンテキスト内学習(few-shot)の発見、API 化
InstructGPT/ChatGPT (2022)  RLHF で対話の形。使い方が一般へ
GPT-4 (2023)  非公開  画像入力、専門試験で人間水準、詳細の非公開化
GPT-4o (2024) 非公開  音声・画像・テキストを 1 つのモデルで(omni)
GPT 系譜の要点。規模は約 4 年で 3 桁上がり、各世代で質的に新しい能力と使い方が確認された

順に見ていく。

  1. 賭けは一貫して「予測とスケール」: 次の語の予測という単純な目標を、データと計算で押し込み続けた
  2. 能力は段階的に「現れた」: zero-shot、コンテキスト内学習、指示追従は、設計して入れたのではなく規模の先で確認された
  3. 公開から非公開へ: GPT-2 までは重みも論文も開いていた。GPT-4 では構成すら非公開になり、この空白がオープンモデルの章の伏線になる

GPT-1(2018): 事前学習という型

GPT-1 の主張は今から見ると地味だ。ラベルなしテキストで言語モデルを事前学習し、その重みを初期値として各タスク(分類、含意判定)を微調整すると、タスクごとにゼロから作るより良い結果が出る。117M パラメータ、12 層の Transformer decoder。Transformer全体像 で見た decoder-only の系譜はここから始まる。

当時の常識はタスクごとの専用モデルだった。GPT-1 が示したのは「言語の一般的な知識をまず獲得し、タスクは後付けする」という順序の逆転で、この型そのものがその後のすべての前提になる。

GPT-2(2019): 微調整を消す

GPT-2 は規模を 1.5B に上げ、より大きな主張をした。微調整を一切せずに、要約・翻訳・質問応答がある程度できてしまう。論文の題名 "Language Models are Unsupervised Multitask Learners" がその主張そのものだ。ウェブテキストには要約の例も翻訳の例も自然に含まれているから、次の語の予測を極めることは、それらのタスクを教師なしで学ぶことと同じだった、という読みになる。

mini-GPT で作った構成(学習型絶対位置、LayerNorm、GELU)はこの世代のもので、以後の部品の改良(RoPERMSNorm/SwiGLU)はすべて GPT-2 を基準点に語られる。もう 1 つ、GPT-2 は「悪用の懸念があるため段階公開する」と発表した最初の主要モデルでもあり、能力と公開方針が結びつく議論の起点になった。

GPT-3(2020): コンテキスト内学習の発見

GPT-3 は 175B、前世代の 100 倍超。ここで質的に新しい現象が確認される。コンテキスト内学習(in-context learning)、つまりプロンプトに数例を書くだけで、勾配更新なしに新しいタスクをこなす能力だ。

これが奇妙な現象であることは強調しておきたい。学習(重みの更新)は一切起きていない。数例を見せられた瞬間の forward pass の中で、モデルがタスクの規則を掴んで適用している。「微調整の代わりにプロンプトを書く」という現在の LLM の使い方は、設計されたのではなく、この規模で初めて観測された。学習パイプライン で見た Kaplan らのスケーリング則が同年で、「大きくすれば良くなる」が法則として信じられるようになり、規模の競争が確定した。

同時に GPT-3 は重みを公開せず API だけを提供した。モデルが製品になった転換点で、フロンティアの非公開化はここに始まる。

InstructGPT と ChatGPT(2022): 形を与える

素の GPT-3 は続きを書くだけで、指示には従わない。学習パイプライン で追った SFT + RLHF をこれに施したのが InstructGPT で、人間評価では 1.3B の InstructGPT が 175B の素の GPT-3 より好まれた。規模を 100 分の 1 にしても後段学習が勝つ、という結果が「事前学習 = 能力、後段 = 引き出し方」の分業を示した。

2022 年 11 月の ChatGPT はこの技術をチャット UI に載せたもので、技術的には InstructGPT の対話版にあたる。新しいモデルというより新しい届け方であり、2 ヶ月で 1 億ユーザーという普及の速さが、以後の全世界的な開発競争の引き金になった。

GPT-4 以降(2023〜): マルチモーダルと非公開化

GPT-4 は画像入力を受け付け、司法試験や医師国家試験の模試で人間の合格水準に達した。だがテクニカルレポートは「規模・構成・学習方法の詳細は競争と安全の理由で開示しない」と明記し、パラメータ数すら公開されていない。MoE 構成という広く信じられた報告(MoE の章で触れた)も未確認のままだ。研究の系譜としての GPT はここで一度閉じ、以後は製品の系譜として読むしかなくなる。

GPT-4o(2024)は omni の名のとおり、テキスト・画像・音声を単一モデルで入出力する。別モデルへの変換連鎖(音声認識 → LLM → 音声合成)を 1 つのモデルに畳んだことで、リアルタイムの音声対話が実用になった。マルチモーダルの設計思想はGeminiの系譜で対比する。なお、答える前に長く考える o1/o3 系は賭けの軸が「規模」から「推論時間」へ移った別系統なので、推論モデルの章で独立に扱う。

動かす

下のデモは系譜を 1 世代ずつ進める年表で、規模(対数バー)と各世代の賭け・分かったことを並べて追える。規模が 3 桁上がる間に、能力の言葉が「微調整すれば使える」から「例を見せれば使える」「頼めば使える」へ変わっていくことが読み取れる。

デモGPT系譜(賭けと結果)GPT-1 (2018)
GPT-12018117M
GPT-220191.5B
GPT-32020175B
InstructGPT / ChatGPT2022175B
GPT-42023非公開
GPT-4o2024非公開

規模バーは対数(10⁸〜10¹²)。非公開の世代は点線で示している

賭けたこと

ラベルなしテキストの事前学習が、タスク別モデルの初期値として効くか

分かったこと

効いた。「まず言語モデルとして育て、タスクは微調整で後付け」という型が確立した

1 / 6

規模が 3 桁上がる間に、能力の言葉は「微調整すれば使える」→「例を見せれば使える」→ 「頼めば使える」へ変わった。設計して入れた能力ではなく、賭けの結果として確認された能力の 系譜として読むのがこの年表の読み方になる。

設計の観点

  • コンテキスト内学習はなぜ重要か: 勾配更新なしのタスク適応。デプロイ後のモデルを再学習せずに新タスクへ回せることが、LLM を汎用 API にした。プロンプトエンジニアリングという職能はこの現象の上に立っている
  • 規模と後段学習の寄与の切り分け: InstructGPT の「1.3B が 175B に勝つ」は評価軸が人間の好みだから。知識量の評価なら大きい方が勝つ。何を測っているかで答えが変わる、と言えること
  • 創発の議論: 規模の先で能力が急に現れる(創発)という主張には、評価指標の非線形性がそう見せているだけという反論もある(Schaeffer 2023)。両論を知っていると深い
  • 非公開化の構造: 重み公開 → API 化 → 構成非公開という段階は、研究競争が製品競争に変わった過程そのもの。オープンモデルはこの空白を埋める形で伸びた
  • 系譜の読み方: 「GPT-4 は何パラメータか」に確定した答えは存在しない。非公開情報を断定しないことも技術理解の一部

世代表

世代規模確認されたこと
GPT-12018117M事前学習 + 微調整の型
GPT-220191.5B微調整なしの多任務性
GPT-32020175Bコンテキスト内学習、API 提供
InstructGPT20221.3B〜175BRLHF が規模の差を覆す
GPT-42023非公開画像入力、専門試験で人間水準
GPT-4o2024非公開単一モデルの音声・画像・テキスト

裏どり:

簡略化したこと

  • o1/o3 系は扱わない: 推論時間への賭けは推論モデルの章で独立に扱う
  • GPT-3.5 の中間段階(code-davinci 等)は省略: コード学習が推論力に効いたという重要な系譜だが、公開情報が断片的なため世代表から外した
  • 規模の推定値を書かない: GPT-4 以降の非公開情報は「非公開」として扱う

参考資料