Skip to content

推論モデル(o1 / o3 / DeepSeek-R1)

GPT 系譜の賭けは「モデルを大きくする」だった。推論モデルはもう 1 つの軸を開いた。答える前に長く考えさせるほど性能が上がる、という推論時間のスケーリングだ。土台には、途中の思考を書くことが計算を借りることになるという自己回帰の性質がある。この章では chain-of-thought の発見から、強化学習で思考を伸ばす o1、作り方を公開した DeepSeek-R1 と GRPO までを追う。

この章で読むもの

GPT系譜の各世代は、事前学習の規模に賭けてきた。しかし規模の軸は、データの枯渇と費用の急増で逓減が見え始める。2024 年の o1 が示したのは別の軸で、同じモデルでも推論時に長く考えさせるほど数学やコードの成績が上がる。学習時の計算(train-time compute)に対して、推論時の計算(test-time compute)という第 2 の通貨が生まれた。

この章はその仕組みを、確認された順に追う。プロンプトの工夫として始まった chain-of-thought が、なぜ効くのかという自己回帰の構造の話になり、それを強化学習で本格化させた o1、そして製法を論文で公開した DeepSeek-R1 で再現可能な技術になるまでだ。

従来の軸(train-time)      推論モデルの軸(test-time)
モデルを大きくする           考える長さを伸ばす
データを増やす               「思考 → 検算 → やり直し」を許す
学習に数ヶ月・数億ドル        1 問ごとに数秒〜数分・数円
一度きりの投資               問題の難しさに応じて可変
2 つのスケーリング軸。従来は学習時の計算(規模×データ)を増やしてきた。推論モデルは、推論時に考えるトークン数を増やすという直交した軸で性能を伸ばす

順に見ていく。

  1. 思考を書く = 計算を借りる: 自己回帰では 1 トークンの生成が 1 回の固定計算。途中経過を書くことは、難しい問題に追加の計算を割り当てる行為になる
  2. RL が思考を本格化させた: 正解に至る思考連鎖を強化学習で伸ばす。プロンプトの工夫から、学習で獲得する能力へ変わった
  3. 効く領域は検証可能性で決まる: 数学とコードで際立って効くのは、正解が機械的に検証できて報酬が作れるから。開放型の課題では利得が小さい

① chain-of-thought: なぜ「途中を書く」と正解するのか

出発点は 2022 年の観察だ。算数の文章題に直接答えさせると間違えるモデルが、「途中の考えを書いてから答えて」と指示すると正答する(chain-of-thought プロンプティング、Wei らの論文)。「ステップごとに考えよう」という 1 文を足すだけでも効く。

これは不思議な現象に見えるが、Transformer全体像 の構造から説明がつく。decoder-only モデルでは、1 トークンを生成する計算量は固定だ(層数 × ブロックの計算)。桁の繰り上がりが 3 回ある掛け算を 1 トークンで即答することは、必要な逐次計算がその固定量を超えていれば原理的にできない。ところが途中式を書けば、各ステップは固定計算に収まる小さな問題になり、書いた途中式は attention で参照できる作業メモになる。思考の文章は読者向けの説明ではなく、モデル自身の計算資源なのだ。

ここから重要な帰結が出る。出力トークン数は計算量の単位でもあるので、「長く考えさせる」ことには意味がある。問題は、素のモデルの思考が浅く、間違えても戻らないことだった。

② o1: 強化学習で思考を鍛える

OpenAI の o1(2024)は、思考連鎖をプロンプトで引き出すのではなく、強化学習で鍛え込んだ。数学やコードのように正解が検証できる課題で大量に思考させ、正解に至った思考の仕方を強化する。結果として現れた思考は、人間の下書きに似た挙動を持つ。行き詰まると「待てよ、別の方法を試そう」と方針を変え、出した答えを自分で検算し、誤りを見つけて戻る。

o1 の発表で最も影響が大きかったのは 1 枚のグラフだ。推論時に使う思考トークンを増やすほど、数学コンテスト(AIME)の正答率が対数線形に上がる。学習パイプライン のスケーリング則が学習計算に対して成り立っていたのと同じ形が、推論計算に対しても成り立つ。o3(2025)はこの軸をさらに押し込み、数学オリンピックや競技プログラミングで人間の上位水準に達した。

運用面では 2 つの特徴が生まれた。思考の中身(生の chain-of-thought)は利用者に見せず要約だけ返すこと、そして思考の長さ(reasoning effort)が課金と品質を左右する調整弁になったことだ。1 つの応答の裏で数万トークンの思考が走ることも珍しくない。

③ DeepSeek-R1: 製法の公開と GRPO

o1 は結果だけ見せて作り方を伏せた。2025 年 1 月の DeepSeek-R1 論文が、その空白を埋める。

最初の発見は R1-Zero と呼ばれる実験で、SFT を挟まず、事前学習済みモデルに検証可能な課題の強化学習だけを回した。すると、誰も教えていないのに思考が長くなり、自己検証や「待って、ここが違う」という振り返り(論文が aha moment と呼んだ挙動)が自然発生した。長く考えることが報酬につながる環境では、思考の深さは教えなくても育つ、という強い実証になった。製品版の R1 は、読みやすさのために少量の SFT(cold start)を挟んでから同じ RL を回している。

技術的な要は GRPO(group relative policy optimization)だ。学習パイプライン で見た PPO は、報酬の基準値を出すために価値モデルという別のネットワークを要した。GRPO はそれを消す。同じ問題に対して答えを複数本(例えば 16 本)サンプリングし、そのグループの平均報酬を基準にして、平均より良かった答えを強化し悪かった答えを抑える。基準がグループ内の相対比較なので価値モデルが不要になり、メモリと学習の不安定さが減る。

R1 はモデルの重みも手法も公開され、さらに R1 の思考データで小型モデル(Qwen や Llama ベース)を蒸留した版まで揃えた。推論モデルは数ヶ月で「一社の秘伝」から「再現可能な標準技術」へ変わり、Qwen の QwQ、Gemini の thinking 系など各社の推論モデルが続いた。

動かす

下のデモは 2 つの仕組みを追える。「CoTの効果」は同じ文章題を即答と途中式ありで解き比べ、1 トークンあたりの計算が固定であることが即答の失敗とどう繋がるかを見る。「GRPO」は 1 つの問題に 4 本の答えをサンプリングし、グループ平均を基準に強化・抑制が決まる様子を 1 手ずつ確かめられる。

デモ推論モデル(思考と強化)即答(直接)
CoTの効果GRPO
23 × 17 = ?
→ 401(誤答)

1 トークンの生成に使える計算は固定(層数×ブロック)。繰り上がりを複数回追う逐次計算はその中に収まらず、即答はもっともらしい誤答になる

1 / 4

左のモードは「思考を書く = 計算を借りる」を最小の例で示す。右のモードは R1 系の学習で、 検証可能な課題なら報酬が自動で作れるため、この一連(サンプル → 採点 → 相対比較 → 更新)を 大規模に回すだけで、長い思考や自己検証が教えられずに育つ。

設計の観点

  • 使い分けの基準は検証可能性: 数学・コード・論理パズルは検証器が書けるので RL が回り、推論モデルが強い。文章の好みのような開放課題は報酬が作れず、即答型との差が縮む。タスクの検証可能性が、モデル選択の第一の分岐になる
  • コストの構造が変わる: 即答型の費用は出力長に比例するだけだが、推論モデルは見えない思考トークンが支配項になる。thinking budget の上限設定と、簡単な問い合わせを軽いモデルへ振り分けるルーティングが運用の要になる
  • 過剰思考という失敗様式: 簡単な問題にも長考して遅く高くなる。難易度に応じて思考量を配分する制御は現在も改善が続く領域
  • 蒸留の意味: 大きいモデルの思考データで小型を微調整すると、推論の型がある程度移る。R1 の蒸留版が示したこの経路は、エッジで動く推論モデルへの現実的な道になっている
  • 思考を隠す理由: 生の思考には誤りや不適切な内容が混ざりうること、思考データ自体が蒸留の材料になる競争上の価値を持つこと。可視性と安全性・競争のトレードオフとして説明できる

モデルの対照

モデル方式特徴
GPT-4o 等の即答型〜2024事前学習 + RLHF思考は明示的に伸ばさない
o1 / o32024-25検証可能課題の RL(詳細非公開)test-time スケーリングの提示、思考は非公開
DeepSeek-R12025GRPO による RL(公開)製法・重みとも公開、蒸留版も提供
QwQ、Gemini thinking 系2025各社の追随推論モードの標準機能化

裏どり:

  • Wei et al.(2022): Chain-of-Thought Prompting。途中を書かせるだけで算数の正答率が跳ねることを示した観察の原典
  • OpenAI o1(2024): Learning to Reason with LLMs。train-time と test-time の両対数グラフがこの分野の方向を決めた
  • DeepSeek-R1(2025): 論文。R1-Zero の自然発生する振り返りと、蒸留までの全工程を公開
  • GRPO: DeepSeekMath(2024)が初出。価値モデルを消す簡略化は R1 以前に数学特化で検証されていた

簡略化したこと

  • プロセス報酬モデル(PRM)は扱わない: 思考の途中ステップごとに採点する路線もあるが、R1 は最終結果の報酬だけで成立させた。対比は参考資料の論文に譲る
  • 探索系(ツリー探索、MCTS)は扱わない: 推論時に複数の思考を分岐・評価する研究系統は、製品への採用が確認できる範囲で書いていない
  • ベンチマーク数値は最小限: 数値は更新が速く陳腐化するため、傾向(対数線形)だけを記述した

参考資料