強いほうを既定にしない
どのモデルに投げるかは、仕事の難しさでは決まらない。決めているのは、出来のよしあしをテストで判定できるかどうかだ。判定できるなら、安いモデルで何本も出して、通ったものを採ればいい。人が読んで決めるしかないときだけ、上位の判断力が要る。実際に3社とも、いちばん強いものを既定にするなと書いている。同じ窓の大きさでも入る文章の量が違う、という落とし穴もある。
この章で読むもの
この章はコードを書かない。モデルの一覧を並べるのでもない。選ぶときに何を見るかを、公開されている資料から読み取る。
きっかけは素朴な疑問だ。強いモデルのほうが良い結果を出すなら、いつも強いほうを使えばいいのではないか。
ところが、3社とも逆のことを書いている。
Anthropic 迷ったら Opus 5 から始めよ
── 最上位の Fable 5 ではない
OpenAI 必要な結果が出る、いちばん低い深さを使え
── Luna は「良い結果の形が分かっているとき」
Sakana fugu と fugu-ultra を自動では切り替えない
── どちらを呼ぶかは、毎回そちらで決めよ順に見ていく。
- 公式の推奨は最上位ではない: 3社が別々の言い方で同じことを言っている
- 同じ1Mトークンでも、入る文章の量が違う: 世代をまたぐと単価の比較が成り立たなくなる
- 深さの既定は、高いほうに寄せてある: 何もしなければ、高い側で走る
- 並べて走らせても、良くはならない: 速くなるだけで、質は別のところで決まる
① 公式の推奨は最上位ではない
Claude の一覧を、公式の説明ごと並べる。
| 公式の説明 | 単価(入 / 出) | 窓 | 最大出力 | 知識 | 速さ | |
|---|---|---|---|---|---|---|
| Fable 5 | 長く走るエージェントのための次世代の知能 | $10 / $50 | 1M | 128k | 2026-01 | 遅い |
| Opus 5 | 複雑なエージェント的コーディングと企業向けの仕事に | $5 / $25 | 1M | 128k | 2026-05 | 中 |
| Sonnet 5 | 速さと知能のいちばん良い組み合わせ | $2 / $10 | 1M | 128k | 2026-01 | 速い |
| Haiku 4.5 | 最前線に近い知能を持つ最速のモデル | $1 / $5 | 200k | 64k | 2025-02 | 最速 |
Sonnet 5 の $2 / $10 は 2026年8月31日までの導入価格で、9月1日から $3 / $15 になる。
そして公式は「迷ったら Opus 5 から始めよ」と書いている。Fable 5 は「最も能力の高い、広く提供されるモデル」だが、既定の推奨ではない。Fable が要るのは「利用できる最高の能力が必要な仕事」だけになる。
この表には、値段だけを見ていると気づかないものが2つ入っている。
知識の新しさが、能力の順と一致しない。 いちばん新しいことを知っているのは Opus 5 で、2026年5月まで。Fable 5 と Sonnet 5 は2026年1月、Haiku 4.5 は2025年2月になる。Fable のほうが賢くても、知識は4か月古い。最近のことを扱わせるなら Opus 5 が向く。
Haiku は安い廉価版ではない。 窓が 200k で他の5分の1、出力が 64k で半分、知識が1年半古い。おまけに考え方の仕組みも違って、適応的な思考を持たない。「安いから」で長い文脈の仕事に投げると、質が落ちる前に窓のところで先に壊れる。
OpenAI の Codex も三段に分かれている。
| 向いている仕事 | |
|---|---|
| 5.6 Sol | 曖昧・難しい・高価値で、分析や判断や仕上げが要るもの |
| 5.6 Terra | 強い推論と道具の利用が要る日常の仕事。Sol ほどの深さが要らないとき |
| 5.6 Luna | 良い結果の形が分かっている、量の多いもの |
Luna の説明に条件が付いているのが読みどころだ。安いから使うのではなく、良い結果の形が分かっているときに使う。形が分からないなら Sol へ、という切り分けになっている。
Sakana の Fugu も同じで、fugu と fugu-ultra の間を自動では切り替えない。どちらを呼ぶかは毎回こちらが決める。
3社に共通しているのは、強さで選ばせていないことだ。何で選ばせているかは④で書く。
② 同じ1Mトークンでも、入る文章の量が違う
窓の大きさを比べるとき、トークン数だけを見ると足をすくわれる。
BPEトークナイザで作ったとおり、トークンは文字でも単語でもない。どう区切るかは学習したときの併合の履歴で決まる。だから区切り方が変われば、同じ文章のトークン数が変わる。
実際に変わっている。Claude は Opus 4.7 の世代で新しい区切り方に替わり、同じ文章がおよそ30%多いトークンになる。1Mトークンの窓に入る英文で言うと、こうなる。
| 1M に入る英文 | |
|---|---|
| Opus 4.6 / Sonnet 4.6 まで | 約 750,000 語 |
| Opus 4.7 以降・Fable 5 / Opus 5 / Sonnet 5 | 約 555,000 語 |
窓の数字は同じ 1M のままで、入る量が4分の1ほど減っている。
ここから2つ出てくる。
世代をまたいだ単価の比較が、そのままでは成り立たない。 100万トークンあたりの値段が同じでも、同じ仕事に必要なトークン数が違うからだ。3割多いトークンを使うなら、3割高い。
日本語では、この差の上に別の差が乗る。 BPEトークナイザで見たとおり、併合は学習した文章の頻度で決まる。英語中心で学習すれば日本語の並びは併合が育たず、同じ内容でも多くのトークンを使う。窓も課金もトークン単位なので、どちらもそのまま効いてくる。
③ 深さの既定は、高いほうに寄せてある
推論モデルで見たとおり、途中を書かせると正解率が上がる。書かせる量を選べるようになっているのが「深さ」の設定だ。
3社とも段を持っているが、既定の置き方が同じ向きになっている。
| 段 | 既定 | |
|---|---|---|
| Claude | 効果の指定 | Opus 5 / Sonnet 5 は 高い側(API と Claude Code) |
| Codex | 軽い〜最大の6段 | 公式の助言は「必要な結果が出る、いちばん低い深さを使え」 |
| Fugu | high / xhigh / max | fugu-ultra は xhigh、fugu は high |
Fugu には少し変わったところがあって、xhigh と max は同じものを指す。段が3つに見えて、実際は2つになる。
要点は、何もしなければ高い側で走ることだ。深く考えるほど出力のトークンが増え、そこがいちばん高い欄になる。Claude なら出力は入力の5倍の単価だ。だから「速くない」「高い」と感じたとき、モデルを替える前に見るのは深さの設定になる。
OpenAI の言い方をそのまま借りると、選ぶ順番はこうなる。必要な結果が出る、いちばん低い深さから試す。 足りなければ上げる。最初から最大にすると、足りていたかどうかが分からないまま高く払うことになる。
④ 並べて走らせても、良くはならない
同じ仕事を複数のモデルに同時に投げて、良いものを採る。強そうに見えるやり方だが、何が良くなるのかを分けて考える必要がある。
グラフを CI に写すの②で、これと同じ形をすでに測っている。あそこでは経路を固定したまま、モデルに訊く節の数だけを 1 から 4 へ増やした。
| 訊く節 | モデルの呼び出し | 渡した文字 | 経路を選べるか |
|---|---|---|---|
| 1つ | 1 | 47 | 選べない |
| 4つ | 4 | 125 | 選べない |
訊く節を4倍にしても、モデルが選べることは1つも増えなかった。 増えたのは費用だけだ。
複数のモデルに同時に投げる話も、これと同じ構造になる。3つ走らせれば3つの答えが出るが、3つを混ぜて良い1つを作ることはできない。どれかを選んで、残りを捨てる。だから増えるのは候補の数であって、答えの質ではない。
質のほうを上げているのは、並べたことではなく分けたことだ。Anthropic の手引きにこう書いてある。
新しい文脈のほうがコードレビューは良くなる。Claude が、自分がたった今書いたコードに肩入れしないからだ。
書いた本人でない目に見せると、実装したときの思い込みを共有しないので見落としが減る。これは同時に走らせなくても得られる。実装が終わってから別の文脈に見せれば済む。
| 何に効くか | |
|---|---|
| 分けること(書いた本人でない目に見せる) | 質 |
| 並べること(同時に走らせる) | 速さだけ |
そして分けたあとにも落とし穴がある。同じ手引きが、こちらも書いている。
ギャップを探せと言われたレビュアは、仕事が健全でもたいてい何かを報告する。そう頼まれたからだ。見つかったものを全部追いかけると過剰設計に行き着く。
採点役を増やすほど指摘は増えるが、増えた指摘の質は保証されない。 何を報告させるかを先に決めていない採点役は、報告するために報告する。
選ぶ軸
①から④を並べると、3社が何で選ばせているかが見えてくる。仕事の難しさではない。
出来のよしあしを、テストで判定できるかどうかだ。
人が見る前に落とすで「自分で読める合否」を作った。テストの結果、ビルドの終了コード、出力と期待値の突き合わせ。どれも人が読まなくても合否が付く。同じ線が、モデルを選ぶときにも引かれる。
| 選ぶもの | なぜ | |
|---|---|---|
| テストで判定できる | 下位のモデル・低い深さ・多くの候補 | 候補を10本出して、通ったものを採ればいい。選ぶ手間がかからないので、数を出すほど当たる |
| 人が読んで決めるしかない | 上位のモデル・少ない候補 | 候補を10本出しても、読むのは自分だ。読める量が上限になるので、数を増やしても頭打ちになる |
上の行に当たるのは、テストを通す、性能の数値を上げる、大量のファイルを同じ形に直す、といった仕事だ。下の行は、設計をどうするか、名前を何にするか、どこまでやって切り上げるか。
Codex の Luna に「良い結果の形が分かっているとき」という条件が付いているのは、この線のことになる。
だから最初に決めるのは、モデルではない。この仕事の合否をどう付けるかが先になる。テストで付けられるなら安いモデルで何本も出す。人が読むしかないなら、本数を諦めて1本の質に寄せる。決めないまま強いモデルを選ぶのは、選べないものを高く買っているだけになる。
設計の観点
- 強さで選ばない: 3社とも最上位を既定に勧めていない。既定にするのは中位になる
- 合否の付け方を先に決める: テストで判定できるなら安いモデルで数を出す。人が読んで決めるなら数を諦めて1本に寄せる
- 知識の新しさを能力と混ぜない: いちばん賢いものが、いちばん新しいことを知っているとは限らない
- 窓はトークンで比べない: 区切り方が違えば、同じ数字でも入る量が違う
- 高い・遅いと感じたら、まず深さを見る: 既定が高い側に寄せてあるので、モデルを替える前にここが効く
- 並べることと分けることを混ぜない: 質に効くのは分けたほう。並べたほうは速さにしか効かない
- 採点役には基準を渡す: 何を報告させるか決めないと、報告するために報告される
対照と実例
| Claude | Codex | Fugu | |
|---|---|---|---|
| 既定に勧めるもの | Opus 5(最上位ではない) | Terra | fugu |
| 上位が要る条件 | 利用できる最高の能力が要るとき | 曖昧・難しい・高価値 | 難しい多段の問題 |
| 下位が向く条件 | 速さが要るとき | 良い結果の形が分かっているとき | 既定の振り分けで足りるとき |
| 深さの既定 | 高い側 | 「いちばん低い深さから」 | fugu-ultra は xhigh |
| 自動で選ぶか | しない | しない | しない |
裏どり:
- Claude の一覧: 公式のモデル比較表から。「迷ったら Opus 5 から始めよ。利用できる最高の能力が必要な仕事には Fable 5 を」。知識の確からしい期限は Opus 5 が 2026年5月、Fable 5 と Sonnet 5 が 2026年1月、Haiku 4.5 が 2025年2月
- Haiku の違い: 窓 200k(他は 1M)、最大出力 64k(他は 128k)。適応的な思考は持たず、拡張された思考のほうを持つ
- トークナイザの入れ替え: 「Claude 4.7 以降のモデルと Mythos Preview は新しいトークナイザを使う。同じ文章でおよそ30%多いトークンになる」。窓の注記でも、1M に入る英文が 750k語 から 555k語 へ落ちている
- 深さの既定: Opus 5 と Sonnet 5 は、Claude API と Claude Code で高い側が既定。明示すれば変えられる
- Codex の三段: 三段はいずれも GPT-5.6 系だと書かれている。Sol は「曖昧・難しい・高価値な仕事で、追加の分析や判断や仕上げが要るもの」、Terra は「強い推論と道具の利用が要る日常の仕事で、Sol の深さを必要としないとき」、Luna は「良い結果の形が分かっているときの、量の多い仕事」。助言は「必要な結果が出る、いちばん低い深さを使え」。Terra を既定として勧める、とは書かれていないので、対照の表の「既定に勧めるもの」はこちらの読み替えになる
- Fugu:
xhighとmaxは同じ。fuguとfugu-ultraの自動振り分けが無いことは、解説記事でしか確認できていない - 単価は動く: Sonnet 5 は 2026年8月31日まで導入価格($2 / $10)で、9月1日から $3 / $15 になる。この章の単価は執筆時点のもの
簡略化したこと
- 能力を比べていない: どのモデルがどれだけ賢いかは扱わない。ベンチマークの数字は測り方から確かめる必要があり、この章の範囲を超える
- 自分で測っていない: ④で引いた数字はグラフを CI に写すの測定だが、モデルを実際に並べて走らせた測定ではない
- 費用の試算を置いていない: 何タスクでいくら、は前提の置き方で大きく動く。単価と数え方だけを示した
- モデルが動く: 版も単価も推奨も入れ替わる。ここに書いたのは執筆時点のもので、この章はいちばん先に古くなる
- 他の提供者を扱っていない: 3社に絞った
- 日本語のトークン効率を測っていない: BPEトークナイザで仕組みは作ったが、実物のモデルで何倍かは測っていない
参考資料
- Models overview(Anthropic) — 比較表と、どれから始めるか
- Pricing(Anthropic) — 単価とトークナイザの注記
- Models(Codex) — 三段の使い分けと深さの助言
- Models(Sakana Fugu) — モデル ID と深さ
- 前提: BPEトークナイザ / 推論モデル / グラフを CI に写す