Skip to content

強いほうを既定にしない

どのモデルに投げるかは、仕事の難しさでは決まらない。決めているのは、出来のよしあしをテストで判定できるかどうかだ。判定できるなら、安いモデルで何本も出して、通ったものを採ればいい。人が読んで決めるしかないときだけ、上位の判断力が要る。実際に3社とも、いちばん強いものを既定にするなと書いている。同じ窓の大きさでも入る文章の量が違う、という落とし穴もある。

この章で読むもの

この章はコードを書かない。モデルの一覧を並べるのでもない。選ぶときに何を見るかを、公開されている資料から読み取る。

きっかけは素朴な疑問だ。強いモデルのほうが良い結果を出すなら、いつも強いほうを使えばいいのではないか。

ところが、3社とも逆のことを書いている。

  Anthropic   迷ったら Opus 5 から始めよ
              ── 最上位の Fable 5 ではない

  OpenAI      必要な結果が出る、いちばん低い深さを使え
              ── Luna は「良い結果の形が分かっているとき」

  Sakana      fugu と fugu-ultra を自動では切り替えない
              ── どちらを呼ぶかは、毎回そちらで決めよ
Anthropic・OpenAI・Sakana が、それぞれの言い方で同じことを勧めている。最上位を既定にせよ、とはどこも言っていない

順に見ていく。

  1. 公式の推奨は最上位ではない: 3社が別々の言い方で同じことを言っている
  2. 同じ1Mトークンでも、入る文章の量が違う: 世代をまたぐと単価の比較が成り立たなくなる
  3. 深さの既定は、高いほうに寄せてある: 何もしなければ、高い側で走る
  4. 並べて走らせても、良くはならない: 速くなるだけで、質は別のところで決まる

① 公式の推奨は最上位ではない

Claude の一覧を、公式の説明ごと並べる。

公式の説明単価(入 / 出)最大出力知識速さ
Fable 5長く走るエージェントのための次世代の知能$10 / $501M128k2026-01遅い
Opus 5複雑なエージェント的コーディングと企業向けの仕事に$5 / $251M128k2026-05
Sonnet 5速さと知能のいちばん良い組み合わせ$2 / $101M128k2026-01速い
Haiku 4.5最前線に近い知能を持つ最速のモデル$1 / $5200k64k2025-02最速

Sonnet 5 の $2 / $10 は 2026年8月31日までの導入価格で、9月1日から $3 / $15 になる。

そして公式は「迷ったら Opus 5 から始めよ」と書いている。Fable 5 は「最も能力の高い、広く提供されるモデル」だが、既定の推奨ではない。Fable が要るのは「利用できる最高の能力が必要な仕事」だけになる。

この表には、値段だけを見ていると気づかないものが2つ入っている。

知識の新しさが、能力の順と一致しない。 いちばん新しいことを知っているのは Opus 5 で、2026年5月まで。Fable 5 と Sonnet 5 は2026年1月、Haiku 4.5 は2025年2月になる。Fable のほうが賢くても、知識は4か月古い。最近のことを扱わせるなら Opus 5 が向く。

Haiku は安い廉価版ではない。 窓が 200k で他の5分の1、出力が 64k で半分、知識が1年半古い。おまけに考え方の仕組みも違って、適応的な思考を持たない。「安いから」で長い文脈の仕事に投げると、質が落ちる前に窓のところで先に壊れる

OpenAI の Codex も三段に分かれている。

向いている仕事
5.6 Sol曖昧・難しい・高価値で、分析や判断や仕上げが要るもの
5.6 Terra強い推論と道具の利用が要る日常の仕事。Sol ほどの深さが要らないとき
5.6 Luna良い結果の形が分かっている、量の多いもの

Luna の説明に条件が付いているのが読みどころだ。安いから使うのではなく、良い結果の形が分かっているときに使う。形が分からないなら Sol へ、という切り分けになっている。

Sakana の Fugu も同じで、fugufugu-ultra の間を自動では切り替えない。どちらを呼ぶかは毎回こちらが決める。

3社に共通しているのは、強さで選ばせていないことだ。何で選ばせているかは④で書く。

② 同じ1Mトークンでも、入る文章の量が違う

窓の大きさを比べるとき、トークン数だけを見ると足をすくわれる。

BPEトークナイザで作ったとおり、トークンは文字でも単語でもない。どう区切るかは学習したときの併合の履歴で決まる。だから区切り方が変われば、同じ文章のトークン数が変わる

実際に変わっている。Claude は Opus 4.7 の世代で新しい区切り方に替わり、同じ文章がおよそ30%多いトークンになる。1Mトークンの窓に入る英文で言うと、こうなる。

1M に入る英文
Opus 4.6 / Sonnet 4.6 まで約 750,000 語
Opus 4.7 以降・Fable 5 / Opus 5 / Sonnet 5約 555,000 語

窓の数字は同じ 1M のままで、入る量が4分の1ほど減っている。

ここから2つ出てくる。

世代をまたいだ単価の比較が、そのままでは成り立たない。 100万トークンあたりの値段が同じでも、同じ仕事に必要なトークン数が違うからだ。3割多いトークンを使うなら、3割高い。

日本語では、この差の上に別の差が乗る。 BPEトークナイザで見たとおり、併合は学習した文章の頻度で決まる。英語中心で学習すれば日本語の並びは併合が育たず、同じ内容でも多くのトークンを使う。窓も課金もトークン単位なので、どちらもそのまま効いてくる。

③ 深さの既定は、高いほうに寄せてある

推論モデルで見たとおり、途中を書かせると正解率が上がる。書かせる量を選べるようになっているのが「深さ」の設定だ。

3社とも段を持っているが、既定の置き方が同じ向きになっている。

既定
Claude効果の指定Opus 5 / Sonnet 5 は 高い側(API と Claude Code)
Codex軽い〜最大の6段公式の助言は「必要な結果が出る、いちばん低い深さを使え」
Fuguhigh / xhigh / maxfugu-ultra は xhigh、fugu は high

Fugu には少し変わったところがあって、xhighmax は同じものを指す。段が3つに見えて、実際は2つになる。

要点は、何もしなければ高い側で走ることだ。深く考えるほど出力のトークンが増え、そこがいちばん高い欄になる。Claude なら出力は入力の5倍の単価だ。だから「速くない」「高い」と感じたとき、モデルを替える前に見るのは深さの設定になる。

OpenAI の言い方をそのまま借りると、選ぶ順番はこうなる。必要な結果が出る、いちばん低い深さから試す。 足りなければ上げる。最初から最大にすると、足りていたかどうかが分からないまま高く払うことになる。

④ 並べて走らせても、良くはならない

同じ仕事を複数のモデルに同時に投げて、良いものを採る。強そうに見えるやり方だが、何が良くなるのかを分けて考える必要がある

グラフを CI に写すの②で、これと同じ形をすでに測っている。あそこでは経路を固定したまま、モデルに訊く節の数だけを 1 から 4 へ増やした。

訊く節モデルの呼び出し渡した文字経路を選べるか
1つ147選べない
4つ4125選べない

訊く節を4倍にしても、モデルが選べることは1つも増えなかった。 増えたのは費用だけだ。

複数のモデルに同時に投げる話も、これと同じ構造になる。3つ走らせれば3つの答えが出るが、3つを混ぜて良い1つを作ることはできない。どれかを選んで、残りを捨てる。だから増えるのは候補の数であって、答えの質ではない。

質のほうを上げているのは、並べたことではなく分けたことだ。Anthropic の手引きにこう書いてある。

新しい文脈のほうがコードレビューは良くなる。Claude が、自分がたった今書いたコードに肩入れしないからだ。

書いた本人でない目に見せると、実装したときの思い込みを共有しないので見落としが減る。これは同時に走らせなくても得られる。実装が終わってから別の文脈に見せれば済む。

何に効くか
分けること(書いた本人でない目に見せる)
並べること(同時に走らせる)速さだけ

そして分けたあとにも落とし穴がある。同じ手引きが、こちらも書いている。

ギャップを探せと言われたレビュアは、仕事が健全でもたいてい何かを報告する。そう頼まれたからだ。見つかったものを全部追いかけると過剰設計に行き着く。

採点役を増やすほど指摘は増えるが、増えた指摘の質は保証されない。 何を報告させるかを先に決めていない採点役は、報告するために報告する。

選ぶ軸

①から④を並べると、3社が何で選ばせているかが見えてくる。仕事の難しさではない。

出来のよしあしを、テストで判定できるかどうかだ。

人が見る前に落とすで「自分で読める合否」を作った。テストの結果、ビルドの終了コード、出力と期待値の突き合わせ。どれも人が読まなくても合否が付く。同じ線が、モデルを選ぶときにも引かれる。

選ぶものなぜ
テストで判定できる下位のモデル・低い深さ・多くの候補候補を10本出して、通ったものを採ればいい。選ぶ手間がかからないので、数を出すほど当たる
人が読んで決めるしかない上位のモデル・少ない候補候補を10本出しても、読むのは自分だ。読める量が上限になるので、数を増やしても頭打ちになる

上の行に当たるのは、テストを通す、性能の数値を上げる、大量のファイルを同じ形に直す、といった仕事だ。下の行は、設計をどうするか、名前を何にするか、どこまでやって切り上げるか。

Codex の Luna に「良い結果の形が分かっているとき」という条件が付いているのは、この線のことになる。

だから最初に決めるのは、モデルではない。この仕事の合否をどう付けるかが先になる。テストで付けられるなら安いモデルで何本も出す。人が読むしかないなら、本数を諦めて1本の質に寄せる。決めないまま強いモデルを選ぶのは、選べないものを高く買っているだけになる。

設計の観点

  • 強さで選ばない: 3社とも最上位を既定に勧めていない。既定にするのは中位になる
  • 合否の付け方を先に決める: テストで判定できるなら安いモデルで数を出す。人が読んで決めるなら数を諦めて1本に寄せる
  • 知識の新しさを能力と混ぜない: いちばん賢いものが、いちばん新しいことを知っているとは限らない
  • 窓はトークンで比べない: 区切り方が違えば、同じ数字でも入る量が違う
  • 高い・遅いと感じたら、まず深さを見る: 既定が高い側に寄せてあるので、モデルを替える前にここが効く
  • 並べることと分けることを混ぜない: 質に効くのは分けたほう。並べたほうは速さにしか効かない
  • 採点役には基準を渡す: 何を報告させるか決めないと、報告するために報告される

対照と実例

ClaudeCodexFugu
既定に勧めるものOpus 5(最上位ではない)Terrafugu
上位が要る条件利用できる最高の能力が要るとき曖昧・難しい・高価値難しい多段の問題
下位が向く条件速さが要るとき良い結果の形が分かっているとき既定の振り分けで足りるとき
深さの既定高い側「いちばん低い深さから」fugu-ultra は xhigh
自動で選ぶかしないしないしない

裏どり:

  • Claude の一覧: 公式のモデル比較表から。「迷ったら Opus 5 から始めよ。利用できる最高の能力が必要な仕事には Fable 5 を」。知識の確からしい期限は Opus 5 が 2026年5月、Fable 5 と Sonnet 5 が 2026年1月、Haiku 4.5 が 2025年2月
  • Haiku の違い: 窓 200k(他は 1M)、最大出力 64k(他は 128k)。適応的な思考は持たず、拡張された思考のほうを持つ
  • トークナイザの入れ替え: 「Claude 4.7 以降のモデルと Mythos Preview は新しいトークナイザを使う。同じ文章でおよそ30%多いトークンになる」。窓の注記でも、1M に入る英文が 750k語 から 555k語 へ落ちている
  • 深さの既定: Opus 5 と Sonnet 5 は、Claude API と Claude Code で高い側が既定。明示すれば変えられる
  • Codex の三段: 三段はいずれも GPT-5.6 系だと書かれている。Sol は「曖昧・難しい・高価値な仕事で、追加の分析や判断や仕上げが要るもの」、Terra は「強い推論と道具の利用が要る日常の仕事で、Sol の深さを必要としないとき」、Luna は「良い結果の形が分かっているときの、量の多い仕事」。助言は「必要な結果が出る、いちばん低い深さを使え」。Terra を既定として勧める、とは書かれていないので、対照の表の「既定に勧めるもの」はこちらの読み替えになる
  • Fugu: xhighmax は同じ。fugufugu-ultra の自動振り分けが無いことは、解説記事でしか確認できていない
  • 単価は動く: Sonnet 5 は 2026年8月31日まで導入価格($2 / $10)で、9月1日から $3 / $15 になる。この章の単価は執筆時点のもの

簡略化したこと

  • 能力を比べていない: どのモデルがどれだけ賢いかは扱わない。ベンチマークの数字は測り方から確かめる必要があり、この章の範囲を超える
  • 自分で測っていない: ④で引いた数字はグラフを CI に写すの測定だが、モデルを実際に並べて走らせた測定ではない
  • 費用の試算を置いていない: 何タスクでいくら、は前提の置き方で大きく動く。単価と数え方だけを示した
  • モデルが動く: 版も単価も推奨も入れ替わる。ここに書いたのは執筆時点のもので、この章はいちばん先に古くなる
  • 他の提供者を扱っていない: 3社に絞った
  • 日本語のトークン効率を測っていない: BPEトークナイザで仕組みは作ったが、実物のモデルで何倍かは測っていない

参考資料