CODEX モデル + 強度セレクター

タスクに合う Codex モデルと推論強度を選ぶ

タスクを指定すると、Codex Juice が Astra、Sol、Terra、Luna と、良い結果に必要な最小の推論強度を提案します。

Codex Radar に戻る

TASK → MODEL → EFFORT

開始構成を決める

3 つのタスクシグナルから透明な開始点を出します。検証に失敗したら、Juice 値を推測に使わずフォールバックに従います。

推奨構成 モデルTerra強度 Terra は定型作業の能力とコストを両立します。明確で慣れたタスクには Medium が根拠のある開始点です。 最初の実行が失敗したら: モデルを変える前に、同じモデルの強度を 1 段上げます。

早見表

開始点であり能力順位ではありません。検証の難しさや品質優先で上方調整します。

タスク開始モデル強度
短く検証しやすい Luna
定型で範囲明確 Terra
複雑なリポジトリ作業 Sol
曖昧または高リスク Astra 超高
OpenAI の Astra、Sol、Terra、Luna のモデル位置付けを読む

30 秒ガイド

30 秒で選ぶ

まずタスクの性質を見ます。手順と確認方法が明確なら推論を抑え、曖昧さやレビューリスクが高ければ増やします。以下は OpenAI の品質と速度の方向性と外部結果に基づき、Juice 値には基づきません。

ルールの仕組み タスク範囲と検証リスクでモデルを選び、強度で推論量を調整します。OpenAI のモデル位置付けと外部強度エビデンスを使い、Juice 指紋の大小は使いません。

技術モニター

実験的ランタイム指紋

以下の 6 強度のライブ観測は、収集の健全性と構成変化を監視します。Juice は能力スコアではありません。値の大小や増減は中立なランタイム指紋です。

ランタイム観測は現在非表示です

セレクターとエビデンスは利用できます。オンラインスナップショットが最新または明示的な最終既知で、有効な観測を含む場合だけ Juice 値を表示します。

プローブ方法

制限された一時 Codex CLI セッションで各強度を観測します。新しい値は別の新規セッションで一致した二回目の観測後のみ公開します。完全 sweep 中にモデル識別子が変われば全体を無効化します。

この指標で証明できないこと

Juice は非公式の自己申告ランタイム指紋で、実際の推論 token 使用量でも品質ベンチマークでもありません。値が高い、低い、またはどちらに変化しても、コーディング能力の向上・低下とは解釈できません。

OpenAI は推論強度について品質と速度の方向性のみを示し、追加推論の効果はタスクによって異なると明記しています。 OpenAI の推論強度ガイドを読む

/api/juice の Raw データを開く

effort-guide --external-evidence

実タスクのライブ外部エビデンス

NixBench は現在、29 件のコーディングタスクを使い、Low、Medium、High、XHigh、Max の各強度で 5 回記録した GPT-5.6 Sol の結果を掲載しています。別ベンチマークによる方向性エビデンスであり、Codex Juice の能力スコアではありません。NixBench はまだ GPT-6 Astra の行を公開していません(2026-09-06 確認)。

出典と更新
NixBench · 2026-07-12
外部モデル
GPT-5.6 Sol
ハーネス
codex-cli 0.144.1
タスクセット
29 · NixBench 29-task corpus · 5×/effort
平均通過タスク数、観測 95% 区間、タスク当たり秒数、記録試行数、タイムアウト数。
強度平均通過95% 区間秒/タスク試行タイムアウト
23.6/29 22.2–25.0 27.4s 5 0
24.0/29 22.5–25.5 38.5s 5 0
23.6/29 22.9–24.3 47.4s 5 0
超高 24.0/29 23.1–24.9 60.7s 5 0
最大 23.2/29 20.1–26.3 81.4s 5 3

制約:NixBench は独自のハーネス、コーパス、客観的な hidden shell evaluator を使用します。これは Codex Juice の観測値ではありません。Max の公開行はありますが、Ultra は製品モードで、今回比較可能な公開性能行は見つかりませんでした。

静的スナップショット · 2026-08-03 確認