最近の完全な観測
- 現在の観測を読み込み中…
CODEX モデル + 強度セレクター
タスクを指定すると、Codex Juice が Astra、Sol、Terra、Luna と、良い結果に必要な最小の推論強度を提案します。
Codex Radar に戻るTASK → MODEL → EFFORT
3 つのタスクシグナルから透明な開始点を出します。検証に失敗したら、Juice 値を推測に使わずフォールバックに従います。
開始点であり能力順位ではありません。検証の難しさや品質優先で上方調整します。
| タスク | 開始モデル | 強度 |
|---|---|---|
| 短く検証しやすい | Luna | 低 |
| 定型で範囲明確 | Terra | 中 |
| 複雑なリポジトリ作業 | Sol | 高 |
| 曖昧または高リスク | Astra | 超高 |
30 秒ガイド
まずタスクの性質を見ます。手順と確認方法が明確なら推論を抑え、曖昧さやレビューリスクが高ければ増やします。以下は OpenAI の品質と速度の方向性と外部結果に基づき、Juice 値には基づきません。
技術モニター
以下の 6 強度のライブ観測は、収集の健全性と構成変化を監視します。Juice は能力スコアではありません。値の大小や増減は中立なランタイム指紋です。
利用不可
| 強度 | 現在 | 前回 | 差分 | 検証状態 |
|---|---|---|---|---|
| 低 | — | — | — | 利用不可 |
| 中 | — | — | — | 利用不可 |
| 高 | — | — | — | 利用不可 |
| 超高 | — | — | — | 利用不可 |
| 最大 | — | — | — | 利用不可 |
| ウルトラ | — | — | — | 利用不可 |
現在の観測を読み込み中…
推論強度を選び、保持された sweep の確認済み値を確認します。
制限された一時 Codex CLI セッションで各強度を観測します。新しい値は別の新規セッションで一致した二回目の観測後のみ公開します。完全 sweep 中にモデル識別子が変われば全体を無効化します。
Juice は非公式の自己申告ランタイム指紋で、実際の推論 token 使用量でも品質ベンチマークでもありません。値が高い、低い、またはどちらに変化しても、コーディング能力の向上・低下とは解釈できません。
OpenAI は推論強度について品質と速度の方向性のみを示し、追加推論の効果はタスクによって異なると明記しています。 OpenAI の推論強度ガイドを読む
NixBench は現在、29 件のコーディングタスクを使い、Low、Medium、High、XHigh、Max の各強度で 5 回記録した GPT-5.6 Sol の結果を掲載しています。別ベンチマークによる方向性エビデンスであり、Codex Juice の能力スコアではありません。NixBench はまだ GPT-6 Astra の行を公開していません(2026-09-06 確認)。
| 強度 | 平均通過 | 95% 区間 | 秒/タスク | 試行 | タイムアウト |
|---|---|---|---|---|---|
| 低 | 23.6/29 | 22.2–25.0 | 27.4s | 5 | 0 |
| 中 | 24.0/29 | 22.5–25.5 | 38.5s | 5 | 0 |
| 高 | 23.6/29 | 22.9–24.3 | 47.4s | 5 | 0 |
| 超高 | 24.0/29 | 23.1–24.9 | 60.7s | 5 | 0 |
| 最大 | 23.2/29 | 20.1–26.3 | 81.4s | 5 | 3 |
制約:NixBench は独自のハーネス、コーパス、客観的な hidden shell evaluator を使用します。これは Codex Juice の観測値ではありません。Max の公開行はありますが、Ultra は製品モードで、今回比較可能な公開性能行は見つかりませんでした。
静的スナップショット · 2026-08-03 確認
ライブ NixBench 結果を開く NixBench の方法を読む NixBench リポジトリを開く DeepSWE ライブボードと比較 OpenAI GPT-5.6 の背景を読む