最近完整观测
- 正在加载当前观测…
CODEX 模型 + 强度选择器
描述任务,Codex Juice 会推荐 Astra、Sol、Terra 或 Luna,以及最可能把任务做好所需的最低推理强度。
返回 Codex 雷达TASK → MODEL → EFFORT
三个任务信号生成一套透明的起始建议。若验证失败,按回退规则调整,不要根据 Juice 数值猜测。
这些是起点,不是能力排名。验证难度或质量优先会把配置上调。
| 任务 | 建议模型 | 强度 |
|---|---|---|
| 快速且容易检查 | Luna | 低 |
| 常规且范围明确 | Terra | 中 |
| 复杂仓库工作 | Sol | 高 |
| 模糊或高风险 | Astra | 超高 |
30 秒指南
先看任务形态:路径和验收明确时少用推理,需求模糊或审查风险高时增加推理。以下建议结合 OpenAI 的质量—速度方向与外部任务结果,不来自 Juice 数字。
技术监控
下面六档实时观测用于监控采集健康和配置变化。Juice 不是能力分数;数值大小与升降都只是中性的运行时指纹。
不可用
| 强度 | 当前 | 之前 | 变化 | 验证状态 |
|---|---|---|---|---|
| 低 | — | — | — | 不可用 |
| 中 | — | — | — | 不可用 |
| 高 | — | — | — | 不可用 |
| 超高 | — | — | — | 不可用 |
| 最大 | — | — | — | 不可用 |
| 极致 | — | — | — | 不可用 |
正在加载当前观测…
选择一个推理强度,查看保留 sweep 中的已确认数值。
受限的临时 Codex CLI 会话逐个观测推理强度。新数值只有在全新会话的第二次观测一致后才发布。完整 sweep 中途模型标识变化时,整轮作废。
Juice 是非官方自报告运行时指纹,不是实际推理 token 用量,也不是质量基准。数值更高、更低或任何方向的变化,都不能解释为编程能力变强或变弱。
OpenAI 只提供推理强度在质量与速度之间的方向性说明,并明确表示并非所有任务都同样受益于更多推理。 阅读 OpenAI 推理强度说明
NixBench 目前报告 GPT-5.6 Sol 在 Low、Medium、High、XHigh 和 Max 上的结果,使用 29 个编码任务、每档 5 次记录试验。这是不同基准的方向性证据,不是 Codex Juice 能力分数。NixBench 尚未公布 GPT-6 Astra 的结果行(2026-09-06 核对)。
| 强度 | 平均通过 | 95% 区间 | 秒/任务 | 试验 | 超时 |
|---|---|---|---|---|---|
| 低 | 23.6/29 | 22.2–25.0 | 27.4s | 5 | 0 |
| 中 | 24.0/29 | 22.5–25.5 | 38.5s | 5 | 0 |
| 高 | 23.6/29 | 22.9–24.3 | 47.4s | 5 | 0 |
| 超高 | 24.0/29 | 23.1–24.9 | 60.7s | 5 | 0 |
| 最大 | 23.2/29 | 20.1–26.3 | 81.4s | 5 | 3 |
局限:NixBench 使用自己的工具、任务集和客观隐藏 shell 评估器;这些结果不是 Codex Juice 观测。这里有 Max 的公开行,但 Ultra 是产品模式,本次没有找到可比的公开性能行。
静态快照 · 2026-08-03 核验
打开实时 NixBench 结果 阅读 NixBench 方法 打开 NixBench 仓库 对照 DeepSWE 实时榜单 阅读 OpenAI GPT-5.6 背景