CODEX 模型 + 强度选择器

为当前任务选择正确的 Codex 模型和推理强度

描述任务,Codex Juice 会推荐 Astra、Sol、Terra 或 Luna,以及最可能把任务做好所需的最低推理强度。

返回 Codex 雷达

TASK → MODEL → EFFORT

获取起始配置

三个任务信号生成一套透明的起始建议。若验证失败,按回退规则调整,不要根据 Juice 数值猜测。

推荐配置 模型Terra强度 Terra 适合兼顾常规工作的能力与成本;对于清晰、熟悉的任务,Medium 是有证据支持的起点。 第一次未通过时: 先保持模型不变,把强度提高一档,再考虑切换模型。

快速参考

这些是起点,不是能力排名。验证难度或质量优先会把配置上调。

任务建议模型强度
快速且容易检查 Luna
常规且范围明确 Terra
复杂仓库工作 Sol
模糊或高风险 Astra 超高
阅读 OpenAI 对 Astra、Sol、Terra 和 Luna 的模型定位

30 秒指南

30 秒完成选择

先看任务形态:路径和验收明确时少用推理,需求模糊或审查风险高时增加推理。以下建议结合 OpenAI 的质量—速度方向与外部任务结果,不来自 Juice 数字。

规则如何工作 先依据任务范围和验证风险选择模型,再用强度控制推理投入。选择器采用 OpenAI 的模型定位和外部强度证据,不使用 Juice 指纹大小。

技术监控

实验性运行时指纹

下面六档实时观测用于监控采集健康和配置变化。Juice 不是能力分数;数值大小与升降都只是中性的运行时指纹。

运行时观测当前已隐藏

选择器和证据仍可正常使用。只有在线快照为当前或明确标记为最近已知,且包含有效观测时,才显示 Juice 数值。

探针方法

受限的临时 Codex CLI 会话逐个观测推理强度。新数值只有在全新会话的第二次观测一致后才发布。完整 sweep 中途模型标识变化时,整轮作废。

这个指标不能证明什么

Juice 是非官方自报告运行时指纹,不是实际推理 token 用量,也不是质量基准。数值更高、更低或任何方向的变化,都不能解释为编程能力变强或变弱。

OpenAI 只提供推理强度在质量与速度之间的方向性说明,并明确表示并非所有任务都同样受益于更多推理。 阅读 OpenAI 推理强度说明

打开 /api/juice 原始数据

effort-guide --external-evidence

实时真实任务外部证据

NixBench 目前报告 GPT-5.6 Sol 在 Low、Medium、High、XHigh 和 Max 上的结果,使用 29 个编码任务、每档 5 次记录试验。这是不同基准的方向性证据,不是 Codex Juice 能力分数。NixBench 尚未公布 GPT-6 Astra 的结果行(2026-09-06 核对)。

来源与更新
NixBench · 2026-07-12
外部模型
GPT-5.6 Sol
测试工具
codex-cli 0.144.1
任务集
29 · NixBench 29-task corpus · 5×/effort
平均通过任务数、观测到的 95% 区间、每任务秒数、记录试验数与超时数。
强度平均通过95% 区间秒/任务试验超时
23.6/29 22.2–25.0 27.4s 5 0
24.0/29 22.5–25.5 38.5s 5 0
23.6/29 22.9–24.3 47.4s 5 0
超高 24.0/29 23.1–24.9 60.7s 5 0
最大 23.2/29 20.1–26.3 81.4s 5 3

局限:NixBench 使用自己的工具、任务集和客观隐藏 shell 评估器;这些结果不是 Codex Juice 观测。这里有 Max 的公开行,但 Ultra 是产品模式,本次没有找到可比的公开性能行。

静态快照 · 2026-08-03 核验