Observaciones completas recientes
- Cargando observaciones actuales…
SELECTOR DE MODELO + ESFUERZO
Describe la tarea. Codex Juice recomienda Astra, Sol, Terra o Luna y el menor esfuerzo de razonamiento que probablemente la complete bien.
Volver al Radar de CodexTASK → MODEL → EFFORT
Tres señales de la tarea producen un punto de partida transparente. Si falla la verificación, sigue la alternativa en vez de adivinar con valores Juice.
Son puntos de partida, no una clasificación de capacidad. La verificación difícil o la prioridad de calidad pueden elevar la configuración.
| Tarea | Empieza con | Esfuerzo |
|---|---|---|
| Rápida y fácil de comprobar | Luna | Bajo |
| Rutinaria y acotada | Terra | Medio |
| Trabajo complejo en repositorio | Sol | Alto |
| Ambigua o de alto riesgo | Astra | Muy alto |
GUÍA DE 30 SEGUNDOS
Empieza por la forma de la tarea: usa menos esfuerzo si el camino y la validación son claros, y más si hay ambigüedad o alto riesgo de revisión. Esta guía combina la orientación de calidad frente a velocidad de OpenAI con resultados externos, no con valores Juice.
MONITOR TÉCNICO
Las observaciones en vivo de los seis niveles vigilan la recolección y los cambios de configuración. Juice no es una puntuación de capacidad; el tamaño y la dirección son huellas neutrales de ejecución.
no disponible
| nivel | actual | anterior | cambio | verificación |
|---|---|---|---|---|
| Bajo | — | — | — | no disponible |
| Medio | — | — | — | no disponible |
| Alto | — | — | — | no disponible |
| Muy alto | — | — | — | no disponible |
| Máximo | — | — | — | no disponible |
| Ultramáximo | — | — | — | no disponible |
Cargando observaciones actuales…
Elige un nivel para revisar valores confirmados en los sweeps conservados.
Una sesión restringida y efímera de Codex CLI observa cada nivel. Un valor nuevo se publica solo tras coincidir en una segunda sesión nueva. El sweep completo se invalida si cambia el identificador del modelo.
Juice es una huella de ejecución no oficial y autodeclarada, no uso real de tokens ni un benchmark de calidad. Un valor más alto, más bajo o un cambio en cualquier dirección no indica mayor o menor capacidad de programación.
OpenAI solo ofrece una guía direccional entre calidad y velocidad y señala que no todas las tareas se benefician igual de más razonamiento. Leer la guía de esfuerzo de OpenAI
NixBench publica ahora resultados de GPT-5.6 Sol en Low, Medium, High, XHigh y Max sobre un corpus de 29 tareas de código, con cinco ensayos registrados por nivel. Es evidencia orientativa de otro benchmark, no una puntuación de capacidad de Codex Juice. NixBench aún no publica filas de GPT-6 Astra (comprobado el 2026-09-06).
| nivel | media superada | intervalo 95 % | segundos/tarea | ensayos | tiempos de espera |
|---|---|---|---|---|---|
| Bajo | 23.6/29 | 22.2–25.0 | 27.4s | 5 | 0 |
| Medio | 24.0/29 | 22.5–25.5 | 38.5s | 5 | 0 |
| Alto | 23.6/29 | 22.9–24.3 | 47.4s | 5 | 0 |
| Muy alto | 24.0/29 | 23.1–24.9 | 60.7s | 5 | 0 |
| Máximo | 23.2/29 | 20.1–26.3 | 81.4s | 5 | 3 |
Límites: NixBench usa su propio arnés, corpus y evaluadores shell ocultos objetivos; estos resultados no son lecturas de Codex Juice. Aquí hay una fila pública para Max. Ultra es un modo de producto y no encontramos una fila pública comparable en esta revisión.
Instantánea estática · verificada 2026-08-03
Abrir los resultados en vivo de NixBench Leer el método de NixBench Abrir el repositorio de NixBench Comparar con el tablero en vivo de DeepSWE Leer el contexto GPT-5.6 de OpenAI