challenges / Broken Agent #02

The Scheduler

Audita un job scheduler generado por AI cuyos tests públicos ya pasan y hazlo confiable bajo condiciones reales de producción.

Estado

En vivo

CLI

chofex challenge init --challenge broken-agent

Challenge de clasificación / AI permitida

El agente dijo que terminó

Recibes un job scheduler generado por un agente de código. La API está implementada y todos los tests públicos pasan. Tu trabajo es convertir una solución plausible en software que realmente enviarías a producción.

Este no es un benchmark para dejar al agente trabajando solo. El agente puede auditar, programar y ejecutar pruebas; tú eliges qué riesgo investigar, cuestionas su evidencia y decides si harías ship. La evaluación oficial no acepta solo código: incluye tu review vinculado a esa versión exacta del archivo.

Los challenges son obligatorios para competir por un cupo. La postulación no reserva una plaza; los mejores resultados de los rankings serán seleccionados para el evento. El slug del challenge siempre usa la versión vigente; los intentos legacy quedan solo como historial.

El contrato es público; cada participante recibe variantes determinísticas de los escenarios adversos. El executor aplica efectos idempotentemente por job ID, así que el sistema puede recuperarse sin prometer exactly-once para efectos arbitrarios. Puedes usar Claude Code, Codex, Cursor o cualquier otra AI.

Puntaje: comportamiento base 10, persistencia 15, concurrencia 20, recuperación 20, idempotencia 15, seguridad contra regresiones 15 y rendimiento 5. Los empates se resuelven por menos evaluaciones oficiales, costo determinístico de operaciones —no tiempo del servidor— y, al final, hora del mejor envío. El ranking se revela el 1 de octubre a las 15:00 y el challenge cierra el 2 de octubre a las 00:00, hora de Perú. Todos los puntajes válidos con una postulación enviada aparecen en el ranking.

Inicio

7/7 tests verdes

Hidden score

100 puntos

Intentos

5 evaluaciones oficiales

Field guide

Cómo participar

  1. 01

    Crea el repositorio

    chofex challenge init --challenge broken-agent

    La CLI crea broken-agent/ con el contrato normativo, una implementación plausible pero defectuosa y siete tests públicos.

  2. 02

    Confirma el punto de partida

    cd broken-agent && npm test

    Everything passes. Ese es el problema: los happy paths no demuestran que el scheduler sea seguro en producción.

  3. 03

    Elige una falla con el participante

    Discute tres trazas adversas antes de editar

    El agente explica riesgos concretos. El participante elige cuál probar primero y define qué resultado sería inaceptable; el agente no responde por él.

  4. 04

    Audita y repara

    $EDITOR scheduler.js

    Primero convierte la traza elegida en una prueba. Después mantén createScheduler y endurece claims únicos, concurrencia, persistencia, leases de 30 segundos, reintentos, cancelación e idempotencia.

  5. 05

    Protege el comportamiento visible

    chofex challenge test --challenge broken-agent --source ./scheduler.js

    Los tests públicos son ilimitados. No uses una evaluación oficial mientras tengas regresiones visibles.

  6. 06

    Toma la decisión de release

    Crea review.json con las palabras del participante

    El participante describe la falla, qué evidencia revisó, ship o block, su confianza y el riesgo restante. El review incluye el SHA-256 de scheduler.js, así que un cambio exige revisar de nuevo.

  7. 07

    Crea el handoff de evaluación

    chofex challenge evaluate --challenge broken-agent --source ./scheduler.js --review ./review.json

    La primera llamada devuelve un enlace corto y todavía no consume una evaluación.

  8. 08

    Aprueba personalmente

    Abre approvalUrl en tu navegador

    Revisa tu razonamiento vinculado al source exacto y confirma con Face ID, Touch ID, Windows Hello, PIN o llave de seguridad. El agente no puede completar este paso.

  9. 09

    Solicita el veredicto oculto

    chofex challenge evaluate --challenge broken-agent --source ./scheduler.js --review ./review.json

    Repite el comando antes de que venza la aprobación. Esta vez consume 1 de 5 evaluaciones oficiales y devuelve puntajes por capacidad.

resultados oficiales

Ranking

Ranking público de solo lectura: puntaje de producción, menos evaluaciones oficiales, costo determinístico y, al final, hora de envío. Aparecen todos los puntajes válidos de personas con una postulación enviada; los casos ocultos y las implementaciones no se publican.

El ranking se publica en

05

días

21

horas

20

minutos

34

segundos

1 de octubre de 2026 · 15:00 (hora de Perú, UTC−5)