challenges / Broken Agent #02
The Scheduler
Audita un job scheduler generado por AI cuyos tests públicos ya pasan y hazlo confiable bajo condiciones reales de producción.
Estado
En vivo
CLI
chofex challenge init --challenge broken-agent
Challenge de clasificación / AI permitida
El agente dijo que terminó
Recibes un job scheduler generado por un agente de código. La API está implementada y todos los tests públicos pasan. Tu trabajo es convertir una solución plausible en software que realmente enviarías a producción.
Este no es un benchmark para dejar al agente trabajando solo. El agente puede auditar, programar y ejecutar pruebas; tú eliges qué riesgo investigar, cuestionas su evidencia y decides si harías ship. La evaluación oficial no acepta solo código: incluye tu review vinculado a esa versión exacta del archivo.
Los challenges son obligatorios para competir por un cupo. La postulación no reserva una plaza; los mejores resultados de los rankings serán seleccionados para el evento. El slug del challenge siempre usa la versión vigente; los intentos legacy quedan solo como historial.
El contrato es público; cada participante recibe variantes determinísticas de los escenarios adversos. El executor aplica efectos idempotentemente por job ID, así que el sistema puede recuperarse sin prometer exactly-once para efectos arbitrarios. Puedes usar Claude Code, Codex, Cursor o cualquier otra AI.
Puntaje: comportamiento base 10, persistencia 15, concurrencia 20, recuperación 20, idempotencia 15, seguridad contra regresiones 15 y rendimiento 5. Los empates se resuelven por menos evaluaciones oficiales, costo determinístico de operaciones —no tiempo del servidor— y, al final, hora del mejor envío. El ranking se revela el 1 de octubre a las 15:00 y el challenge cierra el 2 de octubre a las 00:00, hora de Perú. Todos los puntajes válidos con una postulación enviada aparecen en el ranking.
Inicio
- 7/7 tests verdes
Hidden score
- 100 puntos
Intentos
- 5 evaluaciones oficiales
Field guide
Cómo participar
- 01
Crea el repositorio
chofex challenge init --challenge broken-agentLa CLI crea broken-agent/ con el contrato normativo, una implementación plausible pero defectuosa y siete tests públicos.
- 02
Confirma el punto de partida
cd broken-agent && npm testEverything passes. Ese es el problema: los happy paths no demuestran que el scheduler sea seguro en producción.
- 03
Elige una falla con el participante
Discute tres trazas adversas antes de editarEl agente explica riesgos concretos. El participante elige cuál probar primero y define qué resultado sería inaceptable; el agente no responde por él.
- 04
Audita y repara
$EDITOR scheduler.jsPrimero convierte la traza elegida en una prueba. Después mantén createScheduler y endurece claims únicos, concurrencia, persistencia, leases de 30 segundos, reintentos, cancelación e idempotencia.
- 05
Protege el comportamiento visible
chofex challenge test --challenge broken-agent --source ./scheduler.jsLos tests públicos son ilimitados. No uses una evaluación oficial mientras tengas regresiones visibles.
- 06
Toma la decisión de release
Crea review.json con las palabras del participanteEl participante describe la falla, qué evidencia revisó, ship o block, su confianza y el riesgo restante. El review incluye el SHA-256 de scheduler.js, así que un cambio exige revisar de nuevo.
- 07
Crea el handoff de evaluación
chofex challenge evaluate --challenge broken-agent --source ./scheduler.js --review ./review.jsonLa primera llamada devuelve un enlace corto y todavía no consume una evaluación.
- 08
Aprueba personalmente
Abre approvalUrl en tu navegadorRevisa tu razonamiento vinculado al source exacto y confirma con Face ID, Touch ID, Windows Hello, PIN o llave de seguridad. El agente no puede completar este paso.
- 09
Solicita el veredicto oculto
chofex challenge evaluate --challenge broken-agent --source ./scheduler.js --review ./review.jsonRepite el comando antes de que venza la aprobación. Esta vez consume 1 de 5 evaluaciones oficiales y devuelve puntajes por capacidad.
resultados oficiales
Ranking
Ranking público de solo lectura: puntaje de producción, menos evaluaciones oficiales, costo determinístico y, al final, hora de envío. Aparecen todos los puntajes válidos de personas con una postulación enviada; los casos ocultos y las implementaciones no se publican.
El ranking se publica en
días
horas
minutos
segundos
1 de octubre de 2026 · 15:00 (hora de Perú, UTC−5)