# Starter Kit: evals para coding agents

Este kit mínimo convierte resultados de varias ejecuciones de un agente en una
señal comparable y en un gate de regresión. No depende de un proveedor de
modelos ni instala paquetes.

## Ejecutar el ejemplo

```bash
node score.mjs cases.json trials.example.json
```

El proceso termina con código `0` cuando todas las regresiones cumplen el
umbral y con código `1` cuando falta una ejecución o una regresión cae por
debajo del mínimo. Las tareas de capacidad se reportan, pero no bloquean.

## Archivos

- `cases.json`: contrato de la suite, tareas, graders y pesos.
- `trials.example.json`: resultados de tres intentos aislados por tarea.
- `score.mjs`: agregador sin dependencias.

## Integrarlo

1. Reemplaza las tareas de ejemplo con 20–50 casos tomados de bugs, soporte y
   verificaciones manuales reales.
2. Ejecuta cada tarea en un checkout o contenedor limpio. No compartas estado
   entre intentos.
3. Haz que tu runner escriba un objeto por intento en el formato de
   `trials.example.json`.
4. Usa graders deterministas para tests, tipos, seguridad y estado final.
5. Reserva graders de modelo o revisión humana para criterios semánticos.
6. Conserva transcript, commit, modelo, configuración, latencia y costo fuera
   de este resumen para poder investigar cada fallo.
7. Ejecuta `node score.mjs ...` en CI cuando cambie el modelo, el prompt, las
   herramientas, una skill o el harness.

## Regla de diseño

El scorer sólo agrega evidencia. No ejecuta al agente ni decide qué significa
“correcto” en tu producto. Esa decisión vive en los casos y graders que tu
equipo versiona.

