Guías

Calibración (humano ↔ juez)

Mide qué tan alineado está un juez modelo con tu criterio humano, con intervalo de confianza.

Un juez modelo es útil solo si coincide con vos. La calibración mide esa coincidencia con números, y te da las palancas para mejorarla.

La pregunta que responde no es "¿qué porcentaje aprobó el juez?" sino "¿cuál es la tasa real de éxito, corregida por el sesgo del juez?".

Solo los dos tipos de juez modelo se calibran: label_model y score_model. Los criterios determinísticos no tienen modelo que calibrar. text_similarity con embeddings cuesta tokens pero tampoco se calibra: no hay consigna que ajustar.

Cómo llegar

Desde la mesa de trabajo del dataset, en la cabecera de la columna de un juez: Calibrar. Un chip violeta en esa cabecera muestra la alineación actual — "Alineación con tus veredictos — clic para calibrar".

El juez necesita tener veredictos antes: "Para calibrar este juez primero necesitas sus veredictos: genera la salida y evalúa este criterio."

La página se llama Alineación del juez y es de un solo juez. Para calibrar otro, vuelves al dataset y lo abres desde su columna.

Etiquetar a ciegas

Etiquetar abre un diálogo modal con un caso por vez:

  • Entrada/s — solo las columnas que elijas. Por defecto se muestran las que el prompt realmente referencia con {{ }}, y tu elección se recuerda para ese dataset.
  • Salida — siempre visible.
  • ¿Cumple este criterio? — dos botones, PASS y FAIL. Elegir avanza al siguiente.
  • Anterior y Saltar para moverte sin etiquetar.
No ves el veredicto del juez mientras etiquetas. Es deliberado: "Etiquetas sin ver el veredicto del juez, para no sesgar la medición."

La cola se arma con los casos que tienen un veredicto usable del juez, intercalando los que el juez aprobó con los que reprobó, para que ambas caras de su precisión se puedan estimar. Se te ofrecen hasta 50 casos, y cada vez que abres el diálogo empieza en el primero sin etiquetar.

Tus veredictos se guardan solos, en columnas reservadas del dataset. Cerrar el diálogo es terminar: te deja en la pestaña de concordancia.

El botón de la cabecera cambia de nombre según dónde estés: EtiquetarContinuar etiquetandoRevisar etiquetas.

La tasa corregida

La cifra grande es la Tasa de éxito corregida: "la tasa cruda del juez, corregida por su sesgo medido (corrección de Rogan-Gladen)". Al lado, el intervalo de confianza del 95%; debajo, la tasa cruda del juez sin corregir.

La idea es simple. Si el juez aprueba el 80% de los casos, pero sabes que es demasiado indulgente, el 80% no es la tasa real. La corrección usa dos medidas tomadas de tus etiquetas:

  • Acierta en los buenos — de los casos que vos aprobaste, cuántos aprobó el juez.
  • Acierta en los malos — de los casos que vos reprobaste, cuántos reprobó el juez.

Con esas dos, la tasa observada del juez sobre todos los casos calificados se corrige hacia la tasa verdadera. El intervalo de confianza sale de un bootstrap sobre los mismos datos, y es determinístico: los mismos datos dan siempre el mismo intervalo, no uno que tiembla en cada visita.

La corrección solo es válida si el juez supera al azar. Si no, la página lo dice sin adornos y no muestra el número.

El semáforo de confiabilidad

Debajo de la tasa hay una alerta que interpreta la medición por vos:

ColorCuándoQué dice
🔴 RojoEl juez apenas supera el azar"La corrección no es confiable. Mejora las instrucciones del juez."
🟠 ÁmbarFaltan etiquetas de una de las dos clases"Etiqueta al menos una fila que cumpla y una que no."
🟠 ÁmbarLa banda del intervalo todavía es amplia"Tómala como orientativa", más qué hacer para angostarla.
🟢 VerdeLa banda es angosta"La medición ya es firme."

Cuando la banda es amplia, el consejo apunta a la palanca correcta: si todavía te quedan veredictos del juez sin etiquetar, te pide etiquetar más; si ya los etiquetaste todos, te pide generar y evaluar más filas, porque el cuello de botella pasó a ser el otro.

Precisión del juez

Un panel plegable muestra el desglose, con una barra que se abre hacia los dos lados desde el centro:

  • Demasiado estricto (rosa, a la izquierda) — casos que vos aprobaste y el juez reprobó.
  • Demasiado indulgente (verde, a la derecha) — casos que vos reprobaste y el juez aprobó.

Las dos alas y la concordancia suman exactamente 1. Un juez alineado tiene las dos alas vacías. Y saber hacia qué lado se desvía es lo que te dice cómo reescribir la consigna.

La trampa de medir donde ajustaste

Si etiquetas al menos 30 casos, Verica reserva el 40% como conjunto retenido: vos ajustas la consigna contra la mitad de entrenamiento, y la concordancia que se te reporta viene de casos que nunca viste durante el ajuste. "Medido sobre {n} casos retenidos (no usados para ajustar)."

Por debajo de 30 etiquetas no alcanza para partir, y todo se mide sobre el mismo conjunto. La página lo advierte: Tasa optimista"Mides y ajustas sobre las mismas filas, así que la tasa puede ser optimista."

Esta es la razón de ser del conjunto retenido: sin él, cada ajuste de la consigna que hagas mirando los desacuerdos infla el número que estás tratando de mejorar.

Progreso de la alineación

Cuando hay más de una medición, aparece una tira de chips v1 → v2 → v3 con la concordancia de cada una. Cada re-evaluación agrega un punto; ajustar contra la misma evaluación actualiza el punto en su lugar en vez de inventar historia. Se guardan los últimos 12.

Barrido de umbral

Solo para jueces de puntaje (score_model).

Un juez de puntaje devuelve un número y aprueba a partir de un umbral. El barrido prueba todos los umbrales posibles contra tus etiquetas y encuentra el que mejor alinea al juez con vos, sin volver a llamar al modelo.

La tarjeta Umbral de puntuación muestra:

  • La curva de precisión balanceada, con un punto en el óptimo y una línea punteada en el umbral actual.
  • Actual {x} y Óptimo {y}.
  • Un campo de Umbral manual con vista previa inmediata: "Precisión balanceada a {v}: {acc} (óptimo {opt})".
  • El botón Aplicar umbral óptimo.

Si ya estás en el óptimo, la tarjeta se colapsa a una línea con un Ver curva por si quieres mirarla igual.

Lo que optimiza es la precisión balanceada — el promedio entre acertar en los buenos y acertar en los malos — y no la concordancia cruda. La diferencia importa: si el 90% de tus casos aprueban, un juez que aprueba todo tiene 90% de concordancia y es inútil.

Aplicar es barato y reversible. Recalcula los PASS/FAIL aritméticamente a partir de los puntajes ya guardados: no vuelve a llamar al juez, no re-muestrea, no cuesta un token. Después de aplicar aparece "Umbral aplicado ({de}{a})" con un Deshacer.

Desacuerdos

La pestaña Desacuerdos lista los casos donde vos y el juez no coinciden — el material de trabajo para arreglar la consigna. "Filas donde tu criterio y el juez no coinciden. Edita las instrucciones del juez para reducirlos."

Cada elemento muestra Tu veredicto y el del Juez como insignias, la salida del caso y el razonamiento del juez.

Si al releer el caso concluyes que el error fue tuyo, Me equivoqué yo invierte tu etiqueta. Verica pide confirmación, porque la implicación es real: "Tu etiqueta es la verdad de referencia. Cambiarla para coincidir con el juez ajusta la medición de concordancia." La verdad de referencia sigue siendo humana — esto es un "me equivoqué" deliberado, no un arreglo automático del juez.

Cuando hay conjunto retenido, la lista muestra solo la mitad de entrenamiento: los casos retenidos nunca se exponen aquí, así que ajustar mirando desacuerdos no puede contaminar la medición.

El bucle de ajuste

Instrucciones del juez abre el editor del criterio sin salir de la página. "Edita las instrucciones del juez y vuelve a evaluar para acercarlo a tu criterio."

Volver a evaluar y medir guarda la consigna nueva y recalifica. La advertencia de costo es honesta sobre el alcance: "Vuelve a evaluar las {n} salidas de la última ejecución con el modelo del juez" — todas, no una muestra.

Mientras corre, una barra de progreso muestra "Evaluados: {hechos}/{total}". Al terminar, un diálogo confirma y te devuelve a la concordancia con el número actualizado.

Ese es el bucle completo: etiquetar → mirar los desacuerdos → reescribir la consigna → volver a evaluar → mirar si la concordancia subió.

Siguientes pasos

En esta página