Primeros pasos

Crea tu primera evaluación en unos 10 minutos — desde la credencial hasta la lectura de resultados.

Esta guía recorre el flujo completo una sola vez: conectar tu clave, armar un golden set, definir la eval y leer el primer run.

1. Inicia sesión

Entra con tu email: Verica envía un código de un solo uso (OTP), sin contraseña. El primer inicio de sesión crea tu workspace personal.

2. Conecta tu API key (BYOK)

En Configuración → Credenciales, carga la API key del proveedor que quieras evaluar (OpenAI o Anthropic).

  • La clave se cifra al guardarse y solo se descifra en el momento de ejecutar un run.
  • En la interfaz verás únicamente su huella (key_fingerprint), nunca la clave.

3. Crea un golden set

En Datasets, crea un dataset nuevo. Cada fila combina las variables de entrada (lo que se inyecta en el prompt) y, si tu criterio lo necesita, una referencia (la respuesta esperada).

Puedes importar un CSV o escribir las filas directamente en la mesa de trabajo. Para un primer eval, con 10–20 filas representativas alcanza.

4. Crea la eval

Desde el dataset, crea una eval. Ahí defines las tres piezas:

  • Prompt — con variables {{ asi }} que se completan con las columnas del dataset. Si lo editas antes de un run, se versiona automáticamente.
  • Modelo — el modelo a evaluar, de la lista de tu proveedor conectado.
  • Criterios — uno o más graders. Estos cuatro cubren el caso más común para empezar (hay ocho en total — ver Criterios y graders):
GraderQué hace
text_checkEvaluar TextoComparación determinística: igual, distinto, contiene, regex.
text_similarityEvaluar SemánticaParecido con el valor esperado (fuzzy, ROUGE-L o embeddings).
label_modelEvaluar con Juez (etiqueta)Un modelo juez clasifica la salida con una etiqueta.
score_modelEvaluar con Juez (puntaje)Un modelo juez puntúa la salida en un rango.

5. Ejecuta el run

Al lanzar el run, Verica congela una copia del golden set y fija la versión del prompt: el run es reproducible aunque después sigas editando el borrador.

Cada fila se muestrea contra el modelo, se califica con tus criterios y se persiste. Si algo falla a mitad de camino, el run se reanuda sin repetir filas ya procesadas.

6. Lee los resultados

Cada fila muestra su veredicto (passed), su puntaje (score) o su etiqueta (label) según el tipo de grader, junto con la salida generada. Los totales del run incluyen el costo, con el costo de grading desglosado.

Siguientes pasos

En esta página