Qué es Verica

Plataforma no-code para evaluar salidas de LLMs — datasets, criterios de calidad y runs con score, sin escribir código.

Verica es una plataforma de evaluación de LLMs pensada para Product Managers y testers: permite construir datasets (golden sets), definir criterios de calidad y ejecutar evaluaciones puntuadas contra las salidas de un modelo, todo desde la interfaz y sin escribir código. Los equipos de ingeniería también pueden dispararla desde CI.

Cómo se organiza

Todo gira alrededor de la eval como unidad de trabajo:

  • Datasets (golden sets) — las filas de entrada y sus referencias esperadas. Se importan por CSV o se editan en la propia mesa de trabajo.
  • Criterios — viven dentro del eval. Ocho tipos de grader: cuatro que cubren lo que cubría OpenAI Evals (text_check, text_similarity, label_model, score_model) y cuatro propios de Verica (tool_check, json_check, number_check, span_check).
  • Ejecuciones — cada una congela una copia del golden set y la versión exacta del prompt, para que los resultados sean reproducibles y comparables entre sí.

Y lo que ya está en producción

La sección Observabilidad recibe las trazas reales de tu aplicación — por OTLP, con SDKs o desde n8n — y les aplica los mismos criterios. Un fallo de producción se promueve a un golden set y deja de repetirse.

Traé tu propia clave (BYOK)

Verica no revende tokens: conectas tu propia API key de OpenAI o Anthropic. La clave se guarda cifrada (AES-256-GCM) y solo se descifra en el momento de usarla; en la interfaz nunca se muestra, solo su huella.

Por dónde empezar

En esta página