Qué es Verica
Plataforma no-code para evaluar salidas de LLMs — datasets, criterios de calidad y runs con score, sin escribir código.
Verica es una plataforma de evaluación de LLMs pensada para Product Managers y testers: permite construir datasets (golden sets), definir criterios de calidad y ejecutar evaluaciones puntuadas contra las salidas de un modelo, todo desde la interfaz y sin escribir código. Los equipos de ingeniería también pueden dispararla desde CI.
Cómo se organiza
Todo gira alrededor de la eval como unidad de trabajo:
- Datasets (golden sets) — las filas de entrada y sus referencias esperadas. Se importan por CSV o se editan en la propia mesa de trabajo.
- Criterios — viven dentro del eval. Ocho tipos de grader: cuatro que cubren lo que cubría OpenAI Evals (
text_check,text_similarity,label_model,score_model) y cuatro propios de Verica (tool_check,json_check,number_check,span_check). - Ejecuciones — cada una congela una copia del golden set y la versión exacta del prompt, para que los resultados sean reproducibles y comparables entre sí.
Y lo que ya está en producción
La sección Observabilidad recibe las trazas reales de tu aplicación — por OTLP, con SDKs o desde n8n — y les aplica los mismos criterios. Un fallo de producción se promueve a un golden set y deja de repetirse.
Traé tu propia clave (BYOK)
Verica no revende tokens: conectas tu propia API key de OpenAI o Anthropic. La clave se guarda cifrada (AES-256-GCM) y solo se descifra en el momento de usarla; en la interfaz nunca se muestra, solo su huella.
Por dónde empezar
- Primeros pasos — tu primera eval en 10 minutos.
- Migrar desde OpenAI Evals — si venías de la plataforma deprecada de OpenAI.
- El Eval — cómo se organiza todo alrededor del eval.