Infrastructure

Evaluation Engine

Evaluación y QA de agentes de IA: no basta con confiar

Qué es

Azter Evaluation Engine es la capa que evalúa a los agentes más allá de la respuesta: si comprendió correctamente la situación, utilizó las herramientas adecuadas, siguió las políticas y consiguió el resultado esperado. Cada ejecución puede verificarse por dimensiones — comprensión, herramientas, políticas, resultado — y cada versión del agente compararse contra la anterior para detectar regresiones antes de que lleguen al cliente.

El problema

Sin evaluación sistemática, cada mejora del agente es una apuesta: nadie sabe si el cambio rompió otra cosa. Y sin evaluar comportamiento —no solo texto—, un agente puede «responder bien» y aun así usar la herramienta equivocada o violar la política. Confiar no es verificar.

En acción

Experiencia interactiva — demostración
Demo

input: “Reserva el modelo negro” → reserve + link de pago

7/8 PASS · 1 WARNING

PASSIntent Correctnesspurchase_intent + availability detectados
PASSContext Usagevariante y stock verificados antes de responder
PASSTool Selectioncheck_stock → reserve_stock correcto
PASSPolicy Compliancereserva 24h dentro de política
PASSAction Correctnessidempotencia + verificación ok
PASSResponse Qualityrespuesta precisa y con CTA
PASSProhibited Actionscobro no ejecutado sin confirmación
WARNINGOutcomecliente no pagó aún — journey de seguimiento activo

Conectado con

PlaygroundRegression TestingObservabilidadLearning Engine

Azter no evalúa solamente qué respondió el agente: verifica si comprendió la situación, usó las herramientas adecuadas, siguió las políticas y consiguió el resultado esperado. Cada versión se compara contra el comportamiento conocido para detectar regresiones.

Capacidades

Qué hace Evaluation Engine

Evaluación por dimensiones

Comprensión de intención, uso de herramientas, cumplimiento de políticas y calidad del resultado — no solo el texto de salida.

Detección de regresiones

Versiones nuevas del agente se comparan contra el comportamiento conocido: lo que empeoró aparece antes de producción.

Verificación contra expectativas

Casos con resultado esperado —acción correcta, política respetada— definen qué significa «bien hecho» de forma explícita.

Evidencia para mejorar

Los veredictos alimentan a Learning Engine y al Playground donde cada empresa prueba sus propios agentes.

Cómo funciona

Evaluation Engine dentro del flujo

Vista conceptual: cada tecnología consume lo que otra produce. El grafo es representativo — no toda ejecución recorre la secuencia completa.

Dónde encaja en Azter

Ejecución del agente
Evaluation Engine
Playground / Regresión
Agente mejorado

Impacto

Por qué importa

Los agentes se prueban y se evalúan. No simplemente se confía en ellos.

  • Mejoras sin miedo: cada cambio se mide contra lo anterior.
  • Comportamiento verificable, no solo respuestas convincentes.
  • Regresiones detectadas antes del cliente.
  • Estándar de calidad explícito y repetible.

En la práctica

Evaluation Engine en una situación real

Se cambia la configuración de un agente para que responda más rápido en horario punta.

Sin Evaluation Engine

La versión nueva responde rápido — y empezó a usar precios desactualizados en las cotizaciones. Nadie lo nota hasta que reclaman los clientes.

Con Azter

Evaluation Engine compara la versión nueva contra la anterior en comprensión, herramientas y políticas: la degradación de frescura de datos aparece como regresión antes de llegar a producción.

El sistema completo

Cómo encaja en Azter

Evaluation Engine evalúa las ejecuciones que salen de Agent Harness bajo las reglas de Trust Layer, y entrega sus veredictos a Learning Engine para la mejora continua.

Trabaja junto a

Azter no es el modelo. Azter es el sistema alrededor del modelo. Explorar las 15 tecnologías.

Preguntas frecuentes

Sobre Evaluation Engine

¿Qué se evalúa exactamente?

No solamente qué respondió el agente: si comprendió correctamente la situación, utilizó las herramientas adecuadas, siguió las políticas y consiguió el resultado esperado. La respuesta es una dimensión más, no la única.

¿Cómo se evita que un cambio empeore al agente?

Cada versión se compara contra el comportamiento conocido en las mismas dimensiones. Las regresiones — algo que funcionaba y dejó de funcionar — aparecen en la comparación, antes de producción.

Ver cómo opera Evaluation Engine en tu negocio

Una demo con tus casos reales: canales, catálogo y políticas de tu empresa.