¿Qué es la evaluación de IA?
Evaluar IA no es preguntarle al modelo si “funciona bien”. Es convertir una expectativa concreta —responder con precisión, completar una tarea, usar bien una herramienta, evitar una conducta riesgosa o sostener un nivel de calidad— en pruebas y criterios que permitan medirla de forma consistente.
La evaluación de IA es el proceso sistemático de medir y analizar cómo se comporta un modelo o sistema de inteligencia artificial frente a objetivos, criterios, tareas y condiciones de uso definidos, utilizando casos de prueba, métricas y/o juicios humanos o automatizados para estimar su calidad, capacidad, seguridad, confiabilidad u otras propiedades relevantes. Una evaluación válida especifica qué se prueba, bajo qué condiciones y cómo se califica e interpreta el resultado; no se reduce a un único benchmark ni a una prueba aislada.
Qué es la evaluación de IA
Una evaluación de IA transforma una afirmación general —por ejemplo, “este asistente responde bien”, “este modelo es seguro” o “esta versión mejoró”— en una pregunta medible. Para hacerlo define qué sistema se evalúa, qué tareas o situaciones debe resolver, qué cuenta como éxito o fallo y cómo se registran e interpretan los resultados.
En aprendizaje automático clásico, evaluar suele implicar medir el rendimiento sobre datos de validación o prueba. En sistemas generativos y agentes, el alcance se amplía: la calidad puede depender de instrucciones, recuperación de información, herramientas, memoria, límites operativos y del entorno donde el sistema actúa. Por eso, muchas veces se evalúa el sistema completo y no sólo el modelo base.
Una medición diseñada alrededor de una pregunta concreta. Define el comportamiento esperado, las condiciones de prueba y una forma explícita de determinar si el sistema cumple.
Un puntaje universal de “inteligencia”. Un resultado sólo describe el desempeño bajo las tareas, datos, criterios y condiciones que fueron evaluados.
Evaluación de IA: diferencias con conceptos cercanos
| Concepto | Qué es | Relación con una evaluación |
|---|---|---|
| Eval | Una prueba o unidad de evaluación con entradas y criterios de éxito definidos. | Es una pieza concreta del proceso; una suite reúne múltiples evals. |
| Benchmark | Conjunto estandarizado de tareas, datos y reglas de medición. | Permite comparar sistemas bajo un protocolo común, pero no cubre necesariamente el caso de uso real. |
| Test set | Conjunto de ejemplos reservado para probar desempeño fuera del entrenamiento. | Es una fuente de casos; por sí solo no define qué se mide ni cómo se califica. |
| Métrica | Regla cuantitativa que resume un aspecto del desempeño. | Es una forma de medición dentro de una evaluación; elegirla mal puede ocultar fallos importantes. |
| LLM-as-a-judge | Uso de un modelo para calificar resultados según una rúbrica. | Es un tipo de evaluador automatizado; necesita criterios claros y calibración frente a juicio humano. |
| Red teaming | Pruebas deliberadamente adversariales para encontrar fallos, vulnerabilidades o conductas riesgosas. | Es una modalidad de evaluación enfocada en casos difíciles y riesgos específicos. |
| Monitoreo en producción | Observación continua del comportamiento real del sistema desplegado. | Complementa las evals: detecta distribución real, drift y fallos que un conjunto de pruebas no anticipó. |
Qué puede medir una evaluación de IA
La dimensión correcta depende del objetivo y del riesgo del sistema. NIST plantea que la medición de IA puede combinar métodos cuantitativos, cualitativos o mixtos y que debe considerar funcionalidad, confiabilidad e impactos relevantes. En productos generativos, una misma suite suele combinar varias dimensiones.
| Dimensión | Pregunta que intenta responder | Ejemplos de señal |
|---|---|---|
| Calidad y corrección | ¿El resultado es correcto, relevante y útil para la tarea? | Exact match, precisión, rúbricas, revisión experta. |
| Capacidad | ¿Qué tareas puede resolver el sistema y con qué nivel de dificultad? | Tasa de éxito, tareas completadas, benchmarks de capacidad. |
| Confiabilidad y robustez | ¿Mantiene el comportamiento ante variaciones, casos límite y múltiples corridas? | Consistencia, degradación por segmento, éxito repetido. |
| Seguridad | ¿Respeta restricciones y evita resultados o acciones peligrosas? | Violaciones de política, jailbreaks, acciones prohibidas, fallos de salvaguardas. |
| Groundedness y trazabilidad | ¿Las afirmaciones o acciones están respaldadas por información y herramientas válidas? | Citas correctas, soporte de fuentes, uso adecuado de herramientas. |
| Eficiencia operativa | ¿Alcanza el resultado con un costo y una latencia aceptables? | Latencia, tokens, costo por tarea, cantidad de pasos o llamadas. |
No existe una métrica única que resuma toda la calidad. La evaluación debe priorizar las dimensiones que realmente determinan éxito, daño o costo en el uso concreto.
Componentes de una evaluación de IA
Objetivo o claim. La afirmación que se quiere comprobar: por ejemplo, que el agente resuelve correctamente una solicitud de reembolso dentro de la política.
Tareas y casos. Entradas representativas, casos límite y ejemplos donde el comportamiento debería y no debería ocurrir.
Sistema y entorno. Modelo, instrucciones, herramientas, retrieval, memoria, límites, datos y harness que forman el sistema realmente probado.
Evaluadores (graders) y métricas. Reglas, tests, modelos evaluadores o personas que determinan el grado de éxito y registran señales complementarias.
Trials y agregación. Una o más corridas por caso, necesarias cuando el sistema es no determinista, más la forma de resumir resultados por tarea y segmento.
Validez. Revisión de contaminación, tareas rotas, atajos del grader, sesgos del evaluador y diferencias entre el entorno evaluado y el uso que se quiere representar.
Anthropic llama evaluation harness a la infraestructura que ejecuta las tareas, registra los pasos, aplica graders y agrega resultados. OpenAI subraya además que, en sistemas agentivos, el harness puede cambiar materialmente el desempeño; por eso debe describirse cuando se interpreta una evaluación.
Tipos de evaluaciones de IA
| Tipo | Para qué sirve | Ejemplo |
|---|---|---|
| Offline | Probar cambios antes del despliegue con casos controlados y reproducibles. | Comparar dos prompts sobre una suite fija de tareas. |
| Online / producción | Medir comportamiento con tráfico o datos reales, bajo controles adecuados. | Evaluar una muestra de conversaciones reales y sus resultados. |
| Capacidad | Explorar qué puede hacer bien un sistema y dónde está su límite. | Tareas difíciles que todavía tienen margen de mejora. |
| Regresión | Detectar si una versión nueva dejó de hacer algo que antes funcionaba. | Correr automáticamente casos críticos en cada cambio. |
| Comparativa | Comparar modelos o configuraciones bajo condiciones equivalentes. | Mismo dataset, presupuesto y herramientas para dos modelos. |
| Adversarial / seguridad | Buscar fallos deliberadamente difíciles o riesgosos. | Intentos de evasión de políticas o uso indebido de herramientas. |
Estas categorías se pueden combinar. Una regresión puede ser offline y automatizada; una evaluación de seguridad puede ser comparativa; y una suite agentiva puede incluir graders de código, modelos evaluadores y revisión humana al mismo tiempo.
Cómo diseñar una evaluación útil
Una buena evaluación empieza por el producto o la decisión que debe informar, no por una métrica disponible. El diseño debería hacer visible qué significa éxito y qué tipo de error importa.
Definí el comportamiento esperado. Convertí requisitos vagos en criterios observables y separá capacidad, calidad, seguridad y eficiencia cuando corresponda.
Construí casos representativos. Incluí ejemplos normales, casos límite, escenarios negativos y fallos reales. Evitá una distribución que sólo premie un tipo de respuesta.
Elegí el grader adecuado. Usá reglas deterministas cuando exista una condición objetiva; rúbricas o personas cuando la calidad sea subjetiva; y combinaciones cuando una sola señal no alcance.
Fijá el entorno. Documentá modelo, herramientas, contexto, presupuesto, reintentos y cualquier scaffolding que pueda modificar el resultado.
Repetí cuando haya variabilidad. Una sola corrida puede ser engañosa en sistemas generativos. Medí consistencia además del mejor caso.
Leé los fallos. Un promedio no reemplaza la inspección. Revisá ejemplos para detectar problemas del sistema, del dataset o del propio mecanismo de evaluación.
Cómo interpretar los resultados de una evaluación
Un resultado de eval tiene sentido sólo en relación con la pregunta que se diseñó para responder. Un 90% puede ser excelente para una tarea experimental y completamente insuficiente para una acción de alto riesgo. También puede ocultar que el sistema funciona muy bien en casos comunes y falla sistemáticamente en un segmento crítico.
| Riesgo | Qué ocurre | Qué revisar |
|---|---|---|
| Contaminación | El sistema conoce o puede recuperar ejemplos demasiado parecidos a los de prueba. | Origen de datos, duplicados, filtraciones y posibilidad de acceso a respuestas. |
| Tareas rotas | La consigna, el entorno o el grader penalizan soluciones válidas o hacen imposible la tarea. | Soluciones de referencia y revisión manual de fallos. |
| Reward hacking | El sistema obtiene puntaje explotando un atajo sin demostrar el comportamiento buscado. | Trayectorias, condiciones de éxito y loopholes del grader. |
| Saturación | Casi todos los sistemas obtienen puntajes muy altos y el benchmark deja de discriminar mejoras. | Dificultad de los casos y necesidad de renovar la suite. |
| Desajuste con producción | La evaluación usa tareas, herramientas o distribución distintas del uso real. | Representatividad de casos, harness y señales posteriores al despliegue. |
| Grader no calibrado | La lógica de puntuación no coincide con el criterio humano o de negocio que debía representar. | Acuerdo con expertos, falsos positivos/negativos y ejemplos discrepantes. |
El objetivo no es producir un número bonito. Es obtener evidencia suficientemente válida para decidir si el sistema mejoró, si mantiene una capacidad, si cumple una exigencia o si es seguro desplegarlo bajo condiciones definidas.
Ejemplo: evaluar un agente de atención al cliente
Supongamos un agente que puede consultar políticas, verificar identidad y procesar reembolsos. Decir que “resuelve bien los casos” es demasiado ambiguo. Una evaluación útil separa el objetivo en condiciones observables.
Casos. Reembolsos permitidos, casos fuera de política, identidades incompletas, clientes frustrados y solicitudes ambiguas.
Resultado verificable. El estado final confirma si el reembolso correcto fue procesado o rechazado.
Uso de herramientas. Se comprueba que el agente verificó identidad y consultó la política antes de ejecutar una acción sensible.
Calidad de interacción. Una rúbrica evalúa claridad, explicación de la decisión y adecuación del tono.
Consistencia. Los casos críticos se ejecutan varias veces para detectar si el comportamiento depende demasiado del azar.
El resultado final no debería reducirse a “92 puntos”. Conviene observar tasa de éxito global, fallos críticos, desempeño por tipo de caso, costo, latencia y ejemplos concretos donde el sistema o la evaluación necesitan corrección.
Errores frecuentes al evaluar sistemas de IA
Usar un benchmark general como sustituto del caso de uso
Un benchmark puede servir para comparar capacidades, pero no demuestra automáticamente que el sistema resolverá bien las tareas, riesgos y datos de un producto específico.
Elegir la métrica antes de definir qué importa
Optimizar accuracy, una rúbrica o un score agregado puede desviar el sistema si esa señal no representa el costo real de los errores.
Evaluar el modelo y desplegar otro sistema
Prompts, herramientas, retrieval, memoria y límites cambian el comportamiento. Si forman parte del producto, también deben formar parte de la evaluación relevante.
Confiar en una sola corrida
Los sistemas generativos pueden variar entre intentos. Una prueba aislada no mide confiabilidad ni la probabilidad de repetir un resultado.
Usar un juez de IA sin calibración
Un LLM grader puede escalar evaluaciones subjetivas, pero también tiene sesgos y errores. Debe contrastarse periódicamente con criterios y ejemplos humanos.
No mantener la suite
Con el tiempo cambian el modelo, el producto y la distribución real de casos. Una evaluación que no incorpora nuevos fallos puede saturarse o dejar de representar el sistema.
Preguntas frecuentes sobre evaluación de IA
¿Qué es la evaluación de IA?
La evaluación de IA es el proceso sistemático de medir y analizar cómo se comporta un modelo o sistema de inteligencia artificial frente a objetivos, criterios, tareas y condiciones definidos. Usa casos de prueba, métricas y/o juicios humanos o automatizados para estimar propiedades como calidad, capacidad, seguridad o confiabilidad.
¿Qué es un eval en inteligencia artificial?
Un eval es una prueba o unidad de evaluación diseñada para comprobar un comportamiento o capacidad concreta de un sistema de IA. Suele combinar una tarea o entrada con criterios de éxito y una forma de calificar el resultado. Una suite de evals reúne múltiples tareas para medir un objetivo más amplio.
¿Evaluación de IA y benchmark son lo mismo?
No. Un benchmark es un conjunto estandarizado de tareas, datos y reglas de medición que facilita comparaciones. Una evaluación de IA es más amplia: puede usar benchmarks, pero también pruebas propias del producto, casos reales, red teaming, revisión humana y mediciones específicas del contexto de uso.
¿Quién puede calificar una evaluación de IA?
La calificación puede realizarse con reglas deterministas o código, con otro modelo de IA, con personas o con una combinación de métodos. El método adecuado depende de qué se quiere medir y debe validarse para que realmente represente el criterio de éxito.
¿Cuántos casos necesita una evaluación de IA?
No existe un número universal. La cantidad depende de la diversidad del comportamiento que se quiere medir, la variabilidad del sistema, el riesgo de los errores y la precisión necesaria para detectar cambios. La cobertura y representatividad de los casos importan tanto como su cantidad.
¿Un buen resultado en evals garantiza que el sistema funcionará bien en producción?
No. Un resultado de evaluación sólo es evidencia sobre las tareas y condiciones probadas. Puede fallar si el conjunto no representa el uso real, si existe contaminación, si el grader está mal calibrado o si el entorno de producción difiere del evaluado. Por eso las evals se complementan con monitoreo, feedback de usuarios y revisión de casos reales.
Fuentes y referencias
1. Google for Developers. Machine Learning Glossary · evaluation y evals.
2. Anthropic. Demystifying evals for AI agents.
3. NIST AI Resource Center. AI RMF Core · Measure.
4. OpenAI. A shared playbook for trustworthy third party evaluations.
5. OpenAI. How evals drive the next chapter in AI for businesses.