Esquema de tres preguntas para evaluar un rag.Ampliar esquema ↗
Esquema educativo propio: Tres preguntas para evaluar un RAG.

Evaluar un sistema de RAG (generación aumentada con recuperación) no se reduce a comprobar si encuentra información. Tres aspectos clave deben analizarse por separado: la recuperación de evidencia, la fidelidad al contenido recuperado y la utilidad final para el usuario. Cada uno puede fallar incluso si los otros funcionan bien. Por ejemplo, un sistema puede recuperar documentos relevantes, pero generar una respuesta que no refleje correctamente lo encontrado. O bien, puede recuperar información precisa, pero no responder a la pregunta del usuario porque no la entiende.

La idea, paso a paso

La recuperación se refiere a la capacidad del sistema para encontrar documentos o fragmentos que sean relevantes para la pregunta. Una buena recuperación implica que el sistema identifica correctamente qué información está disponible. Sin embargo, esto no garantiza que la respuesta generada sea precisa. Por ejemplo, si se pregunta cuántos días dura una vacación recomendada y el documento menciona cinco días, pero la respuesta generada dice tres, la recuperación fue correcta, pero la fidelidad no lo fue.

Un ejemplo para entenderlo

En una prueba ficticia, el sistema encuentra el documento correcto, que dice cinco días, pero responde tres. La recuperación ha aportado evidencia útil y la generación ha fallado al utilizarla. En otro caso, la respuesta puede sonar correcta sin contar con un pasaje que la respalde. Evaluar ambos casos por separado ayuda a localizar qué componente necesita mejora.

Qué conviene comprobar

La fidelidad implica que la respuesta generada se basa en la información recuperada. Esto significa que no se invente información ni se modifique lo encontrado en los documentos. Por ejemplo, si un documento dice que la vacación incluye una excursión a una montaña, la respuesta no debe añadir una visita a una playa si no se menciona en ninguno de los textos recuperados. La fidelidad es crucial para evitar que el sistema muestre información errónea simplemente porque se le pide que responda, incluso si no hay evidencia suficiente.

La utilidad, por su parte, depende de si la respuesta responde efectivamente a la pregunta del usuario. Un sistema puede recuperar información precisa y mantener la fidelidad, pero si no responde directamente a la pregunta, su utilidad es limitada. Por ejemplo, si se pregunta si se puede viajar en tren a cierta ciudad y la respuesta habla de opciones de transporte en general, sin mencionar específicamente el tren, la utilidad no se cumple.

Al evaluar un sistema RAG, es común cometer errores como confundir la calidad de recuperación con la calidad de la generación. Algunas personas asumen que si el sistema encuentra información, su respuesta será buena, pero no siempre es así. Otro error es no considerar preguntas que no tienen respuesta en los documentos. En esos casos, el sistema debe saber abstenerse de generar una respuesta que no esté respaldada por la información disponible.

RAG significa generación aumentada con recuperación. La evaluación necesita separar la evidencia recuperada, la fidelidad de la respuesta y su utilidad para la pregunta. Un modelo que actúa como evaluador puede equivocarse; utiliza referencias y revisiones independientes cuando importe la exactitud.

Pruébalo con un caso pequeño

Construye seis preguntas, dos de ellas sin respuesta en los documentos.

Para revisar tu ejercicio, distingue qué dato entra, qué resultado esperas y con qué evidencia lo comprobarías. Si aparece una duda, anótala como tal en lugar de completar el dato. El propósito es detectar una decisión concreta que puedas justificar, no obtener una respuesta que solo suene convincente.

Cómo leer el esquema

La ilustración organiza los conceptos explicados en el artículo. Es un esquema educativo, no una medición de un sistema real.

Fuentes

Documentación original utilizada para los conceptos de este artículo.

Sigue explorando