Prueba de regresión de tu servicio RAG con DeepEval — y resuelve un debate sobre modelos con datos
Nuestro análisis de economía de tokens de GPT-5.6 terminó con un desafío: las promesas de referencia son una hipótesis, no una razón — ejecuta la evaluación en tu carga de trabajo antes de que creas en un reclamo de "menos tokens por tarea". Este tutorial es nosotros siguiendo nuestro propio consejo.
Tomamos el asistente de documentos RAG de parte 5,
lo envolvemos en una suite de regresión DeepEval — en contenedor, juzgada por gemma4 en la API de
Inferencia WEC, sin dependencia de OpenAI — y luego usamos esa suite para responder a una pregunta genuinamente abierta:
¿deberíamos cambiar el modelo de generación del servicio? Qwen2.5-3B-Instruct (actual) vs
gemma4 (candidato), tasa de aprobación y tokens por tarea, medidos cara a cara.
Spoiler: la evaluación nos salvó de una migración innecesaria. Y en el camino encontramos cuatro fallos reales de producción: un espiral mortal por disco lleno, una condición de carrera en el arranque, una trampa de variable de Docker Compose que evaluó silenciosamente el modelo incorrecto, y la solución que hace que esa clase de error sea imposible. Cada comando, número y error a continuación proviene de una ejecución real.
