Un router que no puede ver la conversación no puede clasificar "yes"
Clasificando la palabra "yes"
El trabajo de un router de modelos es leer una solicitud y decidir qué modelo debe responderla. Las preguntas baratas van a un modelo pequeño, las difíciles a uno grande, y la factura baja. Todo el arreglo depende de poder distinguir.
Entonces un usuario escribe "yes".
O "continue". O "hazlo". Nada en estas dos o tres letras dice si el trabajo que se está aprobando es una corrección ortográfica o una migración de base de datos. Un router que puntúa el mensaje actual de forma aislada ve una cadena muy corta sin vocabulario técnico, y hace lo obvio: modelo más barato.
Lo que significa que si rutas las solicitudes para ahorrar dinero, tu nivel más barato probablemente esté absorbiendo trabajo que nunca debería haber visto — y tu cifra de ahorro es en parte falsa. El 4 de agosto LiteLLM publicó un benchmark que mide ambas mitades de eso: qué tan mal se equivoca la ruta, y cuánto cuesta arreglarlo.
Todo lo anterior es la propia medición de LiteLLM, publicada en su blog y citado aquí: v1.97, clasificador gpt-5.4-mini, sus tres conjuntos de datos, sus etiquetas de referencia. Ninguno de ellos se ejecutó en nuestra infraestructura, y no lo hemos reproducido.
La medición
El recorrido: 5.600 llamadas de clasificación en tiempo vivo contra proveedores reales, descritas como
"dos recorridos de siete configuraciones cada una (tamaño de la ventana de contexto del clasificador de 0, 1, 2, 3, 5, 8, 10), uno con giros de asistentes en la ventana y otro sin, en tres conjuntos de datos multi-turno, con dos repeticiones por conversación."
La variable es cuántos giros anteriores puede ver el clasificador. Cero significa que juzga el mensaje actual solo. Diez significa que lee los diez giros anteriores primero.
Acuerdo con las capas de referencia, por tamaño de ventana:
| Giros anteriores | Respuestas cortas de seguimiento | MT-Bench giros 2do | Compartir GPT multi-turno |
|---|---|---|---|
| 0 | 50.0% | 49.4% | 83.8% |
| 1 | 71.2% | 53.1% | 84.4% |
| 2 | 87.5% | 53.1% | 90.6% |
| 3 (predeterminado) | 85.0% | 55.0% | 91.9% |
| 5 | 86.2% | 53.8% | 91.9% |
| 8 | 87.5% | 55.6% | 91.2% |
| 10 | 90.0% | 55.6% | 88.8% |
Figura 1. Acuerdo con las capas de referencia por ventana de contexto, extraído de las cifras publicadas en el benchmark de LiteLLM. La línea roja es el subconjunto de 36 giros que solo resuelve la dificultad contra el historial.
Tres historias en tres columnas, que es lo primero que resulta útil aquí.
ShareGPT comienza en 83.8% y gana ocho puntos. MT-Bench no se mueve mucho en absoluto — 49.4% a 55.6% en todo el recorrido — y su propia advertencia explica por qué: "El techo de MT-Bench refleja sus etiquetas de referencia más que el comportamiento del router." El conjunto de respuestas cortas es donde le da, 50% a 90%.
El número que vale la pena citar, con su denominador
Dentro de la primera columna se encuentra un subconjunto, y es el resultado más agudo en la publicación:
Acuerdo de 14% en N=0, 47% en N=1 y 78% en N=2, y plano desde allí hasta N=10.
Catorce por ciento a setenta y ocho por ciento, logrado mostrando al clasificador dos giros anteriores.
Esta cifra describe 36 seguimientos — los que "su giro final solo resuelve contra el historial" — es un subconjunto elegido deliberadamente, no una afirmación de precisión general, y leerlo como "los routers son 14% precisos" sería incorrecto. Lo que muestra es la forma del error: cuando la dificultad de un giro vive enteramente en lo que ha venido antes, un clasificador sin contexto es peor que adivinar, y casi todas las correcciones ocurren con el segundo giro de la historia.
La curva que permanece plana en N=2 es la parte prácticamente útil. Esto no es un resultado de "más contexto es mejor". Es un resultado de "dos giros es casi todo lo que necesitas".
Lo que costó, y lo que costó más
Esta es la mitad que hace que el hallazgo sea accionable, y donde la respuesta honesta es más interesante que "es barato".
La ventana en sí es gratuita. Cada comparación emparejada contra la configuración de ventana cero tiene un intervalo de confianza bootstrap de 95% que abarca cero. Ventana 1 con giros de asistente desactivados llega a -17.8 ms, intervalo -68.9 a +29.6. Su explicación es que la ventana solo añade pre-relleno — la salida permanece una etiqueta de nivel pequeña y fija. En un rango de 318 a 1.043 prompts de tokens, los tokens y la latencia se correlacionan en r = 0.007.
El clasificador no es gratis. Añadir historia no cuesta nada, pero pedirle a un modelo que clasifique a toda costa "está a 600 ms en cada configuración" — y eso está delante del final de la finalización. El clasificador aquí es gpt-5.4-mini, y se ejecuta a 0.31–0.61 dólares por 1.000 solicitudes en todo el recorrido. Barato en dinero, medio segundo en tiempo.
Y la precisión aumentó el coste. Esta es la parte que vale la pena reflexionar sobre. Para el conjunto de respuestas cortas, el coste modelado de la ruta aumentó con la ventana — de 2.87 a 6.49 dólares por 1.000 solicitudes. No una regresión: la razón es "una mezcla de nivel del 66% SIMPLE en N=0 contra 30% en N=2". Dos tercios de esas solicitudes de seguimiento se estaban sirviendo por el modelo más barato. Una vez que el clasificador podía ver lo que estaban aprobando, dejaron de hacerlo.
Así que la ruta era barata porque estaba equivocada. El ahorro era una factura que alguien más estaba pagando, en respuesta a calidad, en solicitudes que nadie estaba auditando. En los otros dos conjuntos de datos el efecto va al revés — el coste modelado de ShareGPT disminuye ligeramente, porque el contexto permite que el clasificador se establezca en MEDIO en lugar de por defecto a REASONING.
Esto es lo que vale la pena quedarse con ello: un mejor contexto no corta de forma fiable los gastos. Mueve los gastos hacia donde realmente estaba el trabajo.
Dos cosas que esto no resuelve
La configuración predeterminada es 3, y 3 no es el mejor número en ninguna columna. Diez es mejor para respuestas cortas de seguimiento en 90.0%, y simultáneamente el peor resultado para ShareGPT más allá de N=2, cayendo a 88.8% de 91.9%. Más historia no es un resultado monótonamente mejor, y el nivel predeterminado enviado es una llamada de juicio en los conjuntos de datos que no están de acuerdo.
Y nombran sus propios límites, que es la marca de un benchmark digno de confianza: "Las capas de referencia son llamadas de juicio", "El coste de finalización del enrutamiento se modela más que se factura", "Un clasificador de modelos fue recorrido", y "La latencia se midió en una sola máquina virtual a una concurrencia de 10". Una concurrencia de 10 en una sola máquina no es de producción, y un clasificador de modelos más pesado tiene más latencia absoluta que el que usaron.
Por qué importa si enruta algo
La lección sobrevive a la implementación específica. Si está eligiendo modelos por solicitud — con una heurística, un clasificador o una regla hecha a mano — los giros que le avergonzarán no son los largos técnicos. Son los cortos. Una ruta que puntúa "yes" como una pregunta trivial, ruta la aprobación de una migración de arquitectura al modelo más pequeño que tiene — y nada en sus registros lo señalará, porque una respuesta barata a una pregunta barata es exactamente lo que le pediste.
Su solución es una ventana de giros anteriores. La solución más barata, si su clasificador no tiene tal opción, es darse cuenta de que las respuestas cortas en una conversación establecida son la población para preocuparse y dejar de puntuarla en su propio contenido.
Lo tomamos el mismo router por el otro lado recientemente — las siete dimensiones de puntuación, el cálculo en un prompt real, y lo que un escáner de palabras clave gratuito pierde que un modelo captura — en ruta por complejidad.
Fuentes
- Auto Router v1.97: benchmarks de uso y mejor calidad para un menor coste — 4 de agosto de 2026
- Referencia de configuración de enrutamiento automático
