Descripción
Mandar todas las consultas al modelo más caro infla la factura y, en la práctica, no mejora cada respuesta. Decidir a mano qué petición merece un LLM grande y cuál no deja de ser viable en cuanto el tráfico crece.
Este proyecto ofrece un marco para servir y evaluar enrutadores de modelos de lenguaje: el sistema elige a qué LLM enviar cada petición para ahorrar costes sin sacrificar la calidad.
Qué cubre
- Servir routers que asignan cada consulta a un modelo
- Evaluar el equilibrio entre coste y calidad de esos routers
- Reducir el gasto en inferencia manteniendo el nivel de las respuestas
Tecnologías y temas
-
Coste de inferencia
Baja la factura sin tocar la calidad
-
Enrutado de LLM
Asigna cada consulta al modelo adecuado
-
Evaluación de routers
Compara routers por coste y resultado
-
Serving
Sirve el enrutador en el flujo de inferencia