RouteLLM

IA / ML

Enruta cada consulta al modelo justo y recorta la factura de LLM.

Descripción

Mandar todas las consultas al modelo más caro infla la factura y, en la práctica, no mejora cada respuesta. Decidir a mano qué petición merece un LLM grande y cuál no deja de ser viable en cuanto el tráfico crece.

Este proyecto ofrece un marco para servir y evaluar enrutadores de modelos de lenguaje: el sistema elige a qué LLM enviar cada petición para ahorrar costes sin sacrificar la calidad.

Qué cubre

  • Servir routers que asignan cada consulta a un modelo
  • Evaluar el equilibrio entre coste y calidad de esos routers
  • Reducir el gasto en inferencia manteniendo el nivel de las respuestas

Tecnologías y temas

  • Coste de inferencia

    Baja la factura sin tocar la calidad

  • Enrutado de LLM

    Asigna cada consulta al modelo adecuado

  • Evaluación de routers

    Compara routers por coste y resultado

  • Serving

    Sirve el enrutador en el flujo de inferencia