Inferencia, serving y optimización de LLM en open source

La capa de inferencia decide cuánto cuesta ejecutar un modelo y a qué velocidad responde. Estos proyectos cubren motores de serving, batching, cuantización y los trucos de memoria que hacen que un modelo quepa en el hardware que ya tienes.

La inferencia es donde se gastan de verdad los presupuestos de IA. El entrenamiento sale en los titulares; el serving sale en la factura, y una diferencia de factor tres en el rendimiento entre dos motores ejecutando los mismos pesos es rutina, no excepción.

Los proyectos de aquí ocupan puntos distintos de esa curva: motores puros, capas de enrutamiento y batching, y optimizaciones de memoria que permiten que un modelo más grande quepa en hardware más pequeño. Cada descripción dice cuál de esas capas es, porque mezclar dos capas que quieren controlar la planificación es la forma más común de estropear este stack.

Proyectos en este tema

18 proyectos analizados coinciden con este tema.

Herramientas LLM y Claude
Featured

Entorno de llm inference autoalojable para optimization

Ahorra semanas de desarrollo propio partiendo de una base de llm inference que ya funciona.

llm inferenceoptimizationconsumer hardware
Avanzado · Biblioteca para desarrolladores
TOOL-89085Ver detalles

Preguntas frecuentes

¿Qué diferencia hay entre un motor de inferencia y un servidor de modelos?
El motor ejecuta el forward pass de forma eficiente en tu hardware. El servidor pone delante una API, colas, batching y autenticación. Algunos proyectos hacen ambas cosas; combinar dos que hacen ambas suele costarte rendimiento.
¿La cuantización daña la calidad?
Una cuantización moderada cuesta poco en la mayoría de las tareas y mucho en unas pocas: el razonamiento largo y el código son las sensibles. Prueba con tus propios prompts antes de decidir; las medias de los benchmarks esconden exactamente los casos que te importan.
¿De dónde sale normalmente la mayor aceleración?
Del batching y la reutilización de caché, no de una GPU más rápida. Dos despliegues idénticos pueden diferir varias veces solo por la capa de planificación.

Categorías relacionadas

Todas las categorías

Otros temas

Actualizado: 2026-08-17