notas de campo
Notas de lo que
me voy encontrando.
Tutoriales, arquitectura y trampas de producción. Lo que aprendo construyendo, escrito mientras todavía me acuerdo de por qué me costó.
Explorar los casos de estudio- Mixture of experts: por qué un modelo enorme apenas usa sus parámetros
- Batching continuo: cómo una GPU sirve a cien peticiones a la vez
- El KV cache: por qué el primer token tarda y los demás vuelan
- Enrutado de modelos: no todo merece el modelo grande
- Por qué alucinan los LLM (y qué hacer al respecto)
- Ventana de contexto: por qué llenarla no te hace más listo
- LoRA: afinar un modelo sin pagar el precio de reentrenarlo entero
- Decodificación especulativa: acelerar la inferencia sin tocar el modelo
- Tool calling: cómo un LLM decide llamar a tu código
- Temperatura, top-p y top-k: domar la aleatoriedad del modelo
- Cuantización: correr modelos grandes sin fundir la GPU
- Prompt caching: recortar coste y latencia en producción