notas de campo

Notas de lo que
me voy encontrando.

Tutoriales, arquitectura y trampas de producción. Lo que aprendo construyendo, escrito mientras todavía me acuerdo de por qué me costó.

Explorar los casos de estudio
  1. Mixture of experts: por qué un modelo enorme apenas usa sus parámetros llm · arquitectura · moe
  2. Batching continuo: cómo una GPU sirve a cien peticiones a la vez llm · inferencia · throughput
  3. El KV cache: por qué el primer token tarda y los demás vuelan llm · kv-cache · latencia
  4. Enrutado de modelos: no todo merece el modelo grande ia · llm · coste
  5. Por qué alucinan los LLM (y qué hacer al respecto) llm · alucinaciones · rag
  6. Ventana de contexto: por qué llenarla no te hace más listo llm · contexto · rag
  7. LoRA: afinar un modelo sin pagar el precio de reentrenarlo entero fine-tuning · lora · llm
  8. Decodificación especulativa: acelerar la inferencia sin tocar el modelo llm · inferencia · latencia
  9. Tool calling: cómo un LLM decide llamar a tu código llm · agentes · tool-calling
  10. Temperatura, top-p y top-k: domar la aleatoriedad del modelo llm · sampling · inferencia
  11. Cuantización: correr modelos grandes sin fundir la GPU llm · cuantización · inferencia
  12. Prompt caching: recortar coste y latencia en producción llm · prompt-caching · coste