notas de campo
Notas de lo que
me voy encontrando.
Tutoriales, arquitectura y trampas de producción. Lo que aprendo construyendo, escrito mientras todavía me acuerdo de por qué me costó.
Explorar los casos de estudio- GraphRAG: cuándo el grafo le gana al vector
- FlashAttention: la atención no era lenta por las cuentas, sino por la memoria
- RAG agéntico: cuando recuperar deja de ser un solo paso
- PagedAttention: gestionar la KV cache como memoria de un sistema operativo
- Prefill y decode: por qué un LLM tiene dos velocidades
- Atención agrupada: el truco que encoge el KV cache
- Mixture of experts: por qué un modelo enorme apenas usa sus parámetros
- Batching continuo: cómo una GPU sirve a cien peticiones a la vez
- El KV cache: por qué el primer token tarda y los demás vuelan
- Enrutado de modelos: no todo merece el modelo grande
- Por qué alucinan los LLM (y qué hacer al respecto)
- Ventana de contexto: por qué llenarla no te hace más listo