notas de campo

Notas de lo que
me voy encontrando.

Tutoriales, arquitectura y trampas de producción. Lo que aprendo construyendo, escrito mientras todavía me acuerdo de por qué me costó.

Explorar los casos de estudio
  1. GraphRAG: cuándo el grafo le gana al vector rag · graphrag · grafos
  2. FlashAttention: la atención no era lenta por las cuentas, sino por la memoria llm · atencion · rendimiento
  3. RAG agéntico: cuando recuperar deja de ser un solo paso rag · agentes · llm
  4. PagedAttention: gestionar la KV cache como memoria de un sistema operativo llm · inferencia · kv-cache
  5. Prefill y decode: por qué un LLM tiene dos velocidades llm · inferencia · rendimiento
  6. Atención agrupada: el truco que encoge el KV cache llm · atencion · inferencia
  7. Mixture of experts: por qué un modelo enorme apenas usa sus parámetros llm · arquitectura · moe
  8. Batching continuo: cómo una GPU sirve a cien peticiones a la vez llm · inferencia · throughput
  9. El KV cache: por qué el primer token tarda y los demás vuelan llm · kv-cache · latencia
  10. Enrutado de modelos: no todo merece el modelo grande ia · llm · coste
  11. Por qué alucinan los LLM (y qué hacer al respecto) llm · alucinaciones · rag
  12. Ventana de contexto: por qué llenarla no te hace más listo llm · contexto · rag