notas de campo

Notas de lo que
me voy encontrando.

Tutoriales, arquitectura y trampas de producción. Lo que aprendo construyendo, escrito mientras todavía me acuerdo de por qué me costó.

Explorar los casos de estudio
  1. LoRA: afinar un modelo sin pagar el precio de reentrenarlo entero fine-tuning · lora · llm
  2. Decodificación especulativa: acelerar la inferencia sin tocar el modelo llm · inferencia · latencia
  3. Tool calling: cómo un LLM decide llamar a tu código llm · agentes · tool-calling
  4. Búsqueda híbrida en RAG: cuando el vector no basta rag · búsqueda · embeddings
  5. Temperatura, top-p y top-k: domar la aleatoriedad del modelo llm · sampling · inferencia
  6. Cuantización: correr modelos grandes sin fundir la GPU llm · cuantización · inferencia
  7. Prompt caching: recortar coste y latencia en producción llm · prompt-caching · coste
  8. Tokenización: por qué tu LLM no sabe contar letras llm · tokenizacion · python
  9. Fine-tuning o RAG: cómo elegir sin quemar presupuesto llm · fine-tuning · rag
  10. Inyección de prompts: el agujero que tu RAG no ve seguridad · llm · rag
  11. Memoria en agentes: qué recuerda tu LLM y cómo agentes · llm · memoria
  12. Reranking en RAG: el segundo filtro que casi nadie pone rag · ia-generativa · reranking