notas de campo
Notas de lo que
me voy encontrando.
Tutoriales, arquitectura y trampas de producción. Lo que aprendo construyendo, escrito mientras todavía me acuerdo de por qué me costó.
Explorar los casos de estudio- LoRA: afinar un modelo sin pagar el precio de reentrenarlo entero
- Decodificación especulativa: acelerar la inferencia sin tocar el modelo
- Tool calling: cómo un LLM decide llamar a tu código
- Búsqueda híbrida en RAG: cuando el vector no basta
- Temperatura, top-p y top-k: domar la aleatoriedad del modelo
- Cuantización: correr modelos grandes sin fundir la GPU
- Prompt caching: recortar coste y latencia en producción
- Tokenización: por qué tu LLM no sabe contar letras
- Fine-tuning o RAG: cómo elegir sin quemar presupuesto
- Inyección de prompts: el agujero que tu RAG no ve
- Memoria en agentes: qué recuerda tu LLM y cómo
- Reranking en RAG: el segundo filtro que casi nadie pone