notas de campo
Notas de lo que
me voy encontrando.
Tutoriales, arquitectura y trampas de producción. Lo que aprendo construyendo, escrito mientras todavía me acuerdo de por qué me costó.
Explorar los casos de estudio- RAG en español: dónde se pierde el recall cuando el corpus no está en inglés
- Deduplicar el corpus antes de indexar: el paso que casi nadie hace
- Chunking tardío: trocea después de embeber, no antes
- Métricas de similitud en embeddings: coseno, producto interno y L2
- Migrar de modelo de embeddings sin cortar el servicio
- Recuperación visual de documentos: cuando dejas de extraer texto del PDF
- HNSW frente a IVF: afinar el índice antes de cambiar de base de datos vectorial
- Recuperación contextual: el chunk que se olvidó de dónde venía
- Cuantización de embeddings: reducir el índice 32 veces sin perder recall
- Late interaction: por qué ColBERT recupera mejor que un solo vector
- Embeddings Matryoshka: recorta dimensiones sin perder el hilo
- Búsqueda híbrida en RAG: cuando el vector no basta