Revisada el 2026-10-09 · vigente hasta 2027-01-07

RAG (generación aumentada por recuperación) es la técnica de buscar fragmentos relevantes en tus documentos y añadirlos al prompt para que el modelo responda con ellos.12

El patrón LLM Wiki de Karpathy propone otra vía: que el modelo compile las fuentes una vez en una wiki de Markdown y la mantenga al día, en lugar de redescubrirlas en cada pregunta.3 Y si los documentos son pocos, a veces lo mejor es no montar nada y meterlos enteros en el prompt.2

Cómo funciona RAG

  • Origen: Lewis et al. (2020, aceptado en NeurIPS 2020). Une la memoria paramétrica, lo que el modelo aprendió al entrenarse, con una memoria no paramétrica: un índice vectorial de Wikipedia consultado por un recuperador neuronal. Sus respuestas fueron más específicas y factuales que las del modelo solo.1
  • Embeddings, en dos líneas: un embedding convierte un texto en un vector de números de forma que se pueda medir su parecido de significado. Así se busca por sentido y no solo por palabras exactas.4 Anthropic no tiene modelo de embeddings propio y remite a Voyage AI.4
  • Flujo habitual: trocear los documentos en fragmentos de unos cientos de tokens, guardar sus embeddings en una base vectorial y, en paralelo, un índice BM25 para coincidencias literales. Se fusionan los resultados y los mejores fragmentos van al prompt.2
  • El punto débil: al trocear se pierde contexto. «Los ingresos crecieron un 3 %» no dice de qué empresa ni de qué trimestre, y la búsqueda falla.2

Contextual retrieval

  • Propuesta de Anthropic (2024): antes de indexar, un modelo añade a cada fragmento entre 50 y 100 tokens que lo sitúan en su documento.2
  • Fallos de recuperación (20 primeros fragmentos): un 35 % menos con embeddings contextuales, un 49 % menos si se suma BM25 contextual y un 67 % menos con reordenación (reranking).2
  • Base de conocimiento de menos de 200.000 tokens (unas 500 páginas): según Anthropic, mejor meterla entera en el prompt con caché, sin RAG.2 Ver ventana de contexto.
  • En producto: los proyectos de claude.ai activan RAG solos cuando el conocimiento se acerca al límite de la ventana, y así amplían su capacidad hasta 10 veces. Disponible en Pro, Max, Team y Enterprise.5

El patrón LLM Wiki

  • Es un «archivo de idea» que Karpathy publicó en abril de 2026 para pegárselo a un agente y construir la wiki con él.3
  • Su crítica a RAG: el modelo redescubre el conocimiento desde cero en cada pregunta. En la wiki, el conocimiento se compila una vez y se acumula: enlaces, contradicciones y síntesis ya están escritos.3
  • Tres capas: fuentes en bruto, que el modelo lee y nunca toca; la wiki, que el modelo escribe y mantiene; y el esquema (CLAUDE.md o AGENTS.md) con estructura, convenciones y flujos.3
  • Tres operaciones: ingerir (una fuente puede tocar de 10 a 15 páginas), consultar (y guardar las buenas respuestas como páginas nuevas) y revisar (contradicciones, datos viejos, páginas huérfanas, enlaces que faltan).3
  • Dos archivos clave: index.md, catálogo por categorías con una línea por página, y log.md, registro cronológico al que solo se añade, con prefijos fáciles de filtrar con grep.3
  • Escala: el índice basta a escala moderada (unas 100 fuentes y cientos de páginas). Más allá, propone un buscador local híbrido (BM25 y vectores).3

Cuándo conviene cada uno

SituaciónOpción
Pocos documentos (menos de 200.000 tokens)Todo en el prompt, con caché2
Corpus grande que no cabe en la ventanaRAG, mejor con contextual retrieval2
Conocimiento que quieres acumular, revisar y enlazar durante mesesLLM Wiki3
Preguntar a tus fuentes con citas, sin montar nadaHerramienta hecha, como Gemini Notebook

Gemini Notebook responde solo con datos de tus fuentes y cita los fragmentos que usa.6 Su ayuda no explica cómo los recupera por dentro.

RAG tampoco es infalible: en las pruebas de Anthropic, el sistema básico no encontraba el fragmento correcto entre los 20 primeros en el 5,7 % de los casos.2 Ver alucinaciones.

Cómo lo uso

  • Esta wiki sigue el patrón LLM Wiki; contexto/objetivo.md lo cita como base. Las piezas encajan así: bandeja/ son las fuentes en bruto (fuera de git), fichas/ es la wiki, y CLAUDE.md más .claude/rules/linea-editorial.md hacen de esquema.
  • index.md se genera con un script y log.md usa entradas ## [fecha] operación | título, el mismo formato que propone el gist. La revisión mecánica la hace scripts/revisar.py.
  • Añade dos controles que el gist no exige: nada se afirma sin fuente enlazada y solo yo paso una ficha a publicado.
  • Sin embeddings ni base vectorial: con unas cincuenta fichas, el índice y el mapa bastan.
  • Para preguntar a fuentes concretas uso Gemini Notebook con los libros escolares: ver libros escolares en NotebookLM.

Véase también

Referencias

Footnotes

  1. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Lewis et al., arXiv, 2020-05-22 (versión 4, 2021-04-12); aceptado en NeurIPS 2020. Consultado el 2026-10-09. ↩ ↩2

  2. Introducing Contextual Retrieval. Anthropic, 2024-09-19. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10

  3. llm-wiki.md. Andrej Karpathy, gist de GitHub, 2026-04-04. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8

  4. Embeddings. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2

  5. Retrieval augmented generation (RAG) for projects. Anthropic, centro de ayuda. Consultado el 2026-10-09. ↩

  6. Use chat in Gemini Notebook. Google, ayuda de Gemini Notebook. Consultado el 2026-10-09. ↩