Revisada el 2026-10-09 · vigente hasta 2027-01-07
RAG (generación aumentada por recuperación) es la técnica de buscar fragmentos relevantes en tus documentos y añadirlos al prompt para que el modelo responda con ellos.12
El patrón LLM Wiki de Karpathy propone otra vía: que el modelo compile las fuentes una vez en una wiki de Markdown y la mantenga al día, en lugar de redescubrirlas en cada pregunta.3 Y si los documentos son pocos, a veces lo mejor es no montar nada y meterlos enteros en el prompt.2
Cómo funciona RAG
- Origen: Lewis et al. (2020, aceptado en NeurIPS 2020). Une la memoria paramétrica, lo que el modelo aprendió al entrenarse, con una memoria no paramétrica: un índice vectorial de Wikipedia consultado por un recuperador neuronal. Sus respuestas fueron más específicas y factuales que las del modelo solo.1
- Embeddings, en dos líneas: un embedding convierte un texto en un vector de números de forma que se pueda medir su parecido de significado. Así se busca por sentido y no solo por palabras exactas.4 Anthropic no tiene modelo de embeddings propio y remite a Voyage AI.4
- Flujo habitual: trocear los documentos en fragmentos de unos cientos de tokens, guardar sus embeddings en una base vectorial y, en paralelo, un índice BM25 para coincidencias literales. Se fusionan los resultados y los mejores fragmentos van al prompt.2
- El punto débil: al trocear se pierde contexto. «Los ingresos crecieron un 3 %» no dice de qué empresa ni de qué trimestre, y la búsqueda falla.2
Contextual retrieval
- Propuesta de Anthropic (2024): antes de indexar, un modelo añade a cada fragmento entre 50 y 100 tokens que lo sitúan en su documento.2
- Fallos de recuperación (20 primeros fragmentos): un 35 % menos con embeddings contextuales, un 49 % menos si se suma BM25 contextual y un 67 % menos con reordenación (reranking).2
- Base de conocimiento de menos de 200.000 tokens (unas 500 páginas): según Anthropic, mejor meterla entera en el prompt con caché, sin RAG.2 Ver ventana de contexto.
- En producto: los proyectos de claude.ai activan RAG solos cuando el conocimiento se acerca al límite de la ventana, y así amplían su capacidad hasta 10 veces. Disponible en Pro, Max, Team y Enterprise.5
El patrón LLM Wiki
- Es un «archivo de idea» que Karpathy publicó en abril de 2026 para pegárselo a un agente y construir la wiki con él.3
- Su crítica a RAG: el modelo redescubre el conocimiento desde cero en cada pregunta. En la wiki, el conocimiento se compila una vez y se acumula: enlaces, contradicciones y síntesis ya están escritos.3
- Tres capas: fuentes en bruto, que el modelo lee y nunca toca; la wiki, que el modelo escribe y mantiene; y el esquema (
CLAUDE.mdoAGENTS.md) con estructura, convenciones y flujos.3 - Tres operaciones: ingerir (una fuente puede tocar de 10 a 15 páginas), consultar (y guardar las buenas respuestas como páginas nuevas) y revisar (contradicciones, datos viejos, páginas huérfanas, enlaces que faltan).3
- Dos archivos clave:
index.md, catálogo por categorías con una línea por página, ylog.md, registro cronológico al que solo se añade, con prefijos fáciles de filtrar con grep.3 - Escala: el índice basta a escala moderada (unas 100 fuentes y cientos de páginas). Más allá, propone un buscador local híbrido (BM25 y vectores).3
Cuándo conviene cada uno
| Situación | Opción |
|---|---|
| Pocos documentos (menos de 200.000 tokens) | Todo en el prompt, con caché2 |
| Corpus grande que no cabe en la ventana | RAG, mejor con contextual retrieval2 |
| Conocimiento que quieres acumular, revisar y enlazar durante meses | LLM Wiki3 |
| Preguntar a tus fuentes con citas, sin montar nada | Herramienta hecha, como Gemini Notebook |
Gemini Notebook responde solo con datos de tus fuentes y cita los fragmentos que usa.6 Su ayuda no explica cómo los recupera por dentro.
RAG tampoco es infalible: en las pruebas de Anthropic, el sistema básico no encontraba el fragmento correcto entre los 20 primeros en el 5,7 % de los casos.2 Ver alucinaciones.
Cómo lo uso
- Esta wiki sigue el patrón LLM Wiki;
contexto/objetivo.mdlo cita como base. Las piezas encajan así:bandeja/son las fuentes en bruto (fuera de git),fichas/es la wiki, yCLAUDE.mdmás.claude/rules/linea-editorial.mdhacen de esquema. index.mdse genera con un script ylog.mdusa entradas## [fecha] operación | título, el mismo formato que propone el gist. La revisión mecánica la hacescripts/revisar.py.- Añade dos controles que el gist no exige: nada se afirma sin fuente enlazada y solo yo paso una ficha a publicado.
- Sin embeddings ni base vectorial: con unas cincuenta fichas, el índice y el mapa bastan.
- Para preguntar a fuentes concretas uso Gemini Notebook con los libros escolares: ver libros escolares en NotebookLM.
Véase también
Referencias
Footnotes
-
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Lewis et al., arXiv, 2020-05-22 (versión 4, 2021-04-12); aceptado en NeurIPS 2020. Consultado el 2026-10-09. ↩ ↩2
-
Introducing Contextual Retrieval. Anthropic, 2024-09-19. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10
-
llm-wiki.md. Andrej Karpathy, gist de GitHub, 2026-04-04. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8
-
Embeddings. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2
-
Retrieval augmented generation (RAG) for projects. Anthropic, centro de ayuda. Consultado el 2026-10-09. ↩
-
Use chat in Gemini Notebook. Google, ayuda de Gemini Notebook. Consultado el 2026-10-09. ↩