Revisada el 2026-10-08 · vigente hasta 2027-01-06

Un arnés (harness) es el software que rodea a un modelo de lenguaje y le da contexto, memoria, herramientas, verificación y permisos para que pueda trabajar, no solo conversar.1 [0:00]

Claude Code y Codex no son modelos: son arneses de los modelos de Anthropic y de OpenAI.1 [0:30] Ambos laboratorios usan el término en su documentación oficial (ver más abajo).23 El mismo modelo puede rendir de forma muy distinta según el arnés que lo envuelve.1 [1:00]

Teoría

El modelo solo

  • Un modelo de lenguaje es un predictor de texto: recibe una cadena y devuelve otra algo más larga, palabra a palabra.1 [2:31]
  • Solo no tiene memoria entre chats, no ve tus archivos, no puede actuar (solo te dice qué hacer) ni comprueba si lo que ha hecho funciona.1 [2:31]
  • El vídeo lo resume como un cerebro en un frasco; el arnés es la silla y las riendas que dirigen esa potencia hacia un objetivo útil.1 [4:02]

Las cinco piezas

PiezaPara qué sirveMinuto
ContextoQué estás haciendo y por qué: proyecto, estructura de archivos, cambios recientes, herramientas disponibles5:33
MemoriaQué pasó antes: resúmenes y registros que sobreviven al límite de la ventana7:05
HerramientasCómo actúa el modelo en el mundo real9:26
VerificaciónCómo comprueba que lo hecho es correcto11:56
Permisos y sandboxQué no puede hacer, o qué necesita aprobación14:24

Fuente de la tabla: el vídeo.1 El autor aclara que son las cinco partes «a fecha de la grabación» [4:32], es decir, un esquema suyo y no un estándar.

Cómo funciona cada pieza

  • Contexto. Al empezar una sesión el modelo no sabe nada de ti. El arnés le entrega esa información al inicio de la conversación, oculta al usuario. Se prepara una vez y evita reexplicarlo en cada prompt.1 [5:33] En Claude Code se hace con CLAUDE.md y en Codex con AGENTS.md.1 [6:04]
  • Memoria y compactación. Cuanto más larga la conversación, más se llena la ventana de contexto, y según el vídeo el modelo se vuelve menos listo y aparecen instrucciones contradictorias.1 [7:05] La compactación resume los pasos antiguos, descarta los intentos fallidos y libera ventana. Claude Code la hace solo cuando la ventana casi se llena.1 [8:07] Algunos arneses guardan además un registro de cambios en vez del archivo entero, parecido al control de versiones con Git.1 [8:38]
  • Herramientas. El modelo solo emite texto. El arnés reconoce cierto tipo de texto como una petición, la empareja con una herramienta, la ejecuta y devuelve el resultado al modelo. Ocurre decenas de veces por minuto sin que lo notes.1 [9:26] MCP (Model Context Protocol) es hoy el esquema más común para conectar herramientas externas.1 [11:10]
  • Verificación. Sin ella, el modelo suele dar por bueno lo que genera, porque no puede saber si el código se ejecuta. El arnés añade herramientas de comprobación (tests, linters, formateadores), las lanza sobre el resultado y le devuelve la salida al modelo.1 [11:56]
  • Permisos. El arnés revisa cada llamada a una herramienta y, a escala mayor, la secuencia de llamadas. Hoy se hace sobre todo con reglas fijas; algunos experimentan con otro modelo como vigilante.1 [14:24]
  • Sandbox. Es un entorno aislado donde el modelo puede actuar sin tocar nada fuera. Sirve para acotar el daño de un error (por ejemplo, un borrado masivo) y para contener acciones no deseadas del propio modelo.1 [16:48]

El bucle del agente

  • El modelo recibe el contexto y el estado actual y decide el siguiente paso. Si razona, repite una pasada sobre su propia salida antes de decidir.1 [18:13]
  • El ciclo es: pensar, actuar (llamada a herramienta), comprobar permisos, ejecutar (a menudo en sandbox), recortar la salida, leer el resultado y volver a pensar. Se repite hasta cumplir el objetivo.1 [20:54]
  • Ese patrón se conoce como ReAct (reason + act) y subyace a la mayoría de los arneses agénticos.1 [21:24] ReAct se describió en un artículo de 2022 que intercala razonamiento y acciones en el modelo.4

Por qué importa

  • El rendimiento depende del modelo y del arnés. Según el vídeo, un arnés bueno puede dar buenos resultados con un modelo flojo, y muchos avances recientes vienen del arnés y no del modelo.1 [5:03] [19:53] El autor dice que hay estudios que lo muestran, pero no los cita en el vídeo: [cita requerida].
  • Al ver un benchmark nuevo no se sabe si mejoró el modelo o el arnés.1 [2:00]
  • Un arnés es solo software, así que cualquiera puede contribuir (un servidor MCP propio, por ejemplo), cosa que no pasa con el entrenamiento de modelos.1 [11:10] [20:24]

En la práctica

Ejemplos del vídeo que se pueden aplicar directamente:

  • Escribe un CLAUDE.md o AGENTS.md con el estilo de código, carpetas intocables y tests que ejecutar. Resuelves el contexto una vez.1 [6:04]
  • Calculadora como verificación: antes los modelos fallaban en cuentas como 17 × 3; al darles una calculadora y hacer que la usen, el error desaparece. Es la misma idea que delegar en tests y linters.1 [12:43]
  • Hook posterior a la edición: ejecutar la batería de tests tras cada archivo editado, de modo que el modelo vea el resultado y sepa si lo hizo bien.1 [15:47]
  • Hook previo a una acción: antes de enviar datos a un sitio, comparar con la lista de sitios ya usados y pedir confirmación si es nuevo.1 [16:17]
  • Sandbox para cualquier cosa que pueda borrar o cambiar ajustes del sistema.1 [16:48]
  • Conectar apps mediante MCP o pedirle al propio agente que cree un servidor MCP a medida.1 [11:10]

Qué dice la documentación oficial

Anthropic

  • Define el arnés como la capa que rodea al modelo: aporta las herramientas y gestiona el contexto que el modelo ve. Lo llama «agentic harness».2
  • Su bucle tiene tres fases que se mezclan: reunir contexto, actuar y verificar resultados, repetidas hasta acabar la tarea. Puedes interrumpirlo en cualquier punto.2 Es más simple que las cinco piezas del vídeo, que son un esquema del autor y no una división oficial.
  • Herramientas: cinco categorías (archivos, búsqueda, ejecución, web e inteligencia de código). Sin herramientas, el modelo solo responde con texto.2
  • Contexto: CLAUDE.md se carga cada sesión, y si el repositorio tiene AGENTS.md, Claude Code puede leerlo en su lugar.2
  • Compactación: al acercarse al límite borra primero las salidas antiguas de herramientas y luego resume la conversación. Las instrucciones detalladas del principio pueden perderse, por eso las reglas permanentes van en CLAUDE.md.2 Si un archivo o salida es tan grande que el contexto se rellena enseguida, deja de compactar tras unos intentos y muestra un error.2
  • Seguridad: puntos de control que permiten deshacer ediciones de archivos (no acciones sobre sistemas remotos) y modos de permisos (auto, manual, aceptar ediciones y plan).2
  • Extensiones sobre el bucle: skills, MCP, hooks y subagentes. Cada subagente trabaja en su propia ventana y devuelve un resumen.2
  • Tareas largas: el artículo de ingeniería de Anthropic (2025-11-26) plantea el arnés como lo que permite trabajar a lo largo de varias ventanas de contexto. Cada sesión empieza sin memoria, así que un agente inicializador deja un init.sh, un archivo de progreso y un commit base. Los agentes siguientes leen ese estado, trabajan sobre una lista de funciones que solo cambia de «falla» a «pasa» y verifican de extremo a extremo antes de darlas por hechas.5

OpenAI

  • Llama arnés de Codex al bucle del agente y la lógica comunes a todas sus superficies (web, CLI, extensión de IDE y app de macOS).36
  • El bucle del agente orquesta la interacción entre el usuario, el modelo y las herramientas que este invoca.3
  • Los detalles de ese bucle (construcción del prompt, caché, compactación) no los he podido leer en la fuente oficial: [cita requerida].
  • Contexto: Codex lee AGENTS.md global (~/.codex/) y de proyecto, desde la raíz de Git hasta el directorio actual. Los archivos más cercanos van al final y prevalecen. El tope combinado por defecto es de 32 KiB.7
  • Sandbox y aprobaciones son dos cosas distintas: el sandbox fija los límites técnicos y la política de aprobación decide cuándo debe pararse a preguntar antes de cruzarlos.8 Modos de sandbox: read-only, workspace-write (por defecto) y danger-full-access.8

Coincidencias con el vídeo

  • Los dos laboratorios confirman la idea central: el modelo solo no actúa; el arnés le da herramientas, contexto y límites.23
  • Ambos usan un archivo de instrucciones por proyecto (CLAUDE.md o AGENTS.md) y limitan lo que el agente puede hacer con permisos y aislamiento.278
  • El vídeo habla de una capa de permisos y otra de sandbox; en Codex son ejes independientes, algo más fino de lo que se cuenta allí.8

Hacia dónde va, según el vídeo

Son predicciones del autor, no hechos:1

  • MCP en más aplicaciones, expuesto a través de conectores y plug-ins [21:24].
  • Equipos de agentes con una capa de contexto compartida, más allá de los subagentes actuales [21:55].
  • Lanzar la misma tarea varias veces con verificación propia y quedarse con la que funciona [22:26].
  • Arneses evolutivos: un modelo analiza los errores del arnés y lo corrige (por ejemplo, buscar antes de listar todo el espacio de trabajo para gastar menos tokens) [22:57].

Cómo lo uso

Sin uso propio documentado todavía.

Véase también

Referencias

Footnotes

  1. AI Harnesses In 24 Minutes (For Normal People). Nick Saraev, vídeo de YouTube, 2026-10-07. Fuente de nivel 4 (creador); el autor dirige una agencia de IA y promociona un programa de pago en el vídeo. Cada dato lleva el minuto entre corchetes. Consultado el 2026-10-08. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30

  2. How Claude Code works. Anthropic, documentación oficial. Consultado el 2026-10-08. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11

  3. Unrolling the Codex agent loop. Michael Bolin, OpenAI, 2026-01-23. La página devolvió 403 al abrirla; el dato procede del extracto que muestra el buscador. Consultado el 2026-10-08. ↩ ↩2 ↩3 ↩4

  4. ReAct: Synergizing Reasoning and Acting in Language Models. Yao et al., arXiv, 2022. Consultado el 2026-10-08. ↩

  5. Effective harnesses for long-running agents. Justin Young, Anthropic Engineering, 2025-11-26. Consultado el 2026-10-08. ↩

  6. Unlocking the Codex harness: how we built the App Server. Celia Chen, OpenAI, 2026-02-04. La página devolvió 403 al abrirla; el dato procede del extracto que muestra el buscador. Consultado el 2026-10-08. ↩

  7. Custom instructions with AGENTS.md. OpenAI, documentación de Codex (antes en developers.openai.com/codex/guides/agents-md). Consultado el 2026-10-08. ↩ ↩2

  8. Sandbox. OpenAI, documentación de Codex (antes en developers.openai.com/codex/concepts/sandboxing). Consultado el 2026-10-08. ↩ ↩2 ↩3 ↩4