Revisada el 2026-10-09 · vigente hasta 2027-01-07

Un benchmark es una prueba estandarizada que puntúa modelos de IA; sirve para compararlos, pero una cifra suelta engaña si no se sabe qué mide, quién la midió y cómo.

Hay tres grandes tipos: pruebas fijas con respuesta correcta, votaciones de preferencia humana como Arena e índices que agregan muchas pruebas, como el de Artificial Analysis. Los tres sufren contaminación, saturación y diferencias en las condiciones de medida, así que conviene cruzar fuentes de tipos distintos.123

Cómo funciona

Pruebas fijas

  • Un banco de preguntas o tareas con solución conocida: GPQA Diamond (ciencia), MATH (matemáticas), FrontierMath (matemáticas muy difíciles) o SWE-bench Verified (resolver incidencias reales de GitHub).1
  • Epoch AI ejecuta varias por su cuenta para poder responder de los resultados con sus propios ajustes.1

Preferencia humana: Arena

  • Dos modelos anónimos responden a la misma pregunta, la persona vota y solo después ve sus nombres. Los votos emitidos tras revelarse los nombres no cuentan.2
  • Con los votos se calcula una puntuación mediante el modelo de Bradley-Terry, parecido al Elo del ajedrez.2
  • Hay clasificaciones por categoría: texto, programación web, visión, documentos, imagen, vídeo y búsqueda, entre otras.2
  • Control de estilo: el cálculo incluye la longitud de la respuesta y el número de títulos, negritas y listas, porque las personas tienden a preferir respuestas largas y vistosas. Así se estima qué modelo ganaría con el mismo estilo.4

Índices agregados

  • Artificial Analysis Intelligence Index (versión 4.3.2): diez evaluaciones en cuatro bloques. Agentes pesa un 30 %, programación un 20 %, conocimiento general un 30 % y razonamiento científico un 20 %.3
  • Artificial Analysis ejecuta las pruebas con sus propias copias de los datos y con ajustes fijos: temperatura 0 en modelos sin razonamiento y 0,6 en los de razonamiento, salvo que el laboratorio recomiende otra.3
  • Epoch AI publica su propio índice, el Epoch Capabilities Index, que combina muchas pruebas en una escala de capacidad general.1

Problemas que conviene conocer

  • Contaminación. Si las preguntas estaban en los datos de entrenamiento, la puntuación se infla. Epoch lo advierte en MATH Level 5, y Artificial Analysis mantiene privados algunos conjuntos de datos para limitar ese riesgo.13
  • Saturación. Cuando todos los modelos rozan el máximo, la prueba deja de distinguir. Epoch considera que MATH Level 5 se acerca a ese punto y añadió otra más difícil.1 Artificial Analysis ha ido retirando pruebas de su índice: MMLU-Pro, LiveCodeBench y AIME 2025 en la versión 4.0, y GPQA Diamond en la 4.2. No explica el motivo.3
  • Condiciones de medida. Pequeños cambios de prompt o de temperatura mueven los resultados, y quien publica no siempre los declara.1 En los modelos de razonamiento, bajar el esfuerzo reduce la capacidad del mismo modelo, así que importa con qué nivel se midió.5
  • Selección interesada. El artículo «The Leaderboard Illusion» (2025) sostiene que algunos laboratorios prueban en privado muchas variantes en Arena y publican solo la mejor; cita 27 variantes de Meta antes de Llama 4.6 Arena respondió que su política de pruebas previas es pública desde el 2024-03-01 y que el artículo contiene afirmaciones incorrectas.7
  • Margen de error. Diferencias pequeñas pueden ser ruido: Arena alega que varias de las diferencias citadas en ese artículo caen dentro de los intervalos de confianza.7
  • Modelo o arnés. En pruebas de agentes, la nota depende también del software que rodea al modelo. Ver arnés de IA.

Por qué importa

Antes de fiarte de una cifra, comprueba:

  • Qué mide: una prueba de matemáticas no dice nada de redacción ni de programación.
  • Quién la midió: el laboratorio que vende el modelo o un tercero independiente.
  • Con qué ajustes: esfuerzo, número de intentos, herramientas disponibles.
  • Qué versión: los índices cambian de composición varias veces al año, así que compara cifras de la misma versión.3
  • Si la prueba está saturada o pudo filtrarse al entrenamiento.
  • Cuántos votos hay detrás, en el caso de Arena.

Cómo lo uso

  • El comparador Mejor modelo para cada tarea combina la inteligencia y el coste por tarea de Artificial Analysis con la preferencia humana por categoría de Arena, y se actualiza cada semana.
  • A mi entender, cruzar un índice agregado con una votación humana es más fiable que fiarse de una sola cifra.

Véase también

Referencias

Footnotes

  1. AI Benchmarking Hub. Epoch AI. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7

  2. FAQ. Arena. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4

  3. Intelligence benchmarking methodology. Artificial Analysis, incluido su historial de versiones. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6

  4. Style control. Arena, 2024-08-29 (actualizado el 2025-06-13). Consultado el 2026-10-09. ↩

  5. Effort. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩

  6. The Leaderboard Illusion. Shivalika Singh et al., arXiv, 2025-04-29. Consultado el 2026-10-09. ↩

  7. Our Response to «The Leaderboard Illusion» Writeup. Arena, 2025-05-09 (actualizado el 2025-06-13). Consultado el 2026-10-09. ↩ ↩2