Revisada el 2026-10-09 · vigente hasta 2027-01-07
Un benchmark es una prueba estandarizada que puntúa modelos de IA; sirve para compararlos, pero una cifra suelta engaña si no se sabe qué mide, quién la midió y cómo.
Hay tres grandes tipos: pruebas fijas con respuesta correcta, votaciones de preferencia humana como Arena e índices que agregan muchas pruebas, como el de Artificial Analysis. Los tres sufren contaminación, saturación y diferencias en las condiciones de medida, así que conviene cruzar fuentes de tipos distintos.123
Cómo funciona
Pruebas fijas
- Un banco de preguntas o tareas con solución conocida: GPQA Diamond (ciencia), MATH (matemáticas), FrontierMath (matemáticas muy difíciles) o SWE-bench Verified (resolver incidencias reales de GitHub).1
- Epoch AI ejecuta varias por su cuenta para poder responder de los resultados con sus propios ajustes.1
Preferencia humana: Arena
- Dos modelos anónimos responden a la misma pregunta, la persona vota y solo después ve sus nombres. Los votos emitidos tras revelarse los nombres no cuentan.2
- Con los votos se calcula una puntuación mediante el modelo de Bradley-Terry, parecido al Elo del ajedrez.2
- Hay clasificaciones por categoría: texto, programación web, visión, documentos, imagen, vídeo y búsqueda, entre otras.2
- Control de estilo: el cálculo incluye la longitud de la respuesta y el número de títulos, negritas y listas, porque las personas tienden a preferir respuestas largas y vistosas. Así se estima qué modelo ganaría con el mismo estilo.4
Índices agregados
- Artificial Analysis Intelligence Index (versión 4.3.2): diez evaluaciones en cuatro bloques. Agentes pesa un 30 %, programación un 20 %, conocimiento general un 30 % y razonamiento científico un 20 %.3
- Artificial Analysis ejecuta las pruebas con sus propias copias de los datos y con ajustes fijos: temperatura 0 en modelos sin razonamiento y 0,6 en los de razonamiento, salvo que el laboratorio recomiende otra.3
- Epoch AI publica su propio índice, el Epoch Capabilities Index, que combina muchas pruebas en una escala de capacidad general.1
Problemas que conviene conocer
- Contaminación. Si las preguntas estaban en los datos de entrenamiento, la puntuación se infla. Epoch lo advierte en MATH Level 5, y Artificial Analysis mantiene privados algunos conjuntos de datos para limitar ese riesgo.13
- Saturación. Cuando todos los modelos rozan el máximo, la prueba deja de distinguir. Epoch considera que MATH Level 5 se acerca a ese punto y añadió otra más difícil.1 Artificial Analysis ha ido retirando pruebas de su índice: MMLU-Pro, LiveCodeBench y AIME 2025 en la versión 4.0, y GPQA Diamond en la 4.2. No explica el motivo.3
- Condiciones de medida. Pequeños cambios de prompt o de temperatura mueven los resultados, y quien publica no siempre los declara.1 En los modelos de razonamiento, bajar el esfuerzo reduce la capacidad del mismo modelo, así que importa con qué nivel se midió.5
- Selección interesada. El artículo «The Leaderboard Illusion» (2025) sostiene que algunos laboratorios prueban en privado muchas variantes en Arena y publican solo la mejor; cita 27 variantes de Meta antes de Llama 4.6 Arena respondió que su política de pruebas previas es pública desde el 2024-03-01 y que el artículo contiene afirmaciones incorrectas.7
- Margen de error. Diferencias pequeñas pueden ser ruido: Arena alega que varias de las diferencias citadas en ese artículo caen dentro de los intervalos de confianza.7
- Modelo o arnés. En pruebas de agentes, la nota depende también del software que rodea al modelo. Ver arnés de IA.
Por qué importa
Antes de fiarte de una cifra, comprueba:
- Qué mide: una prueba de matemáticas no dice nada de redacción ni de programación.
- Quién la midió: el laboratorio que vende el modelo o un tercero independiente.
- Con qué ajustes: esfuerzo, número de intentos, herramientas disponibles.
- Qué versión: los índices cambian de composición varias veces al año, así que compara cifras de la misma versión.3
- Si la prueba está saturada o pudo filtrarse al entrenamiento.
- Cuántos votos hay detrás, en el caso de Arena.
Cómo lo uso
- El comparador Mejor modelo para cada tarea combina la inteligencia y el coste por tarea de Artificial Analysis con la preferencia humana por categoría de Arena, y se actualiza cada semana.
- A mi entender, cruzar un índice agregado con una votación humana es más fiable que fiarse de una sola cifra.
Véase también
Referencias
Footnotes
-
AI Benchmarking Hub. Epoch AI. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
-
Intelligence benchmarking methodology. Artificial Analysis, incluido su historial de versiones. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Style control. Arena, 2024-08-29 (actualizado el 2025-06-13). Consultado el 2026-10-09. ↩
-
Effort. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩
-
The Leaderboard Illusion. Shivalika Singh et al., arXiv, 2025-04-29. Consultado el 2026-10-09. ↩
-
Our Response to «The Leaderboard Illusion» Writeup. Arena, 2025-05-09 (actualizado el 2025-06-13). Consultado el 2026-10-09. ↩ ↩2