Cada pocos meses sale un modelo nuevo afirmando ser "el más inteligente hasta la fecha". La pregunta que casi nunca se responde es: ¿más inteligente según qué? Este artículo reconstruye la carrera real, benchmark a benchmark — de dónde salió cada prueba, por qué se quedó obsoleta, y qué modelo iba ganando en cada momento. Cada cifra está marcada según su origen: anuncio oficial del laboratorio, o estimación de un agregador independiente cuando no había tabla oficial disponible. Nada se rellena a ojo.

OpenAI Anthropic Google DeepMind DeepSeek
0:00 / 0:00

La barra muestra la media de los benchmarks que cada modelo tiene reportados (de MMLU/MMLU-Pro, GPQA Diamond, SWE-bench Verified, AIME, ARC-AGI/ARC-AGI-2 y Humanity's Last Exam) — no todos los modelos tienen los seis, así que la media se calcula solo sobre los disponibles. Un asterisco (*) marca cifras de agregadores independientes no confirmadas contra la tabla oficial del laboratorio. Arrastra el control deslizante o dale a reproducir.

Por qué los benchmarks caducan

Un benchmark de IA muere de éxito. Se publica, mide algo que ningún modelo sabe hacer bien todavía, los laboratorios entrenan y optimizan hasta acercarse al 100%, y entonces deja de servir para diferenciar nada — todo el mundo saca un 95%+ y la prueba se convierte en ruido. Ha pasado con prácticamente cada benchmark relevante desde 2020, y es la razón por la que la lista de "pruebas de referencia" se renueva por completo cada 18-24 meses.

MMLU y MMLU-Pro

MMLU ("Measuring Massive Multitask Language Understanding") lo publicaron Dan Hendrycks y varios coautores el 7 de septiembre de 20201: casi 16.000 preguntas de opción múltiple repartidas en 57 materias, desde matemáticas hasta nutrición o derecho internacional, pensadas para medir el conocimiento adquirido durante el preentrenamiento. Nació porque los benchmarks anteriores (GLUE, SuperGLUE) ya estaban saturados por modelos que rendían casi a nivel humano sin que eso reflejara comprensión amplia de nada.

Para mediados de 2024 el propio MMLU ya estaba en las últimas: los modelos de frontera rondaban el 86-88% con resultados inestables según cómo se formulara la pregunta. Un equipo de TIGER-AI-Lab publicó MMLU-Pro en junio de 20242: menos preguntas triviales, diez opciones en vez de cuatro (para que acertar por azar sea más difícil) y más peso al razonamiento en varios pasos. El golpe fue inmediato — GPT-4o pasó de 88,7% a 72,6% de un día para otro.

GPQA Diamond

GPQA ("Graduate-Level Google-Proof Q&A") lo publicó David Rein y su equipo en noviembre de 20233: 448 preguntas de biología, física y química escritas por gente con doctorado o camino a él. "Google-proof" no es exageración — expertos del dominio aciertan un 65-74%, pero no-expertos con acceso ilimitado a internet solo llegan al 34%. GPQA Diamond es el subconjunto más exigente: 198 preguntas donde como mínimo un experto acertó y como máximo un no-experto de tres lo hizo.

De HumanEval a SWE-bench Verified

HumanEval, el primer benchmark de código serio, lo publicó OpenAI en julio de 2021 junto al lanzamiento de Codex4: 164 problemas de programación resueltos a mano, cada uno con su docstring y sus tests. Codex resolvía un 28,8%; GPT-3 resolvía un 0%. Para 2024, Claude 3.5 Sonnet llegaba al 92% — y el problema de fondo es que HumanEval mide funciones aisladas y cortas, no ingeniería de software real.

El campo se movió a SWE-bench, publicado por Princeton y la Universidad de Chicago en octubre de 20235: 2.294 problemas sacados de issues y pull requests reales de 12 repositorios Python populares — el modelo tiene que editar el repo entero y su parche se valida ejecutando los tests reales de ese proyecto. En el paper original, el mejor modelo (Claude 2) resolvía un 1,96%. SWE-bench Verified, publicado el 13 de agosto de 2024 por OpenAI junto con los autores originales6, es un subconjunto de 500 tareas revisadas por desarrolladores humanos para corregir tests mal calibrados del original. Se ha convertido en la métrica de referencia para posicionar "agentes de código" precisamente porque mide tareas realistas de varios archivos, no ejercicios de libro de texto.

ARC-AGI y ARC-AGI-2

François Chollet (investigador de Google AI y creador de Keras) publicó en 2019 el paper "On the Measure of Intelligence"7, del que salió ARC-AGI: rompecabezas de rejillas de colores donde hay que inferir una regla de transformación completamente nueva a partir de unos pocos ejemplos. Está diseñado a propósito para resistir la memorización — cada tarea exige una regla nunca vista, no conocimiento almacenado, así que los LLM tradicionales (fuertes en conocimiento, débiles en razonamiento novedoso) lo hacían fatal mientras que una persona con inteligencia fluida normal lo resuelve sin esfuerzo. ARC-AGI-2, publicado en mayo de 20258, sube la dificultad para la IA manteniendo una dificultad parecida para humanos (que en promedio individual rondan el 66%).

MATH, AIME y FrontierMath

El dataset MATH lo publicó Hendrycks en 20219: 12.500 problemas de matemáticas de competición con solución paso a paso. Se saturó también — DeepSeek R1 llegó a 97,3% en la variante MATH-500 en enero de 2025. El campo se movió a usar los exámenes AIME (American Invitational Mathematics Examination) reales, año a año, porque cada edición trae problemas nunca vistos en el entrenamiento. Pero incluso el AIME se está acercando a la saturación con los modelos de razonamiento actuales, así que la frontera se ha desplazado otra vez, ahora a FrontierMath, de Epoch AI (anunciado el 8 de noviembre de 202410): problemas de matemática avanzada que a matemáticos profesionales les cuesta horas o días resolver. En su lanzamiento, ni GPT-4o ni Gemini 1.5 Pro pasaban del 2%.

FrontierMath tiene además una anécdota que vale la pena contar: el mismo día que OpenAI presentó o3 (20 de diciembre de 2024), Epoch AI reveló que OpenAI había financiado la creación del benchmark y tenía acceso temprano a los problemas y sus soluciones — sin que los matemáticos que los habían escrito lo supieran11. No invalida el benchmark, pero es un recordatorio de que hasta las pruebas "independientes" pueden tener financiación con conflicto de interés de por medio.

Chatbot Arena / Arena

Lanzado en mayo de 2023 por investigadores académicos como LMSYS Chatbot Arena (paper formal en 2024)12: usuarios anónimos mandan un prompt, reciben respuesta de dos modelos anónimos y votan cuál prefieren; esos votos se convierten en un rating tipo Elo que se actualiza dinámicamente. Es un animal distinto a todo lo anterior — no mide exactitud verificable, mide preferencia humana subjetiva en uso real. El proyecto se independizó como empresa en 2024 (LMArena), levantó 100 millones de dólares en mayo de 2025, y se rebautizó de nuevo como simplemente "Arena" el 28 de enero de 202613.

Es también la única tabla de "quién va ganando ahora mismo" que pude verificar en vivo contra la fuente oficial (el resto de leaderboards de 2026 están renderizadas en JavaScript y no las pude extraer directamente). A fecha del 21 de agosto de 2026, con más de 7,9 millones de votos sobre 394 modelos, el top eran modelos de Anthropic — Claude Fable 5 en primer puesto — con Anthropic ocupando 6 de los 10 primeros puestos14.

Otros bancos de prueba que están naciendo ahora

Humanity's Last Exam (HLE): pese al nombre, es real, no marketing — lo crearon conjuntamente el Center for AI Safety y Scale AI: 2.500 preguntas de más de 100 materias, escritas por casi 1.000 expertos de más de 500 instituciones en 50 países. Dan Hendrycks (director del CAIS) dijo que se inspiró en una conversación con Elon Musk, que consideraba que benchmarks como MMLU ya eran demasiado fáciles15. En su presentación, ni los mejores modelos pasaban del 10%.

También están ganando peso los benchmarks pensados específicamente para agentes que usan herramientas — Terminal-Bench (uso de terminal), TAU-bench (uso de herramientas), y el más reciente ARC-AGI-3, orientado a entornos interactivos en vez de rompecabezas estáticos. Aparecen ya de forma habitual en los anuncios de 2025-2026 de los tres grandes laboratorios, junto a SWE-bench Verified — la señal de que la industria ha pasado de medir "responde bien a una pregunta" a medir "termina un trabajo de verdad".

Estado actual — con las reservas correspondientes

La tabla de Arena de más arriba es, hasta donde pude verificar, el dato más fiable de "quién va ganando hoy" porque sale directamente de la fuente. Para SWE-bench Verified, ARC-AGI-2 y GPQA Diamond, en cambio, las cifras más recientes de este artículo (Claude Fable 5, GPT-5.6 Sol, Claude Opus 5) proceden de agregadores independientes como BenchLM.ai o vals.ai, no de las tablas oficiales de swebench.com o arcprize.org — sus páginas están renderizadas en JavaScript y no pude confirmar los números en vivo contra la fuente primaria. Las he incluido igualmente porque son la mejor información disponible a día de hoy, pero van marcadas con un asterisco tanto en el gráfico como en las comparativas, y conviene tratarlas como una estimación razonable, no como un hecho verificado al mismo nivel que un anuncio oficial de laboratorio.

Lo que sí parece un patrón sólido a lo largo de los cuatro años que cubre este artículo: cada benchmark nuevo dura entre uno y dos años antes de saturarse, y la sustitución casi siempre viene acompañada de una caída brusca y visible en los resultados de los mismos modelos que antes "dominaban" la prueba anterior — la señal más clara de que el progreso es real, no solo optimización para el examen.

Fuentes

  1. Hendrycks et al., "Measuring Massive Multitask Language Understanding" (ICLR 2021). en.wikipedia.org
  2. TIGER-AI-Lab, MMLU-Pro (arXiv:2406.01574, NeurIPS 2024). arxiv.org · github.com
  3. Rein et al., "GPQA: A Graduate-Level Google-Proof Q&A Benchmark" (arXiv:2311.12022). arxiv.org
  4. Chen et al. (OpenAI), "Evaluating Large Language Models Trained on Code" (arXiv:2107.03374). arxiv.org
  5. Jimenez et al. (Princeton/Universidad de Chicago), "SWE-bench" (arXiv:2310.06770, ICLR 2024). arxiv.org
  6. OpenAI, "Introducing SWE-bench Verified". openai.com
  7. François Chollet, "On the Measure of Intelligence" + ARC Prize. arcprize.org
  8. ARC-AGI-2 (arXiv:2505.11831). arxiv.org
  9. Hendrycks et al., "Measuring Mathematical Problem Solving With the MATH Dataset" (NeurIPS 2021). neurips.cc
  10. Epoch AI, FrontierMath. epoch.ai
  11. TechCrunch, sobre la financiación de OpenAI a FrontierMath. techcrunch.com
  12. Chiang et al., "Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference" (arXiv:2403.04132) + blog original LMSYS. arxiv.org · lmsys.org
  13. Wikipedia, "LMArena" (historial de financiación y rebranding a Arena). en.wikipedia.org
  14. Arena, leaderboard de texto en vivo (consultado 21 agosto 2026). arena.ai
  15. Wikipedia, "Humanity's Last Exam" + Scale AI. en.wikipedia.org · scale.com