Qué contiene esta página
Esta página reúne, por categoría, las puntuaciones de los principales LLM en los benchmarks más seguidos hasta la fecha. Cada fila de cada tabla lleva su fuente, la fecha en la que se midió el valor y una insignia que indica si la cifra procede del editor del modelo o de una medición independiente. Última revisión global: 28 de julio de 2026.
Ninguna cifra se copia en el texto de esta página: todas viven en las tablas, que siguen siendo la única fuente actualizada. El texto explica qué mide realmente cada familia de benchmarks y dónde encuentra sus límites.
Editor o independiente: la distinción que importa
Antes de leer las tablas
Una puntuación publicada por el editor de un modelo, en una system card o en un artículo de anuncio, no ha sido verificada por nadie más. Una puntuación publicada por un tercero que no vende ninguno de los modelos comparados (Artificial Analysis, Arena, el mantenedor oficial de un benchmark) se midió en condiciones que el editor no controla. Ambas tienen su utilidad, pero no pesan lo mismo.
Cada fila lleva por tanto una insignia Editor o Independiente, junto con el nombre del publisher. Un mismo modelo puede aparecer dos veces en el mismo benchmark, una vez bajo cada estatus: no es una redundancia, es la información más útil de la página. Antes de comparar dos filas entre sí, comprueba primero que llevan la misma insignia.
Codificación y agéntico
Estos benchmarks hacen que el modelo resuelva tareas de desarrollo reales: corregir un error en un repositorio, conseguir que pase una batería de pruebas, ejecutar comandos en una terminal. El harness que envuelve al modelo, es decir, el agente que orquesta sus llamadas a herramientas, influye en el resultado tanto como el propio modelo. Un mismo modelo probado con dos harnesses distintos no produce la misma puntuación: la columna de notas registra el agente usado (agent=) cuando la fuente lo documenta.
La clasificación oficial de SWE-bench Verified no ha recibido ninguna nueva entrada desde febrero de 2026. Las puntuaciones más recientes de esta categoría proceden por tanto solo de las cartas de los editores, no de un envío verificado en esa clasificación concreta.
| Modelo | Proveedor | Licencia | Puntuación | Estado | Fuente | Registrado el |
|---|---|---|---|---|---|---|
| Claude Fable 5agent=Claude Code · ci=±1.2 · submitted=2026-06-07 | Anthropic | Propietaria | 83,8 % | IndependienteTerminal-Bench | tbench.ai Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva | |
| GPT-5.5agent=Codex · ci=±1.1 · submitted=2026-05-01 | OpenAI | Propietaria | 83,1 % | IndependienteTerminal-Bench | tbench.ai Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva | |
| Claude Opus 4.8agent=Claude Code · ci=±1.3 · submitted=2026-07-09 | Anthropic | Propietaria | 78,9 % | IndependienteTerminal-Bench | tbench.ai Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva | |
| GPT-5.6 Terraagent=Codex · ci=±1.3 · submitted=2026-07-11 | OpenAI | Propietaria | 78,4 % | IndependienteTerminal-Bench | tbench.ai Abrir la fuente de la puntuación de GPT-5.6 Terra en una pestaña nueva | |
| Muse Spark 1.1agent=mini-SWE-agent · ci=±1.2 · submitted=2026-07-09 | Meta | No documentada | 76,2 % | IndependienteTerminal-Bench | tbench.ai Abrir la fuente de la puntuación de Muse Spark 1.1 en una pestaña nueva | |
| GPT-5.6 Lunaagent=Codex · ci=±1.3 · submitted=2026-07-11 | OpenAI | Propietaria | 75,7 % | IndependienteTerminal-Bench | tbench.ai Abrir la fuente de la puntuación de GPT-5.6 Luna en una pestaña nueva | |
| Claude Sonnet 5agent=Claude Code · ci=±1.6 · submitted=2026-07-09 | Anthropic | Propietaria | 74,6 % | IndependienteTerminal-Bench | tbench.ai Abrir la fuente de la puntuación de Claude Sonnet 5 en una pestaña nueva | |
| Gemini 3 Proagent=Terminus 2 · ci=±1.3 · submitted=2026-05-01 | Propietaria | 73,9 % | IndependienteTerminal-Bench | tbench.ai Abrir la fuente de la puntuación de Gemini 3 Pro en una pestaña nueva | ||
| Claude Opus 4.7agent=Claude Code · ci=±1.4 · submitted=2026-05-01 | Anthropic | Propietaria | 68,9 % | IndependienteTerminal-Bench | tbench.ai Abrir la fuente de la puntuación de Claude Opus 4.7 en una pestaña nueva | |
| Gemini 3.1 Proagent=Gemini CLI · ci=±1.7 · submitted=2026-05-05 | Propietaria | 65,8 % | IndependienteTerminal-Bench | tbench.ai Abrir la fuente de la puntuación de Gemini 3.1 Pro en una pestaña nueva |
| Modelo | Proveedor | Licencia | Puntuación | Estado | Fuente | Registrado el |
|---|---|---|---|---|---|---|
| GPT-5.6 Soleffort=xhigh · agent=Terminus 2 · runs=3 | OpenAI | Propietaria | 89,5 % | IndependienteArtificial Analysis | artificialanalysis.ai Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva | |
| Claude Opus 5effort=max · mode=adaptive · agent=Terminus 2 · runs=3 | Anthropic | Propietaria | 89,1 % | IndependienteArtificial Analysis | artificialanalysis.ai Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva |
| Modelo | Proveedor | Licencia | Puntuación | Estado | Fuente | Registrado el |
|---|---|---|---|---|---|---|
| Claude Opus 5effort=max · runs=5 · n=500 | Anthropic | Propietaria | 96 % | ProveedorAnthropic | www-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva | |
| Claude Opus 4.5effort=high · agent=mini-SWE-agent | Anthropic | Propietaria | 76,8 % | IndependienteSWE-bench | swebench.com Abrir la fuente de la puntuación de Claude Opus 4.5 en una pestaña nueva | |
| Gemini 3 Flasheffort=high · agent=mini-SWE-agent | Propietaria | 75,8 % | IndependienteSWE-bench | swebench.com Abrir la fuente de la puntuación de Gemini 3 Flash en una pestaña nueva | ||
| Claude Opus 4.6agent=mini-SWE-agent | Anthropic | Propietaria | 75,6 % | IndependienteSWE-bench | swebench.com Abrir la fuente de la puntuación de Claude Opus 4.6 en una pestaña nueva | |
| GPT-5.2 Codexagent=mini-SWE-agent | OpenAI | Propietaria | 72,8 % | IndependienteSWE-bench | swebench.com Abrir la fuente de la puntuación de GPT-5.2 Codex en una pestaña nueva | |
| Claude Sonnet 4.5effort=high · agent=mini-SWE-agent | Anthropic | Propietaria | 71,4 % | IndependienteSWE-bench | swebench.com Abrir la fuente de la puntuación de Claude Sonnet 4.5 en una pestaña nueva | |
| Gemini 3 Proagent=mini-SWE-agent | Propietaria | 69,6 % | IndependienteSWE-bench | swebench.com Abrir la fuente de la puntuación de Gemini 3 Pro en una pestaña nueva |
Razonamiento
GPQA Diamond y Humanity's Last Exam evalúan conocimientos de nivel experto sobre preguntas de respuesta cerrada, sin acceso a herramientas externas. GPQA Diamond está cerca de la saturación: los modelos más recientes se mantienen a menos de un punto de diferencia, lo que ya no distingue gran cosa entre ellos. Humanity's Last Exam sigue siendo más discriminante, pero su puntuación depende mucho del alcance elegido (solo texto o el conjunto completo) y del modelo usado para juzgar las respuestas abiertas, dos parámetros que la columna de notas precisa cuando se conocen.
| Modelo | Proveedor | Licencia | Puntuación | Estado | Fuente | Registrado el |
|---|---|---|---|---|---|---|
| Claude Fable 5tools=off | Anthropic | Propietaria | 56,5 % | ProveedorAnthropic | www-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva | |
| Claude Opus 5tools=off · effort=max · runs=5 | Anthropic | Propietaria | 56,3 % | ProveedorAnthropic | www-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva | |
| Claude Fable 5effort=max · fallback=Claude Opus 4.8 · subset=text-only · n=2158 | Anthropic | Propietaria | 53,3 % | IndependienteArtificial Analysis | artificialanalysis.ai Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva | |
| Claude Opus 5effort=max · mode=adaptive · subset=text-only · n=2158 | Anthropic | Propietaria | 52,6 % | IndependienteArtificial Analysis | artificialanalysis.ai Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva | |
| Claude Opus 4.8tools=off | Anthropic | Propietaria | 49,8 % | ProveedorAnthropic | www-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva | |
| GPT-5.6 Soltools=off · dataset=full | OpenAI | Propietaria | 44,5 % | ProveedorMoonshot AI | huggingface.co Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva | |
| Kimi K3tools=off · dataset=full · effort=max | Moonshot AI | Kimi K3 License | 43,5 % | ProveedorMoonshot AI | huggingface.co Abrir la fuente de la puntuación de Kimi K3 en una pestaña nueva | |
| GPT-5.5tools=off · dataset=full | OpenAI | Propietaria | 41,4 % | ProveedorMoonshot AI | huggingface.co Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva | |
| GLM-5.2tools=off · subset=text-only | Z.ai | MIT | 40,5 % | ProveedorZ.ai | huggingface.co Abrir la fuente de la puntuación de GLM-5.2 en una pestaña nueva |
Agentes y herramientas
GDPval-AA, OSWorld y BrowseComp miden capacidades más cercanas a un uso real: completar una tarea profesional puntuada por preferencia humana en GDPval-AA, manejar una interfaz gráfica de ordenador en OSWorld, navegar y buscar en la web para localizar una información precisa en BrowseComp. Estos benchmarks agénticos son más sensibles a los rechazos de seguridad y a las conmutaciones automáticas hacia otro modelo que una prueba de respuesta única: un rechazo o una conmutación cuenta como un fallo en la media final, igual que un error del modelo.
Contexto largo
AA-LCR y OpenAI MRCR comprueban la capacidad de un modelo para localizar y razonar sobre información escondida en una ventana de contexto muy larga, en lugar de razonar en abstracto. Una puntuación alta aquí no dice nada sobre la calidad de razonamiento del mismo modelo en un contexto corto, y viceversa. Pocos editores publican este tipo de cifra para toda su gama, lo que explica tablas más cortas que en las demás categorías.
| Modelo | Proveedor | Licencia | Puntuación | Estado | Fuente | Registrado el |
|---|---|---|---|---|---|---|
| GPT-5.2 Codexeffort=xhigh | OpenAI | Propietaria | 75,7 % | IndependienteArtificial Analysis | artificialanalysis.ai Abrir la fuente de la puntuación de GPT-5.2 Codex en una pestaña nueva | |
| GPT-5effort=high | OpenAI | Propietaria | 75,6 % | IndependienteArtificial Analysis | artificialanalysis.ai Abrir la fuente de la puntuación de GPT-5 en una pestaña nueva | |
| GPT-5.1effort=high | OpenAI | Propietaria | 75 % | IndependienteArtificial Analysis | artificialanalysis.ai Abrir la fuente de la puntuación de GPT-5.1 en una pestaña nueva |
| Modelo | Proveedor | Licencia | Puntuación | Estado | Fuente | Registrado el |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | OpenAI | Propietaria | 91,5 % | ProveedorOpenAI | openai.com Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva | |
| GPT-5.6 Terra | OpenAI | Propietaria | 89,6 % | ProveedorOpenAI | openai.com Abrir la fuente de la puntuación de GPT-5.6 Terra en una pestaña nueva | |
| GPT-5.5 | OpenAI | Propietaria | 81,5 % | ProveedorOpenAI | openai.com Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva | |
| GPT-5.6 Luna | OpenAI | Propietaria | 41,3 % | ProveedorOpenAI | openai.com Abrir la fuente de la puntuación de GPT-5.6 Luna en una pestaña nueva |
Preferencia humana
Text Arena y WebDev Arena clasifican los modelos mediante una puntuación Elo construida a partir de votos de preferencia humana a ciegas, no mediante una evaluación automática. El intervalo de confianza y el número de votos importan aquí más que la posición mostrada: en estas clasificaciones, varios modelos consecutivos suelen solaparse estadísticamente, y un modelo añadido recientemente puede mostrar una posición favorable con un volumen de votos aún reducido. La columna de notas recoge el intervalo de confianza (ci=) y el número de votos (votes=) cuando la fuente los publica.
| Modelo | Proveedor | Licencia | Puntuación | Estado | Fuente | Registrado el |
|---|---|---|---|---|---|---|
| Claude Opus 5effort=max · votes=686 | Anthropic | Propietaria | 1725 | IndependienteArena | arena.ai Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva | |
| Kimi K3effort=max · votes=3777 | Moonshot AI | Kimi K3 License | 1682 | IndependienteArena | arena.ai Abrir la fuente de la puntuación de Kimi K3 en una pestaña nueva | |
| Claude Fable 5votes=5801 | Anthropic | Propietaria | 1629 | IndependienteArena | arena.ai Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva | |
| GPT-5.6 Soleffort=xhigh · votes=5340 | OpenAI | Propietaria | 1623 | IndependienteArena | arena.ai Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva | |
| GLM-5.2effort=max · votes=5779 | Z.ai | MIT | 1587 | IndependienteArena | arena.ai Abrir la fuente de la puntuación de GLM-5.2 en una pestaña nueva | |
| Claude Opus 4.8mode=thinking · votes=8321 | Anthropic | Propietaria | 1568 | IndependienteArena | arena.ai Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva | |
| Claude Opus 4.7votes=11138 | Anthropic | Propietaria | 1560 | IndependienteArena | arena.ai Abrir la fuente de la puntuación de Claude Opus 4.7 en una pestaña nueva |
Índices compuestos
El Artificial Analysis Intelligence Index agrega varios benchmarks en una sola puntuación, ponderada según una metodología pública. Un índice compuesto simplifica la comparación pero oculta las diferencias entre categorías: dos modelos con un índice cercano pueden tener perfiles de fortalezas muy distintos según el subíndice que se mire. Da un orden de magnitud, no un veredicto.
Metodología y límites
Esta página no cubre todas las trampas de lectura de una puntuación: el efecto del nivel de esfuerzo de razonamiento, la contaminación de los conjuntos de prueba, las contradicciones entre el texto de un anuncio y su propia tabla. El artículo Leer un benchmark de LLM sin que te la cuelen desarrolla nueve de estas trampas a partir de casos verificados. Las puntuaciones de esta página se actualizan periódicamente siguiendo el procedimiento de revisión del equipo editorial; la fecha de la última revisión global aparece en la cabecera de la página.
Próximos pasos
- Leer un benchmark de LLM sin que te la cuelen: la guía de supervivencia: las trampas metodológicas detrás de las cifras de esta página
- Kimi K3: el primer modelo abierto de clase 3T, y lo que cambia de verdad: un caso concreto donde entran en juego varios de estos benchmarks
- Opus 5, GPT-5.6, Kimi K3: tres lanzamientos, tres clasificaciones que se contradicen: una lectura comparativa de las puntuaciones más discutidas de esta página
- Coste real por tarea: lo que el precio por token no te dice: poner estas puntuaciones en perspectiva frente a lo que cuestan de verdad en el uso diario