Ir al contenido principal
Traducción automática en fase de mejora, sin revisión nativa todavía. Informa de errores en GitHub (se abre en una pestaña nueva).

Benchmarks de LLM: tablas de referencia por categoría

Terminal-Bench, SWE-bench, GPQA Diamond, Arena: las puntuaciones de los principales LLM organizadas por categoría, con la fuente, el estatus de editor o independiente y la fecha de cada medición.

  • Referencia
  • Herramientas
Publicado el

Qué contiene esta página

Esta página reúne, por categoría, las puntuaciones de los principales LLM en los benchmarks más seguidos hasta la fecha. Cada fila de cada tabla lleva su fuente, la fecha en la que se midió el valor y una insignia que indica si la cifra procede del editor del modelo o de una medición independiente. Última revisión global: 28 de julio de 2026.

Ninguna cifra se copia en el texto de esta página: todas viven en las tablas, que siguen siendo la única fuente actualizada. El texto explica qué mide realmente cada familia de benchmarks y dónde encuentra sus límites.

Editor o independiente: la distinción que importa

Cada fila lleva por tanto una insignia Editor o Independiente, junto con el nombre del publisher. Un mismo modelo puede aparecer dos veces en el mismo benchmark, una vez bajo cada estatus: no es una redundancia, es la información más útil de la página. Antes de comparar dos filas entre sí, comprueba primero que llevan la misma insignia.

Codificación y agéntico

Estos benchmarks hacen que el modelo resuelva tareas de desarrollo reales: corregir un error en un repositorio, conseguir que pase una batería de pruebas, ejecutar comandos en una terminal. El harness que envuelve al modelo, es decir, el agente que orquesta sus llamadas a herramientas, influye en el resultado tanto como el propio modelo. Un mismo modelo probado con dos harnesses distintos no produce la misma puntuación: la columna de notas registra el agente usado (agent=) cuando la fuente lo documenta.

La clasificación oficial de SWE-bench Verified no ha recibido ninguna nueva entrada desde febrero de 2026. Las puntuaciones más recientes de esta categoría proceden por tanto solo de las cartas de los editores, no de un envío verificado en esa clasificación concreta.

Terminal-Bench 2.1
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
Claude Fable 5agent=Claude Code · ci=±1.2 · submitted=2026-06-07AnthropicPropietaria83,8 %IndependienteTerminal-Benchtbench.ai Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
GPT-5.5agent=Codex · ci=±1.1 · submitted=2026-05-01OpenAIPropietaria83,1 %IndependienteTerminal-Benchtbench.ai Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva
Claude Opus 4.8agent=Claude Code · ci=±1.3 · submitted=2026-07-09AnthropicPropietaria78,9 %IndependienteTerminal-Benchtbench.ai Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva
GPT-5.6 Terraagent=Codex · ci=±1.3 · submitted=2026-07-11OpenAIPropietaria78,4 %IndependienteTerminal-Benchtbench.ai Abrir la fuente de la puntuación de GPT-5.6 Terra en una pestaña nueva
Muse Spark 1.1agent=mini-SWE-agent · ci=±1.2 · submitted=2026-07-09MetaNo documentada76,2 %IndependienteTerminal-Benchtbench.ai Abrir la fuente de la puntuación de Muse Spark 1.1 en una pestaña nueva
GPT-5.6 Lunaagent=Codex · ci=±1.3 · submitted=2026-07-11OpenAIPropietaria75,7 %IndependienteTerminal-Benchtbench.ai Abrir la fuente de la puntuación de GPT-5.6 Luna en una pestaña nueva
Claude Sonnet 5agent=Claude Code · ci=±1.6 · submitted=2026-07-09AnthropicPropietaria74,6 %IndependienteTerminal-Benchtbench.ai Abrir la fuente de la puntuación de Claude Sonnet 5 en una pestaña nueva
Gemini 3 Proagent=Terminus 2 · ci=±1.3 · submitted=2026-05-01GooglePropietaria73,9 %IndependienteTerminal-Benchtbench.ai Abrir la fuente de la puntuación de Gemini 3 Pro en una pestaña nueva
Claude Opus 4.7agent=Claude Code · ci=±1.4 · submitted=2026-05-01AnthropicPropietaria68,9 %IndependienteTerminal-Benchtbench.ai Abrir la fuente de la puntuación de Claude Opus 4.7 en una pestaña nueva
Gemini 3.1 Proagent=Gemini CLI · ci=±1.7 · submitted=2026-05-05GooglePropietaria65,8 %IndependienteTerminal-Benchtbench.ai Abrir la fuente de la puntuación de Gemini 3.1 Pro en una pestaña nueva
Clasificación mantenida por Terminal-Bench (tbench.ai). Ver la clasificación oficial
Terminal-Bench 2.1, repetido por Artificial Analysis
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
GPT-5.6 Soleffort=xhigh · agent=Terminus 2 · runs=3OpenAIPropietaria89,5 %IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
Claude Opus 5effort=max · mode=adaptive · agent=Terminus 2 · runs=3AnthropicPropietaria89,1 %IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
Clasificación mantenida por Artificial Analysis. Ver la clasificación oficial
SWE-bench Verified
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
Claude Opus 5effort=max · runs=5 · n=500AnthropicPropietaria96 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
Claude Opus 4.5effort=high · agent=mini-SWE-agentAnthropicPropietaria76,8 %IndependienteSWE-benchswebench.com Abrir la fuente de la puntuación de Claude Opus 4.5 en una pestaña nueva
Gemini 3 Flasheffort=high · agent=mini-SWE-agentGooglePropietaria75,8 %IndependienteSWE-benchswebench.com Abrir la fuente de la puntuación de Gemini 3 Flash en una pestaña nueva
Claude Opus 4.6agent=mini-SWE-agentAnthropicPropietaria75,6 %IndependienteSWE-benchswebench.com Abrir la fuente de la puntuación de Claude Opus 4.6 en una pestaña nueva
GPT-5.2 Codexagent=mini-SWE-agentOpenAIPropietaria72,8 %IndependienteSWE-benchswebench.com Abrir la fuente de la puntuación de GPT-5.2 Codex en una pestaña nueva
Claude Sonnet 4.5effort=high · agent=mini-SWE-agentAnthropicPropietaria71,4 %IndependienteSWE-benchswebench.com Abrir la fuente de la puntuación de Claude Sonnet 4.5 en una pestaña nueva
Gemini 3 Proagent=mini-SWE-agentGooglePropietaria69,6 %IndependienteSWE-benchswebench.com Abrir la fuente de la puntuación de Gemini 3 Pro en una pestaña nueva
Clasificación mantenida por SWE-bench team. Ver la clasificación oficial
SWE-bench Pro
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
Claude Mythos 5AnthropicPropietaria80,3 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de Claude Mythos 5 en una pestaña nueva
Claude Fable 5effort=maxAnthropicPropietaria80 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
Claude Opus 5effort=max · runs=5AnthropicPropietaria79,2 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
Claude Mythos PreviewAnthropicPropietaria77,8 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de Claude Mythos Preview en una pestaña nueva
Claude Opus 4.8AnthropicPropietaria69,2 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva
GPT-5.6 SolOpenAIPropietaria64,6 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
GPT-5.6 TerraOpenAIPropietaria63,4 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Terra en una pestaña nueva
GPT-5.6 LunaOpenAIPropietaria62,7 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Luna en una pestaña nueva
GLM-5.2effort=maxZ.aiMIT62,1 %ProveedorZ.aihuggingface.co Abrir la fuente de la puntuación de GLM-5.2 en una pestaña nueva
Muse Spark 1.1split=public · ci=±3.10MetaNo documentada61,5 %IndependienteScale AIlabs.scale.com Abrir la fuente de la puntuación de Muse Spark 1.1 en una pestaña nueva
GPT-5.5OpenAIPropietaria59,4 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva
GPT-5.4split=public · effort=xhigh · ci=±3.56OpenAIPropietaria59,1 %IndependienteScale AIlabs.scale.com Abrir la fuente de la puntuación de GPT-5.4 en una pestaña nueva
Muse Sparksplit=public · ci=±3.60MetaNo documentada55 %IndependienteScale AIlabs.scale.com Abrir la fuente de la puntuación de Muse Spark en una pestaña nueva
Gemini 3.1 ProGooglePropietaria54,2 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de Gemini 3.1 Pro en una pestaña nueva
Claude Opus 4.6split=public · mode=thinking · ci=±3.61AnthropicPropietaria51,9 %IndependienteScale AIlabs.scale.com Abrir la fuente de la puntuación de Claude Opus 4.6 en una pestaña nueva
Gemini 3.1 Prosplit=public · mode=thinking · ci=±3.60GooglePropietaria46,1 %IndependienteScale AIlabs.scale.com Abrir la fuente de la puntuación de Gemini 3.1 Pro en una pestaña nueva
Clasificación mantenida por Scale AI. Ver la clasificación oficial

Razonamiento

GPQA Diamond y Humanity's Last Exam evalúan conocimientos de nivel experto sobre preguntas de respuesta cerrada, sin acceso a herramientas externas. GPQA Diamond está cerca de la saturación: los modelos más recientes se mantienen a menos de un punto de diferencia, lo que ya no distingue gran cosa entre ellos. Humanity's Last Exam sigue siendo más discriminante, pero su puntuación depende mucho del alcance elegido (solo texto o el conjunto completo) y del modelo usado para juzgar las respuestas abiertas, dos parámetros que la columna de notas precisa cuando se conocen.

GPQA Diamond
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
GPT-5.6 SolOpenAIPropietaria94,6 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
Gemini 3.1 ProGooglePropietaria94,3 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de Gemini 3.1 Pro en una pestaña nueva
Gemini 3.1 ProGooglePropietaria94,1 %IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Gemini 3.1 Pro en una pestaña nueva
GPT-5.6 Soleffort=maxOpenAIPropietaria94,1 %IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
Claude Opus 5effort=high · mode=adaptiveAnthropicPropietaria93,7 %IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
GPT-5.5OpenAIPropietaria93,6 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva
Kimi K3effort=maxMoonshot AIKimi K3 License93,5 %ProveedorMoonshot AIhuggingface.co Abrir la fuente de la puntuación de Kimi K3 en una pestaña nueva
GPT-5.6 TerraOpenAIPropietaria92,9 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Terra en una pestaña nueva
Claude Fable 5AnthropicPropietaria92,6 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
GPT-5.6 LunaOpenAIPropietaria92,3 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Luna en una pestaña nueva
Claude Opus 4.8AnthropicPropietaria92 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva
GLM-5.2effort=maxZ.aiMIT91,2 %ProveedorMoonshot AIhuggingface.co Abrir la fuente de la puntuación de GLM-5.2 en una pestaña nueva
Clasificación mantenida por Artificial Analysis. Ver la clasificación oficial
Humanity's Last Exam
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
Claude Fable 5tools=offAnthropicPropietaria56,5 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
Claude Opus 5tools=off · effort=max · runs=5AnthropicPropietaria56,3 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
Claude Fable 5effort=max · fallback=Claude Opus 4.8 · subset=text-only · n=2158AnthropicPropietaria53,3 %IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
Claude Opus 5effort=max · mode=adaptive · subset=text-only · n=2158AnthropicPropietaria52,6 %IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
Claude Opus 4.8tools=offAnthropicPropietaria49,8 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva
GPT-5.6 Soltools=off · dataset=fullOpenAIPropietaria44,5 %ProveedorMoonshot AIhuggingface.co Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
Kimi K3tools=off · dataset=full · effort=maxMoonshot AIKimi K3 License43,5 %ProveedorMoonshot AIhuggingface.co Abrir la fuente de la puntuación de Kimi K3 en una pestaña nueva
GPT-5.5tools=off · dataset=fullOpenAIPropietaria41,4 %ProveedorMoonshot AIhuggingface.co Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva
GLM-5.2tools=off · subset=text-onlyZ.aiMIT40,5 %ProveedorZ.aihuggingface.co Abrir la fuente de la puntuación de GLM-5.2 en una pestaña nueva
Clasificación mantenida por Center for AI Safety, Scale AI. Ver la clasificación oficial

Agentes y herramientas

GDPval-AA, OSWorld y BrowseComp miden capacidades más cercanas a un uso real: completar una tarea profesional puntuada por preferencia humana en GDPval-AA, manejar una interfaz gráfica de ordenador en OSWorld, navegar y buscar en la web para localizar una información precisa en BrowseComp. Estos benchmarks agénticos son más sensibles a los rechazos de seguridad y a las conmutaciones automáticas hacia otro modelo que una prueba de respuesta única: un rechazo o una conmutación cuenta como un fallo en la media final, igual que un error del modelo.

GDPval-AA v2
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
Claude Opus 5effort=maxAnthropicPropietaria1861ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
GPT-5.6 SolOpenAIPropietaria1747,8ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
Claude Fable 5AnthropicPropietaria1747ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
Kimi K3effort=maxMoonshot AIKimi K3 License1686ProveedorMoonshot AIhuggingface.co Abrir la fuente de la puntuación de Kimi K3 en una pestaña nueva
Claude Opus 4.8AnthropicPropietaria1593ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva
GPT-5.6 TerraOpenAIPropietaria1593ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Terra en una pestaña nueva
GPT-5.6 LunaOpenAIPropietaria1591,8ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Luna en una pestaña nueva
GLM-5.2effort=maxZ.aiMIT1510ProveedorMoonshot AIhuggingface.co Abrir la fuente de la puntuación de GLM-5.2 en una pestaña nueva
GPT-5.5OpenAIPropietaria1493,7ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva
Gemini 3.5 FlashGooglePropietaria1348,8ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de Gemini 3.5 Flash en una pestaña nueva
Gemini 3.1 ProGooglePropietaria962,3ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de Gemini 3.1 Pro en una pestaña nueva
Clasificación mantenida por Artificial Analysis. Ver la clasificación oficial
OSWorld 2.0
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
Claude Opus 5effort=maxAnthropicPropietaria70,6 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
Claude Fable 5AnthropicPropietaria66,1 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
GPT-5.6 SolOpenAIPropietaria62,6 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
Kimi K3effort=maxMoonshot AIKimi K3 License58,3 %ProveedorMoonshot AIhuggingface.co Abrir la fuente de la puntuación de Kimi K3 en una pestaña nueva
Claude Opus 4.8AnthropicPropietaria55,7 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva
GPT-5.6 TerraOpenAIPropietaria50,2 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Terra en una pestaña nueva
GPT-5.5OpenAIPropietaria47,5 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva
GPT-5.6 LunaOpenAIPropietaria45,6 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Luna en una pestaña nueva
Clasificación mantenida por OSWorld team, University of Hong Kong. Ver la clasificación oficial
BrowseComp
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
Kimi K3effort=max · compaction=300KMoonshot AIKimi K3 License91,2 %ProveedorMoonshot AIhuggingface.co Abrir la fuente de la puntuación de Kimi K3 en una pestaña nueva
Claude Opus 5effort=maxAnthropicPropietaria90,8 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
GPT-5.6 SolOpenAIPropietaria90,4 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
GPT-5.6 TerraOpenAIPropietaria87,5 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Terra en una pestaña nueva
Claude Fable 5AnthropicPropietaria87,4 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
Gemini 3.1 ProGooglePropietaria85,9 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de Gemini 3.1 Pro en una pestaña nueva
GPT-5.5OpenAIPropietaria84,4 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva
Claude Opus 4.8AnthropicPropietaria84,3 %ProveedorAnthropicwww-cdn.anthropic.com Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva
GPT-5.6 LunaOpenAIPropietaria83,3 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Luna en una pestaña nueva
Clasificación mantenida por OpenAI. Ver la clasificación oficial

Contexto largo

AA-LCR y OpenAI MRCR comprueban la capacidad de un modelo para localizar y razonar sobre información escondida en una ventana de contexto muy larga, en lugar de razonar en abstracto. Una puntuación alta aquí no dice nada sobre la calidad de razonamiento del mismo modelo en un contexto corto, y viceversa. Pocos editores publican este tipo de cifra para toda su gama, lo que explica tablas más cortas que en las demás categorías.

AA-LCR: razonamiento sobre contexto largo
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
GPT-5.2 Codexeffort=xhighOpenAIPropietaria75,7 %IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de GPT-5.2 Codex en una pestaña nueva
GPT-5effort=highOpenAIPropietaria75,6 %IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de GPT-5 en una pestaña nueva
GPT-5.1effort=highOpenAIPropietaria75 %IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de GPT-5.1 en una pestaña nueva
Clasificación mantenida por Artificial Analysis. Ver la clasificación oficial
OpenAI MRCR v2 (8-needle, 256K-512K)
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
GPT-5.6 SolOpenAIPropietaria91,5 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
GPT-5.6 TerraOpenAIPropietaria89,6 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Terra en una pestaña nueva
GPT-5.5OpenAIPropietaria81,5 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.5 en una pestaña nueva
GPT-5.6 LunaOpenAIPropietaria41,3 %ProveedorOpenAIopenai.com Abrir la fuente de la puntuación de GPT-5.6 Luna en una pestaña nueva
Clasificación mantenida por OpenAI. Ver la clasificación oficial

Preferencia humana

Text Arena y WebDev Arena clasifican los modelos mediante una puntuación Elo construida a partir de votos de preferencia humana a ciegas, no mediante una evaluación automática. El intervalo de confianza y el número de votos importan aquí más que la posición mostrada: en estas clasificaciones, varios modelos consecutivos suelen solaparse estadísticamente, y un modelo añadido recientemente puede mostrar una posición favorable con un volumen de votos aún reducido. La columna de notas recoge el intervalo de confianza (ci=) y el número de votos (votes=) cuando la fuente los publica.

Text Arena
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
Claude Fable 5ci=±6AnthropicPropietaria1508IndependienteArenaarena.ai Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
Claude Opus 4.6mode=thinking · ci=±4AnthropicPropietaria1505IndependienteArenaarena.ai Abrir la fuente de la puntuación de Claude Opus 4.6 en una pestaña nueva
Claude Opus 4.7mode=thinking · ci=±4AnthropicPropietaria1502IndependienteArenaarena.ai Abrir la fuente de la puntuación de Claude Opus 4.7 en una pestaña nueva
Claude Opus 5effort=max · ci=±12AnthropicPropietaria1495IndependienteArenaarena.ai Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
Muse Spark 1.1ci=±7MetaNo documentada1491IndependienteArenaarena.ai Abrir la fuente de la puntuación de Muse Spark 1.1 en una pestaña nueva
Muse Sparkci=±6MetaNo documentada1488IndependienteArenaarena.ai Abrir la fuente de la puntuación de Muse Spark en una pestaña nueva
Gemini 3.1 Proci=±3GooglePropietaria1486IndependienteArenaarena.ai Abrir la fuente de la puntuación de Gemini 3.1 Pro en una pestaña nueva
Clasificación mantenida por Arena. Ver la clasificación oficial
WebDev Arena
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
Claude Opus 5effort=max · votes=686AnthropicPropietaria1725IndependienteArenaarena.ai Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
Kimi K3effort=max · votes=3777Moonshot AIKimi K3 License1682IndependienteArenaarena.ai Abrir la fuente de la puntuación de Kimi K3 en una pestaña nueva
Claude Fable 5votes=5801AnthropicPropietaria1629IndependienteArenaarena.ai Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
GPT-5.6 Soleffort=xhigh · votes=5340OpenAIPropietaria1623IndependienteArenaarena.ai Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
GLM-5.2effort=max · votes=5779Z.aiMIT1587IndependienteArenaarena.ai Abrir la fuente de la puntuación de GLM-5.2 en una pestaña nueva
Claude Opus 4.8mode=thinking · votes=8321AnthropicPropietaria1568IndependienteArenaarena.ai Abrir la fuente de la puntuación de Claude Opus 4.8 en una pestaña nueva
Claude Opus 4.7votes=11138AnthropicPropietaria1560IndependienteArenaarena.ai Abrir la fuente de la puntuación de Claude Opus 4.7 en una pestaña nueva
Clasificación mantenida por Arena. Ver la clasificación oficial

Índices compuestos

El Artificial Analysis Intelligence Index agrega varios benchmarks en una sola puntuación, ponderada según una metodología pública. Un índice compuesto simplifica la comparación pero oculta las diferencias entre categorías: dos modelos con un índice cercano pueden tener perfiles de fortalezas muy distintos según el subíndice que se mire. Da un orden de magnitud, no un veredicto.

Artificial Analysis Intelligence Index v4.1
ModeloProveedorLicenciaPuntuaciónEstadoFuenteRegistrado el
Claude Opus 5effort=maxAnthropicPropietaria61IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Claude Opus 5 en una pestaña nueva
Claude Fable 5fallback=Claude Opus 4.8AnthropicPropietaria60IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Claude Fable 5 en una pestaña nueva
GPT-5.6 Soleffort=maxOpenAIPropietaria59IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de GPT-5.6 Sol en una pestaña nueva
Kimi K3Moonshot AIKimi K3 License57IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Kimi K3 en una pestaña nueva
GPT-5.6 Terraeffort=maxOpenAIPropietaria55IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de GPT-5.6 Terra en una pestaña nueva
Claude Sonnet 5effort=maxAnthropicPropietaria53IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Claude Sonnet 5 en una pestaña nueva
GLM-5.2effort=maxZ.aiMIT51IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de GLM-5.2 en una pestaña nueva
GPT-5.6 Lunaeffort=maxOpenAIPropietaria51IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de GPT-5.6 Luna en una pestaña nueva
Muse Spark 1.1effort=xhighMetaNo documentada51IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Muse Spark 1.1 en una pestaña nueva
Gemini 3.5 FlashGooglePropietaria50IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Gemini 3.5 Flash en una pestaña nueva
Gemini 3.6 FlashGooglePropietaria50IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Gemini 3.6 Flash en una pestaña nueva
Gemini 3.1 ProGooglePropietaria46IndependienteArtificial Analysisartificialanalysis.ai Abrir la fuente de la puntuación de Gemini 3.1 Pro en una pestaña nueva
Clasificación mantenida por Artificial Analysis. Ver la clasificación oficial

Metodología y límites

Esta página no cubre todas las trampas de lectura de una puntuación: el efecto del nivel de esfuerzo de razonamiento, la contaminación de los conjuntos de prueba, las contradicciones entre el texto de un anuncio y su propia tabla. El artículo Leer un benchmark de LLM sin que te la cuelen desarrolla nueve de estas trampas a partir de casos verificados. Las puntuaciones de esta página se actualizan periódicamente siguiendo el procedimiento de revisión del equipo editorial; la fecha de la última revisión global aparece en la cabecera de la página.

Próximos pasos