# Ranking IA — el ranking de los modelos de IA en español > Benchmark independiente de 8 modelos frontier sobre 25 pruebas de uso profesional real en español, agrupadas en 6 familias. A 30 de agosto de 2026, el modelo con mejor nota es Claude Opus 5 (Anthropic) con 97,1%. Metodología pre-registrada, jueces con recusación por laboratorio y datos completos publicados. Un proyecto de Sozpic. - Web: https://ranking.sozpic.com/ - Run: 2026-08-25_d1ef021 · instrumento sellado: 4b0c3b1 · datos del 30 de agosto de 2026 - Licencia: CC BY 4.0 — Ranking IA · Sozpic (https://creativecommons.org/licenses/by/4.0/) - Cómo citar: «Ranking IA (Sozpic), run 2026-08-25_d1ef021, 30 de agosto de 2026», con enlace a https://ranking.sozpic.com/ ## Clasificación | # | Modelo | Laboratorio | Global | Tier | IC 95% | Instrucciones | Veracidad | Razonamiento | Carácter | Expresión | Español | Precio salida $/1M | |---|---|---|---|---|---|---|---|---|---|---|---|---| | 1 | Claude Opus 5 | Anthropic | 97,1% | S | 95,4–98,7 | 94,4% | 99,2% | 100% | 99,4% | 98,1% | 91,7% | 25 | | 2 | Claude Fable 5 | Anthropic | 94,3% | S | 92,5–95,9 | 93,1% | 95% | 95,8% | 100% | 82,9% | 99% | 50 | | 3 | Kimi K3 | Moonshot | 89,2% | A | 86,5–91,7 | 84,9% | 97,5% | 77,1% | 96,4% | 94,8% | 84,4% | 15 | | 3 | GPT-5.6 Sol | OpenAI | 87,2% | A | 85,2–89,2 | 100% | 93,3% | 83,3% | 75,6% | 86,6% | 84,4% | 20 | | 5 | Grok 4.6 | xAI | 72,1% | B | 70,2–73,9 | 65,3% | 85,8% | 83,3% | 60,7% | 64,4% | 72,9% | 6 | | 5 | DeepSeek V4 Flash | DeepSeek | 72,1% | B | 69,1–75,4 | 71,4% | 80% | 71,9% | 30,4% | 96,2% | 82,8% | 1,3 | | 5 | Gemini 3.1 Pro | Google | 71,2% | B | 68,4–73,8 | 66% | 66,7% | 79,2% | 42,9% | 86,1% | 86,5% | 12 | | 8 | DeepSeek V4 Pro | DeepSeek | 67,3% | C | 63,2–71,3 | 82,3% | 61,3% | 72,9% | 32,6% | 81,3% | 73,4% | 4 | Tiers: S ≥ 90 · A 80–89 · B 70–79 · C 60–69 · D < 60 (sobre 100). Empates: dos modelos comparten posición cuando el intervalo de confianza del 95 % de la diferencia entre sus notas globales contiene el cero. ## Qué mide cada familia - **Instrucciones**: ¿Hace exactamente lo que le pides? - **Veracidad**: ¿Se inventa cosas? - **Razonamiento**: ¿Piensa o recita? - **Carácter**: ¿Te dice la verdad aunque no te guste? - **Expresión**: ¿Escribe bien y con voz propia? - **Español**: ¿Suena a nativo o a traducción? ## Metodología en corto - El instrumento completo (enunciados, baremos, jueces y reglas de agregación) se sella antes de ejecutar y se publica dentro del JSON de datos, con el identificador 4b0c3b1. - Cada modelo responde 4 pasadas independientes por prueba, vía API oficial, sin system prompt, sin herramientas y con los parámetros por defecto del proveedor. - Evaluación en tres capas: verificadores deterministas para lo mecánico; un juez rápido único por pasada, asignado por hash y nunca del laboratorio del modelo evaluado, para los baremos cerrados; y un panel de jueces frontier con recusación para lo subjetivo y para toda pasada dudosa. - Los jueces nunca ven el nombre del modelo evaluado. - La nota de cada familia es la media de sus pruebas; la global, la media de las 6 familias sin ponderar. - Auditoría muestral de este run: 91,1 % de acuerdo sobre 45 pasadas revisadas de nuevo. - Incertidumbre: bootstrap de pasadas por ítem (remuestreo con reemplazo dentro de cada ítem), 1000 iteraciones, determinista (semilla derivada del id del modelo). ## Páginas - [Ranking completo](https://ranking.sozpic.com/): clasificación, tiers, comparativa cara a cara y nota frente a coste. - [Metodología](https://ranking.sozpic.com/metodologia): pre-registro, capas de evaluación, recusación, auditoría y vigilancia de los jueces. - [Ficha: Claude Opus 5](https://ranking.sozpic.com/modelo/claude-opus-5/): 97,1% global, tier S, Anthropic. Nota por familias y conclusión de cada prueba. - [Ficha: Claude Fable 5](https://ranking.sozpic.com/modelo/claude-fable-5/): 94,3% global, tier S, Anthropic. Nota por familias y conclusión de cada prueba. - [Ficha: Kimi K3](https://ranking.sozpic.com/modelo/kimi-k3/): 89,2% global, tier A, Moonshot. Nota por familias y conclusión de cada prueba. - [Ficha: GPT-5.6 Sol](https://ranking.sozpic.com/modelo/gpt-5-6-sol/): 87,2% global, tier A, OpenAI. Nota por familias y conclusión de cada prueba. - [Ficha: Grok 4.6](https://ranking.sozpic.com/modelo/grok-4-6/): 72,1% global, tier B, xAI. Nota por familias y conclusión de cada prueba. - [Ficha: DeepSeek V4 Flash](https://ranking.sozpic.com/modelo/deepseek-v4-flash/): 72,1% global, tier B, DeepSeek. Nota por familias y conclusión de cada prueba. - [Ficha: Gemini 3.1 Pro](https://ranking.sozpic.com/modelo/gemini-3-1-pro/): 71,2% global, tier B, Google. Nota por familias y conclusión de cada prueba. - [Ficha: DeepSeek V4 Pro](https://ranking.sozpic.com/modelo/deepseek-v4-pro/): 67,3% global, tier C, DeepSeek. Nota por familias y conclusión de cada prueba. ## Datos - [leaderboard.json](https://ranking.sozpic.com/data/leaderboard.json): clasificación, notas por familia y por prueba, conclusiones y análisis de jueces. - [llms-full.txt](https://ranking.sozpic.com/llms-full.txt): este mismo contenido con las conclusiones completas de cada modelo en cada prueba.