En el competitivo panorama de la inteligencia artificial, cada nuevo lanzamiento es analizado con lupa. Recientemente, el modelo GLM-5.3 de Z.ai ha captado la atención al obtener una puntuación de 60 en el Índice de Inteligencia de Artificial Analysis, un evaluador independiente. Este resultado lo sitúa al mismo nivel que Kimi K3 de Moonshot AI, y a solo tres puntos de Claude Opus 5 de Anthropic, que actualmente lidera la clasificación con 63 puntos.
Este logro es significativo, especialmente porque GLM-5.3 se posiciona muy por encima de la mediana de 35 puntos entre los 181 modelos de su clase, ocupando el octavo puesto general. Lo más interesante de este modelo es su origen: GLM-5.3 utiliza el mismo modelo base que su predecesor, GLM-5.2. Todas las mejoras de capacidad provienen de un proceso de post-entrenamiento intensivo, en lugar de una nueva fase de pre-entrenamiento. Esto demuestra la eficacia de optimizar modelos existentes a través de técnicas avanzadas de aprendizaje.
El camino hacia el rendimiento de GLM-5.3
Z.ai ha detallado que el desarrollo de GLM-5.3 implicó un mes de escalado de aprendizaje por refuerzo en entornos de tareas de horizonte largo. Esto significa que se utilizaron más entornos, tareas más diversas y mayor capacidad computacional, todo sobre la misma pila de entrenamiento que se construyó para GLM-5.2. Este enfoque ha permitido mejoras sustanciales en benchmarks específicos:
- Terminal-Bench 3.0: de 4.6 a 28.3
- DeepSWE v1.1: de 46.2 a 66.9
La compañía también ha documentado una serie de resultados en codificación, ciberseguridad y benchmarks de agentes, comparándose con modelos como Kimi K3, Claude Opus 4.8, Claude Fable 5 y GPT-5.6 Sol. Estos datos internos, aunque valiosos, adquieren una mayor credibilidad al ser corroborados por evaluaciones independientes como la de Artificial Analysis.
La evaluación de Artificial Analysis es crucial porque ejecuta su propia suite de pruebas, ofreciendo una perspectiva imparcial sobre el rendimiento del modelo. Su Índice de Inteligencia v4.1.1 agrega nueve evaluaciones que abarcan desde tareas de trabajo del mundo real hasta razonamiento científico y fiabilidad del conocimiento.
GLM-5.3 en la tabla de clasificación y su propuesta de valor
La paridad con Kimi K3 es, sin duda, la comparación más destacada. Kimi K3, lanzado en julio de 2026, también obtuvo 60 puntos en el índice y ha sido el modelo de código abierto mejor clasificado en Artificial Analysis. GLM-5.3, aunque actualmente propietario y con 753 mil millones de parámetros, comparte ahora esta puntuación, lo que lo posiciona como un competidor formidable.
A pesar de la cercanía en rendimiento, existe una diferencia clave: el precio. GLM-5.3 es significativamente más económico. Mientras que el costo por millón de tokens de entrada es de $1.40 y el de salida de $4.40 en la API de Z.ai, Kimi K3 cuesta $3.00 y $15.00 respectivamente en la de Moonshot. Esto se traduce en un costo por tarea de $0.68 para GLM-5.3, frente a $0.84 para Kimi K3 y $2.34 para Claude Opus 5. Así, GLM-5.3 logra su puntuación con el menor coste por tarea de los tres, aunque es el más "verboso", generando 170 millones de tokens de salida en la suite de evaluación.
Disponibilidad y futuro
GLM-5.3 ya está disponible a través de la API de Z.ai y se ha implementado para todos los suscriptores del plan de codificación GLM. Es importante destacar que el modelo requiere que la función de "pensamiento" esté habilitada, con tres niveles de esfuerzo, y Z.ai advierte que las aplicaciones que aún lo llamen con el pensamiento deshabilitado fallarán hasta que se migren.
El siguiente paso clave será la liberación de los pesos del modelo. Z.ai se ha comprometido a hacerlo dos semanas después de su lanzamiento, una vez que se completen las evaluaciones de seguridad y el endurecimiento. Esto convertiría a GLM-5.3 en una opción de código abierto a la par de Kimi K3, pero con un precio por token aproximadamente la mitad. Este movimiento podría democratizar aún más el acceso a modelos de IA de alto rendimiento, impulsando la innovación en la comunidad.