Volver a Noticias
InnovaciónAI Understanding sesión informativa

Punto de referencia de IA en conjunto: GLM-5.3 sigue a GPT-5.6 Sol en el primer intento, gana en los reintentos a la mitad del precio

Un análisis de Together AI de las implementaciones de 904 DeepSWE informa que GPT-5.6 Sol de OpenAI lidera la precisión de codificación en el primer intento, mientras que el GLM-5.3 de peso abierto lidera una vez que se permiten los reintentos, a aproximadamente la mitad del costo por intento.

Por 7 min read
Rows of dark server cabinets filled with accelerator chassis in a data-hall aisle, with fiber cables running up to overhead ladder trays.
La versión corta

Un análisis de Together AI de las implementaciones de 904 DeepSWE informa que GPT-5.6 Sol de OpenAI lidera la precisión de codificación en el primer intento, mientras que el GLM-5.3 de peso abierto lidera una vez que se permiten los reintentos, a aproximadamente la mitad del costo por intento.

que paso

Together AI publicó una evaluación comparativa de GLM-5.3 y GPT-5.6 Sol en el punto de referencia de ingeniería de software DeepSWE. Sol resolvió más tareas en el primer intento; GLM-5.3 avanzó una vez que se permitieron múltiples intentos, a aproximadamente la mitad del costo por implementación. Una cascada que ejecuta GLM-5.3 primero y escala las fallas hasta Sol obtuvo la puntuación más alta de todas.

Together AI, una empresa que vende capacidad de inferencia y GPU para modelos abiertos, publicó una publicación de blog el 21 de agosto de 2026 comparando GLM-5.3 con GPT-5.6 Sol en DeepSWE, un punto de referencia de tareas de ingeniería de software que abarca múltiples idiomas y tipos de tareas. Los autores, que figuran como Zain Hasan y Shobhit Dixit, dicen que ejecutaron las 113 tareas cuatro veces por modelo con ambos sistemas al máximo esfuerzo, para 904 implementaciones en total y 452 por lado, basándose en los registros publicados por prueba de una exportación DeepSWE v1.1 en lugar de ejecutar el arnés de un extremo a otro.

En la métrica principal, Sol lideró: 72,7% aprobado@1 contra el 69,0% de GLM-5.3, una brecha de 3,7 puntos que la propia publicación dice "se encuentra dentro de un par de desviaciones estándar" dadas las barras de error reportadas de ±2,2 y ±2,7 puntos. El orden se invierte con los reintentos. En dos intentos los dos están nivelados (81,1% para GLM-5.3, 81,0% para Sol); en cuatro, GLM-5.3 lidera entre un 87,6% y un 85,8%. La puntuación de errores como fallas apenas mueve ninguna de las cifras (68,8% y 72,3%), porque la ejecución registró solo un error de infraestructura para GLM-5.3 y dos para Sol.

El panorama de costos y velocidad se divide en sentido contrario. En conjunto, AI reporta $ 3,99 por implementación de GLM-5.3 contra $ 8,37 por Sol (2,1 veces más barato, o 17 tareas resueltas por $ 100 contra nueve) con totales de ejecución de $ 1806 y $ 3783. Sol fue el trabajador más rápido y conciso: un promedio de 19 minutos y 61 pasos por lanzamiento, y 60.000 tokens de salida, frente a los 35 minutos, 124 pasos y 80.000 tokens de salida de GLM-5.3. Sol también fue más consistente, resolviendo 61 tareas en las cuatro pruebas, frente a las 48 de GLM-5.3, y obteniendo una confiabilidad del 84,5% frente al 78,8%.

El análisis de fallas de la publicación es donde los dos divergen de manera más útil. Sol rompió el conjunto de pruebas existente de un repositorio en el 20% de sus fallas; GLM-5.3 lo hizo en el 11% y, con mayor frecuencia, casi falló con la línea de base intacta (61% contra 54%). Por dominio, la junta divide cuatro victorias cada uno, con Sol más fuerte en contrato exacto y trabajo de sistemas y GLM-5.3 más fuerte en lenguajes de consulta y configuración, componentes internos de tiempo de ejecución y reactividad con estado; El claro punto débil de GLM-5.3 es la conformidad del protocolo con un 44%, quince puntos por detrás de Sol. Por lenguaje, GLM-5.3 lidera en JavaScript (90 a 75) y Rust (70 a 60), y Sol en Python, Go y TypeScript.

Debido a que el acuerdo por tarea entre los dos es sólo de 0,43, su unión cubre 106 de las 113 tareas. La recomendación central de Together AI se deriva de esto: ejecutar GLM-5.3 primero y escalar a Sol solo cuando un conjunto de pruebas rechace la respuesta. Esa cascada, informa, resuelve el 85,9% de las tareas a 6,61 dólares cada una (por encima de Sol solo y por debajo del precio de una sola implementación de Sol) y supera a un hipotético enrutador perfecto de un solo uso con un 83,8%. La nota del método señala límites reales: los archivos de trayectoria por turno para el lote GLM-5.3 no estaban en la CDN pública, por lo que el análisis es a nivel de índice; los dominios de las tareas se clasificaron mediante un modelo de lenguaje; y la figura en cascada supone un verificador confiable e independencia entre intentos.

Lea la fuente principal: together.ai

Por qué es importante

El resultado pone un precio concreto a la brecha restante entre un modelo de codificación de peso abierto y un modelo de frontera cerrada, y muestra que la clasificación depende en gran medida de qué métrica optimice un equipo. También cuantifica una diferencia práctica de seguridad: la frecuencia con la que cada modelo supera las pruebas que ya pasaron.

Para los equipos que eligen modelos para el trabajo de codificación agente, esta es una de las contabilidades públicas más específicas de lo que compra la prima de un modelo de frontera. La afirmación no es que el modelo abierto sea mejor, sino que la diferencia en la precisión del primer intento es inferior a cuatro puntos y está dentro del ruido informado, mientras que la diferencia de precios es un factor de dos. Expresada como trabajo por dólar (17 tareas resueltas por cada 100 dólares frente a nueve), la comparación reformula la selección del modelo como una cuestión de presupuesto en lugar de una cuestión de capacidad para una gran parte de las tareas rutinarias.

El resultado también muestra cuánto depende la respuesta de la métrica. Un equipo que debe aceptar la primera salida, con un humano esperando, debería considerar decisivo el pase@1 más alto de Sol, su mayor confiabilidad y aproximadamente la mitad del tiempo del reloj de pared. Un equipo que ejecuta trabajos por lotes detrás de un conjunto de pruebas debe leer el pass@4 de GLM-5.3 y la cobertura de la misma manera. Éstas no son interpretaciones competitivas de un número; son números diferentes, y la publicación es explícita en que las ventajas de lo mejor de k solo se convierten en valor si algo puede distinguir automáticamente un parche bueno de uno malo.

La anatomía del fallo importa más que el titular para cualquiera que envíe diferencias escritas por modelos. Un modelo que no supera las pruebas anteriores en el 20% de sus fallas impone una carga de revisión diferente que uno que lo hace en el 11%, independientemente de cuál obtenga una puntuación más alta. El consejo práctico de Together AI (realizar una regresión completa alrededor de la producción de Sol antes de aceptarla) es el tipo de detalle operativo que las tablas de clasificación de referencia generalmente omiten, y cualquier equipo que ejecute su propia suite lo puede verificar.

Varias advertencias limitan hasta dónde llegan los hallazgos. Se trata de un punto de referencia único de 113 tareas medidas por un proveedor cuyo negocio se beneficia cuando los modelos abiertos parecen competitivos; no se ha reproducido de forma independiente y la publicación dice que sus propias cifras pueden diferir de otras tarjetas de puntuación públicas del mismo par. Los costos dependen de precios que pueden cambiar sin previo aviso. La publicación llama al GLM-5.3 'el retador de peso abierto' pero no indica su desarrollador, licencia o dónde se pueden obtener los pesos; AI Understanding ha informado anteriormente sobre el GLM-5.2 de código abierto de Zhipu AI, y no se establece aquí que el GLM-5.3 esté disponible en los mismos términos. No se cita ni a OpenAI ni al desarrollador de GLM, y en la fuente no aparece ninguna respuesta de ninguno de ellos.

Qué ver a continuación

Si los grupos independientes reproducen las cifras, si la brecha de precios informada sobrevive a los cambios de precios, si las ponderaciones GLM-5.3 están de hecho ampliamente disponibles y si las cascadas controladas por verificadores se convierten en un patrón de implementación estándar en lugar de un artefacto de referencia.

Lo primero que hay que observar es la replicación. Juntos, AI trabajó a partir de registros publicados por prueba y dice que los archivos de trayectoria por turno para su lote GLM-5.3 faltaban en la CDN pública cuando ejecutó el análisis, lo que mantuvo el trabajo a nivel de índice. Si se publican esos artefactos, otros investigadores pueden verificar las clasificaciones de anatomía de falla y cuasi error, que se basan en definiciones que proporciona la publicación (un cuasi error es que al menos el 80% de las nuevas pruebas pasan con la línea de base intacta) en lugar de medidas estándar de referencia.

La segunda es si el resultado de la cascada sobrevive al contacto con repositorios reales. Su cifra del 85,9% supone un verificador lo suficientemente bueno como para decidir cuándo escalar, y que el segundo intento es independiente del primero. Los proyectos con conjuntos de pruebas ligeros o lentos no tienen ese verificador, y un conjunto de pruebas que pasa un parche incorrecto convierte la cascada en una tubería de solo modelo barato. El enrutamiento controlado por verificadores se ha convertido en una categoría de producto visible este año, y este análisis brinda una afirmación comprobable sobre cuánto puede recuperar realmente.

El tercero es la durabilidad de la diferencia de precios. Tanto la relación de costos de 2,1x como los recuentos de resolución por $100 son funciones de los precios de inferencia actuales y de ejecutar ambos modelos con el máximo esfuerzo; configuraciones de esfuerzo más bajas, servicio cuantificado o un cambio de precio en cualquier lado podrían reordenar la tabla sin ningún cambio en la calidad del modelo. Lo mismo se aplica a la diferencia de velocidad, que refleja cuántos pasos da cada modelo en lugar de cualquier propiedad fija de los sistemas subyacentes.

Finalmente, observe las debilidades específicas que muestra cada lado. El 44% de GLM-5.3 en conformidad con el protocolo es el único dominio en el que la publicación informa una ventaja decisiva de Sol, y es el tipo de brecha que una publicación puntual puede cerrar o afianzar. Si las versiones posteriores de cualquiera de los modelos cambian esas divisiones por dominio y por idioma, y ​​si DeepSWE se mantiene incontaminado a medida que se usa más ampliamente, determinará durante cuánto tiempo las reglas de enrutamiento derivadas de esta ejecución seguirán siendo útiles.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe semanal

Obtenga las historias de IA que realmente importan.

Un correo electrónico útil a la semana: qué cambió en la IA, por qué es importante, además de herramientas, guías, oportunidades y formas prácticas de actuar.

Gratis · Sin spam · Darse de baja en un clic