Voltar às notícias
InovaçãoInstruções AI Understanding

Benchmark Together AI: GLM-5.3 fica atrás do GPT-5.6 Sol na primeira tentativa, vence nas novas tentativas pela metade do preço

Uma análise da Together AI de 904 lançamentos do DeepSWE relata que o GPT-5.6 Sol do OpenAI lidera em precisão de codificação na primeira tentativa, enquanto o GLM-5.3 de peso aberto lidera quando novas tentativas são permitidas, com aproximadamente metade do custo por tentativa.

Por 7 min read
Rows of dark server cabinets filled with accelerator chassis in a data-hall aisle, with fiber cables running up to overhead ladder trays.
A versão curta

Uma análise da Together AI de 904 lançamentos do DeepSWE relata que o GPT-5.6 Sol do OpenAI lidera em precisão de codificação na primeira tentativa, enquanto o GLM-5.3 de peso aberto lidera quando novas tentativas são permitidas, com aproximadamente metade do custo por tentativa.

O que aconteceu

Together AI publicou uma avaliação comparativa de GLM-5.3 e GPT-5.6 Sol no benchmark de engenharia de software DeepSWE. Sol resolveu mais tarefas na primeira tentativa; O GLM-5.3 avançou quando várias tentativas foram permitidas, com cerca de metade do custo por implementação. Uma cascata que executa o GLM-5.3 primeiro e escala as falhas para Sol obteve a pontuação mais alta de todas.

Together AI, uma empresa que vende inferência e capacidade de GPU para modelos abertos, publicou uma postagem no blog em 21 de agosto de 2026 comparando GLM-5.3 com GPT-5.6 Sol no DeepSWE, uma referência de tarefas de engenharia de software abrangendo vários idiomas e tipos de tarefas. Os autores, listados como Zain Hasan e Shobhit Dixit, dizem que executaram todas as 113 tarefas quatro vezes por modelo com ambos os sistemas em esforço máximo, para 904 implementações no total e 452 por lado, com base nos registros publicados por teste de uma exportação DeepSWE v1.1, em vez de executar o chicote de ponta a ponta.

Na métrica do título, Sol liderou: 72,7% pass@1 contra 69,0% do GLM-5.3, uma lacuna de 3,7 pontos que o próprio post diz “fica dentro de alguns desvios padrão”, dadas as barras de erro relatadas de ± 2,2 e ± 2,7 pontos. A ordem é revertida com novas tentativas. Em duas tentativas, os dois estão empatados (81,1% para GLM-5.3, 81,0% para Sol); aos quatro, o GLM-5.3 lidera de 87,6% a 85,8%. A pontuação de erros como falhas quase não altera nenhum dos números (68,8% e 72,3%), porque a execução registrou apenas um erro de infraestrutura para GLM-5.3 e dois para Sol.

O quadro de custo e velocidade se divide em outra direção. Together AI relata US$ 3,99 por implementação do GLM-5.3 contra US$ 8,37 para Sol – 2,1 vezes mais barato, ou 17 tarefas resolvidas por US$ 100 contra nove – com totais de execução de US$ 1.806 e US$ 3.783. Sol foi o trabalhador mais rápido e conciso: uma média de 19 minutos e 61 etapas por implementação e 60.000 tokens de saída, contra 35 minutos, 124 etapas e 80.000 tokens de saída do GLM-5.3. Sol também foi mais consistente, resolvendo 61 tarefas em todos os quatro testes contra 48 do GLM-5.3, e marcando 84,5% de confiabilidade contra 78,8%.

A análise de falhas do post é onde os dois divergem de forma mais útil. Sol quebrou o conjunto de testes existente de um repositório em 20% de suas falhas; O GLM-5.3 fez isso em 11% e mais frequentemente produziu um quase acidente com a linha de base intacta (61% contra 54%). Por domínio, o conselho divide quatro vitórias cada, com Sol mais forte em contrato exato e trabalho de sistemas e GLM-5.3 mais forte em linguagens de consulta e configuração, internos de tempo de execução e reatividade com estado; O claro ponto fraco do GLM-5.3 é a conformidade do protocolo em 44%, quinze pontos atrás do Sol. Por linguagem, GLM-5.3 lidera em JavaScript (90 a 75) e Rust (70 a 60), e Sol em Python, Go e TypeScript.

Como o acordo por tarefa entre os dois é de apenas 0,43, a sua união cobre 106 das 113 tarefas. A recomendação central da Together AI segue isso: execute o GLM-5.3 primeiro e escale para Sol somente quando um conjunto de testes rejeitar a resposta. Essa cascata, relata, resolve 85,9% das tarefas a US$ 6,61 cada – acima apenas do Sol e abaixo do preço de uma única implementação do Sol – e supera um hipotético roteador único perfeito em 83,8%. A nota do método sinaliza limites reais: os arquivos de trajetória por curva para o lote GLM-5.3 não estavam no CDN público, portanto a análise é em nível de índice; os domínios das tarefas foram classificados por um modelo de linguagem; e a figura da cascata pressupõe um verificador confiável e independência entre tentativas.

Leia a fonte primária: together.ai

Por que isso importa

O resultado atribui um preço concreto à lacuna restante entre um modelo de codificação de peso aberto e um modelo de fronteira fechada e mostra que a classificação depende fortemente de qual métrica uma equipe otimiza. Também quantifica uma diferença prática de segurança: a frequência com que cada modelo quebra os testes que já passaram.

Para as equipes que escolhem modelos para o trabalho de codificação de agentes, esta é uma das contas públicas mais específicas sobre o que o prêmio de um modelo de fronteira compra. A alegação não é que o modelo aberto seja melhor, mas que a diferença na precisão da primeira tentativa é inferior a quatro pontos e está dentro do ruído relatado, enquanto a diferença de preço é um fator de dois. Expressa como trabalho por dólar – 17 tarefas resolvidas por cada 100 dólares contra nove – a comparação reformula a selecção do modelo como uma questão orçamental em vez de uma questão de capacidade para uma grande parte das tarefas rotineiras.

O resultado também mostra o quanto a resposta depende da métrica. Uma equipe que deve aceitar a primeira saída, com uma espera humana, deve interpretar o passe@1 mais alto do Sol, maior confiabilidade e cerca de metade do tempo de parede como decisivos. Uma equipe executando trabalhos em lote por trás de um conjunto de testes deve ler o pass@4 do GLM-5.3 e o lead de cobertura da mesma maneira. Estas não são interpretações concorrentes de um número; são números diferentes, e a postagem é explícita que as vantagens do melhor de k só se convertem em valor se algo puder distinguir automaticamente um patch bom de um ruim.

A anatomia da falha é mais importante do que o título para qualquer um que envie diferenças escritas por modelos. Um modelo que quebra os testes anteriores em 20% de suas reprovações impõe uma carga de revisão diferente daquela que o faz em 11%, independentemente de qual pontuação for mais alta. O conselho prático da Together AI – fazer uma regressão completa em torno da saída do Sol antes de aceitá-la – é o tipo de detalhe operacional que as tabelas de classificação de benchmark geralmente omitem e pode ser verificado por qualquer equipe que execute seu próprio pacote.

Várias advertências limitam o alcance das descobertas. Este é um benchmark único de 113 tarefas medidas por um fornecedor cujo negócio se beneficia quando os modelos abertos parecem competitivos; não foi reproduzido de forma independente e a postagem diz que seus próprios números podem diferir de outros scorecards públicos do mesmo par. Os custos dependem de preços que podem sofrer alterações sem aviso prévio. A postagem chama o GLM-5.3 de 'o desafiante de peso aberto', mas não indica seu desenvolvedor, licença ou onde os pesos podem ser obtidos; AI Understanding relatou anteriormente o código aberto do Zhipu AI GLM-5.2, e não está estabelecido aqui que o GLM-5.3 esteja disponível nos mesmos termos. Nem OpenAI nem o desenvolvedor do GLM são citados e nenhuma resposta de nenhum deles aparece na fonte.

O que assistir a seguir

Se os grupos independentes reproduzem os números, se a diferença de preços relatada sobrevive às mudanças de preços, se os pesos do GLM-5.3 estão de facto amplamente disponíveis e se as cascatas controladas por verificadores se tornam um padrão de implementação padrão em vez de um artefacto de referência.

A primeira coisa a observar é a replicação. Juntos, a AI trabalhou a partir de registros publicados por teste e diz que os arquivos de trajetória por turno para seu lote GLM-5.3 estavam faltando no CDN público quando executou a análise, o que manteve o trabalho no nível do índice. Se esses artefatos forem publicados, outros pesquisadores poderão verificar a anatomia da falha e as classificações de quase-acidente, que se baseiam nas definições fornecidas pelo post (um quase-acidente é pelo menos 80% dos novos testes aprovados com a linha de base intacta), em vez de medidas padrão de referência.

A segunda é se o resultado da cascata sobrevive ao contato com repositórios reais. Seu valor de 85,9% pressupõe um verificador bom o suficiente para decidir quando escalar e que a segunda tentativa é independente da primeira. Projetos com conjuntos de testes finos ou lentos não têm esse verificador, e um conjunto de testes que passa por um patch errado transforma a cascata em um pipeline apenas de modelo barato. O roteamento controlado por verificador tornou-se uma categoria de produto visível este ano, e esta análise fornece uma afirmação testável sobre quanto ele pode realmente recuperar.

A terceira é a durabilidade da diferença de preços. Tanto a relação de custo de 2,1x quanto as contagens de resolução por US$ 100 são funções do preço de inferência atual e da execução de ambos os modelos com esforço máximo; configurações de menor esforço, porção quantizada ou uma alteração de preço em qualquer um dos lados poderiam reordenar a mesa sem qualquer alteração na qualidade do modelo. O mesmo se aplica à diferença de velocidade, que reflete quantos passos cada modelo dá, em vez de qualquer propriedade fixa dos sistemas subjacentes.

Por fim, observe as fraquezas específicas que cada lado apresenta. Os 44% do GLM-5.3 em conformidade com o protocolo são o único domínio em que o post relata uma vantagem decisiva do Sol, e é o tipo de lacuna que uma liberação pontual pode fechar ou consolidar. Se as versões subsequentes de qualquer modelo mudarão essas divisões por domínio e por idioma – e se o próprio DeepSWE permanecerá incontaminado à medida que for usado mais amplamente – determinará por quanto tempo as regras de roteamento derivadas desta execução permanecerão úteis.

Guias e questionários relacionados

Achou isso útil?
O briefing semanal

Obtenha as histórias de IA que realmente importam.

Um e-mail útil por semana — o que mudou na IA, por que ela é importante, além de ferramentas, guias, oportunidades e formas práticas de agir.

Gratuito · Sem spam · Cancele a inscrição com um clique