Voltar às notícias
InovaçãoInstruções AI Understanding

O estudo de matemática assistido por IA aperta os limites de uma constante de longa data

Um estudo de caso relata que um sistema de investigação de IA ajudou a melhorar os limites da constante de Grothendieck, enquanto os autores enfatizam que os investigadores humanos escolheram o pivô principal e verificaram de forma independente apenas o resultado ao nível do teorema.

6 min readRead the primary source
Documento de origem primáriaFonte registrada
Editora
Long-horizon AI mathematics case study on arXiv
Link da fonte
arxiv.orghttps://arxiv.org/abs/2608.11195
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

API (Interface de Programação de Aplicativo)
Uma maneira estruturada de um sistema de software enviar solicitações e receber respostas de outro sistema.
Memória (memória do agente)
Contexto armazenado que um agente de IA usa em etapas ou sessões para melhorar a continuidade.
Referência
Um teste padronizado ou conjunto de dados usado para medir e comparar o desempenho do modelo.
Teste você mesmoQuestionário sobre agentes de IA

O que aconteceu

Um novo estudo de caso arXiv descreve como um sistema de pesquisa de IA ajudou os matemáticos a melhorar os limites conhecidos da constante de Grothendieck, um problema aberto que data de 1953. O artigo apresenta o resultado matemático e um registro detalhado de onde o sistema funcionou bem, onde as pessoas tiveram que orientá-lo e quais afirmações permanecem verificadas por máquina em vez de verificadas por humanos.

A constante de Grothendieck mede a lacuna entre um problema de otimização combinatória difícil e uma relaxação semidefinida mais tratável. Os autores relatam um novo intervalo com um limite inferior de 6pi/11, cerca de 1,7135, e um limite superior de cerca de 1,7818. O artigo de matemática complementar fornece as provas. O resultado do limite inferior é notável porque não constrói uma instância rígida; em vez disso, deriva uma obstrução que se aplica a todos os esquemas de arredondamento relevantes.

O sistema de pesquisa acoplou um modelo de raciocínio a um agente de codificação. O artigo diz que a execução usou GPT-5.5-Pro ​​e posterior GPT-5.6-Sol para raciocínio, código Claude com Opus e posterior Fable 5 para execução e um nó de quatro GPU para pesquisas numéricas. As sessões deram continuidade por meio de arquivos, transcrições, registros de experimentos e um resumo que registrava afirmações como comprovadas, apoiadas numericamente, conjecturais ou heurísticas, em vez de depender de um contexto ininterrupto.

A execução abrangeu cerca de 240 sessões de pesquisa de 16 de junho a 24 de julho, com 2.091 chamadas de modelo de raciocínio e cerca de 152 milhões de tokens a um custo de API estimado em US$ 5.400. Cerca de 40 diretivas humanas datadas orientaram o trabalho. Quando uma busca de limite superior estabilizou, os operadores reconheceram que falhas repetidas poderiam indicar uma obstrução geral e redirecionaram o sistema para um argumento de limite inferior. O artigo descreve essa mudança na direção da pesquisa como uma intervenção humana, não uma decisão autônoma.

O sistema produziu uma reformulação central e uma prova completa para o limite inferior 6pi/11, que os autores então revisaram e verificaram de forma independente. Também gerou candidatos numéricos superiores e inferiores mais fortes que passaram no protocolo de verificação interna, mas os autores não verificaram independentemente esses certificados e não os declararam como teoremas. O artigo, portanto, separa o resultado matemático verificado dos resultados mais especulativos ou testados por máquina do sistema.

Detalhes da fonte: Long-horizon AI mathematics case study on arXiv ↗

Por que isso importa

O estudo oferece evidências invulgarmente concretas sobre a IA utilizada num programa de investigação, em vez de uma única tarefa de referência. A sua descoberta mais importante é uma divisão de trabalho: o sistema era forte na execução técnica, enquanto os investigadores humanos continuavam responsáveis ​​pela definição da agenda, julgamento e verificação final.

A investigação de longo horizonte é difícil para um sistema de IA porque o objetivo pode mudar à medida que se acumulam abordagens falhadas. Um colaborador útil deve reter o que foi tentado, distinguir um beco sem saída de uma ideia não resolvida e decidir quando uma nova questão é mais valiosa do que outra otimização local. A memória baseada em arquivos e os rótulos de declarações dos autores são uma tentativa de tornar o estado da pesquisa visível e auditável, em vez de permitir que uma resposta fluente substitua o progresso.

A descoberta do limite inferior mostra por que o julgamento humano ainda é importante mesmo quando um agente pode executar matemática. Os operadores perceberam que muitas tentativas de construção falhavam da mesma forma e forneceram o pivô conceitual: comprovar a própria obstrução repetida. O sistema ajudou então a formalizar e certificar o argumento. Essa sequência está mais próxima da exploração supervisionada do que de um matemático de máquinas independente, e a distinção é importante ao descrever o que as evidências apoiam.

A verificação independente é a porta de liberação do resultado. O estudo de caso diz que o limite inferior foi verificado pelos autores e que as provas completas aparecem em um artigo complementar. Não diz que todos os números produzidos durante a execução estão corretos. Manter separadas as afirmações em nível de teorema, os candidatos testados por máquina e as hipóteses dá aos leitores uma maneira de avaliar a contribuição sem aceitar a confiança interna do sistema de IA como prova matemática.

Para organizações de pesquisa, a aula prática é operacional. Um sistema de IA pode pesquisar literatura, escrever código, executar experimentos, preservar tentativas fracassadas e propor transformações, mas o fluxo de trabalho circundante precisa de proveniência, cálculos reproduzíveis, pontos de verificação humanos explícitos e uma maneira de reconstruir por que a equipe mudou de direção. O custo e a computação relatados também deixam claro que a capacidade de longo horizonte não é apenas uma questão de inteligência do modelo; depende de andaimes, tempo e supervisão sustentada.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificação de conceito interativo+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

O que assistir a seguir

A próxima questão é se este padrão de colaboração se generaliza para além de um problema e de uma equipa, e se investigadores independentes podem reproduzir o resultado verificado enquanto medem o custo e a fiabilidade de cada contribuição humana e de IA.

A replicação deve testar outros domínios matemáticos, tipos de problemas e sistemas de pesquisa com diferentes designs de memória e ferramentas. O problema de Grothendieck já vinha acompanhado de uma estrutura substancial construída pelo homem, de notas acumuladas, de mecanismos de certificação e de orientações de candidatos. Essa estrutura anterior ajudou na execução, portanto estudos futuros deverão relatar quanto do estado da pesquisa foi fornecido antecipadamente e como os resultados mudam quando o sistema precisa definir o problema em si.

Os investigadores também devem comparar a execução técnica com o julgamento da investigação utilizando medidas prospectivas. Métricas úteis poderiam incluir a qualidade das direcções escolhidas, o tempo para abandonar um caminho falhado, a taxa de reclamações não apoiadas, o número de intervenções humanas e a fracção de resultados que sobrevivem à verificação independente. Um estudo de caso sofisticado pode mostrar o que aconteceu, mas são necessárias comparações controladas para estimar quando um colaborador de IA melhora o processo, em vez de simplesmente adicionar outra camada de revisão.

A fronteira entre a verificação mecânica e a verificação humana merece atenção contínua. Aritmética de intervalo, assistentes de prova, testes e auditorias contraditórias podem detectar muitos erros, mas um certificado ainda pode codificar o alvo errado ou depender de suposições que nunca foram contestadas. O trabalho de acompanhamento deve publicar artefatos completos, executar novamente os limites não verificados mais fortes e tornar os resultados com falha ou retirados tão visíveis quanto os bem-sucedidos.

Finalmente, versões de modelo, prompts, diretivas de orientação, código, computação e transcrições devem ser preservados onde o licenciamento e a privacidade permitirem. O presente artigo é valioso em parte porque relata essas condições e descreve as fraquezas do sistema, incluindo a frágil representação do Estado na investigação e a autonomia limitada no julgamento. Até que outras equipas reproduzam o padrão, isto é uma forte evidência do progresso matemático assistido pela IA, e não uma prova de que os sistemas de IA possam conduzir de forma independente investigação aberta.

Guias e questionários relacionados

Agentes de IAModelos de IA explicadosTreinamento de IAAvaliações LLMTeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de lançamento de modelo de IA
Achou isso útil?