O que aconteceu
Uma nova pré-impressão publicada em 11 de agosto nomeia um modo de falha observado em repositórios de codificação de agentes como "lembrança catastrófica": os arquivos de instruções do projeto continuam acumulando regras porque adicionar uma precaução é barato, enquanto excluir com segurança uma regra antiga se torna mais difícil depois que sua lógica original desaparece.
Os pesquisadores reuniram 247.694 tempos de vida de instruções e 299.440 transições commit-to-commit de 1.867 repositórios públicos contendo arquivos como CLAUDE.md. Eles rastrearam diretivas individuais por meio de edições e relataram que os arquivos cresceram 226% ao longo de sua vida útil observada, adicionando uma média de 4,9 instruções líquidas por commit de modificação. O estudo trata esses números como evidência de acumulação persistente em sua amostra, e não como prova de que todas as instruções eram desnecessárias ou que todos os projetos de codificação de agentes se comportam da mesma maneira.
O mecanismo central do artigo é a evidência assimétrica. Um mantenedor ou agente de codificação pode anexar uma nova instrução após um erro sem reconstruir cada interação entre as regras já presentes. A eliminação posterior é mais arriscada: uma vez desaparecido o fracasso motivador e o contexto circundante, a remoção de uma directiva pode exigir a verificação se ainda impede uma regressão sob muitas combinações das directivas restantes. Nos dados do repositório, o risco de exclusão estimado caiu à medida que uma instrução envelhecia, com uma inclinação de risco de log relatada de -0,032 por commit.
Para testar uma possível solução, os autores criaram tarefas de seguimento de instruções invertendo as restrições IFEval e, em seguida, compararam prompts contendo regras básicas com prompts que também preservaram comentários curtos explicando por que cada regra existia. Em sua configuração controlada, os prompts não comentados acumularam 211,3% de excesso de instruções, enquanto os prompts comentados terminaram com 1,4% de excesso. Os comentários não eram comandos extras para o modelo; eles eram de origem compacta, destinados a tornar auditáveis as decisões de remoção posteriores.
A equipe também avaliou se avisos menores e mais bem documentados ajudavam os agentes a seguir as instruções. No seu benchmark derivado do WildIFEval, o documento reporta ganhos de até 23,1 pontos percentuais quando os fundamentos foram preservados e regras obsoletas puderam ser removidas. Esses resultados são afirmações de uma pré-impressão recém-publicada e não revisada por pares. O trabalho não estabelece que os comentários por si só irão melhorar cada agente de codificação, repositório, linguagem ou fluxo de trabalho de produção.
Leia a fonte primária: Catastrophic remembering research paper on arXiv ↗
Por que isso importa
Os arquivos de instruções em nível de repositório estão se tornando uma memória operacional durável para agentes de codificação, de modo que o crescimento descontrolado pode aumentar os custos de tokens, preservar restrições obsoletas e dificultar a compreensão das regras que regem as alterações automatizadas de código.
O risco prático não é simplesmente um arquivo longo. Cada instrução compete pela atenção de um modelo e pode interagir com regras mais recentes, descrições de ferramentas, contexto de código e solicitações do usuário. Uma diretiva escrita para evitar uma falha histórica pode se tornar irrelevante após alterações na base de código, entrar em conflito com uma política mais recente ou restringir demais trabalhos não relacionados. Se ninguém conseguir reconstruir a razão da sua existência, a escolha local mais segura é muitas vezes mantê-la, o que transfere os custos de limpeza para compromissos futuros.
Esse padrão é importante além do CLAUDE.md. As equipes armazenam cada vez mais convenções, limites de segurança, comandos de teste, decisões arquitetônicas e cuidados de implantação em orientações de projeto legíveis por máquina. Estes ficheiros podem melhorar a consistência e reduzir erros repetidos, mas também se tornam uma superfície de governação: as pessoas devem ser capazes de identificar quem introduziu uma regra consequente, que provas a justificaram e que condições permitiriam que ela fosse retirada. Um comentário justificativo é uma versão leve dessa trilha de auditoria.
O resultado sugere um princípio de design útil para a memória do agente: a lembrança deve incluir as condições para o esquecimento. Em vez de registrar apenas “sempre faça X”, um sistema pode preservar a falha observada, o escopo da regra, o componente ou teste relevante e um gatilho de revisão. Isso não automatiza a exclusão, mas fornece ao mantenedor evidência posterior para decidir se a restrição ainda protege a correção ou apenas reflete um ambiente antigo.
Há também um ângulo de interesse público, à medida que os agentes de codificação tocam em softwares mais importantes. Instruções privadas acumuladas podem moldar silenciosamente decisões de segurança, comportamento de acessibilidade, manipulação de dados ou como um agente responde a falhas. Arquivos menores não são automaticamente mais seguros e uma limpeza agressiva pode remover uma proteção vital. O resultado útil é a rastreabilidade: menos regras inexplicáveis, propriedade explícita e práticas de revisão que permitem aos humanos desafiar tanto adições como exclusões.
O que assistir a seguir
O próximo teste é a replicação independente entre idiomas, organizações, produtos de agentes e repositórios de vida mais longa, seguido por testes prospectivos que medem se a limpeza documentada melhora a qualidade do código sem excluir salvaguardas importantes.
A amostra observacional tem limites de seleção. Os repositórios públicos que confirmam arquivos de instruções do agente podem diferir das bases de código de empresas privadas, e o histórico do repositório não pode revelar todas as discussões ou incidentes fora da plataforma que motivaram uma regra. O crescimento também pode ser racional quando um projeto se expande. As análises futuras devem separar a cobertura útil de novos componentes de instruções duplicadas, contraditórias ou obsoletas e relatar como os resultados variam de acordo com a idade do repositório, tamanho, idioma, número de contribuidores e plataforma do agente.
Os experimentos controlados necessitam de validação mais ampla. As tarefas foram derivadas de benchmarks de seguimento de instruções, em vez de meses de manutenção de software ao vivo, e o pipeline de correspondência do artigo foi verificado em uma amostra de 50 transições. Um autor produziu a anotação manual usada em parte da validação. O estudo não abrangeu arquivos de instruções em idiomas diferentes do inglês e não examinou todos os limites usados para decidir quando uma alteração contava como uma reescrita em vez de uma continuação de uma instrução.
Os comentários podem preservar raciocínios incorretos tão facilmente quanto os corretos. As equipes devem, portanto, testar a proveniência estruturada em relação a alternativas, como problemas vinculados, testes de regressão reprovados, datas de validade, campos de propriedade ou verificações automatizadas que sinalizam diretivas duplicadas e conflitantes. O fluxo de trabalho mais seguro proporia remoções, mostraria as evidências e os testes afetados e exigiria a revisão de regras de alto impacto, em vez de permitir que um agente removesse instruções apenas para salvar tokens.
Evidências úteis de acompanhamento mediriam os resultados de ponta a ponta: tamanho do prompt, cumprimento das instruções, sucesso da tarefa, regressões, tempo de revisão e número de regras restauradas após a exclusão. Os pesquisadores também devem testar se os modelos realmente usam comentários fundamentados conforme pretendido ou às vezes os confundem com requisitos adicionais. Até que esses resultados cheguem, a lembrança catastrófica é uma descrição bem fundamentada do conjunto de dados e experimentos dos autores, e não uma lei universal ou uma razão para apagar por atacado orientações de projetos maduros.


