Code agents lose reliability when code is rewritten without changing its meaning, study finds
An arXiv preprint reports that code agents can perform differently on semantically equivalent codebases, with effects varying by model, agent framework and benchmark.