Test porównawczy SWE-bench Science wykazał, że agenci kodujący mają problemy z oprogramowaniem naukowym
Nowy wydruk wstępny arXiv wprowadza test porównawczy składający się ze 119 zadań do testowania agentów kodujących w oprogramowaniu naukowym i raportuje, że najskuteczniejszy agent uzyskał wynik poniżej 50% na poziomie pozytywnym @ 1.