BenchBench testuje, zda umělá inteligence dokáže přizpůsobit skutečné protokoly mokré laboratoře
Nový benchmark hodnotí, jak dobře jazykové modely modifikují publikované postupy mokré laboratoře pro skutečné experimentální situace. Nejvýkonnější model dosáhl v normalizované rubrice benchmarku 59,2 % a test zůstal po opakovaných pokusech nenasycený.