BenchBench menguji sama ada AI boleh menyesuaikan protokol makmal basah dunia sebenar
Penanda aras baharu menilai sejauh mana model bahasa mengubah suai prosedur makmal basah yang diterbitkan untuk situasi percubaan sebenar. Model berprestasi terbaik mendapat markah 59.2% pada rubrik ternormal penanda aras, dan ujian itu kekal tidak tepu selepas percubaan berulang.