BenchBench verifica se l'intelligenza artificiale può adattare i protocolli dei laboratori umidi del mondo reale
Un nuovo benchmark valuta la capacità dei modelli linguistici di modificare le procedure di laboratorio umido pubblicate per situazioni sperimentali reali. Il modello con le migliori prestazioni ha ottenuto un punteggio del 59,2% nella rubrica normalizzata del benchmark e il test è rimasto insaturo dopo ripetuti tentativi.