Benchmark toont aan dat codeeragenten moeite hebben om echte serviceagenten te bouwen
Een nieuwe benchmark beoordeelt of codeeragenten volledige klantenserviceagenten kunnen bouwen onder realistische zakelijke beperkingen. Het artikel meldt dat de sterkst geteste configuratie 23,9% van de simulaties doorstond, vergeleken met 82,2% voor een door experts geschreven referentie.