Apa yang terjadi
Product.ai menerbitkan penelitian yang mengevaluasi keakuratan ChatGPT, Claude, Gemini, dan untuk tugas belanja. Penelitian menemukan bahwa 86% dari 220 soal tes menghasilkan konflik faktual yang berulang, seperti harga atau spesifikasi yang salah. Meskipun Perplexity menunjukkan tingkat kesalahan terendah, semua model mengalami kesulitan dalam konsistensi, dan harga yang salah memiliki deviasi median sebesar $300.
Product.ai, sebuah startup yang memverifikasi klaim produk, melakukan penelitian yang menguji versi gratis dan berbayar dari ChatGPT, Claude, Gemini, dan . Tim tersebut menggunakan 220 pertanyaan belanja yang mencakup produk seperti laptop, TV, dan penyedot debu robot, menjalankan setiap pertanyaan lima kali per layanan untuk mendapatkan 8.794 tanggapan.
Studi ini menemukan bahwa 86% pertanyaan menghasilkan konflik faktual yang berulang, yang didefinisikan sebagai ketidaksepakatan dalam harga, model, atau spesifikasi di berbagai tanggapan. Pertanyaan perbandingan langsung memiliki tingkat konflik lebih tinggi yaitu 97%, dibandingkan dengan 75% untuk pertanyaan faktual langsung.
Akurasi bervariasi berdasarkan model dan tingkatan. Gemini memiliki tingkat kesalahan yang merugikan tertinggi yaitu 56% pada tingkat gratis dan 54% pada tingkat berbayar. Versi berbayar Claude mengurangi kesalahan yang merugikan menjadi 21% dari 44% pada tingkat gratis. mencatat tingkat kesalahan paling rendah sebesar 14% pada tingkat berbayarnya, diikuti oleh versi berbayar ChatGPT sebesar 17%.
Jika harga salah, perbedaan mediannya adalah $300. Kepala produk pencarian Product.ai, Dakota Nunley, mencatat bahwa kesalahan ini cukup signifikan sehingga perlu diwaspadai. Dia menyarankan pengguna untuk memperlakukan AI sebagai alat penemuan daripada sebagai sumber pasti untuk data transaksional, dan merekomendasikan agar pembeli memverifikasi informasi di situs web penjual atau dengan membandingkan beberapa keluaran AI.
Detail sumber: businessinsider.com ↗
Mengapa itu penting
Studi ini memberikan bukti nyata bahwa model AI saat ini belum cukup andal untuk mengambil keputusan pembelian secara mandiri. Dengan semakin terintegrasinya agen AI ke dalam ekosistem ritel, tingginya tingkat konflik faktual menimbulkan risiko langsung terhadap keamanan finansial konsumen. Temuan ini menunjukkan bahwa pengguna harus terus memverifikasi detail produk dan harga secara manual sebelum melakukan pembelian, sehingga membatasi kegunaan praktis agen belanja AI yang 'lepas tangan' dalam waktu dekat.
Studi ini menyoroti kesenjangan kritis antara pemasaran agen belanja AI dan keandalan sebenarnya. Ketika pengecer dan perusahaan teknologi mendorong perdagangan berbasis AI, prevalensi konflik faktual melemahkan kepercayaan konsumen dan menimbulkan risiko finansial.
Temuan ini menunjukkan bahwa agen AI yang 'lepas tangan' belum mampu mengambil keputusan pembelian yang berisiko tinggi. Kesalahan harga rata-rata sebesar $300 menunjukkan bahwa hanya mengandalkan AI untuk verifikasi harga dapat menyebabkan kerugian finansial yang signifikan atau kesepakatan yang terlewatkan.
Penelitian ini memberikan tolok ukur bagi industri ini, yang menunjukkan bahwa bahkan model-model terkemuka pun kesulitan dengan konsistensi faktual dasar dalam lingkungan ritel yang dinamis. Hal ini menggarisbawahi perlunya integrasi yang lebih baik dari sumber data terverifikasi dan real-time dalam alat belanja AI.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
crm_get_transaction(id='4092').What most distinguishes an AI agent from a basic chatbot?
Apa yang harus ditonton selanjutnya
Pantau bagaimana pengecer dan pengembang AI merespons tolok ukur akurasi ini, khususnya terkait integrasi verifikasi data real-time di agen belanja. Perhatikan pembaruan dari , yang mengklaim akurasi terdepan di industri, dan amati apakah penyedia lain menerapkan protokol pengecekan fakta yang lebih ketat untuk mengurangi kesalahan yang merugikan dalam aplikasi yang dihadapi konsumen.
Perhatikan tanggapan dari OpenAI, Anthropic, Google, dan mengenai metrik akurasi spesifik ini, karena metrik tersebut dapat memengaruhi pembaruan model atau fitur produk di masa mendatang.
Pantau perkembangan agen belanja AI oleh pengecer seperti Amazon dan Walmart, yang mungkin perlu menerapkan lapisan verifikasi tambahan untuk memitigasi risiko yang diidentifikasi dalam penelitian ini.
Amati apakah Product.ai atau layanan verifikasi serupa menjadi integrasi standar dalam platform belanja AI untuk mengatasi kesenjangan akurasi yang disorot dalam penelitian.