Kembali ke Berita
InovasiAI Understanding pengarahan

Studi menemukan tingkat kesalahan yang tinggi pada asisten belanja AI

Sebuah studi baru yang dilakukan oleh Product.ai mengungkapkan bahwa 86% kueri belanja terhadap model AI utama menghasilkan jawaban faktual yang bertentangan, sehingga menyoroti masalah keandalan yang signifikan bagi pembeli saat liburan.

4 min readRead the original reporting
Source-provided image accompanying Study finds high error rates in AI shopping assistants
Pelaporan yang diatribusikanSumber direkam
Penerbit
businessinsider.com
Tautan sumber
businessinsider.comhttps://www.businessinsider.com/study-shows-ai-errors-shopping-tools-struggle-accuracy-2026-9
Jenis sumber
Pelaporan oleh outlet berita — bukan dokumen pihak pertama.

Yang belum bisa kami konfirmasi secara independen: Klaim ini dikaitkan dengan outlet bernama. Kami tidak memverifikasinya terhadap dokumen pihak pertama. (businessinsider.com)

KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

Perplexity
Metrik model bahasa yang mengukur seberapa terkejut model tersebut dengan token berikutnya yang sebenarnya.
Tolok ukur
Tes atau kumpulan data standar yang digunakan untuk mengukur dan membandingkan kinerja model.
Uji diri Anda sendiriKuis Agen AI

Apa yang terjadi

Product.ai menerbitkan penelitian yang mengevaluasi keakuratan ChatGPT, Claude, Gemini, dan untuk tugas belanja. Penelitian menemukan bahwa 86% dari 220 soal tes menghasilkan konflik faktual yang berulang, seperti harga atau spesifikasi yang salah. Meskipun Perplexity menunjukkan tingkat kesalahan terendah, semua model mengalami kesulitan dalam konsistensi, dan harga yang salah memiliki deviasi median sebesar $300.

Product.ai, sebuah startup yang memverifikasi klaim produk, melakukan penelitian yang menguji versi gratis dan berbayar dari ChatGPT, Claude, Gemini, dan . Tim tersebut menggunakan 220 pertanyaan belanja yang mencakup produk seperti laptop, TV, dan penyedot debu robot, menjalankan setiap pertanyaan lima kali per layanan untuk mendapatkan 8.794 tanggapan.

Studi ini menemukan bahwa 86% pertanyaan menghasilkan konflik faktual yang berulang, yang didefinisikan sebagai ketidaksepakatan dalam harga, model, atau spesifikasi di berbagai tanggapan. Pertanyaan perbandingan langsung memiliki tingkat konflik lebih tinggi yaitu 97%, dibandingkan dengan 75% untuk pertanyaan faktual langsung.

Akurasi bervariasi berdasarkan model dan tingkatan. Gemini memiliki tingkat kesalahan yang merugikan tertinggi yaitu 56% pada tingkat gratis dan 54% pada tingkat berbayar. Versi berbayar Claude mengurangi kesalahan yang merugikan menjadi 21% dari 44% pada tingkat gratis. mencatat tingkat kesalahan paling rendah sebesar 14% pada tingkat berbayarnya, diikuti oleh versi berbayar ChatGPT sebesar 17%.

Jika harga salah, perbedaan mediannya adalah $300. Kepala produk pencarian Product.ai, Dakota Nunley, mencatat bahwa kesalahan ini cukup signifikan sehingga perlu diwaspadai. Dia menyarankan pengguna untuk memperlakukan AI sebagai alat penemuan daripada sebagai sumber pasti untuk data transaksional, dan merekomendasikan agar pembeli memverifikasi informasi di situs web penjual atau dengan membandingkan beberapa keluaran AI.

Detail sumber: businessinsider.com ↗

Mengapa itu penting

Studi ini memberikan bukti nyata bahwa model AI saat ini belum cukup andal untuk mengambil keputusan pembelian secara mandiri. Dengan semakin terintegrasinya agen AI ke dalam ekosistem ritel, tingginya tingkat konflik faktual menimbulkan risiko langsung terhadap keamanan finansial konsumen. Temuan ini menunjukkan bahwa pengguna harus terus memverifikasi detail produk dan harga secara manual sebelum melakukan pembelian, sehingga membatasi kegunaan praktis agen belanja AI yang 'lepas tangan' dalam waktu dekat.

Studi ini menyoroti kesenjangan kritis antara pemasaran agen belanja AI dan keandalan sebenarnya. Ketika pengecer dan perusahaan teknologi mendorong perdagangan berbasis AI, prevalensi konflik faktual melemahkan kepercayaan konsumen dan menimbulkan risiko finansial.

Temuan ini menunjukkan bahwa agen AI yang 'lepas tangan' belum mampu mengambil keputusan pembelian yang berisiko tinggi. Kesalahan harga rata-rata sebesar $300 menunjukkan bahwa hanya mengandalkan AI untuk verifikasi harga dapat menyebabkan kerugian finansial yang signifikan atau kesepakatan yang terlewatkan.

Penelitian ini memberikan tolok ukur bagi industri ini, yang menunjukkan bahwa bahkan model-model terkemuka pun kesulitan dengan konsistensi faktual dasar dalam lingkungan ritel yang dinamis. Hal ini menggarisbawahi perlunya integrasi yang lebih baik dari sumber data terverifikasi dan real-time dalam alat belanja AI.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Pemeriksaan Konsep Interaktif+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Apa yang harus ditonton selanjutnya

Pantau bagaimana pengecer dan pengembang AI merespons tolok ukur akurasi ini, khususnya terkait integrasi verifikasi data real-time di agen belanja. Perhatikan pembaruan dari , yang mengklaim akurasi terdepan di industri, dan amati apakah penyedia lain menerapkan protokol pengecekan fakta yang lebih ketat untuk mengurangi kesalahan yang merugikan dalam aplikasi yang dihadapi konsumen.

Perhatikan tanggapan dari OpenAI, Anthropic, Google, dan mengenai metrik akurasi spesifik ini, karena metrik tersebut dapat memengaruhi pembaruan model atau fitur produk di masa mendatang.

Pantau perkembangan agen belanja AI oleh pengecer seperti Amazon dan Walmart, yang mungkin perlu menerapkan lapisan verifikasi tambahan untuk memitigasi risiko yang diidentifikasi dalam penelitian ini.

Amati apakah Product.ai atau layanan verifikasi serupa menjadi integrasi standar dalam platform belanja AI untuk mengatasi kesenjangan akurasi yang disorot dalam penelitian.

Panduan & kuis terkait

Agen AIModel AI DijelaskanEtika AIUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak rilis model AI
Apakah ini berguna?