Apa yang terjadi
Google DeepMind mengumumkan peluncuran dua model AI baru: Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking. Model ini dirancang untuk dialog langsung, menampilkan kemampuan penalaran hampir real-time yang memungkinkan pembicaraan dan penalaran secara bersamaan. Pengumuman ini menyoroti peningkatan dalam kecerdasan, penalaran paralel, dan kemampuan untuk menjalankan alat dan panggilan API di latar belakang sambil mempertahankan alur percakapan. Model tersedia melalui Gemini Live API untuk pengembang dan diintegrasikan ke dalam aplikasi Gemini, Google Workspace, dan Search.
Google DeepMind memperkenalkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking, yang menggambarkan keduanya sebagai model dialog langsung paling canggih dari perusahaan. Inovasi utamanya adalah kemampuan untuk melakukan penalaran hampir secara real-time, memungkinkan model memproses tugas-tugas kompleks sambil mempertahankan alur percakapan tanpa gangguan. Hal ini dicapai melalui penalaran paralel, di mana model dapat menjawab permintaan dengan isyarat verbal seperti 'Izinkan saya memeriksanya...' dan memberikan narasi kemajuan langsung untuk tugas latar belakang multi-langkah.
Model tersebut dirancang untuk menjalankan alat dan panggilan API di latar belakang sambil melanjutkan percakapan. Kemampuan ini dimaksudkan untuk membuat agen suara lebih andal dan siap produksi bagi pengembang dan perusahaan. Gemini 3.8 Live memproses input visual hampir secara real-time dan secara otomatis mendeteksi dan melakukan transisi antara 97 bahasa yang didukung di tengah percakapan. Varian Extended Thinking diposisikan untuk penyelesaian tugas tingkat perusahaan, menawarkan kemampuan penalaran yang lebih mendalam untuk alur kerja yang kompleks.
Menurut sumber tersebut, Gemini 3.8 Live Extended Thinking mencapai posisi #1 keseluruhan pada Indeks Kualitas Pidato ke Pidato Analisis Buatan dengan skor 82,6. Ini juga memimpin dalam penyelesaian tugas agen dengan 68,6% pada τ-Voice dan 35,1% pada τ-Voice-banking Sierra, dan mencetak 97,7% pada Big Bench Audio. Gemini 3.8 Live mengamankan tempat kedua di Speech Agent Arena. Sumber tersebut mencatat bahwa model ini mendorong Pareto Frontier untuk alur kerja yang kompleks di EVA-Bench ServiceNow dengan menyeimbangkan akurasi dan kualitas percakapan.
Model dapat diakses melalui Gemini Live API, dengan dukungan dari platform pengembang seperti Agora, Fishjam, LiveKit, Pipecat, Vercel, dan Vision Agents. Platform ini mengelola infrastruktur streaming media secara real-time, memungkinkan pengembang untuk fokus pada pengalaman pengguna. Google juga mengumumkan kemitraan dengan perusahaan seperti Salesforce, Genspark, dan Lumeris, yang memanfaatkan model tersebut karena kemampuan latensi, fluiditas, dan pemanggilan alatnya. Semua audio yang dihasilkan oleh model ini diberi tanda air dengan SynthID untuk memastikan keterdeteksian dan mencegah kesalahan informasi.
Detail sumber: deepmind.google ↗
Mengapa itu penting
Rilis ini mewakili kemajuan signifikan dalam interaksi AI berbasis suara, yang melampaui obrolan sederhana hingga penyelesaian tugas agen yang kompleks. Dengan memungkinkan model untuk berpikir dan berbicara secara bersamaan, Google mengatasi keterbatasan utama dalam antarmuka suara saat ini, menjadikan AI lebih intuitif untuk menangani alur kerja multi-langkah. Integrasi dengan platform perusahaan seperti Salesforce dan alat pengembang seperti LiveKit dan Vercel menunjukkan dorongan menuju agen suara yang siap produksi. Perkembangan ini sangat penting bagi evolusi AI dari asisten pasif menjadi kolaborator aktif dalam konteks profesional dan pribadi, yang berpotensi mengubah cara pengguna berinteraksi dengan sistem perangkat lunak yang kompleks melalui bahasa alami.
Pengenalan penalaran dan pembicaraan secara simultan mengatasi hambatan mendasar dalam AI suara, di mana model biasanya berhenti sejenak untuk berpikir sebelum merespons. Dengan mempertahankan alur percakapan selama pelaksanaan tugas yang kompleks, model ini membuat interaksi AI terasa lebih alami dan tidak terlalu robotik. Hal ini sangat penting untuk aplikasi perusahaan di mana pengguna mungkin perlu mengelola banyak tugas atau alur kerja melalui perintah suara tanpa kehilangan konteks atau momentum.
Penekanan pada agen suara yang 'siap produksi' menandakan peralihan dari demo AI eksperimental ke solusi praktis dan terukur. Integrasi dengan platform pengembang mapan dan mitra perusahaan seperti Salesforce menunjukkan bahwa Google memposisikan model ini sebagai infrastruktur inti untuk perangkat lunak berbasis suara generasi berikutnya. Hal ini dapat mempercepat penerapan antarmuka suara di industri yang mengutamakan pengoperasian hands-free, seperti logistik, layanan kesehatan, dan layanan lapangan.
Skor yang tinggi, khususnya dalam penyelesaian tugas agen, menunjukkan bahwa model ini tidak hanya lebih baik dalam mengobrol tetapi juga secara signifikan lebih mampu melaksanakan tugas-tugas yang kompleks dan multi-langkah. Hal ini merupakan pembeda utama dalam pasar AI, di mana kemampuan menyelesaikan tugas dengan andal sering kali lebih berharga daripada kefasihan percakapan. Efektivitas biaya yang disebutkan dalam sumber juga menunjukkan bahwa Google bertujuan untuk membuat kemampuan canggih ini dapat diakses oleh lebih banyak pengembang dan perusahaan, tidak hanya perusahaan teknologi besar.
Dimasukkannya tanda air SynthID di semua audio yang dihasilkan merupakan tindakan keamanan yang penting. Ketika AI suara menjadi lebih lazim, risiko deepfake dan misinformasi meningkat. Dengan menyematkan tanda air yang tidak terlihat, Google berupaya menciptakan standar teknis untuk memverifikasi audio yang dihasilkan AI, yang dapat memiliki implikasi lebih luas terhadap kepercayaan dan keamanan dalam komunikasi digital.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang harus ditonton selanjutnya
Pantau latensi aktual dan keandalan fitur 'Berpikir Diperluas' dalam skenario dunia nyata, karena berpikir dan berbicara secara bersamaan merupakan tantangan teknis. Perhatikan evaluasi pihak ketiga terhadap skor yang diklaim, khususnya peringkat #1 pada Indeks Kualitas Speech to Speech. Amati bagaimana kinerja model ini dalam penerapan perusahaan dengan mitra seperti Salesforce, dan apakah SynthID secara efektif mencegah penyalahgunaan audio yang dihasilkan. Selain itu, lacak tingkat adopsi di antara pengembang yang menggunakan Gemini Live API dan kasus penggunaan spesifik yang muncul dari kemampuan pemanggilan alat baru.
Performa fitur 'Pemikiran Diperluas' di dunia nyata akan sangat penting. Meskipun sumber mengklaim bahwa mereka beralasan dan berbicara secara bersamaan, latensi, akurasi, dan pengalaman pengguna sebenarnya dalam skenario kompleks mungkin berbeda. Pengujian independen dan umpan balik pengguna penting untuk memvalidasi klaim ini.
Penerapan Gemini Live API oleh pengembang dan kasus penggunaan spesifik yang muncul akan memberikan wawasan tentang nilai praktis dari model ini. Jika pengembang mampu membangun agen suara yang kuat dan andal serta mampu menangani alur kerja yang kompleks, hal ini akan menunjukkan potensi sebenarnya dari teknologi tersebut.
Dampak SynthID pada kualitas audio dan persepsi pengguna perlu dipantau. Jika tanda air terlalu mengganggu atau mudah dihilangkan, hal ini dapat mengurangi efektivitasnya sebagai tindakan pengamanan. Selain itu, respon perusahaan AI lain terhadap standar watermarking ini menarik untuk dicermati.
Lanskap persaingan dalam AI suara kemungkinan akan semakin meningkat seiring dengan respons perusahaan lain terhadap rilis Google. Nantikan pengumuman dari OpenAI, Anthropic, dan pemain besar lainnya mengenai kemampuan dan tolok ukur model suara mereka sendiri.