Apa yang berlaku
Google DeepMind mengumumkan keluaran dua model AI baharu: Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking. Model-model ini direka bentuk untuk dialog langsung, menampilkan keupayaan penaakulan masa nyata hampir yang membolehkan pertuturan dan penaakulan serentak. Pengumuman itu menyerlahkan peningkatan dalam kecerdasan, penaakulan selari dan keupayaan untuk melaksanakan alat dan panggilan API di latar belakang sambil mengekalkan aliran perbualan. Model ini tersedia melalui API Langsung Gemini untuk pembangun dan disepadukan ke dalam apl Gemini, Ruang Kerja Google dan Carian.
Google DeepMind memperkenalkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking, menggambarkannya sebagai model dialog langsung paling maju syarikat. Inovasi utama ialah keupayaan untuk melakukan penaakulan hampir masa nyata, membenarkan model memproses tugas yang kompleks sambil mengekalkan aliran perbualan tanpa gangguan. Ini dicapai melalui penaakulan selari, di mana model boleh mengakui permintaan dengan isyarat lisan seperti 'Biar saya periksa itu…' dan menyediakan penceritaan kemajuan secara langsung untuk tugasan latar belakang berbilang langkah.
Model ini direka bentuk untuk melaksanakan alat dan panggilan API di latar belakang sambil meneruskan perbualan. Keupayaan ini bertujuan untuk menjadikan ejen suara lebih dipercayai dan sedia pengeluaran untuk pembangun dan perusahaan. Gemini 3.8 Langsung memproses input visual dalam hampir masa nyata dan secara automatik mengesan serta peralihan antara 97 bahasa yang disokong pada pertengahan perbualan. Varian Extended Thinking diposisikan untuk penyiapan tugas gred perusahaan, menawarkan keupayaan penaakulan yang lebih mendalam untuk aliran kerja yang kompleks.
Menurut sumber itu, Gemini 3.8 Live Extended Thinking mencapai tempat keseluruhan #1 pada Indeks Kualiti Ucapan ke Pertuturan Analisis Buatan dengan skor 82.6. Ia juga mendahului dalam penyelesaian tugas ejen dengan 68.6% pada τ-Voice dan 35.1% pada penanda aras τ-Voice-banking Sierra, dan mendapat 97.7% pada Big Bench Audio. Gemini 3.8 Live mendapat tempat kedua di Arena Ejen Ucapan. Sumber menyatakan bahawa model ini mendorong Pareto Frontier untuk aliran kerja yang kompleks pada EVA-Bench ServiceNow dengan mengimbangi ketepatan dengan kualiti perbualan.
Model ini boleh diakses melalui API Langsung Gemini, dengan sokongan daripada platform pembangun seperti Agora, Fishjam, LiveKit, Pipecat, Vercel dan Ejen Vision. Platform ini mengurus infrastruktur penstriman media masa nyata, membolehkan pembangun menumpukan pada pengalaman pengguna. Google juga mengumumkan perkongsian dengan syarikat seperti Salesforce, Genspark dan Lumeris, yang menggunakan model untuk kependaman, kecairan dan keupayaan panggilan alat mereka. Semua audio yang dijana oleh model ini ditanda air dengan SynthID untuk memastikan pengesanan dan mengelakkan maklumat salah.
Butiran sumber: deepmind.google ↗
Mengapa ia penting
Keluaran ini mewakili kemajuan ketara dalam interaksi AI berasaskan suara, melangkaui sembang mudah kepada penyelesaian tugas yang kompleks dan agen. Dengan membolehkan model menaakul dan bercakap secara serentak, Google menangani had utama dalam antara muka suara semasa, menjadikan AI lebih intuitif untuk mengendalikan aliran kerja berbilang langkah. Penyepaduan dengan platform perusahaan seperti Salesforce dan alat pembangun seperti LiveKit dan Vercel mencadangkan dorongan ke arah ejen suara sedia pengeluaran. Perkembangan ini penting untuk evolusi AI daripada pembantu pasif kepada kolaborator aktif dalam konteks profesional dan peribadi, yang berpotensi membentuk semula cara pengguna berinteraksi dengan sistem perisian yang kompleks melalui bahasa semula jadi.
Pengenalan penaakulan dan pertuturan serentak menangani kesesakan asas dalam AI suara, di mana model biasanya berhenti seketika untuk berfikir sebelum bertindak balas. Dengan mengekalkan aliran perbualan semasa pelaksanaan tugas yang kompleks, model ini menjadikan interaksi AI berasa lebih semula jadi dan kurang robotik. Ini amat penting untuk aplikasi perusahaan di mana pengguna mungkin perlu mengurus berbilang tugas atau aliran kerja melalui arahan suara tanpa kehilangan konteks atau momentum.
Penekanan pada ejen suara 'sedia pengeluaran' menandakan peralihan daripada tunjuk cara AI eksperimen kepada penyelesaian praktikal dan boleh skala. Penyepaduan dengan platform pembangun yang mantap dan rakan kongsi perusahaan seperti Salesforce mencadangkan bahawa Google meletakkan model ini sebagai infrastruktur teras untuk perisian dipacu suara generasi akan datang. Ini boleh mempercepatkan penggunaan antara muka suara dalam industri yang operasi bebas tangan adalah kritikal, seperti logistik, penjagaan kesihatan dan perkhidmatan lapangan.
Markah penanda aras yang tinggi, terutamanya dalam penyelesaian tugas ejenik, menunjukkan bahawa model ini bukan sahaja lebih baik dalam berbual tetapi jauh lebih berkebolehan dalam melaksanakan tugasan yang kompleks dan berbilang langkah. Ini adalah pembeza utama dalam pasaran AI, di mana keupayaan untuk menyelesaikan tugas dengan pasti selalunya lebih berharga daripada kelancaran perbualan mentah. Keberkesanan kos yang disebut dalam sumber juga menunjukkan bahawa Google menyasarkan untuk menjadikan keupayaan lanjutan ini boleh diakses oleh rangkaian pembangun dan perusahaan yang lebih luas, bukan hanya syarikat teknologi besar.
Kemasukan penanda air SynthID dalam semua audio yang dijana adalah langkah keselamatan yang ketara. Apabila AI suara menjadi lebih berleluasa, risiko pemalsuan mendalam dan maklumat salah meningkat. Dengan membenamkan tera air yang tidak dapat dilihat, Google cuba mencipta standard teknikal untuk mengesahkan audio yang dijana AI, yang mungkin mempunyai implikasi yang lebih luas untuk kepercayaan dan keselamatan dalam komunikasi digital.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang perlu ditonton seterusnya
Pantau kependaman dan kebolehpercayaan sebenar ciri 'Pemikiran Lanjutan' dalam senario dunia sebenar, kerana penaakulan dan pertuturan serentak merupakan cabaran teknikal. Tonton penilaian pihak ketiga bagi markah penanda aras yang dituntut, terutamanya tempat #1 pada Indeks Kualiti Pertuturan ke Pertuturan. Perhatikan prestasi model ini dalam penggunaan perusahaan dengan rakan kongsi seperti Salesforce dan sama ada penanda air SynthID berkesan menghalang penyalahgunaan audio yang dijana. Selain itu, jejaki kadar penerimaan di kalangan pembangun menggunakan API Langsung Gemini dan kes penggunaan khusus yang muncul daripada keupayaan panggilan alat baharu.
Prestasi dunia sebenar bagi ciri 'Pemikiran Lanjutan' akan menjadi penting. Walaupun sumber mendakwa ia memberi alasan dan bercakap serentak, kependaman, ketepatan dan pengalaman pengguna sebenar dalam senario kompleks mungkin berbeza-beza. Ujian bebas dan maklum balas pengguna adalah penting untuk mengesahkan tuntutan ini.
Penggunaan Gemini Live API oleh pembangun dan kes penggunaan khusus yang muncul akan memberikan gambaran tentang nilai praktikal model ini. Jika pembangun dapat membina ejen suara yang teguh dan boleh dipercayai yang boleh mengendalikan aliran kerja yang kompleks, ia akan menunjukkan potensi sebenar teknologi tersebut.
Kesan penanda air SynthID pada kualiti audio dan persepsi pengguna patut diawasi. Jika tera air terlalu mengganggu atau jika ia boleh ditanggalkan dengan mudah, ia mungkin menjejaskan keberkesanannya sebagai langkah keselamatan. Selain itu, maklum balas syarikat AI lain terhadap piawaian tera air ini akan menarik untuk diperhatikan.
Landskap berdaya saing dalam AI suara berkemungkinan meningkat apabila syarikat lain bertindak balas terhadap keluaran Google. Nantikan pengumuman daripada OpenAI, Anthropic dan pemain utama lain mengenai keupayaan dan penanda aras model suara mereka sendiri.