Kembali ke Berita
produkAI Understanding taklimat

Google Gemini 3.5 Transkripsikan dokumen mengeja mod pertuturan ke teks dan had

Dokumentasi pembangun Google memperincikan cara Gemini 3.5 Transkripsi mengendalikan fail audio, termasuk pengesanan bahasa automatik, pelabelan pembesar suara, cap masa perkataan dan transkrip "pintar" yang telah dibersihkan. Halaman ini juga mendokumenkan had praktikal, termasuk tempoh audio maksimum yang lebih pendek apabila diarisasi atau cap masa…

6 min readRead the linked source
Source-provided image accompanying Google’s Gemini 3.5 Transcribe docs spell out speech-to-text modes and limits
Rujukan sumberSumber direkodkan
Penerbit
ai.google.dev
Pautan sumber
ai.google.devhttps://ai.google.dev/gemini-api/docs/transcribe
Jenis sumber
Sumber terpaut — status sumber primer belum ditetapkan.
Juga dipetik

Cerita terakhir disemak

KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

API (Antara Muka Pengaturcaraan Aplikasi)
Cara berstruktur untuk satu sistem perisian menghantar permintaan dan menerima respons daripada sistem lain.
Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
Latensi
Masa antara menghantar permintaan dan menerima output model.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berubah sejak penerbitan

  1. Pertama kali diterbitkan
  2. The Verge memajukan keluaran Gemini 3.5 Transcribe secara material dengan melaporkan keupayaan khusus dan butiran pelancaran: penyingkiran perkataan pengisi automatik, perbendaharaan kata tersuai, atribusi untuk sehingga tiga pembesar suara, cap masa peringkat perkataan, kemas kini langsung Gemini 3.5 yang berkaitan, ketersediaan pratonton macOS dan Android terpilih, dan ketersediaan pratonton macOS awam dan terpilih. Butiran ini datang daripada laporan The Verge dan tuntutan Google seperti yang dipetik di sana; mereka tidak disahkan secara bebas dalam bahan yang dibekalkan.
  3. Laporan Ars Technica ini memajukan secara material kemas kini Gemini 3.5 Transkripsi sedia ada dengan menambahkan angka prestasi Google yang dilaporkan, sokongan untuk 85 bahasa dan sehingga tiga pembesar suara dalam audio prarakam, sokongan perbendaharaan kata tersuai dan pelancaran yang lebih luas merentas macOS, Antigravity, AI Studio, rancangan ZXQAIU0Qned Chrome.
  4. Dokumentasi utama Google yang dikemas kini secara material meluaskan pengumuman Gemini 3.5 Transkripsi yang lebih awal dengan contoh API, dua mod transkripsi, sokongan untuk lebih daripada 85 tempat, sehingga 1,000 frasa perbendaharaan kata tersuai, sehingga lapan label pendua pembesar suara, cap masa had tahap perkataan dan keterjelasan.

Apa yang berlaku

Dokumentasi API Gemini Google menerangkan Gemini 3.5 Transkripsi, model pertuturan ke teks untuk fail audio yang dimuat naik. Halaman ini menyediakan butiran pelaksanaan untuk verbatim dan transkripsi pintar, pengesanan bahasa automatik merentas lebih daripada 85 tempat, perbendaharaan kata tersuai, diarisasi pembesar suara dan cap masa peringkat perkataan.

Halaman Google mengatakan API Gemini menukar fail audio yang dimuat naik ke dalam teks dengan model Transkripsi Gemini 3.5, yang dikenal pasti sebagai gemini-3.5-transcribe. Aliran kerja yang didokumenkan adalah untuk memuat naik fail audio melalui API Fail, menghantar URInya kepada API Interaksi dan membaca transkrip yang dikembalikan daripada interaction.output_text. Halaman ini termasuk contoh Python, JavaScript dan REST. Untuk pengecaman masa nyata, kependaman rendah daripada mikrofon atau strim audio langsung, Google mengarahkan pembangun ke model API Langsung berasingan yang dipanggil gemini-3.5-transcribe-live.

Model ini didokumenkan sebagai menyokong pengecaman bahasa automatik merentas lebih daripada 85 tempat, termasuk pelbagai jenis bahasa Inggeris, Sepanyol, Portugis, Bengali, Punjabi dan Cina. Google berkata model itu boleh menukar bahasa secara dinamik apabila penukar kod bertukar dalam atau antara ayat. Pembangun sebaliknya boleh membekalkan kod bahasa BCP-47 apabila bahasa itu diketahui. Halaman ini juga menerangkan perbendaharaan kata tersuai: sehingga 1,000 frasa boleh dibekalkan kepada pengiktirafan berat sebelah terhadap istilah khusus, akronim, nama jenama dan kata nama khas, walaupun Google mengatakan hasil terbaik biasanya diperoleh daripada penggunaan sehingga 100 istilah.

Halaman ini menerangkan dua mod transkripsi. Mod Verbatim ialah lalai dan bertujuan untuk mengekalkan apa yang diperkatakan, termasuk kata pengisi, pengulangan, jeda dan permulaan palsu. Mod pintar menggunakan pasca pemprosesan yang mengalih keluar gangguan, menyelesaikan pembetulan diri yang dituturkan, menambahkan tanda baca dan selongsong ayat serta memformat bahan yang dituturkan ke dalam perenggan, senarai, tarikh, mata wang dan nombor. Contoh Google menukar pembetulan lisan daripada "Selasa, sebenarnya tidak, Rabu" kepada janji temu Rabu yang dibersihkan. Mod pintar tidak boleh digabungkan dengan diarisasi pembesar suara atau cap masa peringkat perkataan.

Google juga mendokumenkan diarisasi pembesar suara dan pemasaan peringkat perkataan sebagai pilihan dalam mod verbatim. Diarisasi melabelkan suara yang berbeza dengan pengecam seperti spk_1 dan spk_2, menyokong sehingga lapan pembesar suara; atribusi untuk tiga atau lebih pembesar suara diterangkan sebagai percubaan. Cap masa peringkat perkataan mengembalikan offset mula dan tamat untuk perkataan yang diiktiraf, tetapi Google memberi amaran bahawa mendayakannya boleh mengurangkan ketepatan transkripsi keseluruhan. Permintaan unary standard menyokong fail audio sehingga satu jam, manakala pemprosesan audio dihadkan kepada 30 minit apabila diarisasi atau cap masa peringkat perkataan didayakan. Halaman terakhir dikemas kini pada 27 Ogos 2026 dan merujuk pembangun di tempat lain untuk harga, had token dan butiran pengurusan fail.

Butiran sumber: ai.google.dev ↗

Mengapa ia penting

Dokumentasi menukar keupayaan model yang diumumkan sebelum ini menjadi spesifikasi yang lebih boleh diambil tindakan untuk pembangun membina aliran kerja transkripsi. Ia juga menjelaskan bahawa ketepatan dan kefungsian melibatkan pertukaran: transkripsi pintar tidak boleh menyediakan label pembesar suara atau cap masa, manakala cap masa mungkin mengurangkan ketepatan transkripsi keseluruhan.

Kepentingan praktikal ialah Google mempersembahkan transkripsi sebagai aliran kerja model boleh dikonfigurasikan dan bukannya satu titik akhir pengecaman pertuturan yang tidak dibezakan. Pembangun boleh memilih output literal untuk rekod atau analisis, atau output yang dibersihkan untuk bacaan. Petua bahasa dan perbendaharaan kata tersuai menawarkan kawalan tambahan untuk rakaman khusus. Kawalan tersebut boleh mengurangkan pembersihan dan pembetulan manual dalam beberapa aliran kerja, tetapi sumbernya tidak memberikan ukuran ketepatan perbandingan atau bukti daripada penggunaan pengeluaran.

Pelabelan pembesar suara dan pemasaan peringkat perkataan amat berkaitan dengan aplikasi yang perlu menavigasi rakaman dan bukannya hanya menghasilkan blok teks. Label boleh memisahkan giliran dalam rakaman berbilang pembesar suara, dan ofset boleh menyokong carian atau penyegerakan dengan audio. Walau bagaimanapun, label mengenal pasti suara yang berbeza dan bukannya orang yang dinamakan dan Google secara eksplisit menandakan atribusi untuk tiga atau lebih pembesar suara sebagai percubaan. Transkrip dengan cap masa juga mungkin kurang tepat secara keseluruhan mengikut amaran dokumentasi, mewujudkan pertukaran antara kebolehlayaran dan kesetiaan.

Sokongan bahasa yang diterangkan pada halaman mungkin penting untuk mesyuarat berbilang bahasa, temu bual, rakaman perkhidmatan pelanggan dan perbualan lain di mana pembesar suara menukar bahasa. Pengesanan automatik mengurangkan keperluan untuk mengkonfigurasi setiap rakaman terlebih dahulu, manakala kod bahasa eksplisit boleh meningkatkan hasil apabila bahasa itu diketahui. Namun, sumber itu menetapkan sokongan dan tingkah laku yang dinyatakan Google, bukan prestasi seragam merentas semua tempat tersenarai, aksen, keadaan hingar atau corak penukaran kod. Rujukannya kepada pelbagai aksen dan bunyi latar belakang adalah tuntutan keupayaan, bukan penanda aras yang dibekalkan.

Had yang didokumenkan juga mempengaruhi reka bentuk sistem. Rakaman panjang mungkin memerlukan pengendalian muat naik fail, dan penambahan cap masa atau diarisasi mengurangkan siling pemprosesan yang dinyatakan daripada satu jam kepada 30 minit. Transkripsi pintar mungkin lebih mudah untuk pembaca tetapi tidak sesuai apabila perkataan yang tepat, atribusi pembesar suara atau pemasaan diperlukan. Halaman ini juga memisahkan transkripsi daripada menjawab soalan audio yang lebih luas dan daripada sintesis teks ke pertuturan, jadi pembangun tidak boleh menganggap bahawa model ini ialah analisis audio umum atau sistem penjanaan suara. Harga, had token, syarat privasi dan amalan pengekalan kekal di luar maklumat yang diberikan di sini.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Soalan seterusnya yang penting ialah prestasi dalam rakaman dunia sebenar, harga, had token, pengendalian data dan ketersediaan. Google tidak memberikan hasil penanda aras, syarat pengekalan, komitmen peringkat perkhidmatan atau harga terperinci pada halaman ini, jadi dokumentasi menetapkan keupayaan dan kekangan dan bukannya kualiti yang disahkan secara bebas.

Keutamaan pengesahan pertama ialah kualiti transkripsi dunia sebenar. Ujian bebas perlu memeriksa aksen, pertuturan bertindih, hingar latar belakang, rakaman berkualiti rendah, penukaran kod berbilang bahasa dan istilah khusus merentas tempat yang disenaraikan. Ia harus membandingkan keluaran verbatim dan pintar, terutamanya apabila mod pintar mengalih keluar perkataan pengisi atau menyelesaikan pembetulan yang mungkin penting kepada makna asal. Dokumentasi tidak memberikan kadar ralat perkataan, hasil bahasa demi bahasa atau contoh daripada rakaman yang tidak terkawal.

Atribusi penceramah patut diteliti secara berasingan. Google menyokong sehingga lapan pembesar suara tetapi memanggil atribusi untuk tiga atau lebih percubaan. Ujian harus mengukur kekerapan sistem membahagikan satu pembesar suara kepada beberapa label, menggabungkan pembesar suara yang berbeza atau memberikan perkataan kepada orang yang salah. Ujian serupa diperlukan untuk cap masa perkataan, kerana halaman tersebut memberi amaran bahawa cap masa mungkin merendahkan ketepatan transkripsi keseluruhan. Pertukaran ini adalah berbangkit untuk transkrip temu bual, alat kebolehaksesan, arkib boleh dicari dan sebarang aliran kerja yang menganggap output sebagai rekod.

Pembangun dan organisasi juga harus melihat syarat operasi yang tidak dinyatakan oleh halaman ini. Google menghalakan pembaca ke halaman harga untuk harga model dan had token, tetapi angka tersebut tidak disertakan dalam sumber. Halaman tersebut juga tidak menyatakan ketersediaan serantau, komitmen peringkat perkhidmatan, format audio yang disokong dalam senarai komprehensif, tempoh pengekalan, kawalan pemadaman atau sama ada rakaman yang dimuat naik digunakan untuk tujuan lain. Perkara yang tidak diketahui itu boleh menjejaskan penggunaan, terutamanya untuk rakaman sensitif atau perkhidmatan volum tinggi.

Akhir sekali, hubungan antara model ini dan alat audio Google yang lain akan menjadi penting. Dokumentasi menghalakan pengguna masa nyata ke laluan transkripsi Langsung yang berasingan, manakala analisis audio yang lebih luas dimiliki oleh pemahaman Audio dan penjanaan suara dimiliki oleh Teks ke pertuturan. Bahagian itu mungkin memberikan antara muka yang lebih jelas kepada pembangun, tetapi ia juga boleh memerlukan penyepaduan berasingan untuk tangkapan langsung, transkripsi, analisis dan sintesis. Nota keluaran lanjut, butiran harga, penilaian bebas dan bukti penggunaan dalam tetapan berbangkit akan menunjukkan sama ada Gemini 3.5 Transkripsi lebih daripada keupayaan API yang dinyatakan dengan baik.

Panduan & kuiz berkaitan

Model AI DiterangkanEtika AILatihan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI

Kemas kini dan pembetulan

Kisah kanonik ini dikemas kini apabila peristiwa yang sedang berkembang berubah secara material. URL dan tarikh penerbitan asalnya tidak pernah berubah.

  • Dokumentasi utama Google yang dikemas kini secara material meluaskan pengumuman Gemini 3.5 Transkripsi yang lebih awal dengan contoh API, dua mod transkripsi, sokongan untuk lebih daripada 85 tempat, sehingga 1,000 frasa perbendaharaan kata tersuai, sehingga lapan label pendua pembesar suara, cap masa had tahap perkataan dan keterjelasan.
  • Laporan Ars Technica ini memajukan secara material kemas kini Gemini 3.5 Transkripsi sedia ada dengan menambahkan angka prestasi Google yang dilaporkan, sokongan untuk 85 bahasa dan sehingga tiga pembesar suara dalam audio prarakam, sokongan perbendaharaan kata tersuai dan pelancaran yang lebih luas merentas macOS, Antigravity, AI Studio, rancangan ZXQAIU0Qned Chrome.
  • The Verge memajukan keluaran Gemini 3.5 Transcribe secara material dengan melaporkan keupayaan khusus dan butiran pelancaran: penyingkiran perkataan pengisi automatik, perbendaharaan kata tersuai, atribusi untuk sehingga tiga pembesar suara, cap masa peringkat perkataan, kemas kini langsung Gemini 3.5 yang berkaitan, ketersediaan pratonton macOS dan Android terpilih, dan ketersediaan pratonton macOS awam dan terpilih. Butiran ini datang daripada laporan The Verge dan tuntutan Google seperti yang dipetik di sana; mereka tidak disahkan secara bebas dalam bahan yang dibekalkan.
Lihat log pembetulan awam
Adakah ini berguna?