Apa yang berlaku
Dokumentasi API Gemini Google menerangkan Gemini 3.5 Transkripsi, model pertuturan ke teks untuk fail audio yang dimuat naik. Halaman ini menyediakan butiran pelaksanaan untuk verbatim dan transkripsi pintar, pengesanan bahasa automatik merentas lebih daripada 85 tempat, perbendaharaan kata tersuai, diarisasi pembesar suara dan cap masa peringkat perkataan.
Halaman Google mengatakan API Gemini menukar fail audio yang dimuat naik ke dalam teks dengan model Transkripsi Gemini 3.5, yang dikenal pasti sebagai gemini-3.5-transcribe. Aliran kerja yang didokumenkan adalah untuk memuat naik fail audio melalui API Fail, menghantar URInya kepada API Interaksi dan membaca transkrip yang dikembalikan daripada interaction.output_text. Halaman ini termasuk contoh Python, JavaScript dan REST. Untuk pengecaman masa nyata, kependaman rendah daripada mikrofon atau strim audio langsung, Google mengarahkan pembangun ke model API Langsung berasingan yang dipanggil gemini-3.5-transcribe-live.
Model ini didokumenkan sebagai menyokong pengecaman bahasa automatik merentas lebih daripada 85 tempat, termasuk pelbagai jenis bahasa Inggeris, Sepanyol, Portugis, Bengali, Punjabi dan Cina. Google berkata model itu boleh menukar bahasa secara dinamik apabila penukar kod bertukar dalam atau antara ayat. Pembangun sebaliknya boleh membekalkan kod bahasa BCP-47 apabila bahasa itu diketahui. Halaman ini juga menerangkan perbendaharaan kata tersuai: sehingga 1,000 frasa boleh dibekalkan kepada pengiktirafan berat sebelah terhadap istilah khusus, akronim, nama jenama dan kata nama khas, walaupun Google mengatakan hasil terbaik biasanya diperoleh daripada penggunaan sehingga 100 istilah.
Halaman ini menerangkan dua mod transkripsi. Mod Verbatim ialah lalai dan bertujuan untuk mengekalkan apa yang diperkatakan, termasuk kata pengisi, pengulangan, jeda dan permulaan palsu. Mod pintar menggunakan pasca pemprosesan yang mengalih keluar gangguan, menyelesaikan pembetulan diri yang dituturkan, menambahkan tanda baca dan selongsong ayat serta memformat bahan yang dituturkan ke dalam perenggan, senarai, tarikh, mata wang dan nombor. Contoh Google menukar pembetulan lisan daripada "Selasa, sebenarnya tidak, Rabu" kepada janji temu Rabu yang dibersihkan. Mod pintar tidak boleh digabungkan dengan diarisasi pembesar suara atau cap masa peringkat perkataan.
Google juga mendokumenkan diarisasi pembesar suara dan pemasaan peringkat perkataan sebagai pilihan dalam mod verbatim. Diarisasi melabelkan suara yang berbeza dengan pengecam seperti spk_1 dan spk_2, menyokong sehingga lapan pembesar suara; atribusi untuk tiga atau lebih pembesar suara diterangkan sebagai percubaan. Cap masa peringkat perkataan mengembalikan offset mula dan tamat untuk perkataan yang diiktiraf, tetapi Google memberi amaran bahawa mendayakannya boleh mengurangkan ketepatan transkripsi keseluruhan. Permintaan unary standard menyokong fail audio sehingga satu jam, manakala pemprosesan audio dihadkan kepada 30 minit apabila diarisasi atau cap masa peringkat perkataan didayakan. Halaman terakhir dikemas kini pada 27 Ogos 2026 dan merujuk pembangun di tempat lain untuk harga, had token dan butiran pengurusan fail.
Butiran sumber: ai.google.dev ↗
Mengapa ia penting
Dokumentasi menukar keupayaan model yang diumumkan sebelum ini menjadi spesifikasi yang lebih boleh diambil tindakan untuk pembangun membina aliran kerja transkripsi. Ia juga menjelaskan bahawa ketepatan dan kefungsian melibatkan pertukaran: transkripsi pintar tidak boleh menyediakan label pembesar suara atau cap masa, manakala cap masa mungkin mengurangkan ketepatan transkripsi keseluruhan.
Kepentingan praktikal ialah Google mempersembahkan transkripsi sebagai aliran kerja model boleh dikonfigurasikan dan bukannya satu titik akhir pengecaman pertuturan yang tidak dibezakan. Pembangun boleh memilih output literal untuk rekod atau analisis, atau output yang dibersihkan untuk bacaan. Petua bahasa dan perbendaharaan kata tersuai menawarkan kawalan tambahan untuk rakaman khusus. Kawalan tersebut boleh mengurangkan pembersihan dan pembetulan manual dalam beberapa aliran kerja, tetapi sumbernya tidak memberikan ukuran ketepatan perbandingan atau bukti daripada penggunaan pengeluaran.
Pelabelan pembesar suara dan pemasaan peringkat perkataan amat berkaitan dengan aplikasi yang perlu menavigasi rakaman dan bukannya hanya menghasilkan blok teks. Label boleh memisahkan giliran dalam rakaman berbilang pembesar suara, dan ofset boleh menyokong carian atau penyegerakan dengan audio. Walau bagaimanapun, label mengenal pasti suara yang berbeza dan bukannya orang yang dinamakan dan Google secara eksplisit menandakan atribusi untuk tiga atau lebih pembesar suara sebagai percubaan. Transkrip dengan cap masa juga mungkin kurang tepat secara keseluruhan mengikut amaran dokumentasi, mewujudkan pertukaran antara kebolehlayaran dan kesetiaan.
Sokongan bahasa yang diterangkan pada halaman mungkin penting untuk mesyuarat berbilang bahasa, temu bual, rakaman perkhidmatan pelanggan dan perbualan lain di mana pembesar suara menukar bahasa. Pengesanan automatik mengurangkan keperluan untuk mengkonfigurasi setiap rakaman terlebih dahulu, manakala kod bahasa eksplisit boleh meningkatkan hasil apabila bahasa itu diketahui. Namun, sumber itu menetapkan sokongan dan tingkah laku yang dinyatakan Google, bukan prestasi seragam merentas semua tempat tersenarai, aksen, keadaan hingar atau corak penukaran kod. Rujukannya kepada pelbagai aksen dan bunyi latar belakang adalah tuntutan keupayaan, bukan penanda aras yang dibekalkan.
Had yang didokumenkan juga mempengaruhi reka bentuk sistem. Rakaman panjang mungkin memerlukan pengendalian muat naik fail, dan penambahan cap masa atau diarisasi mengurangkan siling pemprosesan yang dinyatakan daripada satu jam kepada 30 minit. Transkripsi pintar mungkin lebih mudah untuk pembaca tetapi tidak sesuai apabila perkataan yang tepat, atribusi pembesar suara atau pemasaan diperlukan. Halaman ini juga memisahkan transkripsi daripada menjawab soalan audio yang lebih luas dan daripada sintesis teks ke pertuturan, jadi pembangun tidak boleh menganggap bahawa model ini ialah analisis audio umum atau sistem penjanaan suara. Harga, had token, syarat privasi dan amalan pengekalan kekal di luar maklumat yang diberikan di sini.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Soalan seterusnya yang penting ialah prestasi dalam rakaman dunia sebenar, harga, had token, pengendalian data dan ketersediaan. Google tidak memberikan hasil penanda aras, syarat pengekalan, komitmen peringkat perkhidmatan atau harga terperinci pada halaman ini, jadi dokumentasi menetapkan keupayaan dan kekangan dan bukannya kualiti yang disahkan secara bebas.
Keutamaan pengesahan pertama ialah kualiti transkripsi dunia sebenar. Ujian bebas perlu memeriksa aksen, pertuturan bertindih, hingar latar belakang, rakaman berkualiti rendah, penukaran kod berbilang bahasa dan istilah khusus merentas tempat yang disenaraikan. Ia harus membandingkan keluaran verbatim dan pintar, terutamanya apabila mod pintar mengalih keluar perkataan pengisi atau menyelesaikan pembetulan yang mungkin penting kepada makna asal. Dokumentasi tidak memberikan kadar ralat perkataan, hasil bahasa demi bahasa atau contoh daripada rakaman yang tidak terkawal.
Atribusi penceramah patut diteliti secara berasingan. Google menyokong sehingga lapan pembesar suara tetapi memanggil atribusi untuk tiga atau lebih percubaan. Ujian harus mengukur kekerapan sistem membahagikan satu pembesar suara kepada beberapa label, menggabungkan pembesar suara yang berbeza atau memberikan perkataan kepada orang yang salah. Ujian serupa diperlukan untuk cap masa perkataan, kerana halaman tersebut memberi amaran bahawa cap masa mungkin merendahkan ketepatan transkripsi keseluruhan. Pertukaran ini adalah berbangkit untuk transkrip temu bual, alat kebolehaksesan, arkib boleh dicari dan sebarang aliran kerja yang menganggap output sebagai rekod.
Pembangun dan organisasi juga harus melihat syarat operasi yang tidak dinyatakan oleh halaman ini. Google menghalakan pembaca ke halaman harga untuk harga model dan had token, tetapi angka tersebut tidak disertakan dalam sumber. Halaman tersebut juga tidak menyatakan ketersediaan serantau, komitmen peringkat perkhidmatan, format audio yang disokong dalam senarai komprehensif, tempoh pengekalan, kawalan pemadaman atau sama ada rakaman yang dimuat naik digunakan untuk tujuan lain. Perkara yang tidak diketahui itu boleh menjejaskan penggunaan, terutamanya untuk rakaman sensitif atau perkhidmatan volum tinggi.
Akhir sekali, hubungan antara model ini dan alat audio Google yang lain akan menjadi penting. Dokumentasi menghalakan pengguna masa nyata ke laluan transkripsi Langsung yang berasingan, manakala analisis audio yang lebih luas dimiliki oleh pemahaman Audio dan penjanaan suara dimiliki oleh Teks ke pertuturan. Bahagian itu mungkin memberikan antara muka yang lebih jelas kepada pembangun, tetapi ia juga boleh memerlukan penyepaduan berasingan untuk tangkapan langsung, transkripsi, analisis dan sintesis. Nota keluaran lanjut, butiran harga, penilaian bebas dan bukti penggunaan dalam tetapan berbangkit akan menunjukkan sama ada Gemini 3.5 Transkripsi lebih daripada keupayaan API yang dinyatakan dengan baik.