Apa yang berlaku
Xinhua melaporkan bahawa satu pasukan termasuk penyelidik dari Universiti Jiao Tong Shanghai dan Kuaishou telah membangunkan Habibi, model AI teks-ke-ucapan sumber terbuka untuk lebih daripada 20 varian serantau Arab. Laporan itu mengatakan bahawa pasukan itu telah mengeluarkan fail model, kod dan data ujian, walaupun sumber yang dibekalkan tidak menyediakan ujian bebas, markah penanda aras atau pautan repositori.
Menurut Xinhua, penyelidik China telah melancarkan Habibi, sistem teks-ke-ucapan sumber terbuka yang bertujuan untuk menangani kesukaran menjana pertuturan Arab merentas dialek serantau. Laporan itu mengatakan projek itu melibatkan institusi termasuk Universiti Shanghai Jiao Tong dan platform perkongsian video Kuaishou. Ia menerangkan model itu beroperasi di bawah rangka kerja teknikal bersatu yang meliputi lebih daripada 20 varian serantau. Artikel itu tidak menyenaraikan setiap dialek yang disokong, mengenal pasti seni bina model yang tepat atau menyediakan saiz model, keperluan perkakasan, kependaman atau skor kualiti.
Xinhua merangka masalah teknikal di sekitar jarak antara bahasa Arab formal dan harian. Laporan itu mengatakan Bahasa Arab Standard Moden digunakan terutamanya dalam tetapan rasmi dan sastera, manakala komunikasi harian bergantung pada dialek yang dikaitkan dengan tempat termasuk Mesir, Arab Saudi dan Maghribi. Ia mengatakan penyelidikan awal biasanya tertumpu sama ada pada Bahasa Arab Standard Moden atau pada satu dialek pada satu masa. Xinhua melaporkan bahawa, sebelum Habibi, ia tidak menemui sistem teks-ke-ucapan sumber terbuka yang menyatukan dialek ini dalam satu keluaran.
Laporan itu mengatakan pasukan Habibi telah membuat fail model, kod untuk latihan dan menjalankan sistem, dan data ujian tersedia secara terbuka. Xinhua juga melaporkan bahawa para penyelidik mendakwa sistem itu boleh menghasilkan semula suara daripada rakaman pendek tanpa latihan awal. Artikel itu mengatakan Habibi belum memasuki pasaran. Ia selanjutnya melaporkan bahawa penyelidik berkata model itu melebihi model komersil terkemuka pada ujian dialek utama, tetapi ia tidak menamakan sistem komersial itu, memberi markah, menerangkan reka bentuk ujian, atau mengenal pasti penilai bebas. Oleh itu, tuntutan tersebut kekal tidak disahkan dalam bahan yang dibekalkan.
Butiran sumber: english.news.cn ↗
Mengapa ia penting
Teknologi pertuturan Arab sering dibahagikan antara Bahasa Arab Standard Moden dan dialek individu. Jika keupayaan yang dilaporkan bertahan, sistem bersatu dan tersedia secara terbuka boleh menjadikan antara muka suara lebih berguna merentas komuniti berbahasa Arab dan memberi penyelidik titik permulaan yang sama untuk meningkatkan liputan dialek.
Kepentingan praktikal liputan dialek adalah mudah: sistem pertuturan yang hanya mengendalikan bahasa Arab formal atau set dialek yang sempit mungkin kurang berguna dalam perbualan biasa. Xinhua memetik seorang editor berita Mesir yang berkata bahawa menggunakan dialek biasa boleh menjadikan interaksi seperti cadangan resipi dan pertanyaan berkaitan kesihatan lebih semula jadi dan mengurangkan risiko salah faham. Itu adalah pemerhatian pengguna yang dilaporkan oleh Xinhua, bukan bukti bahawa Habibi sendiri telah meningkatkan hasil dalam tetapan tersebut.
Keluaran terbuka mungkin penting melebihi satu produk. Jika fail, kod dan data ujian benar-benar boleh diakses di bawah syarat yang boleh digunakan, penyelidik dan pembangun boleh memeriksa sistem, menghasilkan semula hasil, menyesuaikannya dengan dialek tambahan dan membandingkannya dengan alternatif komersial. Data ujian awam juga boleh menjadikan penilaian lebih telus daripada hanya bergantung pada demonstrasi vendor. Sumber itu tidak menyatakan lesen, asal data, pengaturan persetujuan pembesar suara atau sama ada keluaran itu boleh digunakan secara sah dalam perkhidmatan komersial, jadi nilai praktikal keluaran itu belum dapat dinilai sepenuhnya.
Projek ini juga menggambarkan bagaimana akses bahasa dan ketersediaan AI boleh bertindih. Xinhua melaporkan bahawa perkhidmatan AI interaktif komersial dalam bahasa Arab Mesir mungkin dihadkan oleh kos langganan, manakala model terbuka boleh merendahkan halangan untuk institusi dan pembangun dengan kapasiti untuk menjalankannya. Itu tidak bermakna sumber terbuka secara automatik menjadikan sistem murah atau boleh diakses: penggunaan masih bergantung pada pengkomputeran, kejuruteraan, pengehosan dan sokongan. Laporan itu juga tidak menetapkan bahawa Habibi pada masa ini tersedia untuk pengguna biasa atau ia berfungsi dengan pasti di luar ujian yang dilaporkan.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Bukti seterusnya yang paling penting ialah ujian bebas merentas dialek yang didakwa model untuk menyokong, bersama-sama dengan maklumat yang jelas tentang pembesar suara, sumber data, pelesenan, kependaman, kos dan kawalan keselamatan. Laporan itu juga mengatakan Habibi boleh meniru suara daripada rakaman ringkas tanpa latihan awal; tuntutan itu memerlukan penelitian khusus kerana sumber tidak memberikan butiran teknikal atau pencegahan penyalahgunaan.
Penilaian bebas harus menentukan sama ada Habibi berprestasi secara konsisten merentas lebih daripada 20 varian yang didakwa oleh penyelidik. Pelaporan yang berguna akan termasuk kebolehfahaman dialek demi dialek dan hasil semula jadi, perbandingan dengan sistem Arab Piawai Moden dan model komersial, bilangan dan kepelbagaian penutur serta ujian pada bahasa harian dan bukannya ayat pilihan susun. Sumber yang dibekalkan tidak memberikan butiran tersebut, jadi kelebihan yang dilaporkan harus dianggap sebagai tuntutan pasukan.
Keterbukaan keluaran memerlukan pemeriksaan yang lebih teliti. Pemerhati harus mencari model sebenar dan repositori kod, lesen data, dokumentasi tentang bahan latihan dan bukti bahawa rakaman suara telah dikumpulkan dengan persetujuan yang sewajarnya. Mereka juga harus menentukan sama ada data ujian boleh diperiksa dan sama ada penyelidik luar boleh menghasilkan semula keputusan yang dilaporkan. Xinhua berkata bahan tersebut adalah umum tetapi tidak memberikan pautan atau menjelaskan syarat pelesenan dan akses mereka.
Keupayaan replikasi suara rakaman ringkas yang dilaporkan memerlukan penelitian yang berasingan. Ia mungkin berguna untuk antara muka yang diperibadikan, tetapi keupayaan yang sama boleh menimbulkan kebimbangan penyamaran, penipuan, persetujuan dan privasi. Sumber itu tidak menerangkan pengesahan pembesar suara, penanda air, keperluan pendedahan, pemantauan penyalahgunaan atau had untuk menjana suara seseorang. Oleh itu, liputan lanjut harus membezakan antara demonstrasi teknikal dan produk yang boleh digunakan, dan harus melaporkan perlindungan yang ada sebelum menganggap keupayaan itu sebagai sedia untuk kegunaan awam.