Apa yang berlaku
Penyelidik Renfei Zhang dan Niloofar Mireshghallah melaporkan bahawa pembelajaran pengukuhan dengan ganjaran yang boleh disahkan pada data fakta jinak meningkatkan kebolehcapaian maklumat yang boleh dikenal pasti secara peribadi yang telah dihafal oleh model arahan. Dalam ujian pada DeepSeek-V3.1, verbatim @k meningkat daripada 0.155 kepada 0.370, peningkatan 2.4 kali ganda.
Corak yang dilaporkan juga berbeza dengan saiz model. Merentasi tiga model antara 8 bilion hingga 671 bilion parameter, penulis mengatakan kebocoran mutlak adalah yang paling besar dalam model terbesar. Perbandingan ini menerangkan cara keputusan yang dilaporkan berbeza merentas model yang diperiksa dalam kajian. Ia tidak menggantikan hasil pusat atau menambah ukuran yang berasingan. Model dalam perbandingan dibentangkan sebagai sebahagian daripada akaun pengarang eksperimen, dengan julat saiz menyediakan skala yang dinyatakan untuk perbandingan itu. Pada masa yang sama, kata-kata itu mengekalkan perbezaan antara kebocoran mutlak dan persoalan yang lebih luas tentang bagaimana pembelajaran pengukuhan menjejaskan akses kepada maklumat yang dihafal.
Pada masa yang sama, model mengekalkan kebolehan penaakulan dan kadar penolakan mereka dalam penilaian kajian. Penulis mentafsir gabungan itu sebagai bukti bahawa pembelajaran pengukuhan secara selektif mengubah akses kepada maklumat yang dihafal dan bukannya mengubah secara meluas tingkah laku model. Dalam huraian kajian, peningkatan yang dilaporkan dalam kebolehaksesan oleh itu muncul bersama prestasi yang dikekalkan dan tingkah laku penolakan. Intinya bukanlah setiap aspek model berubah, tetapi hasil berkaitan privasi yang dilaporkan berubah manakala penilaian yang disebut kekal dikekalkan. Ini ialah gabungan khusus yang digunakan oleh pengarang apabila mencirikan perkara yang dilakukan oleh proses pembelajaran pengukuhan dalam eksperimen.
Sumber tidak memberikan perincian yang mencukupi di sini untuk menilai secara bebas persediaan latihan penuh, saiz sampel penilaian atau identiti tepat ketiga-tiga model. Had itu digunakan pada tahap butiran yang tersedia dalam sumber untuk mentafsir perbandingan. Corak saiz model yang dilaporkan, kebolehan penaakulan yang dikekalkan dan kadar penolakan, dan tafsiran pengarang semuanya diterangkan dalam draf. Maklumat yang hilang bermakna akaun tidak menetapkan butiran tambahan secara bebas tentang persediaan atau penilaian melebihi apa yang dinyatakan. Oleh itu, hasilnya boleh dilaporkan dengan ukuran dan tafsiran yang dinyatakan sambil memastikan butiran sumber yang belum diselesaikan kelihatan.
Mengapa ia penting
Penemuan menunjukkan bahawa risiko privasi boleh berubah semasa penalaan halus model walaupun data latihan baharu tidak mengandungi maklumat peribadi. Model mungkin mengekalkan prestasi penaakulan dan tingkah laku penolakannya sambil menjadi lebih berkemungkinan untuk memaparkan data peribadi yang dihafal.
Kajian itu juga merumitkan penggunaan kadar penolakan dan ujian keupayaan am sebagai penunjuk privasi. Penulis melaporkan bahawa kadar penolakan dan kebolehan penaakulan dikekalkan sementara kebocoran meningkat. Baca bersama-sama, pernyataan tersebut menerangkan ketidakpadanan antara tingkah laku yang diukur dengan keupayaan luas atau semakan penolakan dan kebolehcapaian maklumat yang dihafal. Kepentingan yang didakwa oleh kajian itu datang daripada kewujudan bersama itu: semakan yang disebut tidak menunjukkan kehilangan penaakulan atau tingkah laku penolakan yang sepadan walaupun ukuran kebocoran yang dilaporkan meningkat. Oleh itu, kebimbangan adalah mengenai perkara yang mungkin tidak diukur oleh pemeriksaan tersebut.
Itu menunjukkan model boleh kelihatan stabil pada pemeriksaan keselamatan atau prestasi yang luas sambil menjadi lebih bersedia atau dapat mendedahkan maklumat yang dibenamkan dalam parameternya. Kenyataan itu dirangka sebagai cadangan daripada penemuan yang dilaporkan, bukan sebagai dakwaan bahawa setiap model atau sistem yang digunakan berkelakuan seperti ini. Ia mengenal pasti sebab keputusan yang dilaporkan penting untuk penilaian: keputusan yang kelihatan stabil dalam satu set semakan mungkin wujud bersama dengan hasil yang berbeza mengenai akses kepada data yang dihafal. Perkaitan kajian berikutan daripada kemungkinan pemisahan antara prestasi umum, tingkah laku penolakan dan hasil kebocoran khusus yang diterangkan oleh pengarang.
Penemuan ini adalah berbangkit, tetapi ia kekal sebagai hasil pracetak daripada eksperimen yang diterangkan oleh pengarangnya, bukan kegagalan yang ditunjukkan merentas semua model bahasa yang digunakan. Kelayakan ini mengehadkan skop tuntutan sambil mengekalkan kepentingannya. Draf tidak membentangkan hasil sebagai bukti bahawa semua sistem yang digunakan mempunyai gelagat yang sama. Ia membentangkan penemuan pracetak, melaporkan perkara yang diperhatikan oleh pengarang dalam eksperimen mereka dan mengenal pasti implikasi privasi yang berikut daripada pemerhatian tersebut. Perbezaan antara hasil berbangkit dan kegagalan yang ditunjukkan merentas semua model bahasa yang digunakan adalah sebahagian daripada konteks penemuan yang betul.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Hasilnya perlu diuji merentas lebih banyak model, kaedah latihan, set data dan serangan privasi. Perkara yang tidak diketahui penting termasuk sejauh mana kesan itu digeneralisasikan, sama ada sistem yang digunakan terdedah kepada risiko yang sama dan perlindungan yang boleh mengesan atau menghalang perubahan dalam akses kepada maklumat yang dihafal.
Kesan awam masih tidak pasti kerana sumber tidak menunjukkan bahawa perkhidmatan yang digunakan telah membocorkan data peribadi melalui mekanisme ini. Ketidakpastian itu melibatkan jarak antara eksperimen yang diterangkan dalam pracetak dan gelagat perkhidmatan dunia sebenar. Mekanisme yang dilaporkan melibatkan akses kepada data peribadi yang dihafal selepas pembelajaran pengukuhan jinak, tetapi sumber itu tidak menunjukkan insiden perkhidmatan yang digunakan yang disebabkan olehnya. Ketiadaan demonstrasi itu tidak menghapuskan keputusan yang dilaporkan; ia mentakrifkan perkara yang masih belum dapat diselesaikan apabila mempertimbangkan kesan awamnya. Oleh itu, draf menyimpan penemuan percubaan berasingan daripada tuntutan tentang kegagalan perkhidmatan yang diperhatikan.
Ia juga tidak menyatakan berapa banyak latihan jinak yang diperlukan, sama ada kesannya boleh diterbalikkan, atau kawalan mana yang boleh menghalang pengekstrakan tanpa merosakkan keupayaan berguna. Ini dinyatakan tidak diketahui tentang keadaan, keterbalikan dan pengurangan kesan yang dilaporkan. Ia penting kerana sumber tidak memberikan maklumat yang diperlukan untuk menentukan bagaimana perubahan dalam kebolehaksesan akan bertindak di bawah jumlah latihan yang berbeza atau di bawah perlindungan percubaan. Perkataan itu juga mengekalkan pertukaran yang dikenal pasti dalam draf: kawalan perlu menyekat pengekstrakan sambil mengelakkan kerosakan pada keupayaan berguna. Tiada ambang tambahan, kaedah pembalikan atau kawalan dibekalkan di sini.
Perkara yang tidak diketahui itu harus meredakan implikasi permusuhan kertas itu sambil mengekalkan hasil teras dalam pandangan: menurut pengarang, latihan yang tidak pernah menyentuh data peribadi bagaimanapun boleh mengubah cara data peribadi yang dihafal boleh diakses. Berhati-hati dan hasil teras adalah milik bersama. Ketidakpastian tentang impak awam, keperluan latihan, kebolehbalikan dan kawalan mengehadkan sejauh mana implikasi harus digunakan. Pada masa yang sama, dakwaan yang dilaporkan oleh pengarang kekal sebagai titik utama untuk diperhatikan: data latihan jinak yang tidak mengandungi maklumat peribadi masih boleh mengubah akses kepada maklumat peribadi yang telah dihafal oleh model. Draf tidak memanjangkan tuntutan itu melebihi akaun pengarang.