Kembali ke Berita
KeselamatanAI Understanding taklimat

Tech Xplore melaporkan perlindungan keselamatan dikeluarkan daripada 21 LLM berat terbuka

Tech Xplore melaporkan bahawa penyelidik menguji 21 model bahasa berat terbuka yang digunakan secara meluas dan mendapati penalaan halus atau gangguan lain boleh mengalih keluar perlindungan keselamatan terbina dalam mereka. Penemuan kajian tidak disahkan secara bebas di sini.

6 min readRead the linked source
Primary-source image accompanying Tech Xplore reports safety protections removed from 21 open-weight LLMs
Rujukan sumberSumber direkodkan
Penerbit
techxplore.com
Pautan sumber
techxplore.comhttps://techxplore.com/news/2026-08-major-weaknesses-weight-llms.html
Jenis sumber
Sumber terpaut — status sumber primer belum ditetapkan.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Berat badan
Nilai berangka yang dipelajari yang menskalakan isyarat yang melalui rangkaian saraf.
Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Penalaan Halus
Meneruskan latihan tentang data khusus domain untuk menyesuaikan model pra-latihan kepada tugas tertentu.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Tech Xplore melaporkan bahawa pasukan penyelidik yang diketuai oleh University of Waterloo dan kumpulan keselamatan AI bukan untung FAR.AI telah menguji 21 model bahasa besar berat terbuka yang popular menggunakan rangka kerja yang dipanggil TamperBench. Para penyelidik mendapati bahawa setiap model yang diuji boleh diganggu dengan cara yang menjejaskan perlindungan keselamatannya. Kerja itu dibentangkan di Persidangan ACM SIGKDD dan juga dikenal pasti dalam sumbernya sebagai kertas arXiv. Tech Xplore ialah saluran pelaporan yang dinamakan; penemuan dan implikasinya yang lebih luas belum disahkan secara bebas di sini.

Tech Xplore melaporkan bahawa kajian yang diketuai oleh University of Waterloo dan FAR.AI, meneliti 21 LLM berat terbuka yang paling popular. Pasukan itu termasuk penyelidik dari Institut Teknologi Massachusetts, ETH Zurich dan Universiti Toronto. Menurut outlet itu, para penyelidik mendapati bahawa semua 21 model boleh diganggu walaupun terdapat perlindungan keselamatan yang terbina di dalamnya. Sumber membentangkan ini sebagai hasil daripada ujian kajian, bukan sebagai penemuan yang disahkan secara bebas oleh Tech Xplore. Ia tidak menyenaraikan model atau menyediakan pecahan model demi model bagi hasil.

Para penyelidik membina TamperBench, yang diterangkan oleh Tech Xplore sebagai rangka kerja piawai sumber terbuka untuk mensimulasikan serangan berbeza terhadap keselamatan model. Laporan itu mengatakan pengubahan boleh melibatkan pengubahsuaian berat model atau perwakilan terpendam, dengan tujuan melemahkan atau mengalih keluar perlindungan yang menyekat tindak balas berbahaya. Tech Xplore mencirikan rangka kerja sebagai cara yang sistematik untuk menguji sama ada perlindungan bertahan dengan perubahan sedemikian. Sumber tidak menyatakan prosedur serangan penuh, sumber pengiraan yang diperlukan, kadar kejayaan untuk setiap teknik, atau cara penyelidik menentukan bahawa perlindungan telah terjejas.

Laporan itu mengenal pasti kertas itu sebagai "TamperBench: Keselamatan LLM Pengujian Tekanan Secara Sistematik Di Bawah Penalaan Halus dan Penggangguan." Tech Xplore berkata kerja itu baru-baru ini dibentangkan pada Persidangan ACM SIGKDD ke-32 mengenai Penemuan Pengetahuan dan Perlombongan Data di Korea Selatan dan memberikan pautan DOI dan arXiv penerbitan. Artikel itu menamakan Saad Hossain sebagai penyelidik yang mengetuai kajian itu dan memetik penyelidik Universiti Waterloo yang menggambarkan keputusan itu sebagai amaran untuk pembangun dan pemeroleh AI. Sumber itu tidak secara bebas mengesahkan kaedah, keputusan atau status semakan rakan sebaya di luar penerangannya mengenai butiran pembentangan persidangan dan penerbitan.

Butiran sumber: techxplore.com ↗

Mengapa ia penting

Laporan itu menerangkan masalah keselamatan yang dicipta oleh keupayaan untuk memuat turun dan mengubah suai model berat terbuka. Jika perlindungan keselamatan boleh dialih keluar melalui penalaan halus atau perubahan pada berat model atau perwakilan terpendam, model yang kelihatan selamat semasa dikeluarkan mungkin tidak kekal selamat selepas pengagihan semula atau penyesuaian. Tech Xplore berkata para penyelidik memberi amaran ini boleh menjadikan penjanaan kandungan berbahaya lebih berskala, walaupun sumber itu tidak menetapkan bahawa mana-mana model yang diuji telah digunakan dalam serangan dunia nyata.

Akaun Tech Xplore memfokuskan pada perbezaan antara tingkah laku keselamatan yang dikeluarkan model dan tingkah lakunya selepas pengubahsuaian. Model berwajaran terbuka boleh dimuat turun dan diperhalusi oleh pembangun, syarikat dan organisasi awam. Fleksibiliti itu menyokong penyelidikan, pengauditan dan penggunaan tempatan, tetapi ini juga bermakna bahawa perlindungan asal model mungkin tidak mengawal setiap versi yang diperoleh daripadanya. Laporan itu mengatakan para penyelidik menganggap risiko ini relevan walaupun kelemahannya mungkin tidak unik untuk model terbuka.

Kebimbangan praktikal ialah mengalih keluar perlindungan keselamatan boleh membenarkan model yang mampu menghasilkan bahan berbahaya pada skala. Tech Xplore memetik kemungkinan penggunaan termasuk maklumat salah besar-besaran, penipuan e-mel yang canggih dan arahan untuk membuat bahan kimia berbahaya. Ini adalah senario risiko yang diterangkan dalam laporan, bukan insiden yang didokumenkan yang timbul daripada model yang diuji. Sumber itu tidak memberikan bukti bahawa peserta kajian itu menjalankan kempen dunia sebenar, mencederakan mangsa atau menghasilkan bahan berbahaya.

Penemuan boleh menjejaskan cara organisasi menilai model sebelum menggunakan model tersebut. Tech Xplore melaporkan bahawa para penyelidik meminta penilaian dan perolehan berasaskan bukti yang lebih ketat kerana kerajaan menggunakan AI dalam bidang termasuk penjagaan kesihatan, pengesanan penipuan, pendidikan dan perkhidmatan awam yang lain. Rekod keselamatan model sebelum penyesuaian mungkin tidak mencukupi untuk tetapan tersebut jika penalaan halus kemudian boleh mengubah perlindungannya. Walau bagaimanapun, sumber itu tidak menetapkan keperluan kawal selia, piawaian perolehan khusus atau pemulihan yang diuji yang akan menyelesaikan masalah.

Laporan itu juga memaparkan keterbukaan sebagai pertukaran keselamatan dan akauntabiliti dan bukannya liabiliti mudah. Tech Xplore memetik penyelidik mengatakan model berat terbuka kekal penting untuk penyelidikan dan penelitian awam. Ini bermakna tindak balas tidak boleh terhad kepada menyekat akses tanpa mengambil kira faedah ujian dan pengubahsuaian bebas. Artikel itu tidak dapat diselesaikan cara pembangun dapat mengekalkan faedah tersebut sambil menghalang perubahan yang tidak dibenarkan atau tidak selamat, dan sama ada rintangan gangguan boleh dipercayai merentas keluarga model.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Persoalan utama ialah bagaimana 21 model berprestasi di bawah serangan tertentu, pertahanan yang gagal, sama ada pembangun model boleh menghasilkan semula keputusan, dan sama ada teknik rintangan gangguan yang lebih kuat berfungsi merentas seni bina yang berbeza. Tech Xplore melaporkan bahawa TamperBench dikeluarkan sebagai alat ujian sumber terbuka dan penyelidik mahu orang lain memperhalusinya. Sumber tidak mengenal pasti model, memberikan kadar kegagalan perbandingan, atau mendokumentasikan respons daripada pembangunnya.

Item pertama untuk ditonton ialah replikasi bebas. Tech Xplore melaporkan hasil yang luas merentas 21 model, tetapi sumbernya tidak mengenal pasti model, konfigurasi serangan, perlindungan garis dasar atau kadar kegagalan yang diukur. Butiran tersebut akan menentukan sama ada penemuan itu digunakan secara meluas untuk LLM berat terbuka atau terutamanya pada reka bentuk keluaran dan syarat penilaian tertentu. Pengeluaran semula oleh pembangun model, kumpulan akademik dan penyelidik keselamatan akan membantu membezakan kelemahan umum daripada pengehadan persediaan yang diuji.

Alat TamperBench adalah satu lagi perkembangan penting. Tech Xplore berkata para penyelidik mengeluarkannya sebagai rangka kerja sumber terbuka dan berharap penyelidik lain akan memperbaikinya. Versi akan datang boleh menjelaskan jenis penalaan halus atau berat dan perubahan perwakilan yang paling merosakkan, sama ada kaedah keselamatan tertentu bertahan daripadanya, dan berapa banyak usaha yang diperlukan oleh penyerang. Sumber itu tidak menyatakan di mana alat itu dihoskan, sejauh mana ia boleh diakses atau sama ada keluarannya termasuk perlindungan daripada mendayakan penyalahgunaan.

Respons pembangun model akan menjadi penting. Artikel itu tidak melaporkan ulasan daripada syarikat atau komuniti yang bertanggungjawab ke atas 21 model itu, dan juga tidak menyatakan sama ada ada yang telah mengeluarkan tampalan, dokumentasi yang disemak atau prosedur keluaran baharu. Pelaporan susulan yang berguna akan memeriksa sama ada pembangun boleh mengesan gangguan, mengesahkan varian model yang diluluskan, menerbitkan penilaian keselamatan selepas penalaan halus atau mengehadkan keupayaan berisiko tinggi tanpa menjejaskan penyelidikan yang sah.

Persoalan kesan awam ialah sama ada organisasi mengubah amalan penempatan mereka. Tech Xplore menunjukkan penggunaan AI oleh kerajaan dalam penjagaan kesihatan, pengesanan penipuan, pendidikan dan perkhidmatan awam, tetapi ia tidak memberikan bukti tentang institusi atau insiden tertentu yang terjejas. Perhatikan peraturan perolehan yang memerlukan ujian model yang diubah suai, audit bebas terhadap tingkah laku keselamatan, pendedahan kaedah penalaan halus dan had yang jelas untuk bergantung pada perlindungan yang boleh dialih keluar selepas dikeluarkan. Sehingga soalan tersebut dijawab, laporan itu menyokong sikap berhati-hati tentang menganggap profil keselamatan awal model yang dikeluarkan secara terbuka sebagai kekal.

Panduan & kuiz berkaitan

Model AI DiterangkanEtika AILatihan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak peraturan AI
Adakah ini berguna?