Tilbake til Nyheter
SikkerhetAI Understanding orientering

Tech Xplore rapporterer at sikkerhetsbeskyttelsen er fjernet fra 21 LLM-er med åpen vekt

Tech Xplore rapporterer at forskere testet 21 mye brukte språkmodeller med åpen vekt og fant ut at finjustering eller annen tukling kunne fjerne deres innebygde sikkerhetsbeskyttelse. Studiens funn er ikke uavhengig bekreftet her.

6 min readRead the linked source
Primary-source image accompanying Tech Xplore reports safety protections removed from 21 open-weight LLMs
KildereferanseKilde registrert
Utgiver
techxplore.com
Kilde lenke
techxplore.comhttps://techxplore.com/news/2026-08-major-weaknesses-weight-llms.html
Kildetype
Koblet kilde – status for primærkilde er ikke etablert.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Vekt
En lært numerisk verdi som skalerer signaler som passerer gjennom et nevralt nettverk.
Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Finjustering
Fortsatt opplæring på domenespesifikke data for å tilpasse en forhåndstrent modell til en spesifikk oppgave.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

Tech Xplore rapporterer at et forskerteam ledet av University of Waterloo og nonprofit AI-sikkerhetsgruppen FAR.AI testet 21 populære store språkmodeller med åpen vekt ved å bruke et rammeverk kalt TamperBench. Forskerne fant ut at hver testet modell kunne tukles med på måter som kompromitterte sikkerhetstiltakene. Arbeidet ble presentert på ACM SIGKDD-konferansen og er også identifisert i kilden som en arXiv-artikkel. Tech Xplore er det navngitte rapporteringsstedet; funnene og deres bredere implikasjoner er ikke uavhengig bekreftet her.

Tech Xplore rapporterer at studien, ledet av University of Waterloo og FAR.AI, undersøkte 21 av de mest populære LLM-ene med åpen vekt. Teamet inkluderte forskere fra Massachusetts Institute of Technology, ETH Zürich og University of Toronto. Ifølge utsalgsstedet fant forskerne at alle 21 modellene kunne tukles med til tross for sikkerhetsbeskyttelsene innebygd i dem. Kilden presenterer dette som et resultat av studiens testing, ikke som et uavhengig bekreftet funn av Tech Xplore. Den viser ikke modellene eller gir en modell-for-modell-oppdeling av resultatene.

Forskerne bygde TamperBench, som Tech Xplore beskriver som et åpen kildekode, standardisert rammeverk for å simulere ulike angrep på modellsikkerhet. Rapporten sier at tukling kan innebære å endre en modells vekter eller latente representasjoner, med sikte på å svekke eller fjerne sikkerhetstiltak som blokkerer skadelige reaksjoner. Tech Xplore karakteriserer rammeverket som en systematisk måte å teste om beskyttelser overlever slike endringer. Kilden spesifiserer ikke de fullstendige angrepsprosedyrene, beregningsressursene som kreves, suksessraten for hver teknikk, eller hvordan forskerne fant ut at en beskyttelse hadde blitt kompromittert.

Rapporten identifiserer papiret som "TamperBench: Systematically Stress-Testing LLM Safety Under and Tampering." Tech Xplore sier at arbeidet nylig ble presentert på den 32. ACM SIGKDD-konferansen om kunnskapsoppdagelse og datautvinning i Sør-Korea og gir publikasjonens DOI og en arXiv-lenke. Artikkelen navngir Saad Hossain som forskeren som ledet studien og siterer forskere fra University of Waterloo som beskriver resultatene som en advarsel for AI-utviklere og -anskaffere. Kilden bekrefter ikke uavhengig papirets metoder, resultater eller fagfellevurderingsstatus utover beskrivelsen av konferansepresentasjonen og publikasjonsdetaljer.

Kildedetaljer: techxplore.com ↗

Hvorfor det betyr noe

Rapporten beskriver et sikkerhetsproblem skapt av muligheten til å laste ned og endre modeller med åpen vekt. Hvis sikkerhetsbeskyttelsen kan fjernes gjennom finjustering eller endringer i modellvekter eller latente representasjoner, kan det hende at en modell som ser ut til å være trygg ved utgivelse ikke forblir trygg etter omdistribusjon eller tilpasning. Tech Xplore sier at forskerne advarte om at dette kan gjøre generering av skadelig innhold mer skalerbar, selv om kilden ikke fastslår at noen av de testede modellene har blitt brukt i et angrep fra den virkelige verden.

Tech Xplores beretning fokuserer på skillet mellom en modells utgitte sikkerhetsadferd og dens oppførsel etter modifikasjon. Åpne modeller kan lastes ned og finjusteres av utviklere, bedrifter og offentlige organisasjoner. Denne fleksibiliteten støtter forskning, revisjon og lokal distribusjon, men det betyr også at en modells originale sikkerhetstiltak kanskje ikke kontrollerer alle versjoner avledet fra den. Rapporten sier at forskerne anser denne risikoen som relevant selv om svakhetene kanskje ikke er unike for åpne modeller.

Den praktiske bekymringen er at fjerning av sikkerhetsbeskyttelse kan tillate en dyktig modell å generere skadelig materiale i stor skala. Tech Xplore nevner mulig bruk, inkludert massedesinformasjon, sofistikert e-postsvindel og instruksjoner for å lage farlige kjemikalier. Dette er risikoscenarier beskrevet i rapporten, ikke dokumenterte hendelser som oppstår fra de testede modellene. Kilden gir ingen bevis for at deltakerne i studien gjennomførte kampanjer i den virkelige verden, skadet ofre eller produserte farlige stoffer.

Funnene kan påvirke hvordan organisasjoner evaluerer modeller før de distribueres. Tech Xplore rapporterer at forskerne etterlyste mer strenge, evidensbaserte vurderinger og anskaffelser ettersom myndigheter bruker kunstig intelligens på områder inkludert helsevesen, svindeloppdagelse, utdanning og andre offentlige tjenester. En modells sikkerhetsrekord før tilpasning er kanskje ikke nok for disse innstillingene hvis senere finjustering kan endre sikkerhetstiltakene. Kilden etablerer imidlertid ikke et forskriftskrav, en spesifikk anskaffelsesstandard eller en testet utbedring som ville løse problemet.

Rapporten presenterer også åpenhet som en avveining for sikkerhet og ansvarlighet snarere enn et enkelt ansvar. Tech Xplore siterer forskerne som sier at modeller med åpen vekt fortsatt er viktige for forskning og offentlig gransking. Det betyr at et svar ikke kan begrenses til å begrense tilgangen uten å vurdere fordelene med uavhengig testing og modifikasjon. Artikkelen etterlater uavklart hvordan utviklere kan bevare disse fordelene samtidig som de forhindrer uautoriserte eller usikre endringer, og om manipulasjonsmotstand kan gjøres pålitelig på tvers av modellfamilier.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

Nøkkelspørsmålene er hvordan de 21 modellene presterte under spesifikke angrep, hvilket forsvar som mislyktes, om modellutviklere kan reprodusere resultatene, og om sterkere manipulasjonsmotstandsteknikker fungerer på tvers av forskjellige arkitekturer. Tech Xplore rapporterer at TamperBench ble utgitt som et åpen kildekode-testverktøy og at forskerne vil at andre skal avgrense det. Kilden identifiserer ikke modellene, gir ikke sammenlignende feilfrekvenser eller dokumenterer svar fra utviklerne deres.

Det første elementet å se er uavhengig replikering. Tech Xplore rapporterer et bredt resultat på tvers av 21 modeller, men kilden identifiserer ikke modellene, angrepskonfigurasjonene, grunnleggende sikkerhetstiltak eller målte feilfrekvenser. Disse detaljene vil avgjøre om funnene gjelder bredt for LLM-er med åpen vekt eller hovedsakelig for spesielle utgivelsesdesign og evalueringsforhold. Reproduksjon av modellutviklere, akademiske grupper og sikkerhetsforskere vil hjelpe til med å skille en generell svakhet fra en begrensning i det testede oppsettet.

TamperBench-verktøyet er en annen viktig utvikling. Tech Xplore sier at forskerne ga det ut som et åpen kildekode-rammeverk og håper andre forskere vil forbedre det. Fremtidige versjoner kan avklare hvilke typer finjustering eller vekt- og representasjonsendringer som er mest skadelige, om visse sikkerhetsmetoder overlever dem, og hvor mye innsats en angriper trenger. Kilden sier ikke hvor verktøyet er vert, hvor tilgjengelig det er, eller om utgivelsen inkluderer sikkerhetstiltak mot å muliggjøre misbruk.

Modellutviklernes svar vil ha betydning. Artikkelen rapporterer ikke kommentarer fra selskapene eller samfunnene som er ansvarlige for de 21 modellene, og det står heller ikke om noen har utstedt patcher, revidert dokumentasjon eller nye utgivelsesprosedyrer. Nyttig oppfølgingsrapportering vil undersøke om utviklere kan oppdage tukling, autentisere godkjente modellvarianter, publisere sikkerhetsevalueringer etter finjustering, eller begrense høyrisikofunksjoner uten å undergrave legitim forskning.

Spørsmålet om offentlig innvirkning er om organisasjoner endrer distribusjonspraksis. Tech Xplore peker på myndighetenes bruk av AI i helsevesen, svindeloppdagelse, utdanning og offentlige tjenester, men det gir ingen bevis for en spesifikk berørt institusjon eller hendelse. Se etter innkjøpsregler som krever testing av modifiserte modeller, uavhengige revisjoner av sikkerhetsatferd, avsløring av finjusteringsmetoder og klare grenser for å stole på sikkerhetstiltak som kan fjernes etter utgivelse. Inntil disse spørsmålene er besvart, støtter rapporten forsiktighet med å behandle en offentlig utgitt modells opprinnelige sikkerhetsprofil som permanent.

Relaterte guider og quizer

AI-modeller forklartKI-etikkAI treningTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-reguleringssporeren
Fant du dette nyttig?