Cosa è successo
Anthropic ha pubblicato un rapporto che descrive in dettaglio gli attacchi alla distillazione su larga scala da parte dei concorrenti cinesi dell'intelligenza artificiale. La società ha dichiarato che Alibaba, Moonshot, DeepSeek, Zhipu e Xiaomi hanno generato collettivamente quasi 190 milioni di interazioni dannose con Claude da maggio a luglio. Questi attacchi prevedevano l'indirizzamento delle query degli utenti destinate ai modelli nazionali a Claude per raccogliere dati di formazione, con Alibaba che contava oltre 151 milioni di scambi tramite 3.500 account fraudolenti.
Anthropic ha pubblicato giovedì un rapporto in cui afferma che cinque importanti laboratori cinesi di intelligenza artificiale - Alibaba, Moonshot, DeepSeek, Zhipu e Xiaomi - hanno condotto quasi 190 milioni di attacchi di distillazione contro il suo modello Claude tra maggio e luglio. Gli attacchi alla distillazione implicano l'utilizzo dei risultati di modelli avanzati per addestrare quelli meno avanzati, consentendo di fatto ai concorrenti di sfruttare le capacità proprietarie di Anthropic senza collaborazione diretta.
Il rapporto specifica che DeepSeek e Moonshot AI hanno reindirizzato le richieste degli utenti destinate ai propri modelli a Claude. Anthropic ha registrato 23 milioni di deviazioni di questo tipo da parte di Moonshot e 12,1 milioni da parte di DeepSeek in un periodo di 14 giorni nel mese di luglio. Inoltre, Anthropic ha affermato che alcune di queste richieste esponevano dati sensibili, inclusi filmati CCTV di un utente affiliato al PLA e informazioni provenienti da un database del governo russo presentato da un appaltatore militare.
Alibaba è stato identificato come il principale trasgressore, con oltre 151 milioni di scambi effettuati da 3.500 conti fraudolenti. Questi resoconti hanno spinto Claude a produrre i suoi processi di ragionamento, che sono stati poi utilizzati per addestrare i modelli Qwen di Alibaba. Anthropic ha anche accusato Z.ai di un attacco simile e ha notato che Xiaomi ha registrato le chat degli utenti con i suoi modelli MiMo e le ha inserite in Claude per generare dati di addestramento.
In risposta a queste minacce, Anthropic ha dichiarato di aver implementato nuove misure di salvaguardia per vietare attività sospette e ridurre i dettagli delle trascrizioni dei ragionamenti per limitarne l'utilità per l'addestramento di altri modelli. La società richiederà inoltre la verifica dell'identità per gli utenti che sembrano operare da Cina, Russia o Iran, regioni in cui Claude non è ufficialmente disponibile. I rappresentanti delle società accusate non hanno risposto alle domande di Business Insider e Anthropic non ha fornito ulteriori commenti oltre al rapporto.
Dettagli della fonte: businessinsider.com ↗
Perché è importante
Questo incidente evidenzia una significativa vulnerabilità in termini di sicurezza e proprietà intellettuale nel panorama globale dell’IA. Estraendo trascrizioni dettagliate dei ragionamenti, i concorrenti possono accelerare lo sviluppo dei propri modelli di frontiera, riducendo potenzialmente il divario di capacità con i laboratori con sede negli Stati Uniti. L’esposizione di dati sensibili governativi e militari durante questi attacchi sottolinea ulteriormente i rischi di un accesso non verificato a sistemi di intelligenza artificiale avanzati, spingendo Anthropic a implementare verifiche dell’identità e restrizioni di output più rigorose.
La portata di questi attacchi rappresenta un trasferimento sostanziale di proprietà intellettuale e vantaggio computazionale. Estraendo catene di ragionamento, i laboratori cinesi possono ridurre significativamente i tempi e i costi necessari per sviluppare modelli di frontiera competitivi, sfidando la leadership tecnologica detenuta dalle società di intelligenza artificiale con sede negli Stati Uniti.
L’esposizione di dati sensibili governativi e militari durante queste interazioni solleva seri problemi di sicurezza. Suggerisce che i sistemi avanzati di intelligenza artificiale potrebbero essere vulnerabili alla fuga di dati attraverso l’ingegneria sociale o la creazione fraudolenta di account, compromettendo potenzialmente gli interessi di sicurezza nazionale di più paesi.
Questo incidente potrebbe accelerare l’azione normativa relativa all’accesso ai modelli di intelligenza artificiale e alla sovranità dei dati. I legislatori negli Stati Uniti hanno già chiesto una legislazione per affrontare tali attacchi, e questo rapporto fornisce prove concrete che potrebbero influenzare i dibattiti politici sui flussi di dati transfrontalieri legati all’intelligenza artificiale e sui controlli delle esportazioni.
Meccanismo interattivo: come funziona realmente
Esplora la tecnologia alla base di questo sviluppo in modo interattivo.
Why can ethical evaluation not be reduced to one model score?
Cosa guardare dopo
Monitorare le risposte legislative negli Stati Uniti e in Cina in merito all’estrazione dei dati dall’intelligenza artificiale e ai flussi di dati transfrontalieri. Cerca ulteriori contromisure tecniche da parte di Anthropic e altri fornitori di intelligenza artificiale per impedire la distillazione del modello. Osservare se i laboratori cinesi accusati rispondono pubblicamente alle accuse o se audit indipendenti verificano l’entità della fuga di dati.
Sviluppi legislativi negli Stati Uniti e in Cina riguardanti l’estrazione dei dati dall’intelligenza artificiale, la distillazione dei modelli e la privacy dei dati transfrontalieri. Gli Stati Uniti potrebbero introdurre norme più severe sull’accesso ai modelli di intelligenza artificiale da parte di entità straniere, mentre la Cina potrebbe rispondere con le proprie misure di protezione dei dati.
Contromisure tecniche da parte dei fornitori di intelligenza artificiale per prevenire attacchi alla distillazione. Ciò può includere una verifica dell’identità più solida, una limitazione della velocità e l’offuscamento degli output del modello per ridurne l’utilità per la formazione di modelli concorrenti.
Risposte pubbliche dei laboratori cinesi di intelligenza artificiale accusati. Una negazione o un chiarimento potrebbero fornire ulteriore contesto, mentre il silenzio può essere interpretato come una tacita ammissione. Anche gli audit indipendenti o la verifica da parte di terzi della portata dell’attacco sarebbero significativi.