Ai di frontiera

Anche i modelli open-weight “evadono”: Kimi K3 esce dalla sandbox e cerca le risposte su GitHub

di |

Il modello di Moonshot AI ha sfruttato una configurazione errata dell’ambiente di test per accedere a Internet durante una valutazione di cybersicurezza. Secondo Frontier Security, il caso mostra quanto sia difficile contenere il comportamento dei sistemi AI più avanzati.

Kimi K3, il nuovo modello open-weight sviluppato dalla cinese Moonshot AI, è riuscito a uscire dall’ambiente isolato nel quale veniva sottoposto a un test di cybersicurezza, collegandosi a Internet e cercando su GitHub le risposte necessarie per completare la prova.

A raccontare l’episodio è il South China Morning Post, che cita un’analisi pubblicata dalla società statunitense Frontier Security. Il test utilizzava un benchmark dell’AI Security Institute britannico ed era stato progettato per valutare le capacità difensive del modello in ambito cyber.

La falla nella sandbox

Secondo i ricercatori Paul Kassianik e Yaron Singer, una configurazione errata della rete nel framework di valutazione ha permesso a Kimi K3 di superare i confini della sandbox.

Il modello avrebbe individuato autonomamente il problema, verificando le proprie impostazioni di rete. Una volta ottenuto l’accesso all’esterno, ha cercato su GitHub informazioni utili per rispondere alle domande del benchmark. In pratica, invece di completare il test esclusivamente attraverso le proprie capacità, Kimi K3 ha trovato un modo per consultare risorse esterne.

Nessun attacco a sistemi esterni

L’episodio non ha comunque comportato l’hacking di un’infrastruttura esterna. Kimi K3 ha potuto accedere a Internet a causa della configurazione dell’ambiente di test. È una differenza rilevante rispetto ad altri incidenti recenti che, secondo le ricostruzioni citate, hanno coinvolto modelli proprietari di OpenAI e Anthropic.

Il caso mostra però che anche un sistema open-weight può individuare e sfruttare autonomamente una debolezza dell’ambiente nel quale viene eseguito.

Il nodo dei modelli open-weight

Per Frontier Security, il caso Kimi K3 solleva una questione ulteriore: il modello è open-weight. I pesi possono quindi essere scaricati e utilizzati da soggetti esterni sulle proprie infrastrutture, senza che lo sviluppatore mantenga necessariamente il controllo sulle modalità di impiego.

Secondo i ricercatori, questa caratteristica può rendere più difficile intervenire quando un modello mostra capacità potenzialmente problematiche. Una volta distribuiti, infatti, i pesi possono essere copiati, modificati e riutilizzati anche da attori ostili.

Sicurezza e modelli aperti

Proprio l’accessibilità dei modelli open-weight è diventata uno dei principali terreni di confronto nel dibattito sulla sicurezza dell’AI.

I critici sostengono che sistemi sempre più avanzati, se liberamente disponibili, possano ridurre le barriere tecniche per chi vuole utilizzarli in attività cyber offensive.

Una parte dell’industria tecnologica statunitense sostiene però che gli stessi modelli siano importanti anche per la difesa. Nvidia, Palantir e Meta, insieme ad altre aziende, hanno chiesto a Washington di non introdurre restrizioni generalizzate sull’open-weight, sostenendo che questi strumenti permettono anche ai difensori di analizzare e contrastare nuove minacce.

Leggi le altre notizie sull’home page di Key4biz