dario amodei anthropic

I MODELLI DI INTELLIGENZA ARTIFICIALE DI ANTHROPIC HANNO "OTTENUTO UN ACCESSO NON AUTORIZZATO" AI SISTEMI DI TRE ORGANIZZAZIONI DURANTE UN TEST CHE AVREBBE DOVUTO TENERLI ISOLATI DAL "MONDO REALE" – E’ UNA SITUAZIONE SIMILE A QUELLA ACCADUTA A OPENAI. POCHI GIORNI FA, INFATTI, LA RIVALE GUIDATA DA SAM ALTMAN HA RIVELATO CHE I PROPRI MODELLI AVEVANO AVUTO ACCESSO IMPROPRIO A INTERNET E AVEVANO AGITO IN MODO IMPREVISTO DURANTE I TEST DI SICUREZZA – IN QUESTO CASO PERO’ ANTHROPIC AVEVA POSTO UNA SFIDA ALL’IA PER VALUTARE LE SUE CAPACITÀ INFORMATICHE E IL MODELLO HA OPERATO SENZA LE CONSUETE MISURE DI SICUREZZA PUR DI RAGGIUNGERE L’OBIETTIVO…

Vai all'articolo precedente Vai all'articolo precedente
guarda la fotogallery

ANTHROPIC, 'ACCESSO NON AUTORIZZATO' NOSTRA AI AL MONDO REALE NEI TEST

Avrebbero dovuto restare isolati, l'episodio è simile a quello accaduto a OpenAI

IL MODELLO DI ANTHROPIC CLAUDE MYTHOS

(ANSA) - PECHINO, 31 LUG - I modelli di intelligenza artificiale di Anthropic hanno "ottenuto un accesso non autorizzato" ai sistemi di tre organizzazioni durante la fase dei test che avrebbero dovuto tenerli isolati dal "mondo reale". Lo ha riferito la compagnia, dando conto di una situazione simile a quella accaduta a OpenAI. Pochi giorni fa, infatti, la rivale guidata da Sam Altman ha rivelato che i propri modelli avevano avuto accesso improprio a Internet e avevano agito in modo imprevisto durante i test di sicurezza.

 

IL MODELLO DI ANTHROPIC CLAUDE MYTHOS

In un post sul blog di giovedì sera (la notte di venerdì in Italia), Anthropic ha detto di aver esaminato oltre 141.000 valutazioni di Claude, individuando tre casi in cui un modello ha avuto accesso a Internet mentre si trovava all'interno o interagiva con un ambiente di test isolato, ospitato da un partner terzo, Irregular. Da lì, il modello di IA ha "ottenuto un accesso non autorizzato all'infrastruttura di produzione di tre diverse organizzazioni", ha affermato l'azienda.   

 

Gli incidenti hanno coinvolto tre diverse versioni di Claude: Opus 4.7, Mythos e un modello sperimentale per la ricerca su Internet privo di nome specifico. Sono riusciti a uscire dall'ambiente di test a causa di un "malinteso" tra l'azienda e il partner incaricato della valutazione, il quale aveva reso possibile l'accesso a Internet per i modelli stessi.   

dario amodei

 

La situazione, da questo punto di vista, è diversa dall'incidente di OpenAI, in cui due modelli avevano sfruttato una vulnerabilità sconosciuta in un software di terze parti per accedere a Internet senza intervento umano.

 

Nel caso di Anthropic, al modello era stata assegnata una sfida di tipo "capture-the-flag" (cattura la bandiera), usata dall'azienda per valutare le capacità informatiche del modello, a cui viene presentato uno scenario fittizio: la "bandiera" si trova su una macchina diversa della rete, alla quale deve accedere per recuperarla.

 

"La sfida è a esito aperto e non viene prescritto alcun metodo specifico", ha precisato Anthropic.    Analogamente a quanto accaduto a OpenAI, i modelli di Anthropic hanno operato senza le consuete misure di sicurezza: incidenti che confermano gli avvertimenti lanciati da anni dalla comunità tecnologica sulle crescenti capacità e ai potenziali rischi dell'intelligenza artificiale.