Anthropic: l'AI Claude hackera per errore tre società durante i test
Anthropic: l'AI Claude hackera per errore tre società durante i test
Una settimana dopo il caso OpenAI, Anthropic rivela che Claude ha avuto accesso a Internet per un errore nei test e ha compromesso i sistemi di tre aziende esterne. Il tema della sicurezza degli agenti AI prima dell’ipo di Anthropic

di Elena Dal Maso 31/07/2026 08:50

Ftse Mib
52.591,49 11.43.43

+0,93%

Dax 30
25.802,81 11.43.39

+0,74%

Dow Jones
52.209,48 10.58.22

+1,19%

Nasdaq
25.118,17 7.25.15

+2,78%

Euro/Dollaro
1,1510 11.28.47

-0,10%

Spread
85,03 11.58.31

+4,75

Anthropic ha reso noto che i suoi modelli di intelligenza artificiale Claude hanno violato i sistemi informatici di tre organizzazioni esterne durante test sulle capacità offensive di cybersicurezza, una settimana dopo un episodio analogo comunicato da OpenAI.

Claude è entrato ne sistemi di aziende esterne mentre veniva sottoposto a prove di hacking controllato. Alla base dell'incidente vi sarebbe un errore di configurazione: a causa di «un malinteso» con il partner incaricato dei test, Irregular, il modello ha potuto collegarsi a Internet, nonostante l'ambiente di prova avrebbe dovuto essere completamente isolato.

L'episodio arriva pochi giorni dopo che OpenAI aveva rivelato come due suoi modelli fossero riusciti a uscire dall'ambiente di test e ad attaccare la Hugging Face sfruttando una vulnerabilità software.

Tre casi su oltre 141 mila verifiche

Anthropic ha spiegato che proprio dopo l'incidente di OpenAI ha riesaminato le proprie procedure di valutazione, individuando tre episodi anomali su oltre 141.000 test effettuati. In tutti i casi i modelli erano stati informati che stavano operando in una simulazione priva di accesso alla rete. In realtà, per un errore di coordinamento con il partner esterno, la connessione a Internet era disponibile.

I test consistevano in esercitazioni di tipo capture the flag, una metodologia utilizzata nella cybersicurezza che richiede di analizzare o sfruttare vulnerabilità informatiche per recuperare informazioni nascoste.

In uno degli episodi, Claude ha preso di mira una società fittizia che condivideva però il nome di un dominio Internet realmente esistente. L'agente AI, ossia un programma capace di operare autonomamente seguendo istruzioni umane, ha sfruttato vulnerabilità dell'infrastruttura digitale della società, ha estratto dati e ha ottenuto l'accesso a un database.

Rafforzati i controlli in vista dell'ipo

L'episodio alimenta le preoccupazioni sulla sicurezza dei sistemi di intelligenza artificiale, sempre più capaci di eseguire attacchi informatici reali anche durante la fase di test precedente al rilascio commerciale.

Anthropic, che si prepara a una possibile quotazione in borsa già entro quest'anno, ha dichiarato di aver sospeso immediatamente le valutazioni sulle capacità cyber non appena si è accorta che Claude poteva accedere a Internet.

Gli incidenti hanno coinvolto tre diversi modelli: Opus 4.7, Mythos 5 e un modello sperimentale utilizzato esclusivamente per la ricerca. In particolare, Mythos 5, distribuito a un numero limitato di partner, aveva già attirato l'attenzione per le sue avanzate capacità di individuare e sfruttare vulnerabilità software. (riproduzione riservata)