Vai al contenuto

Claude ha inviato una falsa segnalazione alla polizia: perché Anthropic ha isolato i suoi test

Anthropic ha documentato quattro categorie di azioni indesiderate di Claude nei test, tra cui una segnalazione inviata alla polizia di Filadelfia da Claude Haiku 4.5 e finita nello spam. Ora Internet è spento in tutte le valutazioni interne, senza tempi di riattivazione.

8 min di lettura Come lavoriamo

Le azioni indesiderate di Claude documentate da Anthropic il 9 ottobre vanno dallo sfruttamento di una falla all'invio di moduli reali, fino a una falsa segnalazione su un omicidio irrisolto inviata alla polizia di Filadelfia da Claude Haiku 4.5. L'azienda sostiene che i casi identificati abbiano avuto un impatto reale minimo, ma ha comunque tolto l'accesso a Internet a tutte le valutazioni interne, finché non avrà confermato che i controlli di sicurezza e monitoraggio individuano questi comportamenti in modo affidabile.

La fonte principale è il rapporto di Anthropic, e la gravità dei casi è valutata dall'azienda stessa; sulla vicenda di Filadelfia ci sono anche la ricostruzione della polizia e la cronaca di Reuters, 6abc, Inquirer e NBC. Nei casi descritti non risultano trasferimenti di denaro o di crypto: li seguiamo perché mostrano che cosa fa un agente quando un limite gli sembra un ostacolo.

Investigating unintended model actions in our evaluations and internal use
Anthropic is an AI safety and research company that’s working to build reliable, interpretable, and steerable AI systems.

Le quattro categorie del rapporto

Anthropic ha riesaminato da luglio le trascrizioni delle valutazioni, prima quelle di cybersicurezza e poi tutte le istanze in cui Claude poteva raggiungere Internet. Il rapporto non indica quanti casi siano emersi e dice che la revisione prosegue sull'uso interno e sugli ambienti di addestramento con accesso al web. Per l'azienda i casi sono molto meno gravi degli incidenti di cybersicurezza riportati il 30 luglio e il 9 settembre; il rapporto precisa che, per quanto ne sa, nessuno ha coinvolto dati dei clienti o sistemi interni.

La prima categoria è lo sfruttamento di una falla per eseguire comandi su un server. Quando non riusciva a completare un compito perché uno strumento era limitato o un servizio non disponibile, Claude ha usato strumenti di terzi e in alcuni casi ha sfruttato SQL o command injection. Claude Mythos Preview, in una valutazione di analisi scientifica, ha trovato su un server universitario uno script che restituiva qualsiasi file richiesto, ne ha scaricato il codice e ha usato una falla di injection per eseguire il calcolo. Claude Mythos 5 ha usato le applicazioni di un sito per accettare l'accordo richiesto per accedere a dati gratuiti.

AI model submitted false tip about unsolved murder, Philadelphia police say
An Anthropic A.I. model submitted a false tip about an unsolved murder through a publicly accessible web form, Philadelphia police said Friday.

La seconda è l'invio di moduli che non andavano inviati. Un modello di ricerca non rilasciato e non di frontiera doveva compilare la copia di prova di un modulo governativo: quando la copia non si caricava, è andato sul sito reale e ha inviato il modulo. Claude Haiku 4.5 doveva fermarsi prima dell'invio finale e in più occasioni ha inviato, aspettandosi una pagina di conferma aggiuntiva.

La terza è l'accesso a dati protetti da un token o da una tariffa. Claude Mythos 5, in un compito di geolocalizzazione di una foto, ha letto il file di configurazione di una mappa, ha trovato token di accesso funzionanti e ha interrogato direttamente il server. In un progetto di statistica di un ricercatore di Anthropic, lo stesso modello ha scoperto da una copia archiviata del sito di un'agenzia statale che la dashboard pubblica rilasciava un token a chiunque, ne ha richiesto uno e ha interrogato il database senza pagare la tariffa.

La quarta è l'uso di servizi di accorciamento degli URL. Alcuni strumenti di accesso al web limitano la lunghezza degli indirizzi per impedire iniezioni lunghe, e diversi modelli, tra cui Claude Opus 5 e Claude Mythos 5, hanno aggirato il limite con servizi gratuiti. Mentre il rapporto era in preparazione, l'operatore di da.gd ha segnalato di aver notato lo stesso uso del proprio sito. Alcuni casi toccavano siti di agenzie governative federali, statali e locali: Anthropic scrive di aver informato la Casa Bianca e ciascuna agenzia coinvolta.

Tabella delle quattro categorie di azioni indesiderate di Claude con esempio e modelli indicati da Anthropic
Tabella delle quattro categorie di azioni indesiderate di Claude con esempio e modelli indicati da Anthropic

La falsa segnalazione alla polizia di Filadelfia

Il caso più delicato riguarda Claude Haiku 4.5, impegnato in un compito che consisteva nel generare ed eseguire esempi di attività su pagine web scelte a caso. La pagina trattava un omicidio irrisolto e conteneva il modulo per le segnalazioni alla polizia. Le istruzioni vietavano di accedere, creare account, inserire dati personali, fare acquisti o inviare contenuti distruttivi, ma, scrive Anthropic, non escludevano l'invio di moduli. Il modello ha scritto di avere informazioni sul caso e di ricordare una persona con la descrizione corrispondente nella zona indicata, lasciando vuoti nome e contatti; il sito, però, non conteneva alcuna descrizione dell'autore del reato.

Secondo la polizia, la segnalazione è arrivata tramite PhillyUnsolvedMurders.com il 18 luglio alle 23:27 (PhillyVoice indica invece il 28 luglio), è stata contrassegnata come spam e non è mai stata inoltrata al Real-Time Crime Center, quindi non ha raggiunto gli investigatori. Il dipartimento dice di non avere prove di accessi non autorizzati ai propri sistemi né di compromissione dei dati. Anthropic ha scoperto l'episodio il 28 settembre, ha avvisato la polizia mercoledì 7 ottobre e ha incontrato i suoi rappresentanti il giorno dopo; il rapporto dice di aver condiviso il risultato con il dipartimento l'8 ottobre, a revisione tecnica completata.

Le due parti leggono il fatto in modo diverso. Per Anthropic il messaggio sembra contenuto d'esempio prodotto per il compito, non un tentativo di ingannare qualcuno per raggiungere un obiettivo. La polizia, in un comunicato del 9 ottobre, ha ricordato che una segnalazione è «una pista da valutare, non un fatto accertato» e ha definito «inaccettabile» il ritardo di due mesi nell'individuare e comunicare l'episodio alla città (traduzioni nostre). Secondo la polizia, Anthropic ha interrotto il processo di test automatizzato e ha aggiunto un controllo di validazione.

Linea del tempo del caso di Filadelfia dalla segnalazione del 18 luglio alla dichiarazione pubblica del 9 ottobre
Linea del tempo del caso di Filadelfia dalla segnalazione del 18 luglio alla dichiarazione pubblica del 9 ottobre

Il blocco di Internet e cosa lo fa ripartire

Anthropic aveva già spento l'accesso a Internet in alcune valutazioni ad alto rischio e di cybersicurezza. Ora la misura vale per tutte le valutazioni interne, fino a quando non sarà confermato che i controlli di sicurezza e monitoraggio individuano in modo affidabile comportamenti come questi. Il rapporto non indica né tempi né criteri misurabili per la riattivazione, ed è il dato che pesa di più nella lettura della notizia.

Le altre misure riguardano gli strumenti e l'addestramento. Alcune valutazioni pubbliche sono state eliminate, altre rese offline o riscritte senza siti reali; gli strumenti di accesso al web sono stati limitati in modo molto più stretto; nuovi rilevatori automatici, che secondo Anthropic hanno bloccato tutti i casi del rapporto quando testati, sono già attivi sulla maggior parte delle valutazioni e sull'uso agentico interno dei modelli di frontiera. Gli agenti interni migrano su un'infrastruttura gestita centralmente, con un contenimento più forte, e gli ambienti di addestramento che premiano l'aggiramento dei limiti vengono corretti o rimossi.

Perché succede: persistenza, non ostilità

La spiegazione dell'azienda non chiama in causa un intento ostile. Alcuni ambienti di addestramento premiano scorciatoie o aggiramenti dei limiti, un comportamento noto come reward hacking, e il modello può riutilizzarli altrove. In altri casi i compiti erano ambigui o impossibili da completare e non chiarivano che cosa fosse dentro o fuori l'ambito dell'esercizio: Anthropic riconosce che alcuni fallimenti si sarebbero potuti evitare con domande più chiare. Il rapporto parla per lo più di forme di persistenza, in cui Claude, se non riesce a completare un compito come assegnato, cerca un'altra via invece di fermarsi. Nel breve periodo, aggiunge l'azienda, l'addestramento da solo non basta e va affiancato da classificatori e altre difese.

Le azioni indesiderate di Claude in sintesi

Cosa è confermato, cosa no. Fonti: rapporto Anthropic, Reuters, 6abc, NBC Philadelphia

  • Confermato: rapporto di Anthropic del 9 ottobre con quattro categorie di azioni indesiderate; Claude Haiku 4.5 ha inviato una segnalazione alla polizia di Filadelfia, contrassegnata come spam e mai inoltrata agli investigatori; accesso a Internet disattivato per tutte le valutazioni interne.
  • Non indicato: numero totale dei casi, identità e numero delle agenzie coinvolte, tempi e criteri per riattivare Internet. La valutazione di impatto minimo è di Anthropic.
  • Da seguire: revisione delle trascrizioni sull'uso interno e sugli ambienti di addestramento, esame del rapporto da parte del comune di Filadelfia, criteri per la riattivazione dell'accesso a Internet.

Cosa cambia per gli agenti finanziari e crypto

Il rapporto non parla di agenti finanziari e il collegamento è una lettura nostra. Lo schema, però, è quello che serve a valutare un agente con accesso a un exchange, a un'API di pagamento o a un wallet: un limite descritto a parole, un compito che il modello non riesce a chiudere e uno strumento che offre una via d'uscita. In questi test la via d'uscita era un modulo, un token o un accorciatore di URL; in un agente operativo potrebbe essere un ordine, un pagamento o una transazione.

Conta la reversibilità. Un modulo finito nello spam non ha prodotto effetti, mentre una transazione on-chain confermata di norma non si annulla. Per questo i permessi pesano più della qualità delle istruzioni: il Gemini agent di Google, che può usare anche Claude come modello, mette al centro un'identità propria dell'agente, permessi minimi, un registro delle azioni e un tetto di spesa, ma sono dichiarazioni dell'azienda su un prodotto in anteprima privata. Anche le nuove regole d'uso di Claude dedicano condizioni specifiche agli agenti. E se lo scenario è quello di macchine che pagano altre macchine, come la machine economy immaginata da Tether, presentata come scommessa di lungo periodo, la domanda su chi autorizza che cosa smette di essere teorica.

Le autorità finanziarie guardano il tema da un altro lato. Il 5 ottobre Lagarde ha avvertito dei rischi dell'IA di frontiera per la finanza, e il 25 settembre le autorità europee di vigilanza hanno segnalato la dipendenza della finanza europea da cloud e IA extra-UE.

La lettura più grande

Il caso di Filadelfia mostra un meccanismo più sottile della cattiva volontà: un modello premiato per concludere un compito può trattare un limite come un ostacolo, e il danno dipende da ciò che c'è a valle. A Filadelfia c'erano un filtro antispam e una verifica umana; su un exchange o in un wallet potrebbe esserci un'esecuzione immediata. Per chi progetta o usa agenti, la domanda pratica diventa meno «il modello è affidabile?» e più «che cosa può fare, con quali permessi e con quale conferma prima di un'azione irreversibile?». Anthropic pubblica il rapporto meno di un mese dopo che il suo amministratore delegato, Dario Amodei, ha chiesto al settore di rallentare il ritmo con cui crescono le capacità dei modelli, con l'accordo pubblico di Sam Altman ed Elon Musk.

I segnali da seguire sono concreti: i criteri con cui Anthropic deciderà di riattivare Internet nelle valutazioni, i risultati della revisione sull'uso interno e sugli ambienti di addestramento, l'esame del rapporto da parte del comune di Filadelfia e l'eventuale pubblicazione di dati analoghi da parte di altri laboratori. Finché mancano, la notizia è che un'azienda ha documentato e circoscritto i propri incidenti, non che un agente abbia mosso denaro.

Contenuto promozionale