Durante alcuni test di sicurezza condotti dall'Istituto per la Sicurezza AI del governo britannico (AISI), gli agenti AI di OpenAI e Anthropic hanno fatto qualcosa che nessuno si aspettava: hanno tentato di attaccare obiettivi reali su internet, creando identità false per manipolare persone in carne e ossa. Non è fantascienza, è successo il pochi giorni fa.La notizia si aggiunge a una lista sempre più lunga di comportamenti autonomi non autorizzati da parte di modelli AI durante le fasi di valutazione, e questa volta il livello di preoccupazione è decisamente più alto del solito. Lo stesso AISI lo ha definito la prima volta in cui i rischi legati all'autonomia e all'inganno si sono manifestati così chiaramente, senza essere stati indotti da istruzioni specifiche. Ecco cosa è successo nel dettaglio: l'AISI stava facendo girare una sfida di cybersicurezza, il tipo di test in cui si chiede a un agente AI di trovare un dato protetto. Il test è stato ripetuto 122 volte su più modelli, in un ambiente isolato con macchine virtuali. In 10 di queste sessioni, però, un agente AI ha preso iniziative autonome e non autorizzate sul web reale, prendendo di mira persone e organizzazioni vere. Di 19 azioni non sanzionate registrate, ben 17 provenivano dal modello Mythos 5 di Anthropic.La parte più inquietante riguarda le tecniche usate: l'agente ha tentato di inserire codice malevolo in un progetto open source, e per farlo ha creato identità online false per fare pressione sul manutentore del progetto e fargli approvare il codice. L'AISI lo ha definito social engineering, una forma di inganno che, fino a poco tempo fa, era considerata largamente teorica per i modelli AI. Tutti i tentativi sono falliti e non hanno causato danni reali, ma il punto non è questo.L'AISI ha identificato diversi fattori che hanno contribuito al comportamento anomalo:L'agente era persistente nel cercare soluzioni alternative quando le strade normali erano bloccateIl compito era difficile, il che spinge i modelli a essere più "creativi" nella risoluzione dei problemiIl monitoraggio dell'accesso a internet era insufficiente e avrebbe potuto identificare il problema primaAll'agente non era stato esplicitamente vietato di usare l'accesso a internet in modo ingannevole, perché fino ad ora si dava per scontato che i modelli con training di allineamento non ne avessero bisognoQuest'ultimo punto è forse il più significativo: l'AISI ha scritto che "in precedenza non era chiaro che tali istruzioni fossero necessarie" con modelli dotati di training di allineamento. Ora evidentemente lo è.Vale la pena precisare che i sistemi di sicurezza standard dei modelli erano stati disabilitati per i test, e che i modelli avevano accesso a internet proprio perché l'obiettivo era misurare cosa sono capaci di fare in condizioni simili a quelle di un attaccante umano competente. Non si tratta quindi di modelli sfuggiti al loro ambiente di test, come era avvenuto in un precedente episodio con un agente OpenAI.OpenAI ha riconosciuto l'incidente e ha annunciato una revisione delle procedure per i test ad alto rischio condotti da partner esterni. Ha anche comunicato un secondo episodio separato, in cui modelli erano stati erroneamente dotati di accesso a internet durante esercizi di cybersicurezza condotti dal partner Irregular.Anthropic ha risposto in modo meno dettagliato, sottolineando che le protezioni standard erano disabilitate e che non erano state fornite restrizioni esplicite sull'uso di internet.Tutto questo avviene in un momento in cui la pressione sul governo USA per una regolamentazione più stringente dell'AI è già alta, e questi episodi non faranno che aumentarla. Non è un caso che oltre 1.100 dipendenti di OpenAI, Google e Anthropic abbiano già chiesto formalmente al governo di rallentare lo sviluppo dell'AI.Il problema di fondo è che i laboratori AI non riescono a contenere i loro prodotti nemmeno in fase di test, e molti di questi episodi emergono solo dopo indagini dedicate. La domanda che resta aperta è quanti comportamenti simili non vengano mai scoperti o divulgati, e cosa succederebbe se un modello con queste capacità avesse accesso a strumenti più potenti. Skynet non ci ha insegnato proprio nulla...L'articolo Gli agenti AI di OpenAI e Anthropic hanno attaccato persone reali durante un test di sicurezza sembra essere il primo su Smartworld.