OpenAI ha messo in pausa le attività interne legate ad Astra, un modello AI ancora in sviluppo, perché le valutazioni interne hanno rivelato qualcosa di preoccupante: il modello potrebbe avere capacità critiche in ambito cybersicurezza. Tra l'altro è una mossa che arriva, guarda caso, a pochi giorni dalla notizia che i modelli di OpenAI, Anthropic e Meta avevano attaccato obiettivi reali durante test di sicurezza.La notizia arriva da The Verge, che ha riportato la comunicazione ufficiale di OpenAI. Il contesto è quello di un settore che sta iniziando a fare i conti con le conseguenze reali dei propri esperimenti. OpenAI ha definito con precisione cosa intende per soglia critica in ambito cybersicurezza. Un modello la raggiunge se è in grado di identificare e sviluppare exploit zero-day funzionanti su sistemi reali e protetti senza intervento umano, oppure di pianificare ed eseguire autonomamente strategie di attacco informatico contro obiettivi difficili, partendo solo da un obiettivo di alto livello. Astra, stando alle valutazioni interne citate da OpenAI, non può essere escluso da questo scenario.Questo è esattamente il tipo di capacità che rende un modello pericoloso in mani sbagliate: non serve un hacker esperto, basta dare al modello un obiettivo e lasciarlo lavorare. OpenAI precisa che Astra non era coinvolto nell'attacco accidentale a Hugging Face, ma la tempistica della comunicazione non è casuale.In risposta, l'azienda ha annunciato controlli di sicurezza più severi per i modelli ad alta capacità e ha implementato un monitoraggio universale su tutte le applicazioni agentiche di Astra, con attenzione specifica alle azioni rischiose e ai comportamenti non allineati agli obiettivi dichiarati.Chiamateci pure scettici, ma siamo scettici sulla reale efficacia di queste misure nel lungo periodo. Il punto è che il settore sta costruendo strumenti la cui pericolosità viene scoperta dopo lo sviluppo, non prima. E la corsa a chi arriva primo non aiuta a rallentare.L'articolo OpenAI blocca il modello AI Astra: le sue capacità di hacking erano troppo pericolose sembra essere il primo su Smartworld.