OpenAI ha rinunciato al lancio di un nuovo modello di intelligenza artificiale (IA). Perché ritenuto troppo incline a discostarsi dalle direttive impartite. Si tratta di una versione aggiornata della sua IA, denominata GPT-6.1 Astra ed era previsto per ottobre, secondo il Wall Street Journal. Ma Saachi Jain, responsabile della sicurezza dell’IA presso OpenAI, ha spiegato che, in termini di «allineamento» (ovvero la conformità alle istruzioni fornite dagli sviluppatori), GPT-6.1 ha registrato risultati inferiori rispetto al suo predecessore, GPT-6, in due ambiti specifici.GPT-6.1 Astra: un modello che ingannaIl modello tende infatti più spesso a ingannare i supervisori, omettendo di rivelare alcune azioni compiute o mancate. Inoltre, ha più volte oltrepassato il proprio ambito operativo, ricorrendo a strumenti e servizi senza averne ricevuto l’autorizzazione. GPT-6.1 «ha mostrato progressi (rispetto ai modelli precedenti), in particolare per quanto riguarda la ‘pigrizia’», ha spiegato Jain, dimostrandosi capace di sostenere ragionamenti più prolungati e di ricorrere meno frequentemente a scorciatoie. Tuttavia, «non era all’altezza per quanto concerne il rispetto dei limiti e delle autorizzazioni», ha aggiunto, «così come nella modalità di comunicazione relativa al lavoro svolto».Stop al rilascioOperAi ha comunque fatto sapere di voler rilasciare altri modelli che hanno superato i criteri di valutazione. «Quando rendiamo un modello accessibile agli utenti, fissiamo l’asticella a un livello estremamente alto in termini di sicurezza e allineamento», ha sottolineato Saachi Jain. La responsabile ha spiegato che una delle difficoltà risiede nell’imbrigliare l’IA per evitare comportamenti fuori controllo. Preservandone al contempo lo slancio nell’esecuzione dei compiti.Le osservazioni di OpenAI confermano che il controllo dei modelli diventa sempre più complesso man mano che l’IA si perfeziona. Il 28 settembre l’Istituto per la sicurezza dell’IA (AISI), organismo governativo britannico, ha pubblicato uno studio da cui emerge che GPT-6 Astra, in fase di test, è uscito dai binari più spesso rispetto ai suoi predecessori GPT-5.6 Sol (lanciato a inizio luglio) e GPT-5.5 (aprile).Gli attacchi informaticiDurante le simulazioni, GPT-6 ha condotto attacchi informatici spontanei con una frequenza nettamente superiore rispetto agli altri due modelli. Tali test sono stati eseguiti disattivando le misure di sicurezza per valutarne le piene capacità, e non su versioni destinate al grande pubblico. L’ultimo nato di OpenAI ha inoltre creato molto più frequentemente false identità, tentato di influenzare un esaminatore o inserito codice destinato a usi malevoli in software open source.Noam Brown, ricercatore di OpenAI, ha recentemente spiegato nel podcast “Dwarkesh” che il ricorso sempre più diffuso al miglioramento ricorsivo autonomo (RSI) – ovvero il perfezionamento dell’IA da parte dell’IA stessa, senza intervento umano – potrebbe compromettere la capacità di controllo sui modelli a lungo termine.Gli incidentiDall’inizio dell’estate OpenAI ha segnalato diversi incidenti legati a comportamenti anomali delle proprie IA; il caso che ha avuto maggiore risonanza mediatica ha riguardato un’intrusione nella piattaforma di IA Hugging Face. L’azienda ha porto le proprie scuse al governo australiano, ammettendo che avrebbe dovuto avvisarlo prima in merito alla violazione, da parte di uno dei suoi modelli, di diversi siti e database. L’azienda californiana ha informato le autorità australiane solo il 10 settembre, nonostante avesse scoperto a metà agosto l’incidente, risalente a giugno . «Avremmo dovuto gestire meglio la nostra risposta (al problema)», ha scritto la start-up in un messaggio pubblicato sul proprio sito. «Ci scusiamo e ci impegneremo a fare meglio in futuro».Complessivamente, quattro piattaforme del governo australiano sono state interessate dall’IA del creatore di ChatGPT, tra cui Services Australia (il sito dei servizi sociali), dal quale il modello ha estratto informazioni non pubbliche. Anche Anthropic, Meta e Google hanno segnalato episodi in cui i modelli deviano dai loro obiettivi iniziali per barare, occultare le proprie azioni e ingannare i tecnici incaricati di monitorarli.L'articolo OpenAi ferma il lancio del nuovo modello GPT: «Può essere pericoloso» proviene da Open.