GPT-6.1 Astra bloccato: il modello nascondeva le sue azioni ai ricercatori

Wait 5 sec.

Nemmeno il tempo di lanciarlo che è stato già bloccato. Parliamo del nuovo GPT-6.1 Astra, il modello aggiornato che OpenAI avrebbe dovuto lanciare tra pochi giorni, forse oggi stesso al suo DevDay di San Francisco. Non è andata così: il modello è stato fermato per ragioni di sicurezza emerse durante i test interni. E le ragioni, a leggerle, fanno un po' paura. Secondo un'inchiesta del Wall Street Journal, GPT-6.1 Astra avrebbe dovuto essere un piccolo salto in avanti rispetto all'attuale GPT-6 Astra, soprattutto nella capacità di svolgere compiti in autonomia, senza bisogno di supervisione umana. Ma proprio sotto questo aspetto è emerso il vero problema.Citando un'intervista con Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI, il Wall Street Journal riporta che GPT-6.1 Astra presentava due criticità distinte. La prima è che il modello non seguiva abbastanza fedelmente le istruzioni degli operatori umani, il che lo rendeva imprevedibile e, di conseguenza, non abbastanza sicuro per il rilascio al pubblico. La seconda è ancora più inquietante. Da quanto emerso nei test, GPT-6.1 Astra mostrava "livelli più elevati d'inganno". In pratica, durante l'esecuzione dei compiti assegnati, cercava di nascondere ai ricercatori cosa stava facendo o non facendo. Inoltre, non si limitava a questo, ma interagiva con strumenti e servizi di terze parti e compiva azioni che andavano ben oltre il perimetro del suo incarico, senza chiedere alcun permesso.Chi usa le funzioni agentiche di ChatGPT, quelle che permettono all'AI di operare sul computer al posto nostro, capisce bene perché questo sia un problema serio. Un modello che mente su quello che fa e accede a risorse non autorizzate è esattamente lo scenario che nessuno vuole vedere utilizzando un prodotto di consumo. Non è nemmeno la prima volta che OpenAI si trova a fare i conti con comportamenti fuori controllo dei suoi agenti AI: il tema della supervisione è diventato uno dei nodi più critici dell'intero settore.OpenAI ha comunicato che si concentrerà sul miglioramento della sicurezza dei modelli futuri. GPT-6.1 Astra non è definitivamente cancellato, ma non arriverà nei tempi previsti, per ovvi motivi. Nel frattempo, l'azienda ha già rilasciato GPT-6 Sol e Luna la settimana scorsa, quindi non è a corto di modelli da proporre.La domanda che resta aperta, però, è più grande del singolo problema: se un'AI progettata per agire in autonomia impara a nascondere le proprie azioni già in fase di test, quanto possiamo fidarci di quelle che superano i test e vengono rilasciate? Ne abbiamo parlato anche in uno dei nostri video più recenti, che vi lasciamo a seguire.L'articolo GPT-6.1 Astra bloccato: il modello nascondeva le sue azioni ai ricercatori sembra essere il primo su Smartworld.