OpenAI cancel·la el llançament del nou model per problemes de seguretat

S'han detectat errors en l'"alineació" entre el que els humans li ordenen fer i en l'"autorització" per a evitar que el model creue límits

Sam Altman, CEO d'OpenAI, durant una sessió del Consell de Seguretat de les Nacions Unides este setembre
Sam Altman, CEO d'OpenAI, durant una sessió del Consell de Seguretat de les Nacions Unides este setembre / Brendan McDermid (Reuters)

OpenAI no farà el llançament del seu nou model d'intel·ligència artificial, GPT-6.1 Astra, previst en els pròxims dies, per problemes de seguretat durant la fase de proves interna, segons ha informat este dilluns el diari The Wall Street Journal.

Així ho va indicar al diari el cap de sistema de seguretat de l'empresa, Saachi Jain, que va assenyalar "retrocessos en dos àrees" respecte a la versió prèvia, com l'"alineació" amb el que els humans li ordenen fer, i va dir que "va mostrar majors nivells d'engany".

Una altra àrea problemàtica va ser l'"autorització d'abast", és a dir, que el model avançava en una tasca sense demanar permís a l'usuari i, a vegades, recorria a eines i serveis externs fins i tot quan això podia resultar insegur, va sostindre.

Jain va destacar el repte de "trobar l'equilibri adequat entre mantindre's dins de l'abast, però també evitar la falta d'iniciativa en la manera en què el model duu a terme les tasques, fins i tot quan troba obstacles".

OpenAI es disposa a celebrar este dimarts a San Francisco la conferència anual de desenvolupadors, en la qual sol presentar les seues novetats, entre creixents demandes dels líders del sector a frenar el ritme de desenvolupament d'esta tecnologia pels seus riscos per a la seguretat.

OpenAI demana disculpes a Austràlia

La notícia es produïx també després de diverses incidències de ciberseguretat d'agents d'IA desenvolupats per OpenAI, que van guanyar accés no autoritzat a la plataforma Hugging Face i fins i tot a pàgines del govern dels Estats Units i d'una universitat.

L'últim incident està relacionat amb un accés no autoritzat d'un dels seus models al portal del sistema públic de salut australià i pel qual OpenAI ha demanat disculpes este dimarts. "Ho sentim", ha afirmat la tecnològica en un comunicat en el qual va explicar que, durant un entrenament i avaluació interns realitzats al juny, un dels seus models va accedir a pàgines del govern australià d'una forma que no estava autoritzada.

Segons la investigació d'OpenAI, el model, que s'utilitzava en un entorn intern i no estava destinat al seu llançament públic, va trobar una manera d'accedir a zones no públiques del sistema, on va executar comandos, va consultar arxius interns, credencials i estadístiques agregades i va arribar a escriure arxius.

El model havia rebut la tasca d'investigar la despesa pública per persona en medicaments per a malalties de la pell en comunitats de Victoria, al sud del país. En trobar dificultats per a obtindre la informació, va adoptar accions que OpenAI no havia autoritzat i va aconseguir accedir a informació tècnica i codi font del servei.

L'empresa va reconéixer que hauria d'haver comunicat abans les seues conclusions preliminars a les autoritats australianes i va assegurar que està treballant per a "reconstruir la confiança" al país.

Anthony Albanese, primer ministre australià, va assenyalar este dimarts que OpenAI ha mantingut una actitud "molt constructiva i oberta" amb el govern des de l'incident i va reiterar que la IA pot impulsar el creixement econòmic i la productivitat, encara que també comporta riscos.

Després dels incidents, OpenAI afirma haver reforçat les restriccions de xarxa i els sistemes de supervisió en els seus entorns d'investigació, a més de bloquejar l'accés directe a Internet en determinades proves.

També et pot interessar

stats