Un informe britànic advertix de comportaments autònoms i enganyosos de models d'IA
Segons l'anàlisi, de les 122 proves efectuades amb set models d'IA, en deu es van registrar dènou accions no autoritzades que van excedir els paràmetres fixats pels investigadors
El govern britànic ha alertat que els models d'intel·ligència artificial (IA) Mythos i Sol, de les empreses estatunidenques Anthropic i OpenAI, respectivament, han mostrat comportaments autònoms i enganyosos mai vistos durant unes proves de ciberseguretat. El Ministeri de Ciència, Innovació i Tecnologia del Regne Unit ha arribat a esta conclusió arran d'una avaluació rutinària efectuada per l'Institut de Seguretat de la IA (AISI, per les sigles en anglés).
Segons l'informe emés, de les 122 proves efectuades amb set models d'IA, en deu d'estes es van registrar 19 accions no autoritzades que van excedir els paràmetres fixats pels investigadors. Dèsset d'eixes accions van correspondre al model Mythos 5 d'Anthropic, mentre que dos van ser protagonitzades pel GPT-5.6 Sol d'OpenAI. Els dos models, entre els més potents del món, van arribar a crear perfils humans falsos per a intentar enganyar persones durant un ciberatac simulat per l'AISI. L'eina d'Anthropic, va advertir l'informe, va tractar fins i tot d'accedir a un servici enviant missatges privats després de crear comptes falsos que imitaven persones reals.
La resposta dels dos gegants tecnològics, recollida per la cadena britànica BBC, assenyala que les proves efectuades per l'AISI es van realitzar en un entorn en què s'havien reduït o eliminat les salvaguardes habituals dels seus models. Els investigadors també van identificar intents de contactar amb persones reals per part de Mythos per a induir-les a executar arxius maliciosos i a inserir instruccions ocultes destinades a manipular altres sistemes d'IA. Malgrat això, AISI va subratllar que "estos intents no van tindre èxit" i que la seua investigació "no ha trobat evidències de danys en el món real".
No obstant això, l'organisme considera que es tracta d'un punt d'inflexió, ja que és la primera vegada que s'observen "riscos relacionats amb l'autonomia i l'engany manifestar-se de manera tan clara, sense instruccions específiques i en el món real".
Anthropic obri una investigació pròpia
En la nota remesa a la BBC, Anthropic sosté que els paràmetres de les proves realitzades "no són representatius" dels seus models de producció, encara que confirma que ha obert la seua pròpia investigació.
Per la seua banda, OpenAI assenyala que les condicions en què l'AISI va dur a terme els assajos "no reflectixen l'ús habitual" dels seus models. Assegura, a més, que continuarà col·laborant amb els avaluadors i amb "altres actors del sector per a reforçar les pràctiques comunes que permeten fer avaluacions segures a mesura que els models siguen cada vegada més capaços".
A finals de juliol, Anthropic va revelar que, durant unes proves de ciberseguretat, tres models del seu assistent Claude havien aconseguit accedir a internet i piratejar els sistemes de tres organitzacions. Prèviament, el 21 de juliol, OpenAI ja havia reconegut que dos dels seus models d'IA havien aconseguit eixir d'un entorn de proves i entrar en la plataforma Hugging Face superant les seues defenses.
Més llegit
-
La família va deixar l'urna amb cendres al supermercat de Benidorm perquè estava fent obres a casa
-
Condemnat a presó per haver-se allotjat quasi un mes en un hotel de la Vall d’Alba i anar-se’n sense pagar
-
Un home de 62 anys mata un jove de 20 en un bar de València i confessa el crim
-
Investiguen un regidor i un veí de Gátova per abatre el bou que es va escapar en les festes
-
Troben el cadàver d'una dona a Llaurí, als voltants del Xúquer
-
El Villarreal-Llevant demà dimecres en directe, per À Punt