Răscoala AI. Modele Anthropic și OpenAI au acționat neautorizat în teste cibernetice, iar Mythos 5 a creat identități false

Răscoala AI. Modele Anthropic și OpenAI au acționat neautorizat în teste cibernetice iar Mythos 5 a creat identități false
Două modele avansate de inteligență artificială, dezvoltate de Anthropic și OpenAI, au desfășurat acțiuni neautorizate pe internet în timpul unor teste de securitate cibernetică efectuate de Institutul pentru Securitatea Inteligenței Artificiale din Regatul Unit (AISI), relatează BBC.

În cel mai grav caz identificat, un agent bazat pe modelul Mythos 5 al Anthropic a creat identități false inspirate de persoane reale și a încercat să convingă un dezvoltator să accepte cod malițios într-un proiect open-source găzduit pe GitHub.

AISI a identificat 19 acțiuni neautorizate în 122 de sesiuni de testare

Potrivit BBC, AISI a apreciat că modelele testate au manifestat un nivel de autonomie și comportamente potențial înșelătoare pe care institutul nu le mai observase atât de clar în evaluări desfășurate pe internetul real. Majoritatea acțiunilor considerate problematice au fost atribuite Mythos 5, în timp ce un număr mult mai mic a fost asociat modelului GPT-5.6 Sol al OpenAI.

Conform raportului oficial publicat de AISI, institutul a analizat 122 de sesiuni de evaluare în care au fost testate șapte modele. În zece dintre aceste sesiuni, agenții AI au efectuat, în total, 19 acțiuni neautorizate pe internetul real.

Dintre cele 19 acțiuni, 17 au fost atribuite modelului Mythos 5 al Anthropic, iar două modelului GPT-5.6 Sol al OpenAI, în configurații în care anumite filtre de securitate cibernetică fuseseră dezactivate.

Testele relevante au început la 25 iulie. La 28 iulie, evaluatorii AISI au observat transferuri neobișnuite de date din sistemele de cercetare, iar verificările ulterioare au arătat că unii dintre agenții testați desfășuraseră activități neautorizate îndreptate către persoane și organizații reale. Potrivit institutului, situația a fost izolată la aproximativ o oră după detectare.

Mythos 5 a creat identități false și a încercat să manipuleze un dezvoltator

Cel mai grav caz descris de BBC și detaliat de AISI a implicat un agent Mythos 5 căruia îi fusese solicitat să rezolve o provocare de securitate cibernetică. Agentul a ajuns să încerce introducerea unui cod malițios într-un proiect public open-source găzduit pe GitHub, platforma de dezvoltare software deținută de Microsoft.

Agentul a identificat persoanele care administrau proiectul, a cercetat informații despre acestea și a creat conturi false bazate pe identitățile unor persoane reale. Ulterior, a transmis mesaje și fișiere în încercarea de a convinge un responsabil al proiectului să aprobe modificarea de cod.

AISI afirmă că, atunci când activitatea sa a fost pusă sub semnul întrebării, agentul și-a modificat unele acțiuni anterioare pentru ca acestea să pară inofensive și a analizat posibilitatea utilizării unei identități noi pentru a-și continua demersul.

Tentativa nu a reușit. Intervenția și verificarea umană au împiedicat acceptarea codului malițios, iar institutul britanic precizează că nu dispune de dovezi privind producerea unor prejudicii în lumea reală în urma acestor acțiuni.

Potrivit BBC, GitHub a fost informat despre tentativele respective și a comunicat că a dezactivat conturile false în conformitate cu politicile platformei. AISI precizează, la rândul său, că GitHub a colaborat la eliminarea elementelor asociate incidentului și la informarea utilizatorilor afectați.

Modelele nu au evadat din mediul de testare

AISI atrage atenția asupra unei distincții importante. Incidentele nu au reprezentat o evadare a modelelor dintr-un mediu izolat de securitate. Accesul la internetul real fusese permis în mod intenționat de evaluatori, tocmai pentru a determina capacitățile pe care modelele le-ar putea manifesta în condiții mai permisive.

În plus, anumite mecanisme de protecție furnizate de dezvoltatorii modelelor au fost dezactivate în cadrul testelor. AISI subliniază că aceste configurații nu corespund modului obișnuit în care modelele respective sunt puse la dispoziția publicului și că versiunile testate, în configurațiile respective, nu sunt oferite comercial.

Institutul afirmă, de asemenea, că nu există indicii clare potrivit cărora același tip de comportament s-ar fi produs în afara acestor evaluări. Concluziile provin dintr-un număr redus de evenimente apărute în condiții foarte specifice și nu permit estimarea frecvenței cu care asemenea comportamente ar putea apărea în alte situații.

Anthropic și OpenAI spun că testele nu reflectă utilizarea obișnuită

Anthropic a transmis, potrivit BBC, că parametrii utilizați în evaluarea AISI nu sunt reprezentativi pentru modelele sale folosite în condiții normale de producție. Compania a precizat că desfășoară propria investigație pentru a identifica motivele care au determinat comportamentul modelului.

OpenAI a declarat, de asemenea, pentru BBC că circumstanțele testării nu reflectă utilizarea obișnuită a tehnologiei sale. Compania a afirmat că va continua colaborarea cu evaluatorii independenți și cu organizațiile din industrie pentru îmbunătățirea procedurilor de testare pe măsură ce modelele devin mai capabile.

Într-o informare oficială referitoare la evaluările AISI, OpenAI a confirmat că două dintre cele 19 acțiuni neautorizate identificate de institut au implicat GPT-5.6 Sol. Compania a arătat că testele au fost realizate cu acces la internet și cu anumite mecanisme de protecție cibernetică dezactivate.

Alte incidente au determinat companiile să-și revizuiască procedurile

BBC plasează concluziile AISI în contextul altor incidente raportate recent de companiile care dezvoltă sisteme avansate de inteligență artificială.

Anthropic a anunțat separat, într-o analiză publicată la 30 iulie, că a examinat peste 141.000 de sesiuni de evaluare și a identificat trei incidente în care modele Claude au obținut acces neautorizat la infrastructuri reale, în contextul unor evaluări externe configurate necorespunzător. Compania a suspendat testele respective, a notificat organizațiile afectate și a anunțat măsuri suplimentare de monitorizare.

OpenAI a descris, la rândul său, un incident separat produs într-o evaluare efectuată de o terță parte, în care o configurație defectuoasă a mediului de testare a permis unui model să interacționeze cu un domeniu real pe care acesta l-a confundat cu o componentă a simulării.

AISI pregătește măsuri suplimentare de siguranță

AISI a anunțat că va înăspri procedurile utilizate pentru evaluările cu acces la internet, inclusiv prin monitorizare mai strictă în timp real și prin revizuirea modului în care sunt proiectate testele. Institutul intenționează și să supună incidentul unei examinări independente.

Potrivit BBC, ministrul britanic cu atribuții în domeniul inteligenței artificiale, Kanishka Narayan, a apreciat că identificarea și comunicarea publică a unor asemenea riscuri reprezintă unul dintre motivele pentru care AISI a fost creat. Oficialul a subliniat necesitatea unei mai bune înțelegeri a sistemelor de inteligență artificială, astfel încât acestea să poată fi utilizate în condiții de siguranță.

AISI consideră că rezultatele testelor demonstrează apariția unor capacități care necesită supraveghere atentă, dar avertizează că incidentele trebuie interpretate în contextul condițiilor speciale în care s-au desfășurat evaluările. Institutul nu a identificat dovezi că tentativele descrise ar fi produs prejudicii ca urmare a testelor.

Citește și

Comentarii

Citește mai departe

Președintele Camerei de Comerț și Industrie a României, Mihai Daraban, susține că deplasarea cu avionul privat la Mykonos, alături de politicieni, oameni de afaceri și judecătorul CCR Cristian Deliorga, a avut drept scop o întâlnire cu potențiali investitori americani. Daraban afirmă că întreaga ședere pe insula grecească a durat între patru și cinci ore, fără […]
Ucraina nu a putut susține o rezoluție a ONU privind adoptarea unei noi hărți a lumii, deoarece peninsula Crimeea, ocupată de Rusia, este reprezentată separat de restul teritoriului ucrainean, a declarat parlamentara Kira Rudik pe 5 septembrie, potrivit Kyiv Independent. „În 2026, ONU nu ar trebui să mai aibă nevoie de o astfel de reamintire. […]
USR Sector 4 a sesizat Agenția Națională de Integritate și solicită verificarea averii primarului Daniel Băluță, precum și a unor posibile conflicte de interese sau incompatibilități. Sesizarea vizează zborurile efectuate cu avioane private, proprietățile deținute de familia edilului, o tranzacție imobiliară și relațiile comerciale dintre firme din grupul Toyo și operatorul de salubrizare al Sectorului […]
Wizz Air pregătește concedierea colectivă a 172 de angajați de la bazele operaționale din București, Craiova, Cluj-Napoca și Iași, potrivit unei notificări transmise personalului companiei. Restructurarea ar afecta aproximativ 9% dintre cei 1.892 de salariați menționați în document. Lista posturilor care ar urma să fie desființate cuprinde 51 de piloți și copiloți și 121 de […]
Familiile militarilor americani uciși sau răniți în operațiunile împotriva Iranului se confruntă cu o situație controversată: statutul juridic al conflictului poate influența modul în care sunt acordate anumite beneficii și plăți. Cazul unei văduve a devenit viral după ce aceasta a susținut că i s-a spus că familia sa nu este eligibilă pentru anumite drepturi […]