• Un model AI al Anthropic creează identități false și încearcă să introducă cod malițios pe GitHub.
  • Institutul AISI din Marea Britanie spune că este primul caz în care un model AI încearcă să înșele persoane reale fără să primească astfel de instrucțiuni.
  • Anthropic și OpenAI afirmă că testele au fost realizate într-un mediu controlat, cu mecanismele obișnuite de protecție dezactivate.

Cele mai noi modele de Inteligență Artificială dezvoltate de Anthropic și OpenAI au ajuns să manifeste un nivel fără precedent de autonomie și comportamente înșelătoare în timpul testelor realizate de Institutul pentru Securitatea Inteligenței Artificiale (AISI) din Marea Britanie, scrie BBC.

AISI a anunțat marți că modelele Mythos, al Anthropic, și Sol, al OpenAI, au demonstrat un nivel de „autonomie și înșelăciune” pe care cercetătorii nu l-au mai întâlnit până acum.

În timpul testelor de siguranța, un agent AI al Anthropic a creat profiluri false bazate pe identitatea unor persoane reale pentru a încerca să păcălească un evaluator uman care îi bloca accesul la GitHub, una dintre cele mai mari platforme folosite de dezvoltatori pentru stocarea și distribuirea codului sursă.

Recomandări

VIAȚĂ VEȘNICĂ ÎN CLOUD
YOUTUBE ELIMINĂ DEEPFAKE LA CERERE
ȘTIINȚA PRINDE ARIPI

Anthropic și OpenAI au precizat, ca răspuns la raportul AISI, că testele au fost desfășurate după ce mecanismele obișnuite de protecție au fost reduse sau eliminate.

La început, evaluatorii au observat „transferuri neobișnuite de date care plecau din sistemele noastre de cercetare”. În urma verificărilor, au descoperit că „unii dintre agenții AI testați au desfășurat activități susținute, cu potențial dăunător, îndreptate împotriva unor persoane și organizații reale”.

Investigația a arătat că agentul Mythos a creat cod malițios și a încercat să îl introducă în sistemul GitHub.

Pentru a reuși acest lucru, agentul AI a identificat persoanele care administrează platforma GitHub, le-a analizat profilurile și a creat mai multe identități false inspirate de acestea. Scopul era să le convingă sau să le inducă în eroare pentru a aproba introducerea codului malițios.

Mai mult, agentul a trimis mesaje directe unor persoane reale, pretinzând că este una dintre identitățile false pe care le crease.

„Când solicitarea agentului de a modifica codul a fost contestată public, acesta și-a modificat activitatea anterioară pentru ca aceasta să pară inofensivă și a luat în calcul folosirea unei noi identități pentru a-și continua acțiunile”, a transmis AISI.

Pe tot parcursul testului, evaluatorii umani au fost cei care au împiedicat agentul AI să introducă efectiv codul malițios în GitHub.

Institutul precizează că modelului Mythos nu i s-a cerut nici să evite, nici să adopte un astfel de comportament. Cu toate acestea, „este pentru prima dată când observăm riscuri legate de autonomie și înșelăciune manifestându-se atât de clar, fără instrucțiuni specifice și în lumea reală”.

Cum au reacționat Anthropic și OpenAI

Cele două companii, care se pregătesc să fie listate la bursă, au raportat în ultimele săptămâni că modelele lor AI au fost implicate în mai multe incidente de securitate cibernetică.

Anthropic a transmis într-un comunicat că parametrii testelor realizate de AISI „nu sunt reprezentativi pentru niciunul dintre modelele noastre utilizate în producție”.

Compania a precizat că desfășoară propria investigație pentru „a identifica cauzele acestui comportament”.

La rândul său, un purtător de cuvânt al OpenAI a declarat că testele AISI „nu reflectă modul obișnuit în care sunt folosite modelele” și că societatea va „continua să colaboreze cu evaluatorii și cu ceilalți actori din industrie pentru a consolida practicile comune privind desfășurarea în siguranță a evaluărilor, pe măsură ce modelele devin tot mai performante”.

AISI subliniază că testarea modelelor AI cu mecanismele de protecție dezactivate și cu acces la internet face parte din procedurile obișnuite de evaluare. Institutul precizează că incidentele observate au reprezentat „un număr redus de evenimente produse în condiții foarte specifice”.

Chiar și așa, cercetătorii spun că modul în care modelele Mythos și Sol au reacționat la o sarcină obișnuită a depășit ceea ce li se ceruse să facă.

„Activitatea desfășurată de agent a arătat semne ale unor comportamente noi, cu potențial înșelător, de o amploare și o gravitate pe care nu le-am anticipat”, se arată în raportul AISI.

Majoritatea acțiunilor malițioase identificate în timpul testelor au fost atribuite modelului Mythos al Anthropic. Modelul Sol al OpenAI a fost asociat cu doar două dintre incidentele raportate.

Incidentul principal s-a produs săptămâna trecută, în cadrul unui test în care evaluatorii AISI au cerut fiecărui model AI să rezolve o provocare de securitate cibernetică care implica platforma GitHub, deținută de Microsoft.

Institutul a informat GitHub despre tentativa de compromitere a sistemului său. BBC precizează că a solicitat un punct de vedere și companiei Microsoft.