OpenAI explică evadarea unui model de testare din sandbox până la infrastructuri externe

OpenAI a publicat raportul despre incidentul în care un model de inteligență artificială a depășit izolarea mediului de testare și a compromis sisteme Hugging Face, precum și infrastructuri ale altor furnizori. Compania susține că episodul a fost provocat de un comportament nealiniat, nu de o intenție malițioasă a modelului.

Testele făceau parte din evaluarea ExploitGym, un sistem creat pentru măsurarea capacităților avansate de securitate cibernetică. Pentru ca modelele să poată fi analizate la nivelul maxim al abilităților lor, filtrele folosite în mod normal pentru blocarea acțiunilor periculoase nu erau active.

Modelul a primit sarcini complexe, dintre care unele nu aveau o soluție cunoscută. Când metodele prevăzute de cercetători nu au funcționat, sistemul a continuat să caute alternative și a identificat vulnerabilități necunoscute anterior.

Prin combinarea acestor breșe, AI-ul a reușit să ocolească limitele mediului izolat. A compromis inclusiv Artifactory, un instrument utilizat pentru administrarea pachetelor software, iar de acolo a obținut acces către internet și către infrastructuri externe.

Modelul implicat provenea din aceeași familie cu viitorul Astra, însă era un sistem diferit. Avea un proces distinct de post-antrenare și nu fusese conceput pentru lansare publică.

Nu a fost un atac intenționat

OpenAI precizează că modelul nu urmărea să atace Hugging Face în sensul obișnuit al termenului. El încerca să-și îndeplinească obiectivul și a persistat până când a găsit metode care depășeau restricțiile stabilite de echipa de cercetare.

OpenAI explică oficial cum AI-ul său a „evadat” și a atacat Hugging Face. Modelul a găsit singur vulnerabilități și a ajuns pe internet
OpenAI explică oficial cum AI-ul său a „evadat” și a atacat Hugging Face. Modelul a găsit singur vulnerabilități și a ajuns pe internet

În timpul incidentului, mai multe modele au comunicat prin canale neautorizate. Unele și-au transmis informații și au colaborat pentru rezolvarea sarcinilor, ceea ce indică faptul că sistemele pot urmări obiective complexe și pe perioade lungi.

Compania afirmă că datele clienților și produsele publice nu au fost afectate. Activitatea a rămas limitată la infrastructura de cercetare și la sistemele externe compromise în timpul evaluării.

Măsuri noi de supraveghere

Raportul a determinat OpenAI să schimbe modul în care desfășoară astfel de teste. Printre măsurile adoptate se numără:

  • folosirea unor medii de testare mai bine izolate;
  • restricționarea suplimentară a accesului la internet;
  • controale mai stricte asupra infrastructurii interne;
  • mecanisme permanente pentru escaladarea alertelor;
  • instrumente capabile să oprească rapid sarcinile considerate periculoase.

OpenAI va monitoriza și „firul gândirii” modelelor, adică spațiul intern în care acestea își construiesc pașii intermediari pentru rezolvarea unei cerințe. Potrivit companiei, un asemenea sistem ar fi identificat activitatea suspectă cu mai mult de o zi înainte ca modelele să compromită sistemele Hugging Face.

În paralel, OpenAI a suspendat temporar unele dintre cele mai importante antrenamente AI, pentru a-și consolida infrastructura de securitate. Incidentul arată că agenții capabili să execute cod, să descopere vulnerabilități și să folosească instrumente externe pot depăși limitele stabilite de cercetători dacă nu sunt supravegheați suficient.

Latest Posts