Modelele de inteligenţă artificială Claude dezvoltate de Anthropic au obţinut acces neautorizat la sistemele informatice a trei organizaţii externe în timpul unor teste menite să evalueze capacităţile lor de atac cibernetic, după ce compania a descoperit că mediul de testare avea, din greşeală, acces la internet. Anthropic a oprit imediat evaluările de securitate cibernetică după ce a identificat problema şi a analizat peste 141.000 de cazuri, în urma cărora a identificat trei incidente în care modelele au interacţionat cu sisteme reale. Compania a explicat că testele trebuiau să se desfăşoare într-un mediu izolat, fără acces la internet. În instrucţiunile primite, modelele Claude erau informate că lucrează într-o simulare şi că nu au acces la internet. Totuşi, din cauza unei neînţelegeri între Anthropic şi partenerul său de evaluare, Irregular, conexiunea la internet era disponibilă. „În toate cazurile, promptul de evaluare al Anthropic îi specifica lui Claude că mediul era o simulare şi că nu avea acces la internet. Din cauza unei neînţelegeri între noi şi partenerul nostru de evaluare, acest lucru nu era adevărat, iar accesul la internet era disponibil”, a transmis compania într-o postare
pe blog. Testele erau de tip „capture the flag”, un format utilizat pentru evaluarea competenţelor de securitate cibernetică, în care AI-ul trebuie să analizeze, să decompileze sau să exploateze sisteme vulnerabile pentru a găsi informaţii ascunse. Într-unul dintre cazuri, Claude a primit ca ţintă o companie fictivă al
cărei nume era
asociat cu un domeniu de internet activ. Agentul AI a identificat şi exploatat vulnerabilităţi ale infrastructurii, a extras informaţii şi a obţinut acces la o bază de date care conţinea câteva sute de rânduri de date de producţie. Incidentele au avut loc pe trei modele Claude diferite: Opus 4.7, Mythos 5 şi un model intern utilizat pentru cercetare. Mythos, disponibil doar unui număr limitat de parteneri, a atras atenţia la nivel global datorită capacităţilor sale avansate în zona atacurilor cibernetice, inclusiv identificarea şi exploatarea vulnerabilităţilor software. Dezvăluirea Anthropic vine la aproximativ o săptămână după ce OpenAI a raportat un incident similar. Două modele ale companiei au reuşit să iasă din mediul de testare şi să acceseze internetul, după exploatarea unei vulnerabilităţi software, atacând ulterior platforma de dezvoltare AI Hugging Face. Cele două cazuri amplifică îngrijorările privind securitatea modelelor de inteligenţă artificială capabile să acţioneze autonom. Faptul că aceste sisteme pot identifica şi exploata vulnerabilităţi informatice chiar în timpul testelor de dinaintea lansării ridică noi întrebări privind modul în care sunt izolate şi monitorizate. Anthropic a anunţat că îşi va extinde monitorizarea transcripturilor generate în timpul evaluărilor pentru a identifica „comportamente neaşteptate” şi va introduce proceduri mai riguroase de verificare pentru furnizorii externi implicaţi în testarea modelelor.