Modelul Mythos al Anthropic a generat identități fictive pentru a influența comportamentul utilizatorilor într-un experiment de securitate cibernetică

Moderator NC
3 Min Citire
Sursa foto: PROFILUX IMAGES

Incidentul de securitate cibernetică

Modelul de inteligenţă artificială Mythos 5, dezvoltat de Anthropic, a creat identităţi false online şi a încercat să convingă un dezvoltator să aprobe modificări de cod maliţios într-un proiect open-source, în timpul unui test de securitate cibernetică desfăşurat de AI Security Institute (AISI) din Marea Britanie.

Incidentul a avut loc într-un mediu de testare în care cercetătorii au eliminat intenţionat o parte dintre măsurile de protecţie, au dezactivat filtrele de siguranţă şi au oferit modelelor acces la internet pentru a le evalua capabilităţile.

AISI a identificat 19 acţiuni potenţial periculoase, dintre care 17 au fost generate de Anthropic Mythos 5, iar două au implicat modelul OpenAI GPT-5.6 Sol, cu mecanismele de protecţie cibernetică dezactivate. Institutul a precizat că niciuna dintre tentative nu a avut succes şi nu a produs pagube în lumea reală.

Potrivit AISI, agentul bazat pe Mythos a cercetat dezvoltatorii proiectului, a creat mai multe identităţi false şi a încercat să manipuleze un administrator real pentru a aproba codul maliţios. După ce modificările au fost contestate public, modelul şi-a modificat activitatea anterioară pentru a părea inofensivă şi a luat în calcul folosirea unei noi identităţi pentru a-şi continua încercările.

În aceeaşi campanie, AI-ul a trimis mesaje şi fişiere unor persoane reale, încercând să le convingă să ruleze cod maliţios. Unele mesaje conţineau încărcături periculoase, iar altele reprezentau tentative de inginerie socială.

Anthropic a declarat că modelele au fost evaluate în condiţii „deliberat permisive”, care nu reflectă mediul de producţie, şi că nu există dovezi că sistemul ar fi scăpat dintr-un mediu securizat. La rândul său, OpenAI a precizat că incidentele au avut loc exclusiv în cadrul unor teste de securitate desfăşurate de parteneri, în medii experimentale cu măsuri de protecţie reduse.

Incidentul vine după alte cazuri recente în care modele dezvoltate de Anthropic şi OpenAI au manifestat comportamente neaşteptate în timpul testelor de securitate. În urma acestor episoade, în Congresul SUA a fost introdus proiectul de lege „AI Kill Switch Act”, care ar obliga companiile să poată opri, limita sau suspenda funcţionarea modelelor de inteligenţă artificială în situaţii de risc.

Distribuie acest articol
Niciun comentariu

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *