
Sursă: Biziday
Noua descoperire a fost făcută în timpul unor evaluări realizate de cercetătorii de la Institutul pentru Siguranță și Securitate AI din Marea Britanie (AISI). Acestea au arătat că cele mai noi modele de inteligență artificială ale OpenAI și Anthropic au încălcat instrucțiunile primite și au încercat să obțină acces neautorizat la diverse sisteme securizate, acțiuni care puteau reprezenta riscuri pentru securitatea digitală.
În cadrul testelor, cercetătorii britanici au analizat modelele Anthropic Mythos 5 și OpenAI GPT-5.6-Sol pe care le-au pus în anumite scenarii, pentru a testa securitate cibernetică. AISI a desfășurat 122 de evaluări și a identificat 19 acțiuni neautorizate în 10 dintre teste. Modelul dezvoltat de Anthropic a fost responsabil pentru 17 dintre aceste acțiuni, iar modelul OpenAI pentru două.
Cel mai grav incident a fost atribuit modelului Anthropic Mythos 5 care a creat identități false pe internet și a încercat să păcălească programatorii pentru a introduce modificări în cod care ar fi putut genera probleme de securitate. Mai exact, modelul a trimis mesaje către un programator și a încercat să îl convingă să publice un cod eronat pe platforma GitHub, creat special pentru încărcarea de coduri. Agentul AI a susținut că este o persoană reală, iar după ce a constatat că tentativa sa nu a reușit, a încercat să își editeze activitatea, pentru a nu fi prins și pentru a părea “inocent” în fața cercetătorilor. Mai mult de atât, a luat în calcul folosirea unei alte identități pentru a continua să încerce să convingă programatorii.
Acesta este un fragment din articol. Textul integral a fost publicat de Biziday, care deține drepturile asupra conținutului.

