Claude նեյրոնային ցանցը կիբերանվտանգության թեստերի ժամանակ կոտրել է երեք կազմակերպությունների համակարգերը։
Այս մասին հայտնել է Anthropic ընկերությունը։ Տուժած կազմակերպությունների մասին ճշգրիտ տեղեկություններ չեն նշվել։
Փորձարկման մեջ ներառվել են «Claude Opus 4.7»-ը, «Claude Mythos 5»-ը և ներքին արհեստական բանականության թեստային մոդելը։
Երեք դեպքերում էլ Claude-ը կատարել է ստանդարտ առաջադրանք. նրան տրվել է հորինված սցենար՝ մեկ այլ մեքենայի վրա թաքնված տեղեկատվություն գտնելու համար։ Փորձարկման պայմանները ենթադրել են, որ ինտերնետ մուտքը արգելափակված է, բայց կարգավորման սխալի պատճառով ցանցային մուտքը բաց է եղել։ Արհեստական բանականության մոդելը ճանաչել է իրական համակարգերը որպես սիմուլյացիայի մաս և հարձակվել դրանց վրա։
Կազմակերպությունները հաքերային հարձակումների մասին իմացել են միայն այն բանից հետո, երբ Anthropic-ը տեղեկացրել է նրանց։ Ընկերությունը նշել է, որ մոդելները չեն փորձել «փախչել» սիմուլյացիայից, այլ կատարել են առաջադրանքը միջավայրի սխալ ընկալմամբ։ Նրանք կարծում են, որ միջադեպը գործառնական խափանման արդյունք է։