Anthropic-ի Claude ԱԲ-մոդելը սպանության մասին տեղեկություններ է հորինել և դրանք փոխանցել ԱՄՆ ոստիկանությանը
Anthropic ընկերության արհեստական բանականության մոդելը Ֆիլադելֆիայի ոստիկանությանը կեղծ հաղորդագրություն է ուղարկել չբացահայտված սպանության մասին՝ ներկայանալով որպես մարդ, որը կարող է հանցագործության վերաբերյալ տեղեկություն ունենալ, հայտնել է AFP-ն։
Ոստիկանությունը հայտարարել է, որ ընկերությունը միջադեպը հայտնաբերել է ավելի քան երկու ամիս անց և դրա մասին իշխանություններին հայտնել է անթույլատրելի ուշացումով։
Ֆիլադելֆիայի ոստիկանության վարչության տվյալներով՝ հաղորդագրությունն ուղարկվել է հուլիսի 18-ին PhillyUnsolvedMurders.com կայքի միջոցով, որտեղ քաղաքացիները կարող են տեղեկություններ փոխանցել չբացահայտված սպանությունների մասին։ Ինչպես պարզաբանել է Anthropic-ը, թեստավորման ընթացքում մոդելը փոխգործակցել է պատահականորեն ընտրված կայքերի հետ և, հասնելով այս հարթակին, տեղադրել է հանցագործության մասին հորինված տեղեկություն։
Հաղորդագրությունը նշվել է որպես սպամ և չի հասել ոստիկանության օպերատիվ արձագանքման կենտրոն, որտեղ նման տեղեկությունները ստուգվում են։ Իրավապահները նաև հայտնել են, որ ոստիկանության համակարգերի կոտրման կամ տվյալների արտահոսքի նշաններ չեն հայտնաբերվել։
Anthropic-ը միջադեպը հայտնաբերել է սեպտեմբերի 28-ին, դադարեցրել է թեստային գործընթացը, որը հանգեցրել էր հաղորդագրության ուղարկմանը, և ապագա փորձարկումների համար ավելացրել է ստուգման լրացուցիչ փուլ։ Ընկերությունը ոստիկանությանը տեղեկացրել է միայն հոկտեմբերի 7-ին։ Հաջորդ օրը կողմերի ներկայացուցիչները հանդիպել են։
«Միջադեպի հայտնաբերման և քաղաքին տեղեկացնելու երկամսյա ուշացումն անընդունելի է», — հայտարարել են ոստիկանության վարչությունից։ Այնտեղ ընդգծել են, որ անգամ լուրջ հետևանքների բացակայության դեպքում չի կարելի թերագնահատել այն իրավիճակի վտանգը, երբ ԱԲ-ն հորինված տեղեկությունները ներկայացնում է որպես իրական մարդու տեղեկություն, որը ծանոթ է սպանության հանգամանքներին։
Միջադեպը դարձել է Anthropic-ի ավելի լայն ներքին ստուգման մի մասը, որի ընթացքում բացահայտվել են Claude մոդելի մի քանի տեսակի չկանխամտածված գործողություններ։ Դրանց թվում են՝ կայքերում ձևաթղթերի ուղարկումը, ծրագրային կոդի խոցելիությունների օգտագործումը և առանձին սահմանափակումների շրջանցումը։ Ընկերությունը ժամանակավորապես անջատել է Claude-ի մուտքը ինտերնետ ներքին փորձարկումների ընթացքում, մինչև համոզվի, որ անվտանգության և մոնիթորինգի մեխանիզմները նման վարքագիծը հուսալիորեն բացահայտում են։
Anthropic-ը հայտարարել է, որ բացահայտված դեպքերը իրական աշխարհում ունեցել են նվազագույն հետևանքներ և շատ ավելի լուրջ չեն եղել, քան կիբեռանվտանգության ոլորտում նախկինում նկարագրված այլ միջադեպերը։ Այնուամենայնիվ, տեղի ունեցածն ուժեղացրել է մտահոգությունները ԱԲ-գործակալների օգտագործման վերաբերյալ, որոնք կարող են ինքնուրույն կատարել գործողությունների հաջորդականություն՝ առանց մարդու անմիջական վերահսկողության։
Axios-ի տվյալներով՝ Սպիտակ տան վարչակազմը նույնպես արհեստական բանականության վրա աշխատող ընկերություններից պահանջել է հայտնել անվտանգության միջադեպերի մասին և վերացնել դրանց հետևանքները։ Վարչակազմի ներկայացուցիչներն ընդգծել են, որ նման ծանուցումը պարտավորություն է ազգային անվտանգության ոլորտում։