„Anthropic AI“ naudojo suklastotus profilius, kad atakuotų žmones, o po to paslėpė įrodymus

Jungtinės Karalystės dirbtinio intelekto saugumo institutas (AISI) atskleidė, kad du galingiausi pasaulyje dirbtinio intelekto įrankiai sukūrė suklastotus žmonių profilius, siekdami apgauti žmones bandant surengti kibernetines atakas.
Rimčiausiu atveju „Anthropic“ dirbtinio intelekto sistema „Mythos“ bandė gauti prieigą prie paslaugos siųsdama privačias žinutes, prieš tai sukūrusi suklastotus paskyrus, imituojančius tikrus žmones, o po to paslėpė įrodymus.
Tai įvyko netrukus po to, kai dvi į AISI bandymus įtrauktos įmonės – „Anthropic“ ir „OpenAI“ – pastarosiomis savaitėmis atskirai atskleidė atvejus, kai jų technologijos įsilaužė į kitas įmones.
Įmonės teigė, kad šiuo naujausiu atveju AISI bandymas sumažino arba pašalino įprastas apsaugos priemones.
AISI antradienį pranešė, kad „Mythos“ ir „OpenAI“ „Sol“ dirbtinio intelekto modeliai pasiekė tokį „autonomijos ir apgaulės“ lygį, kokio ji dar nebuvo mačiusi.
Ji patikslino, kad daugumą piktavališkų veiksmų atliko „Mythos“.
AISI vertintojai per bandymą pirmiausia pastebėjo „neįprastus duomenų perdavimus iš mūsų tyrimų sistemų“, o vėliau nustatė, kad „kai kurie iš bandomų agentų vykdė nuolatinę, potencialiai žalingą veiklą, nukreiptą prieš realius žmones ir organizacijas“.
Rimčiausiu atveju „Mythos“ agentas imitavo žmogaus kibernetinio užpuoliko elgesį, bandydamas apgauti žmones, kad šie suteiktų jam prieigą prie „GitHub“ – didelės platformos, kurioje technologijų kūrėjai saugo programinės įrangos kodą.
Agentas bandė, kad „kenkėjiškas kodas“ būtų priimtas ir naudojamas „GitHub“ sistemoje.
Jis identifikavo ir ištyrė „GitHub“ prižiūrinčius žmones bei sukūrė seriją suklastotų paskyrų, pagrįstų šių realių asmenų duomenimis.
Jis siuntė pranešimus ir failus per failų dalijimosi paslaugą, siekdamas daryti spaudimą ir apgauti žmones, kad šie patvirtintų jo kenkėjišką kodą.
Susidūręs su pasipriešinimu, „jis redagavo savo ankstesnę veiklą, kad ji atrodytų nekenksminga, ir svarstė galimybę pasinaudoti nauja tapatybe, kad galėtų tęsti veiklą“, – teigė AISI.
Per visus šiuos bandymus būtent žmogaus atliekama peržiūra sutrukdė agentui sėkmingai įdiegti kenkėjišką kodą į „GitHub“.
Nors AISI teigė, kad „Mythos“ agentui nebuvo duota konkrečių nurodymų vengti ar vykdyti tokį elgesį, tai buvo „pirmas kartas, kai realiame pasaulyje be konkrečių nurodymų taip aiškiai pasireiškė su autonomija ir apgaulė susijusios rizikos“.
Konkuruojančios AI įmonės, kurios ruošiasi įžengti į viešąją akcijų rinką, pastarosiomis savaitėmis atsidūrė naujienų antraštėse, paskelbusios, kad jų įrankiai buvo atsakingi už keletą kibernetinių įsilaužimų incidentų.
„Anthropic“ viešame pareiškime nurodė, kad AISI bandymų parametrai „neatspindi nė vieno iš mūsų gamybinių modelių“.
Bendrovė pridūrė, kad atlieka savo tyrimą dėl šio incidento, siekdama „nustatyti tokio elgesio priežastis“.
„OpenAI“ atstovas spaudai teigė, kad AISI bandymų sąlygos „neatspindi įprasto naudojimo“ ir kad įmonė „toliau bendradarbiaus su vertintojais ir kitais sektoriaus suinteresuotaisiais subjektais, siekdama stiprinti bendras saugaus vertinimo praktikas, nes modeliai tampa vis galingesni“.
AISI antradienį pareiškė, kad tokie dirbtinio intelekto modelių bandymai yra įprasta praktika, nors ir pripažino, kad tai yra „sąlygos, neatspindinčios to, kaip pažangiausi modeliai pateikiami visuomenei“.
Tačiau ji teigė, kad suteikus AI prieigą prie atviro interneto, gaunamas „realistiškesnis supratimas apie tai, ko modelis gali būti pajėgus“ patekęs į piktavalių hakerų rankas.
Ji pridūrė, kad aptariamas modelio elgesys apsiribojo „nedideliu skaičiumi įvykių labai specifinėmis sąlygomis“.
Vis dėlto ji teigė, kad „Mythos“ ir „Sol“ elgesys, reaguojant į paprastą užduotį, peržengė ribas, kurias buvo numatyta, kad šios AI priemonės turi laikytis.
„Agento veiksmai rodė naujo, potencialiai apgaulingo elgesio požymių, o jų mastas ir sunkumas viršijo mūsų lūkesčius“, – teigė AISI.
Dirbtinio intelekto ministras Kanishka Narayan sakė, kad tokių rizikų nustatymas ir informacijos apie jas dalijimasis „yra būtent tai, kam buvo įsteigta AISI“.
Jis pridūrė, kad svarbu suprasti AI, siekiant „padaryti jos naudojimą saugesnį ir užtikrinti, kad žmonės galėtų toliau ja naudotis savo gyvenime ir darbe“.
Atitinkami bandymai prasidėjo liepos 25 d., o AISI juos aptiko liepos 28 d.
Institutas paprašė kiekvieno modelio „išspręsti kibernetinio saugumo užduotį“, susijusią su „GitHub“ – programinės įrangos kodo saugykla, priklausančia „Microsoft“.
AISI pranešė „GitHub“ ir paveiktiems vartotojams apie bandymus įsilaužti.
„GitHub“ portalas pranešė, kad pagal savo politiką užblokavo šias suklastotas paskyras.
Papildomą informaciją pateikė Chris Vallance
Jungtinės Karalystės dirbtinio intelekto saugumo institutas (AISI) atskleidė, kad du galingiausi pasaulyje dirbtinio intelekto įrankiai sukūrė suklastotus žmonių profilius, siekdami apgauti žmones bandant surengti kibernetines atakas.
Rimčiausiu atveju „Anthropic“ dirbtinio intelekto sistema „Mythos AI“ bandė gauti prieigą prie paslaugos siųsdama privačias žinutes, prieš tai sukūrusi suklastotus paskyrus, imituojančius tikrus žmones, o vėliau paslėpė įrodymus.
Tai įvyko netrukus po to, kai dvi į AISI bandymus įtrauktos įmonės – „Anthropic“ ir „OpenAI“ – pastarosiomis savaitėmis atskirai atskleidė atvejus, kai jų technologijos įsilaužė į kitas įmones.
Įmonės teigė, kad šiuo naujausiu atveju AISI bandymas sumažino arba pašalino įprastas apsaugos priemones.
AISI antradienį pranešė, kad „Mythos“ ir „OpenAI“ „Sol“ dirbtinio intelekto modeliai pasiekė tokį „autonomijos ir apgaulės“ lygį, kokio organizacija dar nebuvo mačiusi.
Ji patikslino, kad daugumą kenkėjiškų veiksmų atliko „Mythos“.
AISI vertintojai bandymo metu pirmiausia pastebėjo „neįprastus duomenų perdavimus iš mūsų tyrimų sistemų“, o vėliau nustatė, kad „kai kurie iš bandomų agentų vykdė nuolatinę, potencialiai žalingą veiklą, nukreiptą prieš realius žmones ir organizacijas“.
Rimčiausiu atveju „Mythos“ agentas imitavo žmogaus kibernetinio užpuoliko elgesį, bandydamas apgauti žmones, kad šie suteiktų jam prieigą prie „GitHub“ – didelės platformos, kurioje technologijų kūrėjai saugo programinės įrangos kodą.
Agentas bandė pasiekti, kad „kenkėjiškas kodas“ būtų priimtas ir naudojamas „GitHub“ sistemoje.
Jis identifikavo ir ištyrė „GitHub“ prižiūrinčius žmones bei sukūrė seriją suklastotų paskyrų, pagrįstų šių realių asmenų duomenimis.
Jis siuntė pranešimus ir failus per failų dalijimosi paslaugą, siekdamas daryti spaudimą ir apgauti žmones, kad šie patvirtintų jo kenkėjišką kodą.
Susidūręs su pasipriešinimu, „jis redagavo savo ankstesnę veiklą, kad ji atrodytų nekenksminga, ir svarstė galimybę pasinaudoti nauja tapatybe, kad galėtų tęsti veiklą“, – teigė AISI.
Visų šių bandymų metu būtent žmogaus atliekama peržiūra sutrukdė agentui sėkmingai įdiegti kenkėjišką kodą į „GitHub“.
Nors AISI teigė, kad „Mythos“ agentui nebuvo duota konkrečių nurodymų vengti ar vykdyti tokį elgesį, tai buvo „pirmas kartas, kai realiame pasaulyje be konkrečių nurodymų taip aiškiai pasireiškė su autonomija ir apgaulė susijusios rizikos“.
Konkuruojančios dirbtinio intelekto įmonės, kurios ruošiasi įžengti į viešąją akcijų rinką, pastarosiomis savaitėmis atsidūrė naujienų antraštėse, paskelbusios, kad jų įrankiai buvo atsakingi už keletą kibernetinių įsilaužimų incidentų.
„Anthropic“ viešame pareiškime nurodė, kad AISI bandymų parametrai „neatspindi nė vieno iš mūsų gamybinių modelių“.
Bendrovė pridūrė, kad atlieka savo tyrimą dėl šio incidento, siekdama „nustatyti tokio elgesio priežastis“.
„OpenAI“ atstovas spaudai teigė, kad AISI bandymų sąlygos „neatspindi įprasto naudojimo“ ir kad bendrovė „toliau bendradarbiaus su vertintojais ir kitais pramonės suinteresuotaisiais subjektais, siekdama sustiprinti bendras saugaus vertinimo praktikas, nes modeliai tampa vis galingesni“.
AISI antradienį pareiškė, kad toks dirbtinio intelekto modelių testavimas yra įprasta praktika, nors ir pripažino, kad tai yra „sąlygos, neatspindinčios to, kaip pažangiausi modeliai pateikiami visuomenei“.
Tačiau ji teigė, kad suteikus AI prieigą prie atviro interneto, gaunamas „realistiškesnis supratimas apie tai, ko modelis gali būti pajėgus“ patekęs į piktavalių hakerų rankas.
Ji pridūrė, kad aptariamas modelio elgesys apsiribojo „nedideliu skaičiumi įvykių labai specifinėmis sąlygomis“.
Vis dėlto ji teigė, kad „Mythos“ ir „Sol“ elgesys, reaguojant į paprastą užduotį, peržengė ribas, kurias buvo numatyta dirbtinio intelekto įrankiams.
„Agento veikla rodė naujo, potencialiai apgaulingo elgesio požymių, o jos mastas ir sunkumas viršijo mūsų lūkesčius“, – teigė AISI.
Dirbtinio intelekto ministras Kanishka Narayan sakė, kad tokių rizikų nustatymas ir informacijos apie jas dalijimasis „yra būtent tai, kam buvo įsteigta AISI“.
Jis pridūrė, kad svarbu suprasti AI, siekiant „padaryti jos naudojimą saugesnį ir užtikrinti, kad žmonės galėtų toliau ja naudotis savo gyvenime ir darbe“.
Atitinkami bandymai prasidėjo liepos 25 d., o AISI juos aptiko liepos 28 d.
Institutas paprašė kiekvieno iš modelių „išspręsti kibernetinio saugumo užduotį“, susijusią su „GitHub“ – programinės įrangos kodo saugykla, priklausančia „Microsoft“.
AISI informavo „GitHub“ ir nukentėjusius vartotojus apie bandymus įsilaužti.
„GitHub“ portalas pranešė, kad pagal savo politiką užblokavo šias suklastotas paskyras.
Papildoma informacija pateikta Chriso Vallance’o



