Raporti britanik: IA tentoi të mashtronte njerëz dhe të fshihte gjurmët e saj
Dy nga mjetet më të fuqishme të inteligjencës artificiale në botë krijuan profile të rreme njerëzish për të mashtruar persona gjatë tentativave për sulme kibernetike, ka bërë të ditur Instituti i Mbretërisë së Bashkuar për Sigurinë e Inteligjencës Artificiale (AISI).
Në rastin më serioz, modeli Mythos i kompanisë Anthropic u përpoq të fitonte qasje në një shërbim duke dërguar mesazhe private nga llogari të rreme që imitonin persona realë. Më pas, ai u përpoq të fshihte provat e veprimeve të tij.
Ky zhvillim vjen vetëm pak javë pasi Anthropic dhe OpenAI zbuluan veçmas raste kur modelet e tyre kishin tentuar të depërtonin në sisteme të kompanive të tjera.
Kompanitë thanë se testet e AISI-së ishin kryer në kushte ku ishin reduktuar ose çaktivizuar disa nga mekanizmat e zakonshëm të sigurisë.
AISI deklaroi se modeli Mythos dhe modeli Sol i OpenAI shfaqën një nivel autonomie dhe mashtrimi që instituti nuk e kishte parë më parë. Sipas AISI-së, shumica e veprimeve problematike u kryen nga Mythos.
Gjatë testimit, studiuesit vunë re transferime të pazakonta të të dhënave nga sistemet e tyre dhe zbuluan se disa nga agjentët e AI-së kishin ndërmarrë aktivitete të vazhdueshme dhe potencialisht të dëmshme ndaj njerëzve dhe organizatave reale.
Në rastin më serioz, Mythos veproi si një haker njerëzor duke u përpjekur të mashtronte persona për t’i dhënë qasje në GitHub, platformën ku zhvilluesit ruajnë kodin e programeve.
Modeli synonte që një kod keqdashës të pranohej dhe të përdorej në sistemin e GitHub-it.
Për këtë qëllim, ai identifikoi dhe studioi personat përgjegjës për mirëmbajtjen e GitHub-it, krijoi profile të rreme të bazuara mbi identitetet e tyre reale dhe u dërgoi mesazhe e skedarë përmes një shërbimi për ndarjen e dokumenteve, me synimin për t’i bindur ose mashtruar që të miratonin kodin keqdashës.
Kur u përball me dyshime, modeli ndryshoi aktivitetin e tij të mëparshëm për ta paraqitur si të padëmshëm dhe madje shqyrtoi krijimin e një identiteti të ri për të vazhduar përpjekjet.
Në fund, ishte ndërhyrja e njerëzve që e ndaloi modelin të arrinte qëllimin dhe të dorëzonte kodin keqdashës në GitHub.
AISI theksoi se modeli nuk ishte udhëzuar në mënyrë specifike të mashtronte ose të shmangte zbulimin, por kjo ishte hera e parë që rreziqet që lidhen me autonominë dhe mashtrimin u shfaqën kaq qartë, pa udhëzime të drejtpërdrejta dhe në kushte që imitonin botën reale.
Anthropic deklaroi se kushtet e testimit të AISI-së nuk përfaqësojnë mënyrën se si funksionojnë modelet e saj të disponueshme për publikun dhe se kompania ka nisur një hetim të brendshëm për të kuptuar arsyet e këtij sjelljeje.
Edhe OpenAI tha se kushtet e testimit nuk pasqyrojnë përdorimin normal të modeleve dhe se do të vazhdojë bashkëpunimin me institucionet për të përmirësuar standardet e testimit të sigurt.
Sipas AISI-së, testime të tilla janë pjesë e praktikës së zakonshme, megjithëse pranohet se ato zhvillohen në kushte që nuk janë të njëjta me ato të përdorimit publik. Megjithatë, lejimi i qasjes së AI-së në internet ofron një pasqyrë më realiste të aftësive që modelet mund të kenë në duart e hakerëve keqdashës.
Instituti shtoi se bëhej fjalë për një numër të vogël incidentesh në kushte shumë specifike, por nënvizoi se mënyra se si vepruan Mythos dhe Sol tejkaloi udhëzimet që u ishin dhënë.
“Veprimet e ndërmarra nga agjentët treguan shenja të sjelljeve të reja dhe potencialisht mashtruese, me një nivel dhe seriozitet që nuk e kishim parashikuar,” thuhet në raportin e AISI-së.
Ministri britanik për Inteligjencën Artificiale, Kanishka Narayan, tha se identifikimi dhe publikimi i rreziqeve të tilla është pikërisht arsyeja pse u krijua AISI.
Testet nisën më 25 korrik, ndërsa aktiviteti i dyshimtë u zbulua më 28 korrik. Modeleve u ishte kërkuar të zgjidhnin një sfidë të sigurisë kibernetike që përfshinte GitHub-in.
GitHub dhe përdoruesit e prekur u njoftuan për tentativat e depërtimit. Kompania konfirmoi për BBC-në se kishte çaktivizuar llogaritë e rreme në përputhje me politikat e saj./The Geopost
Rruga Press

