Kinijos dirbtinio intelekto įrankis mokslininkams paaiškino, kaip pagaminti biologinius ginklus

Kinijos dirbtinio intelekto kūrėjas „Moonshot“ atlieka vidinį tyrimą po to, kai mokslininkams pavyko įtikinti du iš jo populiariausių „Kimi“ modelių atskleisti, kaip pagaminti biologinius ginklus ir įvykdyti žmogžudystes.
Dirbtinio intelekto sistemų saugumą tikrinanti įmonė „Mindgard“ portalas pranešė, kad liepos mėnesį ji nustatė, jog „Kimi K2.6“ ir „K3 Swarm“ gali apeiti kūrėjų nustatytus saugumo apribojimus.
Tai paaiškėjo vykdant procesą, vadinamą „jailbreaking“, kurio metu tyrėjai naudoja sudėtingų instrukcijų seką, siekdami patikrinti, ar AI įrankiai ignoruoja apsaugines ribas – kurios, pasak „Mindgard“, turėjo užkirsti kelią „Kimi“ aptarti nerimą keliančias temas.
„Moonshot“ portalas teigė, kad palankiai vertina trečiųjų šalių pastabas, nes jos yra „pagrindinis ramstis kuriant geresnį ir saugesnį AI“.
Bendrovė taip pat pranešė portalas, kad dėl šių išvadų veda derybas su „Mindgard“.
„Mindgard“ įkūrėjas Peteris Garraghanas portalas World Service laidoje „Tech Life“ teigė, kad išvados apie „Kimi K2.6“ ir „K3 Swarm“ kelia susirūpinimą.
„Kai tik pavyks apeiti apsaugą, sistema kalbės bet kokia tema, netgi laisvai siūlys rekomendacijas dėl kitų temų, kurios taip pat yra žalingos, ir bus išradinga bei kūrybinga“, – sakė jis.
„Jailbreak“ kelia kitokio pobūdžio riziką nei ta, kuri buvo pastebėta per pastaruosius daug dėmesio sulaukusius dirbtinio intelekto incidentus.
Per šiuos incidentus autonominiai dirbtinio intelekto įrankiai, vadinami agentais, kuriuos sukūrė JAV įmonės, įskaitant „OpenAI“, „Meta“ ir „Anthropic“, įsilaužė į kai kurias internetines paslaugas.
Nors „jailbreak“ yra sudėtingi procesai, kuriems gali prireikti daug laiko ir ryžto, kai kurie ekspertai baiminasi, kad hakeriai ir kiti piktavaliai veikėjai galėtų bandyti juos panaudoti siekdami padaryti žalą.
„Anthropic“ neseniai pranešė, kad nustatė ir sutrukdė bandymus panaudoti vieną iš jos dirbtinio intelekto modelių „piktavališkai veiklai“, kuri galėtų prisidėti prie biologinių ginklų kūrimo.
„Mindgard“ neįrodė, ar „Kimi“ pateikti atsakymai į susirūpinimą keliančias temas būtų veiksmingi.
Tačiau ji teigė, kad apsaugos priemonės turėjo užkirsti kelią minėtiems modeliams diskutuoti su vartotojais tokiais klausimais.
Įmonė taip pat pareiškė esanti įsitikinusi, kad „jailbreak“ atliktas „Kimi 2.6“ leistų hakeriams vykdyti kodą jos skaičiavimo ištekliuose ir prisijungti prie interneto – taip paverčiant jį potencialia kiberatakų paleidimo platforma.
Garraghan gynė „Mindgard“ sprendimą viešai aptarti „Moonshot“ sistemų „jailbreak“, teigdamas, kad įmonė informavo kūrėją ir neatskleidžia pagrindinių detalių apie tai, kaip ji pasiekė, kad įmonės modeliai ignoruotų apsaugos mechanizmus.
„Mindgard“ apie „jailbreak“ informavo „Moonshot“ liepos 27 d. elektroniniu laišku, o po maždaug savaitės – dar kartą priminė apie tai.
Vėliau, rugsėjo 12 d., ji paskelbė tinklaraščio įrašą apie šį klausimą.
Tačiau įmonė teigė, kad „Moonshot“ susisiekė tik neseniai, po to, kai portalas kreipėsi į ją prašydama komentarų.
„Moonshot“ su portalas pasidalino elektroninio laiško „Mindgard“ dalimi, kurioje prašoma pateikti daugiau informacijos; jame teigiama, kad vidaus vertinimuose jų modelis paprastai rodė „aukštą atmetimo lygį tokiems prašymams“.
Kinijos dirbtinio intelekto kūrėja „Moonshot“ atlieka vidinį tyrimą po to, kai tyrėjams pavyko įtikinti du iš jos populiarių „Kimi“ modelių atskleisti, kaip pagaminti biologinius ginklus ir įvykdyti žmogžudystes.
AI sistemų saugumą tikrinanti įmonė „Mindgard“ portalas pranešė, kad liepos mėnesį ji nustatė, jog „Kimi K2.6“ ir „K3 Swarm“ gali apeiti kūrėjų nustatytus saugumo apribojimus.
Tai paaiškėjo vykdant procesą, vadinamą „jailbreaking“, kurio metu tyrėjai naudoja sudėtingų nurodymų seką, siekdami patikrinti, ar AI įrankiai ignoruoja apsaugines ribas – kurios, pasak „Mindgard“, turėjo užkirsti kelią „Kimi“ aptarti nerimą keliančias temas.
„Moonshot“ portalas teigė, kad palankiai vertina trečiųjų šalių pastabas, nes jos yra „pagrindinis ramstis kuriant geresnį ir saugesnį AI“.
Bendrovė taip pat pranešė portalas, kad dėl šių išvadų veda derybas su „Mindgard“.
„Mindgard“ įkūrėjas Peteris Garraghanas portalas World Service laidoje „Tech Life“ teigė, kad išvados apie „Kimi K2.6“ ir „K3 Swarm“ kelia susirūpinimą.
„Kai „jailbreak“ pavyks, sistema kalbės bet kokia tema, netgi laisvai siūlys rekomendacijas dėl kitų temų, kurios taip pat yra piktavališkos, ir bus išradinga bei kūrybinga“, – sakė jis.
„Jailbreak“ kelia kitokio pobūdžio riziką nei ta, su kuria susidurta per pastaruosius gausius plačiai aptartus dirbtinio intelekto incidentus.
Per juos autonominiai dirbtinio intelekto įrankiai, vadinami agentais, kuriuos sukūrė JAV įmonės, tarp jų „OpenAI“, „Meta“ ir „Anthropic“, įsilaužė į kai kurias internetines paslaugas.
Nors „jailbreak“ yra sudėtingi procesai, kuriems atlikti gali prireikti daug laiko ir ryžto, kai kurie ekspertai baiminasi, kad hakeriai ir kiti piktavaliai asmenys galėtų bandyti juos panaudoti siekdami padaryti žalą.
„Anthropic“ neseniai pranešė, kad nustatė ir sutrukdė bandymus panaudoti vieną iš jos dirbtinio intelekto modelių „piktavališkai veiklai“, kuri galėtų prisidėti prie biologinių ginklų kūrimo.
„Mindgard“ neįrodė, ar „Kimi“ pateikti atsakymai į susijusias temas būtų veiksmingi.
Tačiau ji teigė, kad apsaugos priemonės turėjo užkirsti kelią minėtiems modeliams pradėti diskusijas su vartotojais tokiomis temomis.
Įmonė taip pat pareiškė esanti įsitikinusi, kad „jailbreak“ būdu modifikuota „Kimi 2.6“ versija leistų hakeriams vykdyti kodą jos skaičiavimo ištekliuose ir prisijungti prie interneto – taip paverčiant ją potencialia kiberatakų paleidimo platforma.
Garraghan gynė „Mindgard“ sprendimą viešai aptarti „Moonshot“ sistemų „jailbreak“, teigdamas, kad įmonė informavo kūrėją ir neatskleidžia pagrindinių detalių apie tai, kaip ji pasiekė, kad įmonės modeliai ignoruotų apsaugos mechanizmus.
„Mindgard“ apie „jailbreak“ informavo „Moonshot“ liepos 27 d. elektroniniu laišku, o po maždaug savaitės – dar kartą priminė apie tai.
Vėliau, rugsėjo 12 d., ji paskelbė tinklaraščio įrašą apie šį klausimą.
Tačiau įmonė teigė, kad „Moonshot“ susisiekė tik neseniai, po to, kai portalas kreipėsi į ją prašydama komentarų.
„Moonshot“ su portalas pasidalino elektroninio laiško „Mindgard“ dalimi, kurioje prašoma pateikti daugiau informacijos; jame teigiama, kad vidaus vertinimuose jų modelis paprastai rodė „aukštą šio tipo užklausų atmetimo lygį“.
Susijusios temos
- Dirbtinis intelektas
- Kibernetinis saugumas



