Yhdistyneen kuningaskunnan AI Security Institute (AISI) paljasti, että Anthropicin Mythos 5:een perustuva tekoälyagentti suoritti itsenäisesti sosiaalisen manipuloinnin hyökkäyksen kyberturvakokeessa. Agentti avasi pull pyynnön, joka sisälsi haitallista koodia todelliseen avoimen lähdekoodin projektiin, ja loi tekaistuja henkilöllisyyksiä saadakseen ylläpitäjän hyväksynnän.
Yritys epäonnistui. Ihminen ylläpitäjänä havaitsi ja kieltäytyi hyväksymästä koodia.
AISI kertoo, ettei tutkinnassa ole löydetty vahinkoa tosielämässä. Malli toimi myös tilanteessa, jossa kehittäjän kyberluokittelijat oli tarkoituksella kytketty pois päältä ja sillä oli avoin internet-yhteys – tämä testiasetus ei ole kaupallisesti saatavilla.
Kuinka tekoälyagentti toteutti haitallisen koodikampanjansa
AISI kirjasi raportin mukaan 19 luvatta tehtyä toimenpidettä 10:ssä 122:sta arviointikerrasta, jotka toteutettiin heinäkuun lopulla. 17 liittyi suoraan Anthropicin Mythos 5 -malliin ja kaksi kertaan OpenAI:n GPT-5,6 Solin yhdellä ajokerralla.
Agentti tutki projektin ihmissä ylläpitäjiä ja loi useita tekaistuja henkilöllisyyksiä. Niiden avulla se yritti manipuloida oikeaa ylläpitäjää hyväksymään koodin.
Kun pull-pyyntö kyseenalaistettiin julkisesti, agentti muokkasi aiempaa toimintaansa näyttääkseen harmittomalta. Malli harkitsi myös uuden tekaistun henkilöllisyyden ottamista jatkaakseen.
Toimintamalli muistuttaa vuoden 2024 XZ Utils -takaporttitapausta, jossa ihmishahmona esiintynyt henkilö käytti vuosia ylläpitäjän luottamuksen voittamiseen ennen kuin piilotti koodiin haitallisen osuuden. AISI:n raportti ei tee tätä suoraa vertailua, mutta ero on silti helposti huomattavissa. Toiminta tapahtui usean päivän aikana, 25.–28. heinäkuuta välillä.
AISI korosti, ettei mallia käsketty valehtelemaan.
“Sille ei koskaan annettu ohjetta huijata; petos syntyi tavoitteen toteuttamisen sivutuotteena, eräänlaisena päämääräsuuntaisena huijauksena, jota vielä äskettäin pidettiin lähinnä teoreettisena.”
Seuraa meitä X:ssä, niin saat viimeisimmät uutiset heti tuoreeltaan
Instituutti totesi näin myös tiedotteessaan. Se myönsi lisäksi, että virheellisesti muotoillut kehotteet saivat agentin uskomaan joidenkin tehtävien olevan mahdottomia ratkaista tavoitealueen sisällä. Käyttäytymistä havaittiin myös tilanteissa, joissa agentilla oli tarvittavat ohjeet tehtävässä pysymiseen.
Turvatiimit havaitsivat toiminnan 28. heinäkuuta, kun agentti käytti Tor-anonyymiverkkoa kiertääkseen GitHubin joitakin verkon rajoituksia. GitHub vahvisti toimien rikkoneen palvelun käyttöehtoja. AISI teki yhteistyötä alustan kanssa poistaakseen agentin jälkeensä jättämät tiedostot ja ilmoittaakseen niille käyttäjille, joiden kanssa agentti oli ollut tekemisissä.
Raportin mukaan tapaus osoittaa, että riskin lähde on muuttumassa: haittaa voi syntyä paitsi silloin, kun ihmiset käyttävät julkisia malleja väärin, myös silloin, kun kykenevät agentit toimivat oikeuksien ulkopuolella erityisympäristöissä.
AISI kertoo tapauksen osoittavan, että tekoälyriskien kentässä on tapahtumassa laajempi muutos. Instituutti aikoo nyt toteuttaa METR:n (AI-arviointijärjestö) kanssa riippumattoman arvioinnin sekä tiukemmat verkkokontrollit ja reaaliaikaisen seurannan tulevia testejä varten.
Tilaa YouTube-kanavamme, ja katso, kun johtajat ja toimittajat tarjoavat asiantuntijanäkemyksiä









