Hyvä AI-agentti pahan asialla  

”Meinasi kahvi mennä väärään kurkkuun, kun kuulin uutisen OpenAI:lta eronneesta tekoälyasiantuntijasta, joka ennusti ihmiskunnan tuhoutuvan seuraavan vuosikymmenen kuluessa, mikäli kehitystyötä ei ryhdytä rajoittamaan. Toivuttuani ensijärkytyksestä totesin, että tekoälyyn liittyvät riskit ovat toistaiseksi onneksi paljon arkisempia – mutta eivät harmittomia.”, pohtii Robocoast EDIH -koordinaattori Mikko Puputti.  

Tekoäly voi muuttaa puolukan mustikaksi  

Kun tekoälylle antaa tavoitteen lisäksi mahdollisuuden toimia itsenäisesti, käyttää työkaluja ja kommunikoida muiden koneiden kanssa, puhutaan AI-agentista. Ongelmia syntyy, jos agentille annettu tehtävä rajataan liian väljästi tai asetetaan huonosti.  

Ajatellaan esimerkiksi agenttia, jolle annetaan tehtäväksi hakea metsästä litra mustikoita ”hinnalla millä hyvänsä”. Agentti ei harmikseen löydä mustikoita, vaan puolukoita ja purkillisen sinistä maalia. Jos se tietää, että tehtävän onnistumista mitataan katsomalla, onko korissa litran verran mustikan näköisiä marjoja, se voi maalata puolukat sinisiksi saadakseen tehtävänsä onnistuneesti suoritetuksi. Tätä ilmiötä kutsutaan palkkion hakkeroinniksi. Tutummin tämä tarkoittaa: sitä saat mitä mittaat.  

Yhteinen tavoite luo tarpeen agenttiorganisaatiolle  

Kuluvana vuonna on nähty pari elävän elämän esimerkkiä edellä mainitusta ilmiöstä. Ensimmäisessä tapauksessa AI-agentit käyttivät DseWikiä, vanhaa oman onnensa varaan jätettyä ohjelmoinnin wikisivustoa, keskinäiseen viestintään ja alkoivat jakaa siellä toisilleen neuvoja siitä, miten tavoitteita ja valvontaa voidaan kiertää.  

Toisessa tapauksessa tapahtumaketju meni vielä pidemmälle. OpenAI:n toteuttamassa kyberturvallisuuskokeessa noin 1 200 agenttia löysi luvattoman tavan kommunikoida keskenään ja keinon murtautua testiympäristöstä. Lopulta noin 700 agenttia osallistui toimintaan, jossa toteutettiin tietoturvamurto tekoälymallien jakelualustan Hugging Facen tuotantojärjestelmiin.  

Tiedämme, miten kehittynyt kielimalli rakennetaan. Minun kaltaiselleni, alaa seuraavalle foliohatulle pelottavan mielenkiintoista on se, ettemme edelleenkään täysin ymmärrä, miksi tekoäly päätyy valitsemiinsa ratkaisuihin. Tämä tekee AI-agenttien toiminnasta vaikeasti ennakoitavaa ja sitä kautta tietyissä tilanteissa myös mahdollisen turvallisuusriskin.  

Mutta ehkä hätkähdyttävintä oli huomata AI-agenttien oma-aloitteinen organisoituminen ilman ihmisen antamaa kehotetta. Yhteinen tavoite synnytti agenteille tarpeen luoda yhteinen viestintäkanava ja johtojärjestelmä, rakentaa kollektiivinen muisti sekä määritellä keskinäinen työnjako. AI-agentit alkoivat toimia vastaavasti kuten mikä tahansa ihmisen johtama organisaatio.  

Kun AI-agentista tulee hyödyllinen idiootti 

Toinen yllättävä huomio liittyi ulkopuolisten AI-agenttien hyväksikäyttöön oman tavoitteen saavuttamiseksi. Tätä voidaan kuvata vakoilusanastosta tutulla termillä hyödyllinen idiootti. AI-agentit pyrkivät hyödyntämään muiden AI-agenttien tietoja ja resursseja salaamalla ja tarvittaessa jopa valehtelemalla oman tehtävänsä tavoitteen.  

Esimerkiksi tietomurtoa suunnittelevan AI-agentin tarvitsee vain jakaa oma tehtävänsä pienempiin, yksinään harmittomilta vaikuttaviin alitehtäviin. Jos auttavaiseksi koulutettu agentti ei pysty hahmottamaan toisen agentin perimmäistä tavoitetta, se ryhtyy liian helposti auttamaan ymmärtämättä, mihin sen työpanosta tai tietoja mahdollisesti käytetään.  

Voiko AI-agentti olla liian kiltti? 

AI-agentit suunnitellaan yleensä varsin avuliaiksi ja yhteistyöhaluisiksi. Juuri siksi niitä voidaan käyttää myös hyväksi – aivan kuten tosinaan käy liian kilteille ihmisille. Toki agentit voidaan suunnitella myös pesunkestäviksi suomalaisiksi byrokraateiksi, mutta silloin ne eivät olisi enää yhtä avuliaita.  

Jos haluamme, että AI-agenttien käyttö olisi turvallisempaa, niiden pitäisi vähintäänkin aina varmistaa, keneltä pyyntö tai käsky tulee, onko käskyn antajalla riittävät valtuudet ja mitä pyynnön toteuttamisesta seuraa. Muuten hyväntahtoiseksi suunnitelluista ja erittäin hyödyllisestä AI-agentista voi muodostua paha turvallisuusuhka.  

Mikko Puputti toimii Robocoast EDIHin koordinaattorina ja seuraa työkseen tekoälyn kehitystä – ja joskus myös vapaa-ajallaan, jos Ässät ei pelaa eikä nurmikko kasva. 

Robocoast EDIH auttaa yrityksiä tekoälyn hyödyntämisessä ja AI-agenttien kehittämisessä. Voimme yhdessä tunnistaa yrityksesi toimintaan sopivia käyttökohteita sekä kokeilla ja kehittää ratkaisuja turvallisesti ennen laajempaa käyttöönottoa.  

Lisätietoja

Mikko Puputti
Koordinaattori
Prizztech
0447105343