Tekoälyn tietoturva – mitä tietoja tekoälylle ei pidä antaa?
Kuluttajille suunnattuja kielimalleja käytettäessä on tärkeää valvoa tarkasti, mitä tietoja niihin syöttää. Avoimiin tekoälypalveluihin lähetetyt tiedot poistuvat käyttäjän omasta ympäristöstä. Luottamuksellisten tietojen syöttäminen tekoälylle voi johtaa tietovuotoon, liikesalaisuuden paljastumiseen tai tietosuojasäännösten rikkomiseen. Siksi jokaiseen tekoälyn kanssa käytyyn keskusteluun kannattaa suhtautua kuin tiedot julkaistaisiin avoimesti.
Mitä tietoja tekoälylle ei pidä antaa?
Julkisesti saatavilla oleviin tekoälypalveluihin ei pidä syöttää seuraaviin ryhmiin kuuluvia tietoja:
- henkilötiedot – asiakkaiden, työntekijöiden tai omat nimet, osoitteet, henkilötunnukset, puhelinnumerot ja sähköpostiosoitteet;
- potilastiedot – sairaushistoriat, tutkimustulokset ja diagnoosit, joiden käsittelyä säännellään tiukasti esimerkiksi GDPR:n ja HIPAA:n nojalla;
- yrityksen luottamukselliset tiedot – julkaisemattomat talousraportit, markkinointistrategiat, asiakasrekisterit sekä fuusioita, yritysostoja tai irtisanomisia koskevat suunnitelmat;
- liikesalaisuudet – ohjelmistojen lähdekoodit, valmistusreseptit, ainutlaatuiset algoritmit ja yrityksen sisäinen tekninen dokumentaatio;
- salasanat ja pääsytiedot – API-avaimet, kirjautumistiedot, käyttöoikeustunnisteet, maksukorttitiedot ja salausavaimet;
- tekijänoikeudella suojatut materiaalit – kokonaiset kirjat, maksulliset tieteelliset artikkelit ja käsikirjoitukset, joiden käsittelyyn käyttäjällä ei ole tarvittavaa lupaa;
- laiton sisältö – väkivaltaan tai vihaan yllyttävät materiaalit sekä ohjeet lainvastaiseen toimintaan.
Mitä tekoälylle syötetyille tiedoille tapahtuu?
Pilvipalvelujen tarjoajille lähetettyjä tietoja käsitellään ja analysoidaan useassa vaiheessa. Tietojen käsittely ei pääty siihen, että tekoäly tuottaa vastauksen.
Mallien kouluttaminen
Kuluttajille tarkoitettujen generatiivisten tekoälypalvelujen vakioversioihin syötettyjä tietoja käytetään usein mallien jatkokoulutukseen. Tiedot voivat siis vaikuttaa neuroverkon painoihin ja teoriassa päätyä myöhemmin osaksi toiselle käyttäjälle tuotettua vastausta.
Manuaalinen tarkastus ja moderointi
Automaattisen käsittelyn lisäksi tekoälyjärjestelmissä on turvasuodattimia. Jos algoritmi tulkitsee pyynnön epäilyttäväksi, esimerkiksi käyttöehtojen vastaiseksi, keskustelu voidaan merkitä manuaalista tarkastusta varten. Tällöin palveluntarjoajan työntekijät tai ulkopuoliset tarkastajat, kuten aineiston luokittelijat, voivat nähdä syötetyn sisällön esimerkiksi moderointijärjestelmien kehittämiseksi.
Tietojen säilytys ja varmuuskopiot
Tekoälypalvelujen tarjoajat tallentavat keskusteluja palvelimilleen palvelun jatkuvuuden, virheiden selvittämisen ja myöhempien keskustelujen asiayhteyden säilyttämiseksi. Keskustelun poistaminen käyttöliittymästä ei yleensä tarkoita, että tiedot poistuisivat heti palvelimilta. Niitä voi jäädä palveluntarjoajan varmuuskopioihin määräajaksi. Tämä lisää luottamuksellisten tietojen paljastumisen riskiä, jos pilvi-infrastruktuuri joutuu onnistuneen kyberhyökkäyksen kohteeksi.
Henkilökohtaiset ja yritystilit – miten tietosuoja eroaa?
Tekoälypalvelun tietoturva riippuu merkittävästi tilauksen tyypistä ja siitä, miten palvelu on otettu käyttöön.
Monien suosittujen palvelujen maksuttomilla ja maksullisilla henkilökohtaisilla vakiotileillä lähetettyjä tietoja käsitellään oletusarvoisesti mallien kouluttamista varten. Jos keskusteluun syöttää luottamuksellista aineistoa, siihen liittyy riski, että tiedot päätyvät käyttäjän hallinnan ulkopuolelle.
Yritys- ja organisaatioympäristöissä – esimerkiksi Enterprise-tileillä tai palveluissa, joita käytetään yksityisessä pilvessä Microsoft Azuren, AWS:n tai Google Cloudin kaltaisten tarjoajien API-rajapintojen kautta – suojausvaatimukset ovat tiukemmat. Palveluntarjoajat sitoutuvat turvallisuusstandardeihin, kuten ISO 27001:een ja SOC 2:een, sekä GDPR:n noudattamiseen. Lisäksi ne ilmoittavat sopimuksissaan (SLA/DPA), ettei asiakkaan tietoja käytetä julkisten perusmallien kouluttamiseen. Tietojen syöttämistä koskevat rajoitukset voivat olla tällaisissa ympäristöissä lievempiä, mutta riskienhallinta ja käyttöoikeuksien valvonta ovat silti tarpeen.
Mitä tekoälylle voi antaa turvallisesti?
Rajoituksista huolimatta tekoälyllä voi käsitellä monenlaisia tietoja, kun niiden käyttöön on oikeus eikä niissä ole luottamuksellista sisältöä. Esimerkkejä ovat:
- julkisesti saatavilla oleva aineisto – avoimet artikkelit, blogikirjoitukset, julkiset markkinaraportit, säädökset ja verkkosivujen sisällöt, kuten Wikipedian tekstit;
- ei-luottamukselliset tiedot – yleiset ohjeet, teoreettisia käsitteitä koskevat kysymykset, kielioppi- ja oikeinkirjoitussäännöt, matemaattiset yhtälöt ja sanojen merkityksiä koskevat kysymykset;
- anonymisoidut dokumenttiotteet – kirje- ja sopimuspohjat sekä koodikatkelmat, joista on poistettu yksilöivät muuttujat, avaimet, asiakkaiden nimet ja sisäistä järjestelmäarkkitehtuuria koskevat tiedot;
- omat tekstit – sähköpostiluonnokset, somejulkaisut, esitysrungot ja artikkelit, jotka eivät sisällä arkaluonteisia yritystietoja;
- avoimet tietoaineistot – synteettiset tiedot tai julkisista tietovarannoista peräisin olevat tilastot, joita käytetään analysoinnin ja muotoilun harjoitteluun.
Miten viestit ja tiedot anonymisoidaan ennen niiden lähettämistä tekoälylle?
Ennen luottamuksellisten asiakirjojen lähettämistä kielimallille niistä on poistettava arkaluonteiset tiedot. Näin tekstiä voi käsitellä paljastamatta luottamuksellista sisältöä.
Tunnistetietojen poistaminen ja korvaaminen tunnisteilla
Tunnisteilla korvaamisessa arkaluonteiset tiedot vaihdetaan keinotekoisiin vastineisiin. Esimerkiksi nimen ”Matti Meikäläinen” voi korvata tunnisteella ”[Asiakas_1]” ja yrityksen nimen ”Esimerkki Oy” tunnisteella ”[Yritys_A]”. Näin asiakirjan rakenne, kieli ja asiayhteys säilyvät kielimallin käytettävissä, mutta alkuperäistä henkilöä tai organisaatiota ei voi tunnistaa suoraan tekstistä.
Arkaluonteisten tietojen peittäminen
Peittämisessä kriittisiä merkkijonoja piilotetaan esimerkiksi korvaamalla osa merkeistä tähdillä (maksukortin numero 4532 **** **** ****). Tietoja voi myös yleistää: tarkan arvon, kuten 3 200 euron kuukausipalkan, sijaan voi ilmoittaa palkkahaarukan, esimerkiksi 3 000–4 000 euroa kuukaudessa. Tämä vähentää uudelleentunnistamisen riskiä.
Käsittelyn automatisointi DLP- ja RegEx-työkaluilla
Pitkien tekstien manuaalisessa puhdistamisessa tietoja jää helposti huomaamatta. Ammattikäytössä hyödynnetään säännöllisiin lausekkeisiin perustuvia RegEx-skriptejä tai tietovuotojen estoon tarkoitettuja DLP-järjestelmiä. Ne voivat tarkistaa kehotteen automaattisesti ennen lähettämistä ja havaita, estää tai korvata esimerkiksi henkilötunnusten, Y-tunnusten, sähköpostiosoitteiden ja pankkitilinumeroiden muotoisia merkkijonoja.
Miten estät tekoälymallin kouluttamisen omilla tiedoillasi?
Tietojen jakamiseen liittyviä riskejä voi vähentää myös muuttamalla palvelun asetuksia. Useimmat palveluntarjoajat antavat mahdollisuuden kieltää oman sisällön käytön mallien kouluttamiseen.
- ChatGPT (OpenAI) – tilin Settings-valikon Data controls -osiossa on asetus ”Improve the model for everyone”. Kun poistat sen käytöstä, uusia keskustelujasi ei käytetä mallin kouluttamiseen. Nykyisessä käyttöliittymässä keskusteluhistoria pysyy silti näkyvissä. Asetuksesta riippumatta OpenAI voi säilyttää keskustelulokeja palvelimillaan 30 päivän ajan väärinkäytösten valvontaa ja turvallisuutta varten ennen niiden lopullista poistamista.
- Gemini (Google) – poista tietosuoja-asetuksista Gemini Apps Activity käytöstä. Tällöin uudet keskustelut eivät tallennu Google-tilisi toimintahistoriaan eikä niitä käytetä mallien kouluttamiseen. Muutos ei kuitenkaan poista lokeja heti palveluntarjoajan järjestelmistä: Google voi säilyttää niitä enintään 72 tuntia palvelun turvallisuuden varmistamiseksi.
- Claude (Anthropic) – maksuttomien ja tavallisten kuluttajaversioiden oletusasetukset sallivat nykyisin syötettyjen tietojen käytön mallien kehittämiseen. Tämä poikkeaa yrityksen aiemmasta käytännöstä, jolloin Anthropic korosti, ettei se käyttänyt käyttäjien keskusteluja koulutukseen. Voit poistaa tietojen jakamisen käytöstä tilin tietosuoja-asetusten kohdassa ”Help improve Claude”.
On tärkeää muistaa, että tietosuoja-asetusten muutokset ja koulutuskäytön kielto koskevat vain tulevaa käyttöä. Ne eivät poista tietoja, jotka on lähetetty ennen asetusten muuttamista ja joita on jo ehditty käyttää mallin koulutuksessa.
Yhteenveto
- Kuluttajille suunnattuihin tekoälypalveluihin syötettyihin tietoihin kannattaa suhtautua kuin ne julkaistaisiin avoimesti. Älä anna niille henkilötietoja, potilastietoja, salasanoja tai liikesalaisuuksia.
- Lähetettyjä tietoja voidaan käsitellä useassa vaiheessa, esimerkiksi mallien koulutuksessa ja moderoinnissa. Niitä voidaan myös säilyttää ulkopuolisilla palvelimilla ja varmuuskopioissa.
- Tietoja voi suojata anonymisoimalla ne etukäteen, peittämällä arkaluonteiset merkkijonot, korvaamalla tunnistetiedot keinotekoisilla tunnisteilla ja käyttämällä DLP-työkaluja.
- Enterprise-tilit ja yrityskäyttöön tarkoitetut pilvipalvelut tarjoavat tiukempia suojauskäytäntöjä sekä sopimusehtoja, joiden mukaan asiakkaan tietoja ei käytetä julkisten perusmallien kouluttamiseen.
- Tietosuoja-asetusten muuttaminen ja mallin kouluttamiseen annetun luvan peruuttaminen vaikuttavat vain tulevaan käyttöön. Ne eivät poista tietoja, joita on jo käytetty mallin koulutuksessa.
Vastaa