Kui enamik inimesi kuuleb sõna „tehisintellekt”, tuleb ilmselt esimesena pähe ChatGPT-laadne vestlusrobot. Sisestad küsimuse, AI mõtleb veidi ja vastab tekstiga.
Jev on üles ehitatud teistsuguse põhimõtte järgi.
Ta ei taha sinuga vestelda, kirjutada esseed ega genereerida reklaamteksti. Tegelikult ei väljasta Jev üldse tavapärast teksti. Selle asemel annab ta tarkvarale struktureeritud otsuseid ja tõenäosusi, mida programm saab kohe kasutada.
Näiteks võib klienditoe süsteem saada sõnumi „minu kaardilt võeti sama summa kaks korda” ning küsida Jevilt, milline osakond peaks juhtumiga tegelema. Vastus ei pruugi olla pikk seletus, vaid midagi sellist: arveldus 8%, tehniline probleem 85%, müük 7%, koos usaldusväärsuse hinnanguga. Seejärel võib programm tulemuse põhjal automaatselt järgmise sammu teha. Just selliseid valiku-, skoori- ja jah/ei-tüüpi otsuseid Jev tegema on loodud.
See ongi Jevi põhiidee: tehisintellekti väljund ei ole mõeldud inimesele lugemiseks, vaid arvutile kasutamiseks.
ChatGPT loojaid häiris üks küsimus: kus on kogu automaatika?
Jevi taga oleva ettevõtte TypeSafe AI kaasasutaja Diogo Almeida töötas varem OpenAI-s ning aitas allikmaterjali järgi kaasa nii ChatGPT arengule kui ka RLHF-i ehk inimtagasisidel põhineva tugevdusõppe loomisele.
Ent just senise AI arengu suund hakkas teda häirima.
Almeida küsimus oli lihtne: kui keelemudelid on juba aastaid erakordselt head inimkeele mõistmises ja genereerimises, siis miks pole me näinud samaväärset plahvatust tarkvara automatiseerimises?
Tema hinnangul seisneb probleem selles, et seniseid mudeleid on eelkõige optimeeritud suhtlema inimestega. Arvutitel on aga teistsugused vajadused. Tarkvara ei vaja tingimata ilusat lõiku teksti. Ta tahab teada, kas teha A või B, kui suur on risk või millise protsessi peaks järgmisena käivitama.
Umbes kaks aastat pärast OpenAI-st lahkumist töötas Almeida meeskond TypeSafe AI-s välja Jevi - mudeli, mida ettevõte kirjeldab uue tüüpi „System 1” tehisintellektina. Jev põhineb küll transformer-arhitektuuril, kuid ettevõtte sõnul pole see suur keelemudel ehk LLM. Selle eesmärk pole genereerida sõnu üksteise järel, vaid langetada kiiresti struktureeritud otsuseid.
TypeSafe kasutab selle kohta terminit machine-native AI ehk masinatele mõeldud tehisintellekt.
Mõte on selles, et kui AI hakkab päriselt muutma seda, kuidas tarkvara töötab, ei saa intelligentsuse ainsaks tarbijaks jääda inimene.
Jev ei vasta küsimusele. Ta annab programmile otsuse
Tavalise keelemudeli kasutamisel toimub umbes järgmine protsess.
Programm saadab mudelile sisendi. Mudel genereerib vastuseks teksti. Seejärel peab programm välja selgitama, kas vastus oli õiges formaadis, kas sellest saab vajalikud andmed kätte ning kas mudel ei otsustanud mingil põhjusel vastata hoopis millegi muuga.
Jev proovib selle kihi eemaldada.
Arendaja määrab ette, millist tüüpi vastust programm ootab. Näiteks võib vastus olla üks kolmest kategooriast, arvuline skoor või tõene/väär väärtus. Jev ei peaks saama väljuda ette määratud struktuurist.
Seda võib mõelda kui väga nutikat if-lauset.
Tavalises programmis võiks arendaja kirjutada:
„Kui summa on üle 1000 euro, tee A. Kui alla 1000 euro, tee B.”
Päris maailm on aga harva nii lihtne. Mis saab siis, kui otsus sõltub kliendi varasemast käitumisest, makse kirjeldusest, kümnest teisest muutujast ja kontekstist, mida on keeruline jäikadesse reeglitesse kirjutada?
Just sinna tahab TypeSafe Jevi paigutada.
Ettevõte kirjeldab selliseid kasutuskohti kui „smart if statements” - nutikaid otsustuspunkte kohtades, kus käsitsi kirjutatud reeglid muutuvad liiga keeruliseks või hapraks.
Miks mitte lihtsalt ChatGPT-d kasutada?
Sest inimese ja tarkvara jaoks on kiirusel täiesti erinev tähendus.
Kui inimene küsib vestlusrobotilt küsimuse ja saab vastuse viie sekundiga, tundub see enamasti piisavalt kiire. Kui sama mudel asub aga tarkvara sees ja programm peab ühe toimingu käigus tegema kümneid või sadu AI-päringuid, muutub mitu sekundit väga pikaks ajaks.
TypeSafe'i enda mõõtmiste järgi vastab Jev sõltuvalt ülesandest umbes 70–500 millisekundiga, samas kui võrreldud tipptasemel keelemudelid võivad vajada sekundeid või mõnel juhul isegi minuteid. Ettevõte kirjeldab erinevust ligikaudu 40- kuni 200-kordsena.
Ka hind on TypeSafe'i üks peamisi müügiargumente. Ettevõte väidab, et Jevi kasutamine võib teatud töövoogudes olla suurtest keelemudelitest kordades või isegi suurusjärkude võrra odavam.
Need arvud vajavad siiski ettevaatlikku käsitlemist. Suur osa võrdlustest pärineb TypeSafe'ilt endalt ning ettevõte möönab ka ise, et erinevate mudelite kõrvutamine pole alati üks-ühele õiglane.
Kuid isegi kui kõige suuremad reklaamnumbrid kõrvale jätta, on põhimõtteline argument huvitav: AI, mis töötab tarkvara sees tuhandeid või miljoneid kordi päevas, peab olema odav ja kiire hoopis teisel tasemel kui AI, millega inimene aeg-ajalt vestleb.
Kõige tähtsam omadus võib olla hoopis see, kui kindel Jev enda otsuses on
Kiiruse kõrval võib Jevi huvitavam omadus olla tõenäosuste kalibreerimine.
Oletame, et AI teeb mingi ülesande õigesti 95 protsendil juhtudest.
See kõlab suurepäraselt. Automatiseerimise seisukohast tekib aga järgmine küsimus: kas mudel oskab ära tunda need viis protsenti olukordadest, kus ta tõenäoliselt eksib?
Kui ei oska, võib süsteem olla palju vähem kasulik, kui 95-protsendiline täpsus esmapilgul lubaks.
TypeSafe'i väitel on Jevi antavad tõenäosused kalibreeritud: kõrgem enesekindlus peaks päriselt tähendama suuremat tõenäosust, et vastus on õige. See võimaldaks ehitada töövoo näiteks nii, et üle 95-protsendilise kindlusega otsused tehakse automaatselt, 70–95 protsendi vahele jäävaid kontrollitakse täiendavalt ning madalama kindlusega juhtum saadetakse inimesele.
Selline süsteem muudaks AI rolli üsna palju.
Eesmärk ei oleks enam ehitada masinat, kes püüab iga hinna eest vastata. Sama tähtis oleks, et masin oskaks öelda: „Ma pole piisavalt kindel.”
„Ei hallutsineeri” ei tähenda, et Jev ei võiks eksida
TypeSafe kasutab Jevi tutvustamisel ka väga tugevat väidet: kuna väljund peab vastama ette määratud struktuurile, ei saa mudel ettevõtte sõnul tekitada samasuguseid hallutsinatsioone nagu keelemudelid.
Seda väidet tuleb aga täpselt mõista.
Jev ei saa näiteks otsustada, et programmi nõutud kolme valiku asemel kirjutab ta kaks lõiku olematust neljandast võimalusest. Ta ei saa etteantud skeemist lihtsalt välja jalutada.
See ei tähenda siiski, et tema otsus oleks alati õige.
Kui mudel peab valima A, B või C, võib ta täiesti korrektses formaadis valida vale vastuse B.
Ka Jevi käsitlenud kriitikud on sellele tähelepanu juhtinud: struktureeritud tõenäosus ei saa „hallutsineerida” samal viisil nagu genereeritud tekst, kuid tõenäosus võib sellegipoolest olla väär.
Tegelikult võib see tulevikus tekitada täiesti uue probleemi.
Vestlusroboti absurdne vastus on inimesele sageli kohe nähtav. Kui aga valesti kalibreeritud mudel teeb ettevõtte infosüsteemi sügavuses miljoneid väikeseid otsuseid, võib viga olla palju raskem märgata.
Seetõttu muutuvad koos sellise AI levikuga järjest olulisemaks auditeerimine, logid, testimine ja väga selged piirid selle kohta, millal masin võib ise tegutseda ning millal peab otsuse üle võtma inimene.
Kus sellist AI-d üldse kasutada võiks?
TypeSafe toob näiteks AI-agentide juhtimise.
Kui üks agent saab kasutada kümmet erinevat tööriista, võib Jev otsustada, millist neist järgmisena kasutada. Samamoodi võiks mudel hinnata, kas protsessi jätkata, proovida uuesti, kasutajalt lisainfot küsida või töö peatada.
Teine võimalik kasutuskoht on riskihindamine. Enne tehingut või automaatset toimingut võib süsteem küsida mudelilt tõenäosust, et olukord vajab inimese kontrolli.
Veel üks loogiline valdkond on klienditeenindus: millisesse osakonda päring saata, kas tegemist võib olla pettusega, milline juhtum on kiireloomuline või milline vastus vajab spetsialisti sekkumist.
Sama põhimõtet saab kasutada peaaegu kõikjal, kus tarkvara peab tegema kontekstipõhise otsuse, mida on liiga keeruline kirjeldada mõne lihtsa reegliga.
Ja just siin muutub Jev laiemalt huvitavaks.
Tehisintellekti järgmine etapp võib olla nähtamatu
Viimaste aastate AI-buum on olnud väga nähtav.
Me räägime ChatGPT-ga. Genereerime pilte. Laseme AI-l teksti kirjutada või koodi koostada. Tehisintellekt on eraldi toode, mille avame ja millega suhtleme.
Jev esindab hoopis teistsugust tulevikupilti.
Selles maailmas ei ole AI tingimata rakendus, mida kasutaja kunagi avab. See võib olla tuhandete teiste rakenduste sees olev pisike otsustuskiht.
Üks AI otsustab, kas e-kiri võib olla pettus. Teine hindab, millist andmebaasi pärida. Kolmas valib agendile järgmise tööriista. Neljas otsustab, kas kasutaja juhtum tuleb saata inimesele.
Kasutaja ei pruugi kunagi teada, et ükski neist otsustest tehti tehisintellekti abil.
TypeSafe'i enda filosoofia järgi ongi suurte keelemudelite üks piiranguid see, et neid on treenitud eelkõige tootma teksti, mida inimene heaks hindab. See on ideaalne vestlusrobotile, kuid mitte tingimata ideaalne miljoneid kordi päevas töötavale automatiseeritud otsustusmootorile.
Jevonsi paradoks ja odava intelligentsuse maailm
Ka Jevi nimi pole juhuslik.
See tuleb 19. sajandi majandusteadlaselt William Stanley Jevonsilt, kelle nimega seostatakse Jevonsi paradoksi. Selle mõte on lihtsustatult see, et ressursi efektiivsemaks muutmine ei pruugi vähendada selle kasutamist. Vastupidi: kui kasutamine muutub odavamaks, võib nõudlus nii palju kasvada, et ressurssi hakatakse kokkuvõttes tarbima rohkem.
TypeSafe teeb AI-ga sisuliselt sama panuse.
Kui üks AI-otsus muutub kümneid või sadu kordi odavamaks ja kiiremaks, ei tähenda see tingimata, et ettevõtted kulutavad tehisintellektile vähem. See võib tähendada, et AI-d hakatakse kasutama kohtades, kus seda praegu pole majanduslikult mõtet kasutada.
Ühe AI-päringu asemel võiks rakendus teha sada. Saja asemel miljon.
Siis muutuks ka meie ettekujutus tehisintellektist.
AI ei oleks enam tingimata tark robot, kellele inimene küsimuse esitab.
Ta oleks lihtsalt osa tarkvarast.
Sama nähtamatu kui andmebaas, API või if-lause.
Ja võib-olla ongi Jevi kõige huvitavam idee just see: tehisintellekti järgmine suur läbimurre ei pruugi olla mudel, mis räägib meist veel inimlikumalt. See võib olla mudel, millega inimene ei räägi kunagi.