Globaalne tehisaru kulusurve ja arvutusvõimsuse uus reaalsus
Tehisintellekti areng on jõudnud etappi, kus tehnoloogilise võimekuse kõrval muutub järjest olulisemaks selle majanduslik efektiivsus. Kui veel mõni aasta tagasi keskendus suur osa tähelepanust sellele, mida suured keelemudelid suudavad, siis nüüd küsivad ettevõtted üha enam, kui palju maksab nende kasutamine päris tööprotsessides ja milline on saadud tulemuse tegelik väärtus.
AI arvutusvõimsus kasvab maailmas väga kiiresti. Stanfordi 2026. aasta AI Indexi järgi on globaalne AI arvutusvõimsus alates 2022. aastast kasvanud keskmiselt enam kui kolm korda aastas. Samal ajal investeerivad pilve- ja tehnoloogiaettevõtted rekordilisi summasid uutesse andmekeskustesse ja arvutusinfrastruktuuri.
Eriti kiiresti muudavad kulude struktuuri agendipõhised AI-süsteemid. Erinevalt tavalisest vestlusrobotist ei pruugi agent teha ühe kasutaja ülesande lahendamiseks ainult üht mudelipäringut. Agent võib ülesande jagada etappideks, kasutada erinevaid tööriistu, lugeda andmeid, hinnata oma tulemust, parandada vigu ja käivitada järgmisi päringuid. Üks kasutaja tegevus võib seetõttu tekitada terve ahela mudelikõnesid.
Microsoft Researchi 2026. aasta uuringus tarbisid agentidega lahendatud programmeerimisülesanded koguni ligikaudu 1000 korda rohkem tokeneid kui tavapärased koodiga seotud küsimused ja arutlusülesanded. Uuring näitas ka, et sama ülesande erinevad käivitused võisid tokenite kasutuse poolest erineda kuni 30 korda ning suurem tokenikulu ei toonud tingimata kaasa paremat tulemust.
Seetõttu ei ole AI kuluprobleemi keskmes tingimata mudelite kallinemine. Vastupidi – ühe kindla võimekustaseme saavutamise hind on viimastel aastatel järsult langenud.
Odavamad mudelid, kuid suuremad kasutusmahud
Stanfordi AI Indexi järgi maksis 2022. aasta novembris GPT-3.5 tasemele vastava jõudluse saavutamine ligikaudu 20 dollarit miljoni tokeni kohta. 2024. aasta oktoobriks oli võrreldava jõudlustaseme hind langenud umbes 0,07 dollarini miljoni tokeni kohta. See tähendab enam kui 280-kordset hinnalangust.
Esmapilgul võiks sellest järeldada, et ettevõtete AI-kulud peaksid kiiresti vähenema. Praktikas toimub aga samal ajal vastupidine protsess: kasutusmaht kasvab, AI liigub üksikutest vestlustest tervetesse tööprotsessidesse ning agendid teevad ühe kasutaja nimel järjest rohkem iseseisvaid toiminguid.
Seetõttu sõltub AI tegelik maksumus palju enamast kui ühe tokeni hinnast. Oluline on, kui palju kasutajaid süsteemil on, mitu AI-sessiooni nad käivitavad, mitu sammu agent ühe ülesande jooksul teeb, mitu mudelipäringut iga samm tekitab, kui pikk kontekst mudelile kaasa antakse ja millist mudelit konkreetse töö jaoks kasutatakse.
Hea näide on Uber. Ettevõtte enda 2026. aasta andmetel kasvas AI-agente kasutavate töötajate arv veebruarist augustini seitse korda ja agentidele tehtud päringute arv 9,4 korda. Sellest hoolimata suutis Uber pärast kevadist kulude kiiret kasvu oma AI kogukulu stabiliseerida.
Selle saavutamiseks ei lõpetatud AI kasutamist, vaid muudeti süsteem efektiivsemaks. Uber hakkas valima erinevate ülesannete jaoks sobiva hinnatasemega mudeleid, kasutama alamagentide puhul odavamaid mudeleid, piirama ebavajalikult pikka konteksti, rakendama promptide vahemälu ning andma arendajatele parema ülevaate nende AI-kasutuse tegelikust maksumusest.
Tulemuseks langes ettevõtte andmetel ühe tuhande mudelipäringu maksumus tipptasemega võrreldes ligikaudu kolmandiku võrra ning ühe AI-sessiooni keskmine maksumus üle 50%.
See illustreerib olulist muutust AI-majanduses: konkurentsieeliseks ei ole enam lihtsalt juurdepääs kõige võimsamale mudelile. Üha olulisemaks muutub oskus kasutada piisavalt head mudelit võimalikult efektiivselt.
Tehisaru efektiivsuse otsingul: vahemälu ja targem mudelivalik
Üks võimalus AI-kulusid vähendada on vältida sama arvutuse korduvat tegemist.
Promptide vahemälu võimaldab näiteks pika süsteemijuhise, dokumendi või muu korduva konteksti mudeli jaoks salvestada, nii et seda ei pea iga järgmise päringu puhul täielikult uuesti töötlema.
Semantiline vahemälu läheb sammu kaugemale. Selle asemel, et otsida ainult täpselt sama päringut, võrreldakse uue küsimuse tähendust varem esitatud küsimustega. Kui piisavalt sarnasele küsimusele on juba usaldusväärne vastus olemas, võib süsteem kasutada seda uuesti ilma suure keelemudeli poole pöördumata.
Sellise lahenduse mõju sõltub väga palju kasutusjuhtumist. Korduvate klienditoe-, otsingu- või teadmistebaasi päringute puhul võib võit olla märkimisväärne, kuid kiiresti muutuva või personaalse informatsiooni puhul tuleb vahemälu kasutada ettevaatlikumalt.
Amazoni avaldatud semantilise vahemälu testis vähendas suhteliselt range sarnasuskriteeriumi kasutamine kogukulu ligikaudu 52% ja keskmist vastamisaega ligi 58%. Leebemate kriteeriumidega oli võimalik saavutada veel suurem kokkuhoid, kuid selle arvelt kasvas ka oht, et vahemälust valitakse küsimusele vähem täpne vastus.
Seega ei ole semantiline vahemälu universaalne viis AI-arve pooleks lõikamiseks. Hästi valitud töökoormuse puhul võib see aga vältida suurt hulka tarbetuid mudelipäringuid.
Väiksemad mudelid muutuvad järjest olulisemaks
Teine suur muutus toimub mudelite endi valikus. Kõige keerukama ja kallima mudeli kasutamine iga ülesande jaoks ei ole enam mõistlik arhitektuur.
Väiksemad keelemudelid ehk SLM-id (Small Language Models) vajavad üldjuhul vähem arvutusressurssi ning neid on lihtsam kasutada privaatsetes pilvekeskkondades või ettevõtte enda infrastruktuuris. Neid saab kasutada näiteks info klassifitseerimiseks, andmete struktureerimiseks, dokumentidest vajaliku teabe eraldamiseks, päringute suunamiseks või muude selgelt piiritletud ülesannete täitmiseks.
Väiksem mudel ei tähenda enam tingimata väga piiratud võimekust. Stanfordi AI Index tõi näiteks välja, et 2022. aastal vajas MMLU teadmiste ja arutlusvõime testi 60% taseme ületamiseks üks juhtivaid mudeleid 540 miljardit parameetrit. 2024. aastaks saavutas sama testilävendi Microsofti Phi-3-mini vaid 3,8 miljardi parameetriga.
See ei tähenda, et väike mudel oleks kõigis ülesannetes suure mudeliga võrdväärne. Küll aga näitab see, kui kiiresti paraneb väiksemate mudelite võimekus.
Praktiline AI-süsteem võib seetõttu kasutada korraga mitut mudelit. Lihtsad ja sagedased ülesanded saadetakse väiksemale ja odavamale mudelile. Keerulisemad päringud suunatakse võimsamale mudelile ainult siis, kui ülesanne seda tegelikult nõuab.
Sellist lähenemist nimetatakse sageli mudeliruutinguks. Nii Microsoft kui ka AWS soovitavad ettevõtetel järjest enam hinnata mudelivalikut ülesande, hinna ja vajaliku kvaliteedi järgi, mitte kasutada automaatselt kõige võimsamat saadaolevat mudelit.
Eesti ettevõtete võimalus: efektiivsus, kontroll ja lokaalsus
Eesti ettevõtete konkurentsieelist ei ole mõistlik rajada oletusele, et siin on AI käitamiseks alati odavam elekter või infrastruktuur kui mujal Euroopas. Palju tugevam argument on võimalus ehitada AI-süsteeme, mis kasutavad arvutusvõimsust efektiivselt ja annavad ettevõttele parema kontrolli oma andmete ning tehnoloogiapartnerite üle.
Kõiki ülesandeid ei pea saatma kõige suuremale globaalsele AI-teenusepakkujale. Ettevõte võib kasutada hübriidset arhitektuuri, kus osa ülesandeid lahendatakse väiksemate mudelitega kohalikus või Euroopa pilvekeskkonnas ning kõige keerulisemad ülesanded suunatakse vajaduse korral võimsamatele välistele mudelitele.
Selline lähenemine võib olla oluline ka andmete haldamise seisukohalt. Euroopa Liidu isikuandmete kaitse reeglid ei nõua üldiselt, et Eesti ettevõtte andmeid töödeldaks tingimata Eestis. Küll aga kaasnevad isikuandmete edastamisega väljapoole Euroopa Majanduspiirkonda täiendavad nõuded ning ettevõte peab kontrollima, millisel õiguslikul alusel ja milliste kaitsemeetmetega andmeid edastatakse.
Seetõttu võib Eestis või mujal Euroopa Majanduspiirkonnas paiknev AI-taristu teatud kasutusjuhtudel lihtsustada andmehalduse ja riskijuhtimise korraldamist. Eriti oluline võib see olla ettevõtetele, kes töötlevad tundlikke kliendiandmeid või soovivad täpselt kontrollida, kus nende andmeid töödeldakse ja millised teenusepakkujad neile ligi pääsevad.
Lokaalne mudel ei ole samas automaatselt odavam kui pilve-API. Väikese kasutusmahu puhul võib välise API kasutamine olla märksa efektiivsem kui oma GPU-taristu ülevalpidamine. Suure ja prognoositava kasutusmahu, spetsiifilise tööülesande või tugevate andmekontrolli nõuete puhul võivad aga väiksemad lokaalsed mudelid muutuda atraktiivseks alternatiiviks.
Kõige tugevam lahendus võib seetõttu olla kombinatsioon mitmest tehnoloogiast, mitte sõltuvus ühest mudelist või ühest teenusepakkujast.
Mida tähendab see Eesti ettevõtetele?
AI-kulude kasv ei tähenda, et ettevõtted peaksid tehisintellekti kasutamist vähendama. Pigem tähendab see, et AI kasutamine peab muutuma teadlikumaks.
Ettevõte ei peaks mõõtma ainult seda, kui palju maksab miljon tokenit. Olulisem on teada, kui palju maksab ühe reaalse ärilise tulemuse saavutamine: ühe kliendipöördumise lahendamine, ühe dokumendi töötlemine, ühe koodimuudatuse valmimine või ühe automatiseeritud tööprotsessi edukas läbimine.
Sama oluline on vältida olukorda, kus kõige kallimat mudelit kasutatakse ülesannete jaoks, mida suudaks lahendada märksa väiksem mudel. Mudeliruuting, vahemälu, lühem kontekst ja selgelt piiritletud agentide töövood võivad kokku anda suurema kulueelise kui pelgalt odavama API-teenuse otsimine.
AI-süsteemi arhitektuur peaks olema võimalikult mudeli- ja teenusepakkujaagnostiline. Kui rakenduse äriloogika, andmekiht ja mudel on üksteisest piisavalt eraldatud, saab ettevõte uute ja efektiivsemate mudelite turule tulekul neid märksa lihtsamalt kasutusele võtta.
Tehisaru järgmine konkurentsieelis ei pruugi seega tulla kõige suuremast mudelist ega kõige suuremast arvutusvõimsusest. See võib tulla oskusest kasutada arvutusvõimsust täpselt seal, kus see loob kõige rohkem väärtust.
Ettevõtted, kes suudavad mõõta AI tegelikku ühikukulu, valida ülesande jaoks sobiva mudeli ning vältida tarbetuid mudelipäringuid, on paremas positsioonis AI kasutuse skaleerimiseks ilma, et kulud kasvaksid samas tempos kasutusmahuga.