Tehisintellekti lähiajalugu võib esmapilgul kokku võtta ühe üsna lihtsa reegliga: suurem on parem.

GPT-1 oli 2018. aastal 117 miljoni parameetriga mudel. GPT-2 kasvas järgmisel aastal 1,5 miljardi parameetrini ja GPT-3 jõudis 2020. aastal juba 175 miljardini.

Koos mudelitega kasvas ka nende võimekus. Tekst muutus ladusamaks, küsimustest saadi paremini aru ja ülesannete ring laienes.

Sellest sündis kogu AI-tööstust mõjutanud idee: kui suurem mudel töötab paremini, tuleb järgmine teha veel suurem.

Aga miks suurem üldse parem on?

MIT teadlaste Yizhou Liu, Ziming Liu ja Jeff Gore'i uurimus pakub sellele ühe huvitava vastuse. Nende järgi ei seisne suure mudeli eelis ainult selles, et sinna „mahub rohkem teadmisi”. Suuremal mudelil võib olla ka rohkem ruumi, et õpitud asjad üksteist vähem segaksid. Töö avaldati NeurIPS 2025 konverentsil ning pälvis Best Paper Runner-up tunnustuse.

Keelemudeli peas pole entsüklopeediat

Keelemudelile ei anta treenimisel kätte grammatikareegleid ega nimekirja maailma faktidest.

Selle asemel näeb ta tohutus koguses teksti ja teeb ikka ja jälle ühte harjutust: mis võiks tulla järgmisena?

Sellise treeningu käigus kujunevad välja sisemised seosed. Mudel õpib, et „Pariis” on seotud Prantsusmaaga, et koerad hauguvad, et küsimusele järgneb sageli vastus ning et programmeerimiskoodis käivad teatud märgid ja käsud koos.

Neid õpitud asju võib väga lihtsustatult kujutada tohutu mõistete kaardina.

Probleem on selles, et neid asju, mida mudel tahab eristada, on väga palju.

Ja tema sisemine ruum pole lõputu.

Kujuta ette väga väikest tuba

Oletame, et sul on tuhandeid esemeid, aga ainult mõnisada riiulit.

Kõige lihtsam lahendus oleks anda igale esemele oma riiul. Aga riiuleid ei jätku.

Seega hakkad neid jagama.

Ühele riiulile lähevad asjad, mida sul tõenäoliselt samal ajal vaja pole. Kui süsteem on hästi korraldatud, töötab see üllatavalt hästi.

Midagi sarnast näib juhtuvat ka närvivõrkudes.

Mudeli õpitud tunnustel ei ole igaühel oma täiesti sõltumatut kohta. Selle asemel võivad paljud tunnused kasutada osaliselt sama sisemist representatsiooniruumi.

Seda nähtust nimetatakse superpositsiooniks.

Anthropicu teadlased näitasid 2022. aastal lihtsustatud närvivõrkudega, kuidas mudel võib sel moel esitada rohkem tunnuseid, kui tal on nende jaoks sõltumatuid dimensioone.

See on väga efektiivne pakkimisviis.

Aga sellel on hind.

Kui asjad on liiga lähestikku, hakkavad need segunema

Kujuta ette, et tahad riiulilt haarata ühte eset, aga sikutad kogemata natuke kaasa ka selle kõrval olevat.

Keelemudelis juhtub midagi sarnast.

Kui kaks õpitud tunnust kasutavad osaliselt sama sisemist ruumi, võib ühe aktiveerimine natuke mõjutada ka teist. Teadlased nimetavad seda interferentsiks.

See ei tähenda, et mudel ajaks iga kord elevandi banaaniga segamini. Mõju võib olla väga väike: mõni vale seos saab lihtsalt natuke suurema tõenäosuse, kui peaks.

Aga kui selliseid väikeseid mõjutusi on miljardite ennustuste jooksul väga palju, mõjutavad need mudeli täpsust.

Ja siin tuleb mängu mudeli suurus.

Suuremal mudelil on rohkem hingamisruumi

Kui muuta mudeli sisemine representatsiooniruum laiemaks, saab samu tunnuseid üksteisest kaugemale paigutada.

Vähem kattumist tähendab vähem interferentsi.

Liu, Liu ja Gore leidsid oma lihtsustatud mudelis, et tugeva superpositsiooni korral vähenes selline representatsiooniviga ligikaudu pöördvõrdeliselt mudeli laiusega. Nad analüüsisid ka nelja avatud keelemudelite perekonda — GPT-2, OPT, Pythia ja Qwen — ning leidsid neis sarnase käitumise. Mõõdetud astendaja oli umbes 0,91 ehk üsna lähedal lihtsa mudeli ennustatud väärtusele 1.

Selle taga on väga intuitiivne idee.

Kui sul on kümme inimest väikeses liftis, põrkavad nad pidevalt üksteise vastu. Tee lift kaks korda suuremaks ja kõigil tekib rohkem ruumi.

AI puhul on „lift” mitmemõõtmeline matemaatiline ruum, kuid põhimõte on sama.

See võib olla üks põhjustest, miks suuremaks tehtud mudelid nii järjekindlalt paremaks muutuvad.

Mitte ainult rohkem teadmisi.

Ka rohkem ruumi juba õpitud asjade lahus hoidmiseks.

Siin on aga konks

Sellest võib kergesti teha liiga suure järelduse.

Ei ole nii, et mudeli laiuse kahekordistamine teeks kogu AI kaks korda täpsemaks.

MIT teadlaste tulemus puudutab eelkõige seda osa veast, mis võib tekkida sisemiste representatsioonide kattumisest. Keelemudelil on veel terve rida muid piiranguid.

Ja mida väiksemaks interferents muutub, seda olulisemaks need ülejäänud piirangud saavad.

Üks neist on väga lihtne: keel ise pole täielikult ennustatav.

„Mulle väga meeldib…”

Proovi lõpetada lause:

„Mulle väga meeldib…”

Mis tuleb järgmisena?

Kohv?

Koerad?

Reisimine?

Pizza?

Kõik võivad olla õiged.

Keelemudelit treenitakse küll järgmist tokenit ennustama, kuid päris keeles pole paljudel juhtudel olemas ühte vältimatut järgmist sõna.

Seetõttu ei tähenda mudeli eksimus alati seda, et mudel on midagi valesti õppinud.

Mõnikord on tulevik lihtsalt teadmata.

Ka MIT töö autorid leidsid, et mudelite mõõdetud ennustusviga ei suundu nende analüüsis laiuse kasvades nulli. Nad toovad ühe võimaliku põhjusena välja keele sisemise ebakindluse: suurem mudel võib vähendada valest interferentsist tulenevat müra, kuid ta ei saa muuta mitut täiesti võimalikku jätku üheksainsaks vältimatuks vastuseks.

See on oluline erinevus.

Suurem mudel võib olla parem ennustaja, aga ta ei saa muuta maailma ennustatavaks.

Ja suuremaks tegemine muutub kiiresti kalliks

Teine probleem on hind.

Tänapäeva tippmudelite treenimine maksab juba kümneid või sadu miljoneid dollareid. Täpsed summad pole enamasti avalikud ning hinnangud erinevad, kuid trend on selge: suuremate mudelite treenimiseks vajalik arvutusmaht ja infrastruktuur on kiiresti kasvanud.

Epoch AI hinnangul kasvas frontier-mudelite lõpliku treeningu riistvara- ja energiakulu aastatel 2016–2024 keskmiselt umbes 2,4 korda aastas. Hilisemate mudelite puhul ulatuvad mõned hinnangud juba sadadesse miljonitesse dollaritesse.

Samas muutub iga järgmise paranduse kättesaamine raskemaks.

Kui ühe konkreetse vealiigi vähendamiseks tuleb mudelit jälle märgatavalt suurendada, aga see vealiik moodustab kogu probleemist järjest väiksema osa, muutub pelgalt suuruse kasvatamine üha kehvemaks tehinguks.

See ei tähenda, et AI-mudelite kasvatamine homme lõpeks.

Küll aga tähendab see, et „teeme lihtsalt suuremaks” ei pruugi olla igavene strateegia.

Kas kusagil on siis lõplik lagi?

Oleks ahvatlev öelda, et ühel päeval saab mudel nii laiaks, et igale mõistele jagub oma koht, superpositsioon kaob täielikult ja suuremaks tegemisest pole enam mingit kasu.

Uurimistöö seda päris nii ei tõesta.

Esiteks ei tea me täpselt, kui palju sõltumatuid „tunnuseid” suur keelemudel tegelikult kasutab. Need pole lihtsalt sõnaraamatus olevad sõnad. Mudel võib õppida grammatilisi mustreid, stiile, seoseid, abstraktseid mõisteid ja väga spetsiifilisi kontekste.

Teiseks võib suurem mudel hakata õppima uusi eristusi, mida väiksem mudel üldse ei suutnud esitada.

Seega pole teada mingit konkreetset mudeli laiust, mille juures saaks öelda: nüüd on ruum täiuslikult korras ja edasine suurendamine on mõttetu.

MIT töö annab pigem huvitavama järelduse.

Kui üks põhjus, miks suurus aitab, on õpitud asjade vahelise interferentsi vähendamine, siis selle põhjuse tähtsus peab vähenema sedamööda, kuidas interferents ise väheneb.

Sealt edasi tuleb paremat AI-d otsida üha rohkem mujalt.

Paremast treeningandmest.

Tõhusamast arhitektuurist.

Paremast mälust ja konteksti kasutamisest.

Uutest viisidest, kuidas mudel saab ülesande üle pikemalt arutleda või maailma kohta infot koguda.

Võib-olla ka mudelitest, mis ei õpi maailma peamiselt tekstist, vaid videost, helist, tegevusest ja füüsilise keskkonnaga suhtlemisest.

Suuruse ajastu ei pruugi lõppeda. Aga lihtne retsept võib

Viimaste aastate AI-areng on näidanud, et skaleerimine töötab erakordselt hästi.

Suurem mudel, rohkem andmeid ja rohkem arvutusvõimsust on andnud tulemusi nii järjekindlalt, et sellest sai terve tööstuse keskne strateegia.

Uus uurimistöö aitab seletada, miks vähemalt osa sellest efektist võib tekkida.

Suuremal mudelil on rohkem ruumi.

Rohkem ruumi tähendab vähem kokkusurutud representatsioone.

Vähem kokkusurumist tähendab vähem interferentsi.

Kuid kui see müra muutub järjest väiksemaks, ei kao ülejäänud probleemid kuhugi.

Seetõttu pole kõige huvitavam küsimus ilmselt see, kas AI-mudelid muutuvad veel suuremaks.

Peaaegu kindlasti muutuvad.

Palju huvitavam küsimus on, kui kaua annab suuremaks tegemine meile sama palju juurde kui seni — ja mis tuleb pärast seda.