Diogo Almeida: Dirbtinis intelektas be nereikalingo tarpinio žingsnio

Mantas Lukauskas, Kauno technologijos universiteto alumnas ir „Hostinger“ dirbtinio intelekto techninis grupės vadovas

Diogo Almeida buvo vienas iš „OpenAI“ tyrėjų, prisidėjusių prie „ChatGPT“ kūrimo ir mokymo metodo, šiandien vadinamo mokymusi iš žmogaus grįžtamojo ryšio (angl. RLHF), plėtojimo. Būtent šis metodas laikomas vienu iš svarbių veiksnių, lėmusių dabartinę dirbtinio intelekto (DI) bangą. Tačiau pats autorius liko nusivylęs.

„Turime žaibą butelyje, tačiau jis nenaudingas“, – technologijų leidiniui „TechCrunch“ sakė D. Almeida. Jo paaiškinimas paprastas: ketverius metus mokėme mašinas suprasti žmonių kalbą, tačiau automatizavimui to nepakanka, nes kompiuteriai tarpusavyje komunikuoja kitaip.

Prieš dvejus metus jis paliko „OpenAI“ ir įkūrė bendrovę „TypeSafe AI“. Šį rugsėjį ji pristatė modelį „Jev“. Jis paremtas transformerių architektūra, tačiau nėra didysis kalbos modelis. „Jev“ negeneruoja teksto – vietoj jo pateikia tikimybę, kurią bendrovė vadina kalibruotu sprendimu.

Skamba kaip techninė smulkmena. Tačiau iš tiesų tai rimtas bandymas parodyti, kad didelei daliai verslo užduočių kalba apskritai nėra būtina.

DI be nereikalingo tarpinio žingsnio

Pažiūrėkime, kokioms kasdienėms užduotims organizacijos naudoja DI. Ar kliento laiškas yra skundas, ar užsakymas? Ar serveryje vykdoma komanda yra saugi? Ar sąskaitą galima apdoroti automatiškai, ar ją turi peržiūrėti žmogus? Ar komentaras pažeidžia nustatytas taisykles? Beveik visais šiais atvejais galimi atsakymo variantai yra žinomi iš anksto.

Kalbos modelis, atlikdamas tokią užduotį, generuoja tekstą. Jis suformuluoja atsakymą, kurį programa vėliau turi suanalizuoti ir paversti jai suprantama reikšme. Mokama už kiekvieną sugeneruotą žetoną, reikia laukti, kol bus sugeneruotas tekstas, o gautas atsakymas gali skambėti vienodai užtikrintai tiek tada, kai modelis remiasi turima informacija, tiek tada, kai spėja.

„Jev“ šį tarpinį žingsnį pašalina. Galimi atsakymai apibrėžiami iš anksto, todėl modelis negali pateikti atsakymo, kurio sąraše nėra. Iš esmės keičiasi ir kainodara: už išvesties žetonus mokėti nereikia, o įvesties žetonų kiekiai skaičiuojami ne milijonais, bet milijardais. Susidomėjimas buvo toks didelis, kad bendrovė trumpam neteko galimybės aptarnauti savo programavimo sąsajos (API) naudotojų.

Ką parodė pirmieji bandymai?

Kol kas įdomiausi duomenys ateina ne iš laboratorijos, o iš įmonių, kurios modelį išbandė savo procesuose. Agentinės infrastruktūros bendrovės „Vercel“ inžinierius Pranitas Sharma pasakoja, kad jo komanda „OpenAI“ modelį naudojo tikrindama, ar vykdoma komanda yra saugi. „OpenAI“ modelį pakeitus „Jev“, tas pats patikrinimas pradėjo veikti nuo penkių iki aštuoniolikos kartų greičiau ir tiksliau.

Bendrovės „Bryo AI“ technologijų vadovas Nikhilas Mudholkaras lygino „Jev“ su „Gemini“, atlikdamas verslo laiškų klasifikavimo užduotį. „Gemini“ buvo šiek tiek tikslesnis, tačiau jo naudojimas kainavo nuo dešimties iki dvidešimties kartų daugiau. Labiausiai N. Mudholkarui įstrigo ne greitis, o tai, kad „Jev“ vienintelis pateikia tikimybės įvertį, tinkamą automatizuotiems procesams.

Tikimybė – tai, ko trūko automatizavimui

Čia slypi svarbiausia šios istorijos dalis, ir ji mažiau technologinė, nei gali pasirodyti. Klasikinėje mašininio mokymosi praktikoje klasifikatoriai pateikdavo tikimybės įvertį, kuriuo buvo galima grįsti verslo taisykles. Kalbos modeliai šią praktiką pakeitė – jie pateikia sklandžiai suformuluotą atsakymą, tačiau neparodo, kiek juo galima pasitikėti.

Atvirojo kodo įrankių kūrėjos „Earendil“ technologijų vadovas Arminas Ronacheris tai aiškina paprastai: dalis atsakomybės už galimas modelio haliucinacijas tenka naudotojui. Jei modelis nurodo 50 proc. tikimybę, rezultatas prilygsta monetos metimui, todėl sprendimą turi priimti žmogus. Jei tikimybė siekia 95 proc., procesą galima tęsti automatiškai.

Praktiškai tai reiškia, kad automatizavimo procesą galima projektuoti nustatant aiškias ribas. Viršijus vieną jų, sistema veikia savarankiškai, o nepasiekus kitos, sprendimas perduodamas žmogui. Žmogaus vykdomos priežiūros principas įtvirtintas ir ES DI akte. Turint tikimybės įvertį, tokią priežiūrą galima įgyvendinti techninėmis priemonėmis, o ne tik numatyti dokumentuose.

Kita R. Ronacherio minima pritaikymo sritis – pačių kalbos modelių priežiūra. Vieno DI agento veiklą prižiūrėti pasitelkiant kitą agentą brangu. Tam naudojant nebrangų klasifikatorių, kuris stebi atliekamų veiksmų seką ir aptinka bandymus apeiti nustatytus apribojimus, toks sprendimas tampa ekonomiškai pagrįstesnis.

Dar viena pritaikymo sritis – maršruto parinkimas, kai sprendžiama, kuriam modeliui perduoti konkrečią užduotį. Tai prasminga tik tuomet, kai pats pasirinkimas beveik nieko nekainuoja.

Ko apie šį modelį dar nežinome?

Entuziazmą vis dėlto verta atsverti. D. Almeida beveik neatskleidžia modelio architektūros, o jį analizuojantys ekspertai spėja, kad jo pagrindą vis tiek gali sudaryti atvirų svorių kalbos modelis. Bendrovė teigia, kad „Jev“ mokytas vien sintetiniais duomenimis, taikant metodą, kurį vadina mokymusi iš kalibruotų sprendimų. Nepriklausomų modelio vertinimų kol kas nėra, o visi viešai žinomi rezultatai gauti naudotojams jį išbandžius savo užduotyse.

Svarbu įvertinti ir teiginio apie haliucinacijas ribas. Modelis negali pateikti sąraše nenumatyto atsakymo, tačiau gali priskirti didelę tikimybę klaidingai kategorijai. Kalibracija yra statistinė savybė, vertinama remiantis daugeliu atvejų, o ne garantija, kad konkretus atsakymas bus teisingas. Todėl kiekviena organizacija turėtų ją patikrinti naudodama savo duomenis – priešingu atveju riba, kurią pasiekus procesas vykdomas automatiškai, būtų nustatyta nepagrįstai.

Pati bendrovė „Jev“ vadina pirmosios sistemos (angl. „System 1“) modeliu, t. y. skirtu greitiems, intuityviems sprendimams, o ne nuosekliam samprotavimui. Jis negeneruoja tekstų, neplanuoja ir neatlieka daugiapakopių užduočių. Lieka ir paprastas verslo klausimas: ar verta kritiškai svarbų procesą patikėti vos dvejus metus veikiančiai bendrovei, kurios programavimo sąsaja jau buvo sutrikusi dėl didelės apkrovos? R. Ronacheris prognozuoja, kad konkurentų atsiras greitai, nes, jo vertinimu, ši idėja pasiteisino.

DI galimybės slypi ne pokalbių robotuose

Lietuvos įmonėse DI dažniausiai pristatomas per pokalbių robotus, nors nemažai neišnaudotų galimybių slypi kur kas mažiau pastebimuose procesuose: klientų užklausų nukreipime, dokumentų ir sąskaitų apdorojime, sukčiavimo požymių nustatyme ar turinio patikroje. Tai būtent tos užduotys, kurioms teksto generavimas nėra būtinas.

Kainos klausimas čia itin svarbus. Kai vienas patikrinimas kainuoja centą, jis atliekamas tik tada, kai jo prireikia. Kai jo kaina siekia tūkstantąją cento dalį, patikrinimą galima atlikti vertinant kiekvieną įvykį, laišką ar operaciją. Keičiasi ne pati technologija, o procesų, kuriuose ją finansiškai apsimoka taikyti, spektras. DI naudojančių Lietuvos įmonių dalis per metus išaugo nuo 21,3 iki 34,7 proc., tačiau daugelis diegimų neperžengia bandomojo projekto etapo būtent dėl vieno sprendimo sąnaudų.

Praktinės kryptys gana aiškios. Pirma, verta įvertinti, kiek kalbos modeliui pateikiamų užduočių iš tiesų baigiasi pasirinkimu iš fiksuoto atsakymų sąrašo. Antra, sąnaudas ir greitį vertinti ne pagal žetonų skaičių, o pagal vieno priimto sprendimo kainą ir trukmę. Trečia, iš tiekėjų reikalauti ne tik atsakymo, bet ir jo tikimybės įverčio bei nustatyti ribą, kurios nepasiekus sprendimas būtų perduodamas žmogui. Ketvirta, sistemas kurti taip, kad jos nebūtų priklausomos nuo vieno jauno tiekėjo programavimo sąsajos.

Atskirų privalumų toks modelis gali turėti ir viešajame sektoriuje. Kartu su sprendimu pateikiamas tikimybės įvertis suteikia papildomos informacijos, kurią galima patikrinti ir įvertinti. Vien sklandžiai suformuluotas atsakymas tokios informacijos nesuteikia.

Kuo DI pigesnis, tuo jo daugiau

Modelio pavadinimas pasirinktas sąmoningai. Williamas Stanley Jevonsas – XIX amžiaus ekonomistas, aprašęs paradoksą: kai ištekliaus kaina mažėja, jo suvartojama ne mažiau, o daugiau. D. Almeida tikisi panašaus efekto ir DI srityje. Jo teigimu, išmanioji programinė įranga taps plačiai paplitusi ir integruota į daugybę skirtingų procesų, labiau primindama ankstyvąjį internetą nei kelias milžiniškas programas, kurias šiandien kuria didžiosios bendrovės.

Paklaustas, ar „TypeSafe“ yra dar viena pažangiausius modelius kurianti laboratorija, jis atsakė aštriai: tokių laboratorijų pagrindinis produktas šiandien yra baimė arba šurmulys, o jis norėtų, kad jo bendrovės produktas būtų intelektas.

Nesvarbu, ar būtent „Jev“ išliks. Svarbiau tai, kad pasikeitė pats klausimas. Kelerius metus klausėme, kuris modelis protingiausias. Dabar vertėtų klausti kitaip: kiek kainuoja vienas teisingas sprendimas ir ar žinome, kada modelis nėra užtikrintas savo atsakymu.