Visatos entropija, AI tokenai ir teksto fizika: užkulisinis gidas

Sveiki atvykę į vietą, kurioje tekstas nustoja būti tiesiog plokščia raidžių seka ir tampa fiziniu, finansiniu bei lingvistiniu objektu. Termodinamikos antrasis dėsnis teigia, kad visatos entropija (chaosas) nuolat auga. Kiekvienas jūsų parašytas sakinys – tai mažytė tvarkos sala chaoso vandenyne, o ši skaičiuoklė yra jūsų skaitmeninis spektrometras.

1. AI tokenų ekonomika: kodėl viena nosinė raidė kainuoja brangiau?

Šiuolaikinis pasaulis nebeskaito raidžių – jis skaito tokenus. Nors „ChatGPT“ ar „Claude“ atrodo kaip visagaliai skaitmeniniai orakulai, po jų gaubtu slypi griežta ekonomika. LLM modeliai (Subword BPE tokenizatoriai) anglų kalbą supranta idealiai: 4 simboliai anglų kalba yra apytiksliai 1 tokenas. Tačiau, kai įkeliate lietuvišką tekstą su Ą, Č, Ę, Ė, Į, Š, Ų, Ū, Ž, tokenizatorius dažnai išskaido vieną raidę į 2–3 atskirus tokenus!

Tai reiškia absurdišką reiškinį: užklausos siuntimas lietuviškai ar kiniškai gali kainuoti 200–300% brangiau nei ta pati užklausa anglų kalba. Ši skaičiuoklė realiu laiku apskaičiuoja numatomą AI tokenų kiekį ir prompto kainą doleriais, kad jūsų API sąskaitos nesukeltų finansinės infarkto būsenos.

2. SMS tragedija: 1985 m. Friedhelm Hillebrand paveldo drama

1985 metais vokiečių inžinierius Friedhelm Hillebrand sėdėjo prie savo rašomosios mašinėlės ir rašė atsitiktinius sakinius, norėdamas nustatyti, kiek simbolių reikia trumposioms žinutėms. Jis suskaičiavo vidutinį sakinio ilgį ir ištarė istorinius žodžius: „160 simbolių yra visiškai pakankama bet kuriai žmogaus minčiai išreikšti.“ Taip gimė GSM-7 SMS standartas.

Tačiau čia prasideda lietuviško verslo tragikomedija: GSM-7 abėcėlė neturi lietuviškų raidžių! Jei siunčiate 159 simbolių SMS klientams ir įrašote BENT VIENĄ raidę „ą“ (pvz., „Ačiū už pirkinį!“), SMS siuntimo sistema akimirksniu išjungia GSM-7 režimą ir persijungia į 16-bitų UCS-2 Unicode režimą. Rezultatas? Maksimalus 1 žinutės limitas nukrenta nuo 160 iki 70 simbolių! Jūsų viena graži žinutė tampa 3 atskiromis žinutėmis, o marketingo biudžetas patiria trigubą smūgį. Ši skaičiuoklė iškart įspėja apie persijungimą į UCS-2 Unicode režimą!

3. Paslėptos šiukšlės ir PDF vaiduokliai (U+200B zero-width pragaras)

Ar kada nors bandėte paleisti kodo fragmentą arba įkelti JSON iš PDF dokumento, ir kompiuteris išmetė klaidos pranešimą, nors tekstas atrodo visiškai idealiai? Jūs tapote Zero-Width Space (U+200B) auka. Šie paslėpti nulinio pločio vaiduokliai atsiranda kopijuojant tekstą iš PDF, MS Word ar šiuolaikinių svetainių.

Programuotojui nulinio pločio tarpas kodo viduryje reiškia 3 valandas beviltiško kodo derinimo (debugging), kol išprotėjęs programuotojas sužino, kad kintamasis user[U+200B]Name nėra tas pats kas userName. Mūsų įrankis nuskenuoja tekstą ir iškasa visas paslėptas šiukšles, neperkeliamus tarpus (NBSP), HTML žymas bei tabuliacijas.

4. Emojų fizika ir Šenono informacijos teorija

Pagal Claude Shannon informacijos teoriją, informacija yra matuojama bitais. Fizikiniu požiūriu, paprasta raidė „A“ UTF-8 kodavime sveria 1 baitą (8 bitus). Tačiau linksmas emojinis veidukas 😂 sveria 4 baitus (32 bitus)! Tai reiškia, kad vienas emojinis veidukas turi 4 kartus didesnę masę skaitmeninėje erdvėje nei tradicinė abėcėlės raidė. Ši skaičiuoklė atpažįsta modernius Unicode Extended Pictographic emojus ir parodo tikslų UTF-8 duomenų svorį baitais ir kilobaitais.

5. Tipografija, leksinis turtingumas (TTR) ir Šrėdingerio sakinys

Lietuvių kalbos tipografijoje amžina problema – skirtumas tarp defiso (-), En-dash brūkšnio (–) ir Em-dash ilgojo brūkšnio (—). Be to, mūsų Žodyno Turtingumo rodiklis (TTR %) leidžia atpažinti pasikartojantį, dirbtinį ar primityvų tekstą. Jei tekstas turi 500 žodžių, bet jo TTR yra tik 20%, retai kuris skaitytojas jį perskaitys iki galo nesusiraukęs.

Stebėkite savo tekstą realiu laiku – nuo ilgiausio žodžio iki skaitomumo sekundžių!