Tay alfabesini (ภาษาไทย) Latin harflerine dönüştürmek, alelade bir tipografik makyaj ya da basit bir web dize işlemi değildir. Bu süreç, birbirine taban tabana zıt iki dilbilimsel ve algoritmik felsefenin doğrudan çarpışmasıdır. Bir tarafta, Akdenizli tüccar ve askerlerin sesli ile sessiz harfleri soldan sağa katı bir düzenle dizdiği, perde ve tona tamamen sağır 26 harflik Latin alfabesi yer alır. Diğer tarafta ise sesli harflerin sessizlerin üstünde yüzdüğü, altına kıvrıldığı, önüne geçtiği veya etrafını sardığı; kelimeler arasında tek bir boşluk bırakılmaksızın katı bir sonlu durum makinesi (Finite State Machine) ile ton hesaplanan çok boyutlu bir Brahmik abugida durur. TOOL GIGA bünyesindeki bu araç, aradaki bu uçurumu kullanıcıyı izleyen casus kodlar, 4 megabaytlık JavaScript hantallığı ve reklam çerezleri olmadan deterministik olarak kapatmak amacıyla inşa edilmiştir.
Tay Alfabesinin Fiziği: 3 Baytlık UTF-8 ve Foton Gerçekleri
Batılı yazılımcıların büyük bir kısmı, bir karakterin bir bayta eşit olduğu yanılgısıyla büyür. Standart ASCII aralığında (0x00–0x7F) her karakter 8 bitlik tek bir bayta sığar. Ancak Tay Unicode bloğu (U+0E00–U+0E7F), UTF-8 değişken uzunluklu kodlama mimarisi gereği glif başına tam olarak 3 bayt (1110xxxx 10xxxxxx 10xxxxxx ikili şablonu) talep eder. Örneğin, Tay alfabesinin ilk sessiz harfi olan Ko Kai (ก, Unicode U+0E01), ağ kablosu üzerinde 0xE0 0xB8 0x81 onaltılık bayt dizisi olarak serileştirilir.
Bu durum sadece bir veritabanı depolama detayı değil, küresel telekomünikasyon altyapısını doğrudan etkileyen fiziksel ve termodinamik bir olgudur. 1500 baytlık standart bir Ethernet Maksimum İletim Birimi (MTU) çerçevesinde, Latin harfli bir yük yaklaşık 1460 karakter taşırken, aynı boyuttaki Tayca metin sadece 480 karakterde tüm paketi tüketir. Kıtalararası denizaltı fiber optik kablolarında ve Maxwell dalga kılavuzlarında elektro-absorpsiyon modülatörleri, aynı anlamsal mesajı iletmek için Latin alfabesine kıyasla tam 3 kat daha fazla foton darbesi üretmek zorundadır. Yönlendiriciler ve anahtarlayıcılar (switch), Tayca UTF-8 bayt akışlarını işlerken silikon çekirdeklerinde 3 kat daha fazla Joule ısısı yayar. Metni Latin alfabesine translitere ettiğinizde, veri boyutu neredeyse %66 oranında fiziksel olarak küçülür; bu da işlemci L1/L3 önbellek satırlarını rahatlatır ve bant genişliği tüketimini optimize eder.
Scriptio Continua: Ayrıştırıcıların ve Yazılımcıların Kabusu
Latin kökenli dillerde yazılım geliştiren derleyici mühendisleri için metin ayrıştırma çocuk oyuncağıdır: her kelime kutsal ASCII boşluk karakteriyle (0x20) birbirinden ayrılmıştır. Tay yazısında ise kelimeler arasında kesinlikle boşluk bulunmaz; yazı scriptio continua (kesintisiz yazı) kuralına göre akar. Boşluk yalnızca cümle, yan tümce veya düşünce sınırlarını belirten bir tür noktalı virgül veya nokta işlevi görür.
Sözlüksel desteği olmayan geleneksel bir ayrıştırıcı (parser), Tayca bir cümleyi kelimelerine ayırmaya çalıştığında O(2N-1) karmaşıklığında algoritmik bir patlama ile yüzleşir. Boşluksuz 15 karakterlik bir dizede 16.384 olası kelime sınırı kombinasyonu ortaya çıkar ve bu da işlemci döngülerini tüketerek çağrı yığınını (stack) kilitler. Doğru bir sınır tespiti için Viterbi algoritmasıyla çözülen Yönlendirilmiş Asiklik Grafikler (DAG) veya ICU RuleBasedBreakIterator Trie ağaçları gerekir. Geliştirdiğimiz transliteratör, grafemleri doğrudan ve deterministik olarak Latin karşılıklarıyla eşleyerek, tarayıcıya gigabaytlarca yapay zeka modeli indirmeden okunabilir hece blokları sunar.
Akustik Fonetik: Beş Ton ve Sağır Latin Alfabesi
Latin alfabesi perdeye ve tonlamaya karşı tamamen sağırdır. İngilizce veya Türkçe gibi dillerde ses perdesi sadece vurgu veya soru gibi pragmatik duyguları yansıtır. Tay dilinde ise perde, kelimenin anlamını baştan aşağı değiştiren birincil fonemdir. Ses tellerinin gerilimi değiştirilerek temel frekans (F0, genellikle 100 Hz ile 300 Hz arasında salınır) modüle edilir. Tay dilinde tam 5 akustik ton bulunur: orta, düşük, düşen, yüksek ve yükselen.
Latin harflerinde ton belirten yerel glifler bulunmadığı için yabancılar Latin transkripsiyonlarını okurken kelimeleri akustik olarak sakatlarlar. Oysa Tay alfabesinin kendisi deterministik bir sonlu durum makinesi (FSM) gibi çalışır. Alfabedeki 44 sessiz harf katı biçimde 3 sınıfa ayrılmıştır: Orta (กลาง), Yüksek (สูง) ve Alçak (ต่ำ). Bir hecenin tonu şu doğruluk tablosuyla hesaplanır: sessiz harf sınıfı, sesli harfin süresi (kısa veya uzun), dört ton işaretinden birinin varlığı ve hecenin «canlı» (sonor sesli/nazal ile biten) veya «ölü» (patlamalı -p, -t, -k sesleriyle aniden kesilen) olması. Dışarıdan bakıldığında karmaşık bir kaligrafi gibi görünen bu yapı, kaputun altında kusursuz bir Boolean mantık devresidir.
Tarih: Kral Ramkhamhaeng'den (1283) Bangkok Taksi Kaosuna
Tay yazısının tarihi miladı, Sukhothai Krallığı'nın efsanevi lideri Kral Ramkhamhaeng'in 1283 yılında Güney Hindistan Pallava kökenli eski Khmer yazısını uyarlayarak ilk standart Tay alfabesini taşa kazıtmasıyla başlar. Yüzyıllar boyunca Budist rahipler kutsal Pali ve Sanskritçe metinleri kopyaladıkları için, Tay dili konuşma dilinde tamamen aynı sese karşılık gelen onlarca gereksiz sessiz harfi yalnızca etimolojik kökeni korumak uğruna alfabede tutmuştur.
Bu etimolojik sadakat, 1999 yılında Tayland Kraliyet Enstitüsü'nün RTGS (Royal Thai General System of Transcription) standardını yayımlamasıyla modern bir kaosa dönüştü. RTGS, karakter karakter birebir eşleme yerine basitleştirilmiş fonetik transkripsiyonu seçti: tüm ton işaretlerini attı ve benzer ünlüleri birleştirdi. Bu yüzden Bangkok'un uluslararası havalimanı biletlerde ve tabelalarda Sanskritçe köklerine sadık kalınarak Suvarnabhumi (altın toprak) yazılır, ancak yerel halk ve yer hizmetleri tarafından Suwannaphum olarak telaffuz edilir. Tabeladaki RTGS yazısını bir taksi şoförüne okumaya çalışan bir turist, ton ve süre bilgisi tamamen buharlaştığı için şoförle hiçbir şekilde anlaşamaz.
SaaS Abonelik Saçmalığı: 25 Yıllık C Kodunu Şişirerek Satmak
Modern web dünyası, en basit algoritmik işlevleri dahi «Abonelik Modeli» (SaaS) adı altında pazarlayan girişimlerle dolup taştı. İnternette Tayca romanizasyon aradığınızda, karşınıza kredi kartı isteyen, OAuth2 doğrulama zorunluluğu getiren ve fahiş aylık abonelik ücretleri talep eden sözde «Yapay Zeka Destekli Dil API'leri» çıkar. Ancak bu cicili bicili pazarlama sayfalarının arkasında yatan gerçek şudur: Yaptıkları tek iş, IBM, Apple ve Unicode Konsorsiyumu mühendislerinin 1999 yılında C ve C++ ile mükemmelleştirdiği açık kaynaklı ICU (International Components for Unicode) kütüphanesini tembelce çağırmaktan ibarettir.
TOOL GIGA bu sentetik karmaşayı reddeder. Bu çevirici, doğrudan sunucu tarafındaki PHP ext-intl ICU motoru (Thai-Latin / Latin-Thai, ISO 11940 standardı entegrasyonu) üzerinden sıfır gecikmeyle çalışır. Tarayıcınızı kilitleyen 4 megabaytlık JavaScript paketleri yok, izleme kodları yok, kredi kartı formu yok. 0,0 saniyelik İlk İçerik Boyaması (FCP) ile katıksız deterministik hız sunar.