robots.txt: arama motorlarının duyabileceği genel bir fısıltı
Robots.txt dosyası garip bir web yazımı türüne aittir. Büyük teatral anlamda ne düzyazı ne de kod. Bu, kibar niyetle, ticari açlıkla, arşiv hırsıyla veya algoritmik kayıtsızlıkla gelebilecek tarayıcılara yönelik, bir alanın kenarına yerleştirilmiş kısa bir protokol, ince bir protokol duasıdır. Bir tarayıcı kullanıcısı bunu asla arayamayabilir, ancak botlar için genellikle kapının üzerindeki ilk sivil yazı görevi görür.
Bu isim mekanik gibi görünse de, altında yatan fikir neredeyse diplomatiktir. Bir site aslında şöyle diyor: Burası girebileceğiniz koridorlar, burası görmezden gelmenizi tercih edeceğim odalar ve burası da ana haritanın bulunabileceği yer. Eski Latin ritminde buna praemonitio , bir ön bildirim denilebilir. Bu bir hapishane duvarı değil, rehberliktir. Bu fark önemli. robots.txt sınırlar önerebilir, ancak gizliliği garanti edemez, URL'lerin varlığını silemez veya gerçek erişim kontrolünün yerini tutamaz.
Robots.txt SEO için neden önemlidir ve SEO'ya neden zarar verebilir?
Arama motorlarının açıklığa ihtiyacı vardır. Onlar sabırlıdırlar ama asla sonsuz sabırlı değillerdir; her şeyi bilen olmasa da güçlü. Temiz bir robots.txt dosyası belirsizliği azaltır. Tarayıcıların oturum açma bilgileri, yinelenen arama sonucu sayfaları, geçici parametre labirentleri, alışveriş sepeti parçaları veya özel operasyonel köşeler yerine keşfedilmeyi hak eden materyal üzerinde zaman harcamasına yardımcı olur. Büyük bir site için bu, kozmetik bir incelik değildir. Bu tarama ekonomisidir.
Ancak aynı dosya, dikkatsiz bir direktifle görünürlüğü sabote edebilir. User-agent: * altındaki tek bir Disallow: / , tesadüfi bir tutulma gibi işlev görebilir. Varlık klasörlerinin engellenmesi, görüntü oluşturmayı olumsuz etkileyebilir. Site haritası yollarını susturmak gereksiz sis yaratabilir. Dosyayı kabuklu eski kurallarla doldurmak, dosyayı geçişler, ajanslar, eklentiler, panik düzeltmeleri ve miras alınan batıl inançlardan oluşan bir parşömen haline getirebilir. Bir robot dosyası küçüktür, ancak patlama yarıçapı çok büyük olabilir.
Tarayıcılara yönelik, herkesin görebileceği bir dosya
Web'deki en eski yanlış anlamalardan biri, robots.txt dosyasının bazı şeyleri gizlediği inancıdır. Değil. Dosya tasarımı gereği herkese açıktır. /backup/ , /staging/ , /old-site/ , /private-export.sql veya unutulmuş bir melankoli /temp/ oyuk listeliyorsa, bunlar adlar, tarayıcı kullanan meraklı herkes tarafından okunabilir hale gelir. İzin vermeme kuralı, bir örtüden çok, bir duyuru panosuna tutturulmuş bir dizin kartı gibi davranabilir.
İyi bir robots.txt incelemesinin aynı anda iki soruyu sormasının nedeni budur. Birincisi: Dosya indekslemeyi, oluşturmayı, keşfetmeyi veya site haritası yorumlamayı engelliyor mu? İkincisi: Basiretli bir operatörün reklamını yapmak isteyebileceğinden daha fazlasını ortaya koyuyor mu? SEO ve takdir yetkisi genellikle aynı paragrafta buluşur.
Disiplinli bir robots.txt dosyası genellikle iyi sonuç verir
Disiplinli bir dosya kısa, kasıtlı ve neredeyse manastır mizacına sahip olma eğilimindedir. Kullanıcı aracısı gruplarını temiz bir şekilde adlandırır. Ateş yerine kısıtlamayla İzin Ver ve İzin Verme kullanır. Bunun yardımcı olduğu bir site haritası içerir. Etkileyici görünen ancak birçok tarayıcı tarafından göz ardı edilen dekoratif direktiflerden kaçınır. Olası her URL sapmasını dava etmeye çalışmaz. Yüksek değerli hariç tutmaları seçer ve gerisini daha iyi mekanizmalara bırakır: kanonik sinyaller, parametre işleme, kimlik doğrulama, durum kodları, dahili bağlantı ve mantıklı mimari.
Pratik anlamda bu, genel değeri tanımlayan sayfalar yerine, taramanın dikkatini boşa harcayan sayfaların engellenmesi anlamına gelir. Arama sonucu döngüleri, filtre patlamaları, yönlü labirentler, oturum çöpleri, ödeme yolları ve idari koridorlar yaygın adaylardır. Genel makaleler, kategori sayfaları, her zaman yenilenen kaynaklar, sıralamayı destekleyen resimler, oluşturma için gereken stil sayfaları ve düzeni anlamak için gereken JavaScript genellikle daha fazla dikkat gerektirir.
Birçok robots.txt dosyasının yanlış gittiği yer
Bazıları vahşet yüzünden başarısız oluyor. Çok fazla engel oluyorlar. Tüm bölümler tarama yollarından kaybolur. CSS ve JS yasaklanarak arama motorlarının bir sayfayı kısmi anatomiyle yorumlamasına neden oluyor. Bazıları çekingenlikten dolayı başarısız oluyor. Hiçbir site haritası, hiçbir düşünce, hiçbir yapı içermezler; yalnızca boş bir mevcudiyet içerirler. Bazıları kargo kültü mirası nedeniyle başarısız oluyor: eski blog yazılarından, forum kalıntılarından, eklenti varsayılanlarından veya ajans devirlerinden kopyalanan direktifler, mantıkları buharlaştıktan çok sonra.
Daha incelikli bir başarısızlık da var: anlamsal karışıklık. Bir direktif sözdizimsel olarak geçerli ancak stratejik olarak aptalca olabilir. Bir dosya, keşfedilebilirliği zayıflatırken düzenli görünebilir. Bir diğeri, sanki dosya hâlâ evrensel itaati zorunlu kılıyormuş gibi, robots.txt dosyasındaki Noindex gibi standart olmayan takılar içerebilir. Modern internette bu tür büyülerin çoğu etkili olmaktan çok ayinseldir.
Tarayıcı rehberliği ile dizin kontrolü arasındaki fark
Fiiller birlikte hareket ettiğinden insanlar genellikle taramayı indekslemeyle karıştırır. Aynı olmasa da birbiriyle ilişkilidirler. Robots.txt dosyasında bir URL'nin engellenmesi, tarayıcılara bu URL'yi getirmemelerini söyler. Bu, diğer sinyaller onu işaret ediyorsa URL'nin her zaman aramada görünmeyeceği anlamına gelmez. Bunun tersine, taranmasına izin verilen bir sayfa yine de birçok başka nedenden dolayı sonuçların dışında tutulabilir. robots.txt, indeksleme, kanonikleştirme, görüntü oluşturma, iç mimari ve içerik kalitesinden oluşan daha geniş bir orkestranın bir aracıdır.
Bu ayrım, dosyanın asla sihirli bir düşünme aracı haline gelmemesinin nedenidir. Bu evrensel bir kapatma düğmesi değildir. Tarayıcıların gerçekten görebileceği yerlerde sunulan noindex yerine geçmez. Kimlik doğrulama değildir. Bu bir güvenlik duvarı değil. Bu, kesinliği ödüllendiren ve fanteziyi cezalandıran protokol geleneğindeki tavsiye niteliğinde bir metindir.
Site haritaları neden sohbete ait?
robots.txt dosyasındaki bir site haritası yönergesi mütevazı bir şeydir ancak çoğu zaman çok akıllıcadır. Tarayıcılara yalnızca gezinme yoluyla keşif yapmaya zorlamadan kanonik bir harita verir. Genişleyen siteler, yakın zamanda taşınan yapılar, çok dilli mülkler, e-ticaret katalogları ve eşit olmayan dahili bağlantılara sahip arşivler için bu ipucu, zamandan tasarruf sağlayabilir ve yorumlama gürültüsünü azaltabilir. İndekslemeyi garanti etmez; çok az şey işe yarar. Ancak okunabilirliği artırır.
İşin ironisi çok hoş: Bir dosya tarayıcılara nereye gitmemeleri gerektiğini söylerken aynı zamanda önemli olanın haritasının nerede saklandığını da söylüyor. İnkar ve davet aynı düz metin kabında yaşar. Retorik açıdan robots.txt, yarısı eşik, yarısı yön tabelasıdır.
İnsana yararlılık: bir SEO onay kutusundan daha fazlası
Güçlü bir robots.txt denetimi, sıralamadan daha fazlasına yardımcı olur. İhmal edilmiş aşamalandırma yollarını, fosilleşmiş geçişleri, CDN tuhaflıklarını, yönlendirme sapmalarını, düz metin görünümüne bürünen kazara HTML hata sayfalarını, hatalı biçimlendirilmiş satırları, bozuk site haritası referanslarını ve hala tortu gibi oyalanan eski yönergeleri açığa çıkarabilir. Geliştiriciler için bakım borcunu ortaya çıkarır. Site sahipleri için, bölümlerin neden aramadan kaybolduğunu, denetimlerin neden engellenen kaynaklar hakkında şikayette bulunduğunu veya taramanın neden israf ve tutarsız göründüğünü açıklığa kavuşturabilir.
Ajanslar ve serbest çalışanlar için dosya genellikle bir web sitesinin nasıl kullanıldığına dair minyatür bir biyografidir. Etki alanının dikkatli bir şekilde yönlendirilip yönlendirilmediğini veya yalnızca acil durumlarda yama yapılıp yapılmadığını anlayabilirsiniz. Bazı robot dosyaları temiz geometri gibi okunur. Diğerleri ise etiketlenmemiş anahtarlarla dolu bir dolap gibidir.
Robots.txt dosyasındaki değişiklikler genellikle ne anlama gelir?
Bir robots.txt dosyası değiştiğinde, bu genellikle daha derindeki birkaç hareketten birinin sinyalini verir. Bir geçiş sürüyor olabilir. Bir hazırlama ortamı üretim alışkanlıklarına sızmış olabilir. Yeni bir SEO eklentisinin kuralları yeniden yazılmış olabilir. Bir e-ticaret yığını tarama şişkinliğiyle mücadele ediyor olabilir. Sinirli bir operatör bot trafiğini gördükten sonra agresif bir şekilde engellemiş olabilir. Bir geliştirici, eski yönergeleri farklı anatomiye sahip farklı bir siteden kopyalamış olabilir. Nadir durumlarda, kötü niyetli müdahaleler de olay yerine girer.
Bu nedenle ani değişimler omuz silkmek yerine yorumlanmayı hak ediyor. Yeni bir izin verilmeyen yol, iyi niyetli bir temizlik veya görünürlük çöküşünün başlangıcı olabilir. Kaldırılan bir site haritası satırı unutkanlık veya daha geniş bir yapısal başarısızlığın yan ürünü olabilir. Filolojik dilde her redaksiyonun bir bağlamı vardır; Her ihmalin bir geçmişi vardır.
Kaliteyi değerlendirirken nelere dikkat edilmelidir?
İlk soru son derece basittir: Dosya, sıralamada yer alması gereken herhangi bir kamu bölümünü engelliyor mu? Bir sonraki soru da aynı derecede önemlidir: Bu bölümleri oluşturmak için gereken kaynakları engelliyor mu? Bundan sonra daha sessiz testler gelir. Mantıklı bir joker karakter grubu var mı? Site haritası URL'leri mutlak ve geçerli midir? Yardımcı programdan çok tiyatro yaratan hatalı biçimlendirilmiş satırlar, garip ana bilgisayar yönergeleri veya standart olmayan komutlar var mı? Dosya yedekleme, hazırlama, arşivleme, döküm, dışa aktarma veya özel görünümlü yolları gösteriyor mu? Yanıt aslında düz metin mi, yoksa takma bıyıklı bir HTML sayfası mı?
robots.txt dosyasında kalite maksimum karmaşıklık anlamına gelmez. Doğru niyetle yapılan makul bir kısalıktır. En iyi dosyanın en iyi dosya olduğu genellikle geriye dönüp bakıldığında açıkça görülür, ancak bunu yapmak için genellikle gerçekten düşünmek gerekir.
Bir robots.txt analiz aracı neden kullanılmaya değer?
Robots.txt dosyasını gözle okumak büyük hataları yakalayabilir. Uygun bir analizci daha da ileri gider. Yönlendirmeleri takip eder, durum kodlarını kontrol eder, dosyanın gerçekten metin olup olmadığını doğrular, kullanıcı aracısı gruplarının şeklini inceler, site genelindeki kilitlemeleri işaretler, site haritası sorunlarını fark eder, hassas görünen alanlara yapılan genel referansları tespit eder ve küçük meraklar ile gerçek SEO tehlikeleri arasında ayrım yapar. Bu, onu denetimler, geçişler, devir teslimler, durum tespiti, rakip keşifleri, rutin bakım ve trafiğin değiştiği ve kimsenin nedenini bilmediği huzursuz anlar için faydalı kılar.
Aramadaki bazı sorunlar içerikten, bağlantılardan, mimariden veya niyetten doğar. Bazıları alan kökündeki kuru, düz metin dosyasıyla başlar. robots.txt dosyasının zarafeti sadeliğinde yatmaktadır. Tehlike de oradadır. Birkaç satır tüm mülkü netleştirebilir veya sessizce deforme edebilir. Bu nedenle dosya bir bakıştan fazlasını hak ediyor. Yorumlanmayı hak ediyor.