Index Server Architecture Using Tiered and Sharded Phrase Posting Lists patenti ne anlatıyor? Google'ın sayfaları neden eşit hızda taramadığını, phrase tabanlı indekslemeyi anlattığım yazıyı okuyabilirsiniz.
- Google'ın indeksleme sistemi tek bir düz veritabanı değil, kademeli bir mimari. Patent, sayfaların "tier" denen kademelere ayrıldığını ve her kademenin farklı bir işlem önceliği taşıdığını anlatıyor.
- Google kelime değil, ifade (phrase) indeksliyor. Bu patentin mucidi Anna Patterson, aynı zamanda daha önce ele aldığımız Phrase-Based Indexing patentinin de sahibi, iki patent aynı temel felsefeyi paylaşıyor.
- Sharding, aynı bilginin farklı sunucu parçalarına dağıtılması demek. Bir sorgu geldiğinde sistem, sadece ilgili shard'ları işleterek gereksiz sunucu trafiğini önlüyor.
- Sorgu bir maliyet hesabı üzerinden yürütülüyor. Patent, her operasyonun bir "query cost" taşıdığını ve sistemin bu maliyeti en aza indirecek şekilde çalıştığını anlatıyor.
- Bu mimari, neden bazı sayfaların diğerlerinden daha hızlı ve sık tarandığını açıklıyor. Kademe mantığı, crawl budget kavramının teknik kökenlerinden biri olarak okunabilir.
Google'ın gözünde her sayfa aynı hızda işlenmiyor, çünkü sistemin kendisi sayfaları baştan farklı kademelere ayırıyor.
Bir müşteri bana sık sık aynı soruyu soruyor. Neden bazı sayfalarım günde birkaç kez taranıyor, bazıları haftalarca hiç güncellenmiyor? Bu sorunun cevabı genelde "içerik kalitesi düşük" gibi genel bir cümleyle geçiştiriliyor. Ama işin altında çok daha somut bir mimari yatıyor.
Bu, Google Patentler serimizin ikinci yazısı. Bu kez Google'ın arama sonuçlarını nasıl bulduğundan çok, arka planda bu bilgiyi nasıl depoladığından ve işlediğinden bahsedeceğiz. Konu biraz daha teknik ama SEO pratiğinize doğrudan dokunan bir tarafı var. Hadi başlayalım.
Google Neden Bütün Web'i Aynı Hızda Taramıyor?
Web, milyarlarca sayfadan oluşuyor. Bir arama motoru, kullanıcı bir sorgu yazdığı anda bu milyarlarca sayfayı taramaz, bunun yerine önceden hazırlanmış bir index'e bakar. Ama bu index'in kendisi de dev bir yapı ve her sorguda tüm index'i baştan sona taramak, hem çok yavaş hem de çok pahalı olurdu.
Bu sorunu çözmek için Google, indeksini tek bir düz liste olarak değil, kademeli ve parçalı bir mimari olarak kurmuş. Bugün ele alacağımız patent, tam olarak bu mimarinin nasıl işlediğini anlatıyor.
Patent Kimin Eseri ve Ne Zaman Başvuruldu?
Bu patent, Index Server Architecture Using Tiered and Sharded Phrase Posting Lists başlığıyla, 30 Mart 2007'de başvuruldu ve mucidi Anna L. Patterson. Bu isim tesadüf değil, çünkü daha önce serimizin bir başka durağı olarak planladığımız Phrase-Based Indexing System patentinin de mucidi aynı kişi. Yani bu iki patent, aynı zihnin, aynı temel felsefeyi iki farklı katmanda (biri indeksleme mantığı, diğeri sunucu mimarisi) uyguladığı bir bütünün parçaları.
Patent, yıllar içinde birden fazla devam başvurusuyla genişletildi, US8682901B1, US8943067B1 ve US9223877B1 gibi. Bu kadar çok devam patenti alınmış olması, Google'ın bu mimariye ne kadar uzun süre ve ne kadar ciddiyetle yatırım yaptığının bir göstergesi.
Kelime Değil, İfade. Phrase Tabanlı İndeksleme Nedir?
Patent metninin girişinde çok net bir cümle var. Sistem, dokümanları indekslemek, getirmek, organize etmek ve tanımlamak için "phrase" yani ifade kullanıyor. Bu, klasik "her kelimeyi ayrı ayrı indeksle" mantığından farklı bir yaklaşım.
Bunun SEO açısından anlamı şu. Google bir sayfanızı okurken tek tek kelimelere değil, anlamlı ifade gruplarına bakıyor. "Saç ekimi" kelimesi tek başına indekslenmiyor, "saç ekimi maliyeti", "saç ekimi sonrası bakım" gibi anlamlı öbekler olarak işleniyor. Bu, daha önce Semantic Triple yazımızda konuştuğumuz entity-attribute-value mantığıyla da örtüşen bir temel.
Tiering Nedir? Sayfalar Neden Farklı Kademelerde Duruyor?
Patentin en dikkat çekici kavramı burada. Sistem, phrase posting list'leri (yani hangi ifadenin hangi dokümanlarda geçtiğini tutan listeler) kademelere, yani "tier"lara ayırıyor. Patent metninde açıkça belirtiliyor, birinci, ikinci, üçüncü tier gibi birden fazla kademe kurulabiliyor, hatta daha fazlası da mümkün.
Her kademe, kendi index server grubuna sahip. Yani sistem, bilgiyi tek bir dev havuzda tutmak yerine, önem ya da işlem sıklığına göre farklı sunucu gruplarına dağıtıyor. Bu, doğrudan söylenmese de, crawl budget kavramının teknik köklerinden birine işaret ediyor. Bir sayfanın hangi kademede olduğu, o sayfaya ne sıklıkla ve ne öncelikle erişileceğini etkileyebiliyor.
Sharding Nedir? Aynı Bilgi Neden Parçalara Bölünüyor?
Tiering'in yanında ikinci bir kavram daha var, sharding. Patent metnine göre her kademedeki phrase posting list'ler, partition denen parçalara bölünüyor ve bu parçalar farklı index sunucularına dağıtılıyor.
Patent bunun neden önemli olduğunu şu cümleyle açıklıyor. Her index sunucusunun bir ifadeyi işlemesi yerine, sadece o dokümanı kendi shard'ında barındıran sunucular işlem yapıyor. Yani sistem, gereksiz sunucu trafiğini önlemek için bilgiyi akıllıca dağıtıyor. Bu da patentin bir başka önemli notuyla birleşiyor, bazı shard'lar yedeklilik sağlamak için birden fazla sunucuda tekrarlanabiliyor.
Bir Sorgu Sisteme Girdiğinde Ne Oluyor?
Patent, bir sorgunun sisteme girdiğinde izlediği yolu da anlatıyor. Önce sorgudaki olası ifade kombinasyonları (phrasification) belirleniyor. Sonra bu ifadelere dayanan bir "query schedule" oluşturuluyor. Bu program, sorgu işleme ve sunucular arası iletişim maliyetini azaltacak şekilde optimize ediliyor.
Patent metninde geçen "query cost" kavramı da önemli. Sistem, her işlem düğümüne bir maliyet atıyor ve bu maliyeti en aza indirecek sunucu atamalarını yapıyor. Yani bir arama sonucunu size göstermek, aslında arka planda küçük bir optimizasyon problemi çözülerek gerçekleşiyor.
Bu Mimari SEO'da Neden Önemli?
Şimdi teoriyi pratiğe bağlayalım. Bu patent doğrudan bir "sıralama faktörü" anlatmıyor, bir altyapı anlatıyor. Ama bu altyapının SEO'ya üç dolaylı yansıması var.
Birincisi, kademeli yapı, bazı sayfaların neden diğerlerinden daha hızlı ve sık işlendiğini açıklıyor. Bir sitenin otoritesi, güncellik sinyalleri ve tarama geçmişi, hangi kademede yer alacağını dolaylı olarak etkileyebilir. İkincisi, phrase tabanlı indeksleme, içeriğinizi tek tek anahtar kelimeler yerine anlamlı ifade öbekleri halinde düşünmeniz gerektiğini gösteriyor. Üçüncüsü, sistemin maliyet odaklı çalışması, gereksiz derecede karmaşık ya da parçalı site yapılarının, arka planda daha fazla "işlem maliyeti" yaratabileceğine işaret ediyor, bu da dolaylı olarak temiz bir site mimarisinin neden hâlâ önemli olduğunu destekliyor.
Phrase Tabanlı Düşünmek İçeriğinizi Nasıl Değiştirmeli?
Bu patentin en somut çıkarımı, anahtar kelime listesi yerine ifade haritası kurmanız gerektiği. Pratik bir yaklaşım şöyle işliyor.
- Tekil kelimeler yerine ifade öbekleri belirleyin: "Saç ekimi" değil, "saç ekimi Türkiye fiyatları", "saç ekimi sonrası şok dökülme" gibi tam ifadeler üzerinden düşünün.
- İçeriğinizde bu ifadeleri doğal cümle akışında tekrarlayın: Yapay şekilde sıkıştırmak yerine, aynı ifadeyi farklı bağlamlarda organik şekilde kullanın.
- Başlık hiyerarşinizi ifade odaklı kurun: H2 ve H3 başlıklarınız, tek kelime yerine tam bir ifadeyi taşısın, bu da modelin phrase tabanlı işleme mantığıyla daha uyumlu.
Bu Patentin Sınırları Neler?
Bu patentin de, serinin ilk yazısında ele aldığımız duplicate documents patenti gibi bir sınırı var. 2007 tarihli bu mimari, muhtemelen bugünün çok daha gelişmiş, büyük ölçüde transformer tabanlı embedding sistemleriyle harmanlanmış bir altyapının sadece bir katmanı. Google'ın bugünkü sistemi, büyük ihtimalle bu tiering ve sharding mantığını koruyarak üzerine çok daha karmaşık anlam modelleri eklemiş durumda.
Yine de patentin temel felsefesi hâlâ geçerli, bilgiyi verimli işlemek için akıllıca kademelere ve parçalara ayırmak. Bu, ölçek büyüdükçe her dağıtık sistemin karşılaştığı evrensel bir mühendislik problemi ve Google'ın bu probleme getirdiği çözüm, on sekiz yıl sonra bile mimari olarak anlamlı.
Kapanış. Görünmezlik Bazen Bir Ceza Değil, Bir Kademe Meselesidir
Bir sayfanın az taranması ya da geç güncellenmesi, her zaman bir kalite cezası değil. Bazen bu, basitçe o sayfanın sistemin hangi kademesinde konumlandığıyla ilgili bir mesele. Bu ayrımı bilmek, paniklemeden doğru soruları sormanızı sağlıyor.
Serinin bir sonraki yazısında, Google'ın "query fan-out" olarak kamuya açıkladığı Query Augmentation patentini ele alacağım, yani bir sorgunun arka planda nasıl çoğaltılıp genişletildiğini.
Soru şu. Sitenizin farklı bölümleri, sizce bu kademeli sistemde nerede duruyor?
Kaynaklar
-
•Kaynak LinkiPatterson, A. L. (2007). Index server architecture using tiered and sharded phrase posting lists. US Patent No. 7,693,813 B1. Google Patents.
-
•Kaynak LinkiPatterson, A. L. Index server architecture using tiered and sharded phrase posting lists (devam patenti). US Patent No. 8,682,901 B1. Google Patents.
-
•Kaynak LinkiPatterson, A. L. Index server architecture using tiered and sharded phrase posting lists (devam patenti). US Patent No. 9,223,877 B1. Google Patents.
-
•Kaynak LinkiGübür, K. T. (2026). How semantics and topical authority improve local SEO. Search Engine Land.

