Google Patenti İnceleme: Detecting Query-Specific Duplicate Documents Ne Anlatıyor?
Blog Yazılarına Dön
Google Patentler

Google Patenti İnceleme: Detecting Query-Specific Duplicate Documents Ne Anlatıyor?

14 dk okuma
Güncel İçerik
TL;DR & Önemli Çıkarımlar

Detecting Query-Specific Duplicate Documents patenti ne anlatıyor? Google'ın aynı iki sayfayı sorguya göre nasıl farklı değerlendirdiğini, near-duplicate mantığını ve micro-cannibalization riskini anlattığım yazıyı okuyabilirsiniz.

  • Bu patent, Google'ın en az bilinen ama en temel çalışma mantıklarından birini açıklıyor. İki dokümanın kopya sayılıp sayılmayacağı, dokümanların kendisine değil, hangi sorguya göre değerlendirildiğine bağlı.
  • Patent, 2000 yılında başvuruldu ve halen Google'ın arama altyapısının parçası. Yirmi beş yılı aşkın bir mantık, bugün hâlâ SEO kararlarınızı doğrudan etkiliyor.
  • Klasik benzerlik tespiti, dokümanın tamamına bakar ve bu yanıltıcı sonuçlar verir. Patent, karşılaştırmadan önce içeriği sorguya göre yoğunlaştırarak bu sorunu çözüyor.
  • Aynı iki sayfa, üç farklı sorguya göre üç farklı sonuç verebilir. Bir sorguya göre tam kopya, başka bir sorguya göre tamamen özgün sayılabiliyorlar.
  • Bu mantığı anlamayan siteler, kendi sayfalarını kendi elleriyle birbirine rakip ediyor. Micro-cannibalization dediğimiz sorunun teknik kökeni büyük ölçüde bu patentte yatıyor.

Bir sayfanın "kopya" sayılıp sayılmaması, o sayfanın kendisine değil, hangi soruya cevap vermeye çalıştığına bağlı.

SEO camiasında "duplicate content" dendiğinde herkesin aklına aynı şey geliyor. İki sayfa birbirine çok benziyorsa, biri diğerinin kopyası sayılıyor, ceza riski doğuyor. Bu anlayış çoğunlukla doğru ama eksik. Çünkü Google'ın gerçek mantığı çok daha ince, kopya olma durumu sabit bir özellik değil, sorguya göre değişen bir değerlendirme.

Bu, Google Patentler serimizin ilk yazısı. Koray Tuğberk Gübür'ün semantik ve konu otoritesi üzerine yazdığı derinlemesine analizde referans gösterilen patentlerden birini, Detecting Query-Specific Duplicate Documents'ı, doğrudan patent metninden okuyup sizin için açacağım. Hadi başlayalım.

Bu Patent Neden SEO Camiasında Yeterince Konuşulmuyor?

Google'ın yayımladığı binlerce patent arasında bu, en fazla göz ardı edilenlerden biri. Nedeni basit, patent metni oldukça teknik ve doğrudan bir "SEO tavsiyesi" formatında yazılmamış. Ama içindeki mantık, SEO'nun en temel sorularından birine doğrudan cevap veriyor. İki sayfanız birbirine benziyorsa, bu bir sorun mu?

Cevap, patentin adında zaten saklı. "Query-specific." Yani sorguya özgü. Bu üç kelime, duplicate content konusundaki yaygın yanlış anlamayı tek başına çürütüyor.

Sorguya Özel Kopya Doküman Tespiti Mantığı
Klasik tam doküman karşılaştırması ile sorguya özgü içerik yoğunlaştırması arasındaki temel fark.

Patent Tam Olarak Ne Zaman ve Kimler Tarafından Başvuruldu?

Patentin orijinal başvurusu 22 Şubat 2000 tarihinde, Benjamin Smith ve Benedict Gomes adlı iki mühendis tarafından yapıldı. Patent, US6615209B1 numarasıyla tescillendi ve sonraki yıllarda US7779002B1 gibi devam patentleriyle genişletildi.

Bu tarihin önemi şu. Google o dönemde henüz genç bir şirketti ama arama kalitesi konusundaki temel problemlerden birini, yani kullanıcıya aynı bilgiyi tekrar tekrar gösterme sorununu, çok erken bir aşamada çözmeye çalışıyordu. Patent metninde geçen bir cümle bu motivasyonu net özetliyor. Arama motorları genellikle sorgulara on sonuçluk gruplar halinde cevap veriyor, bu on sonuç birbirinin neredeyse aynısı içerikleri taşıyorsa kullanıcı deneyimi ciddi şekilde zedeleniyor.

Klasik Benzerlik Tespiti Neden Yetersiz Kalıyordu?

Patentten önce (ve hâlâ birçok basit sistemde) kullanılan yaklaşım, iki dokümanı bütün olarak karşılaştırmaktı. Bu yaklaşımın referans aldığı çalışmalardan biri, Andrei Broder'ın "Syntactic Clustering of the Web" makalesiydi, patent metninde bu çalışmaya doğrudan atıf var.

Ama patent, bu klasik yaklaşımın ciddi bir zaafını ortaya koyuyor. Patent metninde geçen örnek şöyle. Elli farklı şirketi listeleyen bir doküman düşünün. Bu dokümanın büyük kısmı, o elli şirketin isim ve bilgilerinden oluşuyor. Şimdi başka bir doküman düşünün, o da aynı elli şirketi listeliyor ama farklı bir sıralamayla, farklı ek yorumlarla. Klasik bir benzerlik tekniği, bu iki dokümanı "çok benzer değil" olarak işaretleyebilir, çünkü genel kelime dağılımı, cümle yapısı, ek içerik farklı olabilir.

Ama bu elli şirket hakkında bilgi arayan bir kullanıcı için gerçek durum farklı. O kullanıcı için bu iki doküman pratikte aynı bilgiyi taşıyor. Kullanıcıya ikisi birden gösterilirse, kullanıcı hayal kırıklığına uğrar. Patent metni bunu açıkça söylüyor, kullanıcı aynı bilgiyi tekrar tekrar görmekten rahatsız olur.

Patentin Çözümü. Benzerliği Sorguya Göre Yoğunlaştırmak

Patentin sunduğu çözüm zarif bir fikre dayanıyor. İki dokümanı karşılaştırmadan önce, önce her ikisinin de içeriğini o anki sorguya göre yoğunlaştırmak, yani sorguyla alakalı olmayan kısımları geçici olarak bir kenara bırakmak.

Patent metninde bu süreç şöyle tarif ediliyor. Sistem önce sorgu ile ilgili bölümleri (query-relevant information) belirliyor, sonra karşılaştırmayı sadece bu bölümler üzerinden yapıyor. Bu, dokümanın tamamını değil, o anki kullanıcı niyetiyle örtüşen kısmını dikkate almak anlamına geliyor.

Bunun SEO açısından anlamı çok pratik. Sayfanızın genel içeriği çok geniş ve çeşitli olsa bile, belirli bir sorgu bağlamında sisteme dar bir pencereden bakılıyor. Sayfanızın o dar pencerede rakip bir sayfayla örtüşüp örtüşmediği, asıl belirleyici faktör.

Elli Şirket Örneği Ne Anlatıyor?

Patentteki bu örneği biraz daha açalım, çünkü SEO pratiğine doğrudan çeviriyor. Diyelim ki bir sitede "İstanbul'daki en iyi elli restoran" listesi var, başka bir sitede de aynı elli restoranı içeren ama farklı bir başlıkla sunulan bir liste var.

Elli Şirket / Restoran Listesi Patent Örneği
Aynı veri listesini barındıran iki sayfanın farklı sorgu filtreleri altında kopya skorlarının değişimi.

"İstanbul restoran önerileri" sorgusuna göre bu iki sayfa neredeyse aynı bilgiyi taşıyor, yani sorguya özgü yoğunlaştırma sonucunda yüksek benzerlik çıkıyor. Ama aynı iki sayfa, "restoran rezervasyon telefon numaraları" gibi çok daha spesifik bir sorguya göre değerlendirildiğinde, hangi sayfanın telefon numaralarını daha eksiksiz ve doğru sunduğuna bağlı olarak tamamen farklı bir sonuç çıkabilir. Yani aynı içerik havuzu, farklı sorgu mercekleri altında farklı özgünlük seviyeleri gösterebiliyor.

Aynı İki Sayfa Neden Üç Farklı Sorguda Üç Farklı Şey Olabiliyor?

Bu, patentin en çarpıcı ve en az anlaşılan sonucu. İki sayfanız olsun, biri "elektrikli bisiklet bakımı", diğeri "elektrikli bisiklet arıza giderme" konularını işliyor.

Aynı İki Sayfanın Üç Farklı Sorgudaki Kopya Değerlendirmesi
Sorgu merceği değiştikçe sayfaların birbirine göre özgünlük ve örtüşme derecelerinin analizi.

"Bisiklet nasıl temizlenir" sorgusuna göre bu iki sayfa neredeyse aynı bilgiyi taşıyor olabilir, yani sorguya göre yoğunlaştırıldığında ikisi de temizlik adımlarını benzer şekilde anlatıyorsa kopya sayılabilir. Ama "motor arızası nasıl anlaşılır" sorgusuna göre aynı iki sayfa artık tamamen farklı, biri konuyla ilgisiz kalırken diğeri doğrudan cevap veriyor. Üçüncü bir sorgu, "bisiklet bataryası ne kadar dayanır" gibi, her iki sayfada da hiç geçmiyorsa, ikisi de o sorgu için ilgisiz sayılır, kopya tartışması bile gündeme gelmez.

Bu üçlü örnek, "kopya içerik" kavramının sabit bir etiket değil, bağlama duyarlı bir değerlendirme olduğunu net gösteriyor.

Bu Patent Micro-Cannibalization ile Nasıl Bağlantılı?

Bu patentin pratik sonucu, doğrudan SEO'da sık karşılaşılan bir soruna bağlanıyor, micro-cannibalization. Bir sitede aynı temel niyete hizmet eden birden fazla sayfa varsa, Google bu sayfaları belirli sorgular için sorguya özgü yoğunlaştırma sonrası birbirine çok yakın bulabilir.

Micro-Cannibalization ve Sorguya Özgü Yoğunlaşma Etkisi
Aynı sitedeki iki sayfanın aynı sorgu için birbirinin görünürlüğünü yutması (Micro-Cannibalization).

Bu durumda sistem hangi sayfayı öne çıkaracağına karar vermek zorunda kalıyor ve genellikle sıralama sinyalini iki sayfa arasında bölüyor, ikisi de birbirinin gücünü zayıflatıyor. Bu yüzden "biz aynı konuda iki farklı açıdan yazdık, ikisi de farklı" savunması, sorguya özgü değerlendirme mantığı karşısında her zaman geçerli olmuyor. Asıl soru, bu iki sayfanın hangi spesifik sorgular için birbirine yakınsadığı. Daha detaylı analiz için Query Deserves a Page (Bir Sorgu Her Zaman Ayrı Sayfayı Hak Eder mi?) incelememi de okuyabilirsiniz.

Kendi Sitenizde Bu Mantığı Nasıl Test Edersiniz?

Teoriyi pratiğe indirmek için izleyebileceğiniz basit bir yöntem var.

  1. Benzer konulu sayfalarınızı gruplandırın: Aynı temel konuya değinen, farklı başlıklarla yayınlanmış sayfaları bir araya toplayın.
  2. Hedef sorgularınızı listeleyin: Bu sayfaların hedeflediği tüm sorgu varyasyonlarını çıkarın.
  3. Her sorgu için zihinsel yoğunlaştırma yapın: Her sayfanın, o spesifik sorguyla alakalı kısmını ayrı ayrı okuyun, geri kalanını görmezden gelin.
  4. Örtüşmeye bakın: Yoğunlaştırılmış bu parçalar birbirine çok benziyorsa, o sorgu için micro-cannibalization riski var demektir.
  5. Search Console'da doğrulayın: Bu sayfaların aynı sorgu için sıra değiştirip değiştirmediğini kontrol edin, bu patentin öngördüğü dinamiğin gerçek dünyadaki izidir.

Bu Patentin Sınırları Neler?

Dürüst olmak gerekirse, bu patent yirmi beş yılı aşkın bir süre önce başvuruldu ve Google'ın bugünkü sıralama sistemi çok daha karmaşık katmanlardan oluşuyor. Modern sistem, büyük ihtimalle bu temel mantığı, çok daha gelişmiş dil modelleri ve embedding tabanlı benzerlik teknikleriyle birleştirerek çalışıyor.

Yani bu patenti okurken, "Google bugün birebir bu algoritmayı çalıştırıyor" gibi bir sonuca varmamak gerekiyor. Daha doğru okuma şu, bu patent Google'ın felsefesinin köküne işaret ediyor, benzerlik mutlak değil bağlamsaldır. Bu felsefe, yıllar içinde çok daha sofistike tekniklerle (terim ağırlıklandırma, semantik embedding, entity tabanlı karşılaştırma gibi) güncellenerek devam ediyor, ama temel ilke değişmedi.

Kapanış. Kopya Olmak Sayfaya Değil, Sorguya Bağlı

Bu patentin bize öğrettiği en önemli ders şu, "duplicate content" diye tek bir kategori yok. Bir sayfa çifti, bin farklı sorguya göre bin farklı benzerlik skoru üretebilir. Bu yüzden içerik stratejinizi kurarken, "bu sayfa özgün mü" sorusunu tek başına sormak yeterli değil, "bu sayfa hangi sorgular için özgün, hangileri için değil" sorusunu sormanız gerekiyor.

Serinin bir sonraki yazısında, Google'ın indeksleme mimarisini anlatan tiered ve sharded phrase posting lists patentini ele alacağım.

Soru şu. Sitenizdeki hangi iki sayfa, hangi sorguya göre birbirinin gölgesinde kalıyor?

Kaynaklar

  • Smith, B., & Gomes, B. (2000). Detecting query-specific duplicate documents. US Patent No. 6,615,209 B1. Google Patents.
    Kaynak Linki
  • Smith, B., & Gomes, B. (2010). Detecting query-specific duplicate documents. US Patent No. 7,779,002 B1 (devam patenti). Google Patents.
    Kaynak Linki
  • Gübür, K. T. (2026). How semantics and topical authority improve local SEO. Search Engine Land.
    Kaynak Linki
#Google Patentler#Google Patent İncelemesi#SEO Uzmanı#Arama Motoru Optimizasyonu#SEO Danışmanı#Organik Trafik#SEO Hizmetleri#Duplicate Content#Micro Cannibalization
Ücretsiz SEO Analizi

Ücretsiz SEO Analizinizi Alın

Web sitenizin Google sıralamalarında daha üst sıralara çıkmasını engelleyen kritik hataları ve büyüme fırsatlarını birlikte keşfedelim. Sitenize özel hazırlayacağım detaylı bir analiz raporuyla arama görünürlüğünüzü nasıl artırabileceğinizi gösteriyorum.

Kapsamlı Analiz

Web sitenizin SEO sağlığı ve performans metriklerine derinlemesine bakış.

Teknik Denetim

Arama sıralamalarınızı etkileyen teknik sorunları tespit edin ve düzeltin.

Anahtar Kelime Araştırması

Yüksek değerli anahtar kelimeleri ve optimizasyon fırsatlarını keşfedin.

Eylem Planı

Önceliklendirilmiş öneriler içeren detaylı bir yol haritası alın.

Ücretsiz Analiz Talep Edin
Site Hızı
Analiz ediliyor...
Mobil Uyumluluk
Analiz ediliyor...
Sayfa İçi SEO
Analiz ediliyor...
Backlinkler
Analiz ediliyor...

48 saat içinde teslim edilen Kapsamlı Rapor

Konuyla İlgili Sorun mu Var?

Ekim Demirci olarak tüm dijital büyüme süreçlerinizde yanınızdayız.

WhatsApp ile İletişime Geç