Geonode logo
Geonode Team

Geonode Team

Güncellenme: 7 Ekim 2026

Yayınlanma: 2 Eylül 2026

Bir Web Sitesindeki Tüm Sayfaları Nasıl Bulursunuz: Kapsamlı Bir Kılavuz

Bir web sitesindeki tüm sayfaların tam bir listesini elde etmenin bir yolu yoktur ve bunun nedenini anlamak, atılabilecek ilk yararlı adımdır. Bir site kendi sayfalarını bilir; siz ise bilmezsiniz. Oluşturabileceğiniz şey, birbirinden farklı kısmi görünümlerin birleşimidir — site haritası, arşiv kaydı, arama dizini, tarama — bunların her biri diğerlerinin gözden kaçırdığı bir şeyi görür. Bu kılavuz, en az çaba gerektiren sırayla, kullanmaya değer sekiz kaynağı ele almaktadır.

Açıklama: Biz Geonode olarak, yazının sonlarına doğru açıklanan tarama yönteminin bileşenlerinden biri olan proxy’leri satıyoruz. Dürüstçe söylemek gerekirse, tarama denemeniz gereken ilk şey değil, en son şey olmalıdır. Aşağıdaki sekiz kaynaktan beşi ücretsizdir, altyapı gerektirmez ve genellikle taramadan daha eksiksiz bir liste sunar — çünkü artık hiçbir yerden bağlantı verilmeyen sayfaları da içerirler. Eğer bir tarayıcı yazarak başlarsanız, daha fazla iş yaparsınız ve daha az kapsam elde edersiniz. Ücretsiz kaynaklarda doldurmanız gereken boşluklar olduğunu tespit ettiğinizde bant genişliği satın alın; bu, çoğu kişinin sandığından daha geç bir aşamadır.

Neden “Tüm Sayfalar” İçin Tam Bir Cevap Yok?

Dört neden var ve hepsi yapısal nitelikte.

Yalnız sayfalar mevcuttur. Gelen bağlantısı olmayan bir sayfaya tarama yoluyla ulaşılamaz ve arama motorları tarafından görülmez, ancak bu sayfa mevcuttur ve yayında olabilir. Eski açılış sayfaları, kampanya URL’leri ve kullanımdan kaldırılmış bölümlerin tümü bu kategoriye girer.

Formların ve kimlik doğrulamanın ardındaki içerik sayılabilir değildir. Arama sonuçları, filtrelenmiş görünümler ve oturum açmayı gerektiren her şey, keşif yoluyla erişilemez.

Dinamik URL'ler sonsuz olabilir. Gelecek aya ait bağlantılar içeren bir takvim, sınırsız sayıda URL üretir. Bir e-ticaret sitesindeki yönlendirme seçenekleri, kombinasyonel patlamalara yol açar. Bazı sitelerde "Tüm sayfalar", sonlu bir küme değildir.

Siteler eksiklik yoluyla yanıltıcı olabilir. Bir site haritası, sahibinin listelemeyi seçtiği öğeleri içerir; bu genellikle mevcut sayfalar değil, indekslenmesini istedikleri sayfalardır.

Dolayısıyla gerçekçi hedef, eksiksizlik değil, amacınız için yeterli kapsamdır; bu da seçtiğiniz kaynakların, sorgulama nedeninize bağlı olduğu anlamına gelir.

Site Haritasıyla Başlayın

En verimli ilk adım budur, ancak çoğu kişi bunu atlar.

Site haritası protokolü, bir sitenin URL'lerini listeleyen bir XML formatını tanımlar. Bir site haritası "<urlset> açılış etiketiyle başlamalı ve </urlset> kapanış etiketiyle bitmelidir"; her giriş için bir <loc> öğesi gereklidir. İsteğe bağlı <lastmod>, <changefreq> ve <priority> öğeleri de buna eşlik edebilir, ancak protokolde bunların işlenişinin "arama motorları arasında farklılık gösterebileceği" belirtilmektedir.

Bu sınırlamalar, bulduğunuz sonuçlar açısından önemlidir: tek bir site haritası dosyası "50.000 URL ile sınırlıdır ve 50 MB'den (52.428.800 bayt) büyük olamaz". Daha büyük siteler, diğer site haritalarını listeleyen bir site haritası dizini (<sitemapindex>) kullanır; bu da aynı sınırlamalara tabidir, dolayısıyla bir site düzinelerce site haritası dosyasına sahip olabilir.

Nereye bakmalı:

https://example.com/sitemap.xml
https://example.com/sitemap_index.xml
https://example.com/sitemap.xml.gz

Gzip sıkıştırmasına izin verilir, "ancak sıkıştırması açılmış dosya yine de boyut kısıtlamalarına uymalıdır".

Öncelikle robots.txt adresini kontrol edin, çünkü protokol, Sitemap: yönergesi ile site haritalarının buradan duyurulmasını öngörür:

curl -s https://example.com/robots.txt | grep -i sitemap

Bu, mevcut en uzun otuz saniyelik süredir. Birçok site, adlarını asla tahmin edemeyeceğiniz birkaç site haritasını listeler — ürünler, kategoriler, blog gönderileri ve görseller için ayrı ayrı olanlar.

Dizini özyinelemeli olarak takip edin. Bir site haritası dizini, başka site haritalarına işaret eden site haritalarına yönlendirir. Her birini alın, <loc> değerlerini çıkarın ve bir dizindeki girdilerin site haritası dosyaları, bir urlset'teki girdilerin ise sayfalar olduğunu unutmayın.

<lastmod> alanı, buradan başlamanız için bir başka nedendir: size nelerin değiştiğini bildirir; bu da yeniden taramayı, yer değiştiren birkaç sayfanın alınmasına dönüştürür.

robots.txt Dosyasını İçerdiği Bilgiler Açısından İnceleyin

Sitemap yönergesinin ötesinde, robots.txt dosyası, site sahibinin bahsetmeye değer gördüğü yolların bir listesidir.

Disallow: /admin/
Disallow: /internal/reports/
Disallow: /checkout/
Disallow: /search?

Her Disallow satırı, mevcut bir yolu belirtir. Bu, siteye giriş yolu değildir; taramanız gereken yerleri belirten bir bildirimdir ve buna uymak hem doğru bir davranıştır hem de saygın bir tarayıcı ile baş belası bir tarayıcı arasındaki farkı belirler. Ancak bu dosya size sitenin yapısını gösterir ve sıklıkla sizin bilmediğiniz bölümleri belirtir.

Bunu bir hedef listesi olarak değil, bir harita olarak okuyun. İzin verilmeyen bir yol, tarama listenizin dışında kalmalıdır; ancak bu yolun varlığını bilmek, siteyi anlamanıza yine de katkı sağlar.

Arama Motoru Operatörleri

Hızlı, ücretsiz ve kısmi.

site:example.com
site:example.com inurl:/products/
site:example.com -inurl:/blog/
site:example.com filetype:pdf

Bunun size sağladığı şey: arama motorunun indekslediği sayfalar; bu, mevcut sayfaların bir alt kümesidir. Sonuçlar ayrıca sınırlıdır ve kapsamlı olmaktan ziyade tahmini niteliktedir.

Gerçekten ne için kullanışlıdır: bilmediğiniz alt alan adlarını ve bölümleri keşfetmek ve gezinme menüsünden bağlantı verilmeyen belge dosyalarını bulmak. Bir kurumsal sitede filetype:pdf araması yapmak, genellikle kimsenin kamuya açık olmasını beklemediği materyalleri ortaya çıkarır.

Bunun sınırlaması, arama sonuçlarını kazımak çoğu arama motorunun kullanım koşullarını doğrudan ihlal eder ve manuel versiyonun yavaş olmasıdır. Bunu programlı olarak yapmanız gerekiyorsa, web arayüzünü otomatikleştirmek yerine, varsa resmi bir arama API'sini kullanın.

Web Arşivleri

Çoğu kişinin unuttuğu ve artık mevcut olmayan sayfaları bulabilen tek kaynak.

Internet Archive’ın CDX Sunucu API’si, arşivin yakalama dizinine doğrudan sorgu gönderir. Belgelerde, "CDX sunucusu için en basit sorgu ve tek zorunlu parametre url parametresidir" denilmektedir.

curl -s "http://web.archive.org/cdx/search/cdx?url=example.com/*&output=json&fl=original&collapse=urlkey&limit=10000"

Bilinmesi gereken parametreler:

**matchType

** kapsamı kontrol eder — exact

tek bir URL ile eşleşir, prefix

bir yol altındaki her şeyi döndürür, host

tek bir ana bilgisayar adını kapsar ve domain

bir etki alanını ve tüm alt etki alanlarını kapsar. URL'deki bir joker karakter bunu dolaylı olarak belirler; dolayısıyla example.com/*

önek eşlemesidir.

**collapse=urlkey

** bitişik yinelemeleri kaldırır; arşivde aynı URL'nin birçok kaydı bulunduğundan bu çok önemlidir.

**output=json

** varsayılan CDX metin biçiminden daha kullanışlıdır ve gzip=false

, istemciniz gzip kodlamasını işleyemiyorsa varsayılan gzip kodlamasını devre dışı bırakır.

Sınırlamalar: API, "sorgu başına varsayılan olarak en fazla 150.000 sonuç" sınırını uygular; bu sınır, limit=N

ile ayarlanabilir. Daha büyük sorgular için ise belgelerde, page

ve pageSize

adreslerini kullanarak sayfalandırma API'sinin kullanılması önerilir.

Bunun benzersiz değeri: geçmiş URL'leri ortaya çıkarır. Kaldırılmış sayfalar, yeniden yapılandırılmış bölümler, bağlantısı kesilmiş kampanya açılış sayfaları. Bir sitenin eskiden nasıl olduğunu anlamak veya hâlâ yayında olan terk edilmiş içeriği bulmak için bununla kıyaslanabilecek başka hiçbir şey yoktur — ve hedef sunucuya hiçbir yük getirmez.

Common Crawl

Sorgulama yapabileceğiniz bir dizine sahip, geniş bir kamuya açık tarama külliyatı ve gerçekten yeterince değerlendirilmeyen bir kaynak.

Common Crawl, web’in önemli bir kısmının periyodik taramalarını bir URL diziniyle birlikte yayınlar. Bu dizini sorguladığınızda, siteye dokunmadan bir etki alanı için tarama sırasında tespit edilen URL’leri toplu olarak elde edersiniz.

Bunun getirdiği avantaj ve dezavantajlar açıktır. Kapsam geniştir ancak eksiksiz değildir — bu bir taramadır ve her taramada olduğu gibi bazı kör noktalara sahiptir. Güncellik, hangi taramayı sorguladığınıza bağlıdır. Ayrıca, dizini büyük ölçekte sorgulamak, tek bir istekten ziyade bir veri işleme çalışmasıdır.

Bu hizmetin en çok işe yaradığı alanlar: büyük ölçekli araştırmalar, birçok alan adının karşılaştırılması ve siteye trafik oluşturmadan siteye genel bir bakış elde etmek istediğiniz her türlü durumdur.

Tarama: Son Çare, Doğru Şekilde Yapıldığında

Ücretsiz kaynaklar eksiklikler bıraktığında, tarama yapın. Sorun yaratmayacak şekilde yapın.

Temel döngü: bir sayfayı alın, bağlantıları çıkarın, hedef etki alanına göre filtreleyin, yenilerini kuyruğa alın, kuyruk boşalana kadar tekrarlayın. Prensipte basit, ancak ayrıntılarla dolu.

Önemli ayrıntılar:

robots.txt dosyasına uyun. Bu artık bir standarttır — RFC 9309, eşleşmeyi sıraya göre değil özgüllüğe göre tanımlar, dosyanın en az günde bir kez yenilenmesini gerektirir ve sunucu hatasını tam bir yasaklama olarak değerlendirir. Ayrıştırıcıyı kendiniz yazmak yerine, bakımlı bir kütüphane kullanın.

URL’leri agresif bir şekilde normalleştirin. Sonundaki eğik çizgiler, sorgu parametrelerinin sırası, ana bilgisayar adlarındaki büyük/küçük harf farkı, oturum tanımlayıcıları ve izleme parametreleri, hepsi yinelenenler oluşturur. Normalleştirme yapmayan bir tarayıcı, aynı sayfayı yüzlerce kez ziyaret eder.

Tarama sınırlarını belirleyin. Derinlik sınırları, sayfa sayısı sınırları ve takvimler ile yönlendirme filtreleri için desen hariç tutmaları. Bunlar olmadan bazı siteler sonsuzdur.

Kendi istek hızınızı sınırlayın. Saniyede bir veya iki istek, çoğu iş için uygun ve nezakettir. robots.txt adresindeki Crawl-delay, dikkate alınması gereken bir istek örneğidir.

Kimliğinizi belirtin. Adı ve iletişim URL’si olan bir kullanıcı ajanı, anonim otomasyona kıyasla çok daha az sıklıkla engellenir.

Önbelleğe alın ve koşullu istekler kullanın. If-Modified-Since ve If-None-Match, yeniden taramayı bir dizi ucuz 304 yanıtına dönüştürür.

Proxy'lerin devreye girdiği durumlar: gerçek ölçekte, tek bir adresin hız sınırlamasına tabi tutulması veya içeriğin bölgeye göre farklılık göstermesi durumunda. Daha önce değil. Veri merkezi bant genişliği bunun için mantıklı bir varsayılan seçenektir — bizimki 0,14 $/GB’den başlar, Eylül 2026’da kontrol edilmiştir — ve konut bant genişliğine ancak veri merkezinin açıkça yetersiz kaldığı durumlarda geçilmelidir.

Bilinmesi Gereken Diğer Kaynaklar

Belirli boşlukları dolduran dört küçük kaynak.

Sertifika şeffaflığı günlükleri. Verilen her TLS sertifikası kamuya açık olarak günlüğe kaydedilir ve sertifikalar, ana bilgisayar adlarını belirtir. Bir etki alanı için bir CT günlüğü toplayıcısına sorgu gönderildiğinde, başka yollarla bulunması hiç amaçlanmamış, iç ağa ait gibi görünen alt etki alanları da dahil olmak üzere tüm alt etki alanları ortaya çıkar. Bu, alt etki alanlarını keşfetmenin en iyi yöntemidir ve hedefle herhangi bir temas gerektirmez.

RSS ve Atom beslemeleri. Hâlâ yaygın olarak yayınlanmaktadır ve içerikleri tarihleriyle birlikte yapılandırılmış bir biçimde listeler. /feed, /rss, /atom.xml adreslerini ve sayfa başlığındaki <link rel="alternate"> etiketlerini kontrol edin.

Sitenin kendi arama ve gezinme özellikleri. A'dan Z'ye dizin, etiket listesi, kategori sayfası veya bir HTML site haritası sayfası — birçok site, insan ziyaretçiler için bunlardan birini yayınlar ve bu, genellikle XML site haritasından daha eksiksizdir.

Ön uçtaki API. Site tek sayfalık bir uygulama ise, içeriğini almak için bir API'yi çağırır ve bu API genellikle her şeyi yapılandırılmış bir biçimde döndüren liste uç noktalarını açığa çıkarır. Tarayıcınızın ağ sekmesine bakın. Bu, modern sitelerde her zaman en hızlı yoldur ve insanların her zaman en son bulduğu yoldur.

Kaynakları Birleştirme

Ciddi bir sayım için pratik yöntem ve sıralamanın öneminin nedeni.

Bağımsız olarak toplayın ve birleştirin. Site haritası URL’lerini, arşiv URL’lerini, besleme URL’lerini ve tarama sonuçlarını tek bir küme halinde birleştirin. Birleştirmeden önce normalleştirin; aksi takdirde aynı sayfayı birkaç kez sayarsınız.

Çalışır durumda olup olmadığını doğrulayın. Bir arşiv URL'si bugün 404 hatası verebilir. Her URL için bir HEAD

isteği yapmak çok ucuzdur:

while read -r url; do
  code=$(curl -sIL -o /dev/null --max-time 10 -w '%{response_code}' "$url")
  echo "$code $url"
done < urls.txt

Kaynakları birbiriyle karşılaştırın. Arşivde bulunan ancak site haritasında olmayan URL'ler, kaldırılmış veya yetim kalmış sayfalardır. Site haritasında bulunan ancak 404 hatası veren URL'ler ise güncel olmayan girdilerdir. Tarama sırasında bulunan ancak site haritasında yer almayan URL'ler, sahibinin indekslenmesini istemediği sayfalardır. Her bir farklılık bir bilgi kaynağıdır.

Zaman içinde takip edin. İşlemi periyodik olarak tekrarlayıp farklılıkları karşılaştırmak, nelerin eklendiğini ve nelerin kaldırıldığını gösterir; bu da genellikle "tüm sayfaları bul" talebinin ardındaki asıl sorudur.

Pratik Bir Kılavuz

Kaynakları, en az iş gerektiren sırayla tek bir etki alanında bir araya getirme.

Bir — beyan edilmiş site haritalarını bulun:

DOMAIN="example.com"
curl -s "https://$DOMAIN/robots.txt" | grep -i '^sitemap:' | awk '{print $2}' > sitemaps.txt
# fall back to the conventional locations if nothing is declared
[ -s sitemaps.txt ] || printf 'https://%s/sitemap.xml\nhttps://%s/sitemap_index.xml\n' "$DOMAIN" "$DOMAIN" > sitemaps.txt

İki — dizinleri genişletin ve URL’leri toplayın. Bir site haritası dizini, diğer site haritalarına yönlendiren <loc>

değerlerini içerir; bir urlset ise sayfalara yönlendiren <loc>

değerlerini içerir. Dolayısıyla aynı veri çıkarma işlemi her iki düzeyde de işe yarar ve siz de bunu tekrarlamanız yeterlidir:

extract() { curl -s --compressed "$1" | grep -o '<loc>[^<]*</loc>' | sed 's/<[^>]*>//g'; }

: > all_urls.txt
while read -r sm; do
  extract "$sm" | while read -r u; do
    case "$u" in
      *.xml|*.xml.gz) extract "$u" >> all_urls.txt ;;
      *)              echo "$u" >> all_urls.txt ;;
    esac
  done
done < sitemaps.txt

sort -u all_urls.txt -o all_urls.txt
wc -l all_urls.txt

Üç — arşivin görünümünü ekleyin:

curl -s "http://web.archive.org/cdx/search/cdx?url=${DOMAIN}/*&output=text&fl=original&collapse=urlkey&limit=50000" \
  | sort -u > archive_urls.txt
wc -l archive_urls.txt

Dört — sadece birleştirmek yerine karşılaştırın. İlginç çıktı burada ortaya çıkıyor:

comm -13 all_urls.txt archive_urls.txt > only_in_archive.txt   # orphaned or removed
comm -23 all_urls.txt archive_urls.txt > only_in_sitemap.txt   # new or never archived

only_in_archive.txt

ilk olarak incelenmesi gereken liste budur. Bunlar, sitenin bir zamanlar sunduğu ancak artık tanıtmadığı URL’lerdir — bazıları 404 hatası verecek, vermeyenler ise kimsenin bağlantı vermediği aktif sayfalardır.

Beş — herhangi bir şeye güvenmeden önce aktif olup olmadığını kontrol edin. Her iki liste de güncel olmayan girdiler içerir ve URL başına bir HEAD

isteği, tam bir sayfa yerine birkaç yüz baytlık bir yük getirir:

while read -r u; do
  printf '%s %s\n' "$(curl -sIL -o /dev/null --max-time 10 -w '%{response_code}' "$u")" "$u"
done < only_in_archive.txt | tee liveness.txt
grep '^200 ' liveness.txt | wc -l

Kasıtlı sıralamaya dikkat edin: dört kaynak incelenmiş, binlerce URL toplanmış ve tek bir tarama bile yazılmamıştır. Çoğu sitede bu, bir tarayıcının sağlayacağından daha eksiksiz bir tablo sunar; üstelik çok daha kısa sürede ve hedef site, orada olduğunuzu neredeyse hiç fark etmez.

Kullanıcılar Ayrıca Şunları Soruyor

Bir web sitesindeki tüm sayfaları nasıl bulabilirim?

Öncelikle robots.txt adresini kullanarak site haritası bildirimlerini bulun, ardından site haritalarını indirin ve indeks dosyalarını takip edin. Geçmişteki URL’ler, RSS beslemeleri ve site: araması için Internet Archive’ın CDX API’sini de kullanın. Yalnızca bunların kaçırdıklarını tarayın — bu, en yavaş ve en müdahaleci seçenektir.

Bir web sitesinin site haritası nerede bulunur?

Genellikle /sitemap.xml veya /sitemap_index.xml adresindedir ve bunu bulmanın güvenilir yolu, robots.txt dosyasındaki Sitemap: yönergesidir. Büyük siteler, her birinin 50.000 URL ve 50 MB ile sınırlı olması nedeniyle birden fazla dosyaya işaret eden bir site haritası dizini kullanır.

Hiçbir yerde bağlantısı olmayan sayfaları bulabilir miyim?

Bazen. Tarama işlemleri tanım gereği bu sayfaları bulamaz, ancak web arşivleri genellikle bulabilir — Internet Archive'ın CDX API'si, artık bağlantısı olmayanlar da dahil olmak üzere geçmiş URL'leri döndürür. Sertifika şeffaflığı günlükleri de hiçbir yerden bağlantı verilmeyen alt alan adlarını ortaya çıkarır.

Bir web sitesinin tüm alt alan adlarını nasıl bulabilirim?

Sertifika şeffaflığı günlükleri en iyi kaynaktır, çünkü verilen her TLS sertifikası, ana bilgisayar adlarıyla birlikte kamuya açık olarak kaydedilir. Arama motoru operatörleri ve DNS numaralandırma araçları da bu bilgiyi tamamlar. Bunların hiçbiri hedefle iletişime geçmeyi gerektirmez.

Bir web sitesini tarayarak sayfalarını listelemek yasal mı?

Bu, yargı yetkisine, sitenin kullanım koşullarına ve sonuçlarla ne yaptığınıza bağlıdır. robots.txt adresini dikkate almak, tarayıcınızı tanımlamak ve tarama hızınızı makul bir seviyede tutmak, normal uygulamalar çerçevesinde kalmanızı sağlar. Hizmet şartları, her halükarda otomatik erişimi yasaklayabilir ve bu, kontrol etmeye değer bir sözleşme konusudur.

Bir site haritası kaç URL içerebilir?

Dosya başına 50.000, sıkıştırılmamış 50 MB sınırı vardır. Bunun ötesinde, siteler birden fazla site haritası dosyasını listeleyen bir site haritası dizini kullanır — ve dizinin kendisi de aynı 50.000 ve 50 MB sınırlarına tabidir.

Wayback CDX API nedir?

Internet Archive’ın yakalama dizinine yönelik bir arayüzdür ve bir etki alanı için arşivlediği URL’leri döndürür. matchType, tek bir URL’den bir etki alanına ve tüm alt etki alanlarına kadar kapsamı kontrol eder; collapse=urlkey, yinelenen yakalamaları kaldırır; varsayılan sonuç sınırı 150.000’dir ve daha büyük sorgular için sayfalandırma API’si mevcuttur.

Bir web sitesinin sayfalarını listelemek için proxy'lere ihtiyacım var mı?

Site haritası, arşiv, besleme veya arama yöntemleri için gerekmez — bunların hiçbiri anlamlı bir yük oluşturmaz. Proxy'lere, tek bir adresin hız sınırlamasına tabi olduğu veya içeriğin bölgeye göre farklılık gösterdiği büyük ölçekli taramalar için ihtiyacınız olur. Herhangi bir şey satın almadan önce ücretsiz kaynaklarda eksiklikler olup olmadığını kontrol edin.

Sonuç

Bir web sitesinin sayfalarının eksiksiz bir listesi yoktur; sadece kısmi görünümlerin birleşimi vardır — ve burada izlenmesi gereken yararlı yöntem, maliyetli görünümü oluşturmadan önce daha az maliyetli olanları toplamaktır.

robots.txt'da otuz saniye geçirmek, site haritası bildirimlerini bulmanızı sağlar. Site haritası dizinini birkaç dakika takip etmek, site sahibinin sitesini nasıl gördüğünü ortaya çıkarır. Internet Archive'ın CDX API'si, eskiden var olan sayfaları ve artık kimsenin bağlantı vermediği sayfaları ekler. Beslemeler, sertifika şeffaflık günlükleri ve sitenin kendi HTML dizini, her biri farklı bir boşluğu doldurur. Bunların hepsi ücretsizdir ve hiçbiri hedefe yük bindirmez.

robots.txt'i dikkate alarak, URL'leri normalleştirerek, taramayı sınırlayarak ve hızınızı makul bir seviyede tutarak geriye kalanları tarayın — ve öncelikle sitenin bir API'yi çağıran tek sayfalık bir uygulama olup olmadığını kontrol edin, çünkü bu yol genellikle taramadan daha hızlıdır ve neredeyse her zaman gözden kaçar.

Ardından kaynakları sadece birleştirmek yerine karşılaştırın. Arşivde bulunan ancak site haritasında yer almayan sayfalar ve artık 404 hatası veren site haritası girişleri, genellikle bu çalışmanın ortaya çıkardığı en ilginç sonuçlardır.