Bir kazıyıcı, test ortamında mükemmel şekilde çalışır.
Sonra onu gerçek bir web sitesine yönlendirdiğinizde şunu görürsünüz:
403 Erişim Yasak.
Ya da bir CAPTCHA.
Ya da sayfa Chrome’da yüklenir, ancak komut dosyanızdan tamamen farklı bir sonuç döndürür.
IP adresini değiştirirsiniz. Birkaç istek için işe yarar, sonra tekrar engellenir.
DataDome, otomatik trafik için tam da bu tür sorunlar yaratmak üzere tasarlanmıştır.
Anlaşılması gereken önemli nokta, DataDome'un sadece şunu sormamasıdır:
"Bu IP şüpheli mi?"
Modern bot algılama, şuna çok daha yakındır:
"Bu IP, ağ bağlantısı, tarayıcı, cihaz, istek modeli ve oturum bir arada mantıklı mı?"
Bu ayrım, proxy değiştirmenin neden bazen işe yaradığını, neden çoğu zaman yaramadığını ve HTTP düzeyinde tamamen normal görünen bir veri toplayıcının neden yine de başarısız olabileceğini açıklar.
Bu kılavuz, DataDome’un nasıl çalıştığını, hangi sinyalleri kullanabileceğini, bir DataDome engellemesinin neye benzediğini, tarayıcıların ve komut dosyalarının neden farklı davrandığını ve proxy’lerin, tarayıcı otomasyonunun ve veri toplama API’lerinin bu resimde nasıl bir yer tuttuğunu açıklamaktadır.
DataDome Nedir?
DataDome, web siteleri, mobil uygulamalar ve API’ler tarafından meşru kullanıcıları otomatik veya kötü niyetli trafikten ayırt etmek için kullanılan bir bot ve çevrimiçi dolandırıcılık koruma platformudur.
Web sitesi sahipleri, aşağıdakiler gibi faaliyetleri azaltmak için DataDome gibi sistemleri kullanır:
- yetkisiz veri kazıma;
- kimlik bilgisi doldurma;
- hesap ele geçirme girişimleri;
- sahte hesap oluşturma;
- envanter suistimali;
- ödeme dolandırıcılığı;
- otomatik güvenlik açığı taraması;
- saldırgan botlar;
- istenmeyen yapay zeka ajanları.
Halka açık web verilerini toplayan bir kişi için DataDome, denklemin diğer tarafında yer alır.
İsteğiniz korumalı bir web sitesine ulaşır, ancak uygulama hangi içeriği döndüreceğine karar vermeden önce DataDome, isteği değerlendirerek meşru, şüpheli veya otomatik olup olmadığına karar verebilir.
Sonuç şu şekilde olabilir:
İzin Ver
İstek normal şekilde devam eder.
Cihaz Kontrolü
Ek tarayıcı/cihaz doğrulaması yapılır.
CAPTCHA
İstemciye etkileşimli bir doğrulama sorusu gönderilir.
Engelle
İstek reddedilir.
İşte bu nedenle, tamamen aynı URL’ye yönelik iki istek, birbirinden tamamen farklı yanıtlar verebilir.
URL değişmedi.
Değişen, istemciydi.
DataDome Nasıl Çalışır?
Kullanışlı ve basitleştirilmiş bir model şu şekildedir:
İstemci → korunan web sitesi/DataDome → algılama kararı → web sitesi
Algılama aşaması, kazıyıcı sorunlarının çoğunun yaşandığı yerdir.
DataDome, tek bir basit göstergeye güvenmek yerine, bağlantının birden fazla katmanından gelen sinyalleri değerlendirebilir.
Bu katmanlar şunları içerebilir:
| Katman | Örnek sinyaller |
|---|
| Ağ | IP adresi, ASN, ağ itibarı |
| TLS | TLS parmak izi ve bağlantı özellikleri |
| HTTP | Başlıklar, başlık tutarlılığı, istek özellikleri |
| Tarayıcı | Tarayıcı parmak izi ve ortam |
| Cihaz | İşletim sistemi, donanım ve yürütme sinyalleri |
| JavaScript | İstemci tarafındaki kontrollerden elde edilen sonuçlar |
| Oturum | Çerezler ve istekler arasındaki süreklilik |
| Davranış | Zamanlama ve etkileşim kalıpları |
| İtibar | Altyapıyla ilişkili önceki etkinlikler |
Tek bir satırın tek başına bir isteğin otomatik olduğunu kanıtlaması gerekmez.
Değer, bunların birbirleriyle karşılaştırılmasından kaynaklanır.
İmkansız bir tarayıcı parmak izine sahip bir ev IP'si yine de şüpheli görünebilir.
Tutarsız bir TLS istemcisinden gelen, mükemmel görünen bir User-Agent yine de şüpheli görünebilir.
Yüzlerce son derece tekrarlayan istek üreten gerçek bir tarayıcı yine de şüpheli görünebilir.
İşte modern bot önleme sistemleri ile eski IP engelleme sistemleri arasındaki temel fark budur.
DataDome Algılama: Ana Katmanlar
1. IP İtibarı
IP itibarı hâlâ önemlidir.
Bir IP adresinin geçmişi olabilir.
Örneğin, bir altyapıdan büyük miktarda kötü niyetli veya açıkça otomatikleştirilmiş trafik kaynaklandığında, bu altyapı kötü bir itibar kazanabilir.
DataDome, trafiğin aşağıdakilerden gelip gelmediğini değerlendirebilir:
- bilinen barındırma altyapıları;
- veri merkezi aralıkları;
- paylaşımlı proxy'ler;
- konut proxy'leri;
- ücretsiz genel proxy ağları;
- daha önce şüpheli bulunan adresler.
Ancak IP itibarı yalnızca bir göstergedir.
Bu nedenle şu tür ifadeler:
"Bir konut proxy'si kullanırsanız DataDome sizi tespit edemez."
gibi ifadeler yanıltıcıdır.
Bir konut adresi, bir ağ isteğinin sıradan tüketici trafiğine daha çok benzemesini sağlayabilir.
Ancak isteğin geri kalan kısmını otomatik olarak tutarlı hale getiremez.
2. HTTP Başlıkları
Tarayıcılar, tanınabilir bir başlık kümesi gönderir.
Otomasyon araçları da başlıklar gönderir.
İlginç olan kısım, bir isteğin User-Agent
içermesi değildir.
Asıl önemli olan, isteğin bir bütün olarak mantıklı olup olmadığıdır.
Örneğin, yeni bir Chrome sürümü olduğunu iddia eden, ancak normalde o tarayıcıyla eşleşmeyen bir başlık kümesi gönderen bir istemciyi düşünün.
Tek tek bakıldığında her bir değer makul görünebilir.
Ancak bir arada değerlendirildiğinde makul olmayabilir.
Modern bot algılama sistemleri bu tutarsızlıkları tespit edebilir.
Sadece
User-Agent: Mozilla/5.0...
adresini değiştirmek, basit bir HTTP kütüphanesini Chrome'a dönüştürmez.
3. TLS Parmak İzi Analizi
HTTP verileri HTTPS üzerinden alışverişe girmeden önce, istemci bir TLS bağlantısı kurar.
Farklı istemciler, farklı TLS özellikleri ortaya çıkarabilir.
Bir tarayıcı, bir Python HTTP kütüphanesi, bir komut satırı istemcisi ve başka bir çalışma zamanı ortamı, şifreli bağlantıları farklı şekillerde kurabilir.
Bu kalıplar parmak izleri olarak özetlenebilir.
DataDome belgeleri, trafiği değerlendirirken kullanılabilecek verilerin bir parçası olarak, JA3 ve JA4 bilgileri de dahil olmak üzere TLS parmak izlemesine özel olarak atıfta bulunur.
Bu durum, basit veri kazıma kurulumları için önemli bir sorun yaratır.
HTTP başlıklarınız şunu iddia edebilir:
Windows'ta Chrome
ancak altta yatan ağ bağlantısı, kullandığınızı iddia ettiğiniz Chrome sürümüne hiç benzemiyor olabilir.
Bir HTTP başlığını değiştirmek, altındaki TLS yığınını otomatik olarak değiştirmez.
Bu, yalnızca HTTP tabanlı sahteciliğin sonunda bir sınıra ulaşmasının nedenlerinden biridir.
4. Tarayıcı Parmak İzi Analizi
JavaScript çalıştırılabilir hale geldiğinde, bot önleme sistemi çok daha zengin bir ortama erişebilir.
Gerçek bir tarayıcı, kendisi ve onu çalıştıran cihaz hakkında büyük miktarda bilgi açığa çıkarır.
Olası sinyaller arasında şunlarla ilgili özellikler yer alır:
- tarayıcı sürümü;
- işletim sistemi;
- donanım;
- CPU;
- bellek;
- grafik ortamı;
- desteklenen tarayıcı API'leri;
- görüntüleme davranışı;
- özellik desteği;
- otomasyon kalıntıları.
Otomasyon için zor olan kısım, tek bir inandırıcı değer üretmek değildir.
Asıl zorluk, birbiriyle tutarlı yüzlerce değer üretmektir.
Otomatikleştirilmiş bir tarayıcının, bir işletim sistemi üzerinde çalıştığını iddia etmesine rağmen, ortamının diğer kısımlarının başka bir işletim sistemi gibi davrandığını varsayalım.
Ya da bildirilen donanım özellikleri, iddia edilen cihaza uymuyor olabilir.
Ya da otomasyon, yaygın parmak izi özelliklerini değiştirirken ikincil sinyalleri değiştirmeden bırakabilir.
Beş bariz özelliği incelerseniz tarayıcı ikna edici görünebilir.
Bir algılama sistemi beş özellikle yetinmek zorunda değildir.
5. Başsız ve Otomatikleştirilmiş Tarayıcıları Algılama
Playwright, Puppeteer ve Selenium inanılmaz derecede kullanışlıdır.
Ayrıca görünmez de değildirler.
Chromium'u başlatmak, veri toplayıcınıza gerçek bir tarayıcı motoru sağlar; bu da temel bir HTTP istemcisinin çözemediği birçok sorunu çözer:
- JavaScript yürütme;
- görüntüleme;
- çerezler;
- tarayıcı API'leri;
- dinamik içerik;
- gezinme durumu.
Ancak “gerçek tarayıcı motoru”, “normal bir kullanıcıdan ayırt edilemez” anlamına gelmez.
Otomasyon çerçeveleri, gözle görülür farklılıklar yaratabilir.
DataDome’un kendi algılama belgeleri, Puppeteer, Selenium ve Playwright tarafından çalıştırılan tarayıcılar da dahil olmak üzere, otomatik ve başsız tarayıcılar için algılama kategorilerini açıkça içerir.
Bu da şu basit mimarinin:
Playwright + proxy
evrensel bir bot önleme çözümü olarak değerlendirilmemesi gerektiği anlamına gelir.
Bir web sitesinde mükemmel şekilde çalışırken, başka bir web sitesinde hızla başarısız olabilir.
6. JavaScript ve Cihaz Kontrolü
DataDome, istemciden ek doğrulama da talep edebilir.
Bunun bir mekanizması Cihaz Kontrolü'dür.
Görünür bir CAPTCHA'yı hemen göstermek yerine, JavaScript tarayıcıda çalışır ve ortamı değerlendirir.
DataDome’a göre, Cihaz Kontrolü yüzlerce sinyali toplar ve otomasyon çerçevelerini, sahte ortamları ve programlı erişimi tespit etmeyi amaçlayan çok sayıda kontrol gerçekleştirir.
Gerçek bir ziyaretçi için bu işlem, herhangi bir belirgin kesintiye neden olmadan gerçekleşebilir.
Bir veri kazıyıcı için ise bu, aşağıdakiler arasında önemli bir fark yaratır:
HTTP istemcisi
ve:
beklenen istemci tarafı mantığını çalıştırabilen tarayıcı
Veri kazıyıcınız yalnızca ilk HTML kodunu indirip tarayıcıda gerçekleşen her şeyi göz ardı ediyorsa, korunan sitenin beklediği tam etkileşimi asla yeniden üretemeyebilir.
7. Davranış Tespiti
Teknik açıdan ikna edici bir tarayıcı bile yine de tuhaf davranışlar sergileyebilir.
İki oturumu ele alalım.
Oturum A
Bir kullanıcı:
- bir ürün sayfasını açar;
- 14 saniye boyunca okur;
- başka bir sayfa açar;
- sayfayı aşağı kaydırır;
- geri döner;
- arama yapar;
- bir sonucu açar.
Oturum B
Bir tarayıcı:
- ürün 1’i ister;
- 300 ms sonra ürün 2’yi ister;
- 300 ms sonra ürün 3’ü ister;
- bunu yüzlerce kez tekrarlar.
Her iki oturumda da Chrome kullanılabilir.
Her ikisi de ev tipi IP adresleri kullanabilir.
Davranışları açıkça farklıdır.
Davranışsal algılama, bir bot önleme sisteminin tek tek istekler yerine kalıpları dikkate almasını sağlar.
Bu, özellikle büyük ölçekte önemlidir.
Bir kez başarılı olan bir veri toplayıcı, mutlaka 100.000 isteği sürdürebilecek bir veri toplayıcı değildir.
8. Oturum Tutarlılığı
Modern web siteleri durum bilgisine sahiptir.
Çerezler, tarayıcı durumu, IP adresleri ve istek geçmişi, bir oturumun parçalarını oluşturur.
Bu unsurlar birbiriyle çeliştiğinde, otomasyonun tespit edilmesi daha kolay hale gelir.
Örneğin:
- aynı oturum çerezi kalırken IP sürekli değişir;
- bir oturumun ortasında tarayıcı kimliği değişir;
- gezinme aniden alakasız kaynaklara atlar;
- önceki bir adımdan beklenen çerezler hiç görünmez;
- her istek yepyeni bir ziyaretçi gibi davranır.
Bu nedenle, her istek için körü körüne IP adresi değiştirmek, bazen bir veri toplayıcının inandırıcılığını artırmak yerine azaltabilir.
IP adresi rotasyonu yararlıdır.
Süreklilik de yararlıdır.
Doğru seçim, iş yüküne bağlıdır.
Bir DataDome Engellemesi Nasıl Görünür?
DataDome, her şüpheli isteğe aynı şekilde yanıt vermek zorunda değildir.
Karşılaşabileceğiniz birkaç farklı sonuç vardır.
403 yanıtı
En net işaret, HTTP “403 Forbidden” yanıtıdır.
Ancak internetteki her 403 yanıtının DataDome'dan geldiğini varsaymayın.
Her zaman gerçek yanıtı inceleyin.
CAPTCHA sayfası
Yanıt, hedef sayfa yerine bir DataDome doğrulama sorusu içerebilir.
Cihaz Kontrolü
Tarayıcı, erişim devam etmeden önce görünmez bir doğrulama işlemi gerçekleştirebilir.
Bu durum, hata ayıklama sırasında özellikle kafa karıştırıcı olabilir; çünkü sayfa, CAPTCHA'yı hiç görmeden normal tarayıcınızda sonunda çalışabilir.
Engelleme sayfası
Yeterince şüpheli görülen trafik, doğrudan bir engelleme yanıtı alabilir.
Chrome ve kazıyıcınızda farklı davranış
Bu, sorunun URL'nin kendisinde olmadığına dair en güçlü ipuçlarından biridir.
Eğer:
Chrome → içerik
ancak:
istekler/cURL/özel komut dosyası → doğrulama
ise, fark muhtemelen istemci, ağ kimliği, tarayıcı çalışması veya oturumda bir yerdedir.
IP Adresini Değiştirmek Neden Yeterli Değil?
Bir proxy, isteğin önemli bir kısmını değiştirir:
trafik nereden geliyormuş gibi göründüğü.
Bu çok değerlidir.
Ancak aşağıdakileri otomatik olarak değiştirmez:
- HTTP uygulamanız;
- TLS parmak izi;
- tarayıcı ortamı;
- JavaScript yürütme;
- tarayıcı parmak izi;
- çerezler;
- istek zamanlaması;
- gezinme davranışı;
- oturum mantığı.
Tüm yığını düşünün:
**IP
- TLS
- HTTP
- tarayıcı
- cihaz
- oturum
- davranış**
Bir proxy öncelikle ilk katmanı değiştirir.
Bir isteğin başarısız olmasının nedeni IP itibarındaysa bu yeterli olabilir.
Ancak birkaç katman arasında uyumsuzluk varsa bu yeterli olmaz.
DataDome ile Veri Merkezi ve Ev Tipi Proxy'ler
Evrensel bir "DataDome proxy'si" yoktur.
Farklı proxy türleri, farklı ağ sorunlarını çözer.
Veri merkezi proxy'leri
Veri merkezi IP'leri hızlı, ucuz ve birçok otomasyon iş yükü için son derece kullanışlıdır.
Yoğun şekilde korunan tüketici web sitelerinde dezavantajları, ağ kaynaklarının barındırma altyapısı olarak sınıflandırılmasının daha kolay olmasıdır.
Bu, her veri merkezi isteğinin engellendiği anlamına gelmez.
Bu, IP adresinin kendisinin, istemcinin sıradan bir tüketiciye benzediğine dair daha az kanıt sunabileceği anlamına gelir.
Ev proxy'leri
Ev proxy'leri, istekleri tüketici internet bağlantıları ile ilişkili IP adresleri üzerinden yönlendirir.
Bu, halka açık tüketici web sitelerini içeren iş yükleri için daha uygun bir ağ profili sağlayabilir.
Ancak konut IP'si, insanla eşdeğer değildir.
DataDome, konut proxy'leri üzerinden yönlendirilen otomatik trafiği tanımlayabilen modelleri açıkça belgelemektedir.
Bu nedenle, konut proxy'leri hakkında düşünmenin yararlı bir yolu şudur:
daha iyi ağ kimliği
şu şekilde değil:
otomatik bot koruması atlatma
İSS proxy'leri
İSS proxy'leri, tüketici İSS'leriyle ilişkili IP alanını kullanarak istikrarlı oturumlar sunabilir.
Daha uzun bir oturum boyunca tutarlı bir kimlik gerektiren iş akışları için bu istikrar değerli olabilir.
Yine de, istemcinin geri kalanı hâlâ önemlidir.
Sürekli Proxy Değişiminin Neden Ters Etki Yapabileceği
"Daha sık değiştirin" kulağa bariz bir tavsiye gibi gelir.
Ancak bu her zaman doğru değildir.
Beş dakika süren bir web sitesi oturumu düşünün.
Gerçek bir kullanıcı normalde bu oturumun büyük bir kısmında aynı ağ kimliğini korur.
Otomasyonunuz, aynı çerezleri ve hesap oturumunu korurken her üç istekte bir ülke veya ağ değiştiriyorsa, bu kombinasyon doğal olmayabilir.
Bazı iş yükleri için oturum rotasyonu uygundur.
Diğerleri için ise sabit oturumlar daha tutarlı bir davranış sağlar.
Bir proxy stratejisi, eriştiğiniz uygulamanın yapısına uygun olmalıdır.
Peki ya CAPTCHA Çözücüler?
CAPTCHA, DataDome’un karar sürecinin mutlaka başlangıcı değildir.
Bu, başka bir algılama mekanizmasının oturumu zaten şüpheli olarak işaretlemesinin ardından gelen bir tepki olabilir.
Bu ayrım önemlidir.
Bir CAPTCHA’yı çözmek, aşağıdakileri otomatik olarak düzeltmez:
- şüpheli bir tarayıcı parmak izi;
- tutarsız bir TLS yığını;
- kötü IP itibarı;
- imkansız oturum davranışı.
DataDome, bir test çözüldükten sonra bile CAPTCHA çiftliklerini ve otomatikleştirilmiş ortamları tespit etmeyi kamuoyuna açık bir şekilde tartışmıştır.
Dolayısıyla, CAPTCHA'yı çözmeyi tek sorun olarak ele almak, etrafındaki daha geniş sistemi gözden kaçırmak anlamına gelir.
Bir Veri Toplayıcı Neden Bugün Çalışırken Yarın Başarısız Olabilir?
Bu da sıkça görülen bir başka kafa karışıklığı kaynağıdır.
Kodunuzda hiçbir değişiklik olmaz.
Aniden başarı oranı düşer.
Bu, hedefin web sitesini yeniden tasarladığı anlamına gelmez.
Bot yönetim sistemleri, algılama mantığını sürekli olarak değiştirir.
Diğer değişkenler de değişir:
- IP itibar durumu değişir;
- tarayıcı sürümleri güncellenir;
- web sitesi politikaları değişir;
- trafik hacmi artar;
- istek düzeniniz değişir;
- hedef, belirli bir uç nokta için daha sıkı koruma sağlar.
Bu nedenle, modern anti-bot sistemlerine karşı veri kazıma, tek seferlik bir yapılandırma sorunu değil, operasyonel bir sorundur.
DataDome ve Playwright
Playwright, bir web sitesinin gerçek bir tarayıcıda çalıştırılmasını gerektirdiği durumlarda kullanışlıdır.
JavaScript yükleyebilir, sayfalarla etkileşime girebilir ve tarayıcı durumunu koruyabilir.
Bu da onu, modern web siteleri için basit bir HTTP istek kütüphanesinden çok daha yetenekli kılar.
Ancak Playwright, trafiği otomatik olarak “insan gibi” hale getirmez.
Korunan site yine de şunları değerlendirebilir:
- tarayıcı özellikleri;
- otomasyon izleri;
- ağ kimliği;
- oturumlar;
- istek sıklığı;
- davranış.
Bu nedenle bir Playwright kazıyıcı, geliştirme aşamasında başarılı olsa da büyük ölçekte güvenilmez hale gelebilir.
Tarayıcı otomasyonu, tarayıcıda çalıştırma sorununu çözer.
Tarayıcı etrafındaki her bot önleme katmanını çözmez.
DataDome ve Puppeteer
Aynı ilke Puppeteer için de geçerlidir.
Chromium kullanmak, tarayıcıya ham HTTP’den çok daha zengin bir istemci ortamı sağlar.
Bu, aşağıdakiler için yararlıdır:
- istemci tarafında işlenen uygulamalar;
- dinamik sayfalar;
- JavaScript navigasyonu;
- ilk HTML'den sonra yüklenen içerik;
- çerezler veya tarayıcı durumu gerektiren uygulamalar.
Ancak tarayıcı, IP ve davranışın yine de tutarlı bir oturum oluşturması gerekir.
Puppeteer, bir tarayıcı otomasyon çerçevesidir.
Görünmezlik katmanı değildir.
Gerçekten Önemli Olan Veri Toplama Yığını
Şu soruyu sormak yerine:
"Hangi proxy DataDome'u atlatır?"
katmanlar halinde düşünmek daha yararlıdır.
| Sorun | İlgili katman |
|---|
| Kötü IP itibarı | Proxy/ağ |
| Yanlış konum | Coğrafi hedeflemeli proxy |
| JavaScript gerekliliği | Tarayıcı/görüntüleme |
| Dinamik içerik | Tarayıcı/görüntüleme |
| TLS tutarsızlığı | HTTP/tarayıcı yığını |
| Tarayıcı parmak izi uyuşmazlığı | Tarayıcı ortamı |
| Oturum kararsızlığı | Çerez/oturum yönetimi |
| Aşırı istek modeli | Tarama mimarisi |
| CAPTCHA/doğrulama | Doğrulama işleme |
| Sürekli bot önleme bakımı | Yönetilen veri toplama altyapısı |
Bu, sorun giderme sürecini çok daha hızlı hale getirir.
Artık her sorunu proxy'yi değiştirerek çözmeye çalışmazsınız.
DataDome ile Korunan Bir Siteden Veri Toplamanın Üç Yolu
Hedefe erişiminizin izin verildiği meşru veri toplama işlemleri için genel olarak üç mimari bulunmaktadır.
1. Veri toplayıcıyı kendiniz oluşturun
Her şeyi siz kontrol edersiniz:
- HTTP istemcisi;
- tarayıcı;
- proxy;
- oturum;
- yeniden deneme mantığı;
- ayrıştırma;
- görüntüleme;
- izleme.
Avantajlar:
Maksimum kontrol.
Dezavantajlar:
Maksimum bakım.
Bu, iş akışınız tüm yığını kendiniz yönetmeyi haklı çıkaracak kadar sıra dışı olduğunda mantıklıdır.
2. Kendi tarayıcınız veya kazıyıcınızla proxy'ler kullanın
Mimari:
kazıyıcınız → proxy ağı → hedef
Bu, ağ altyapısını dış kaynaklara devrederken uygulamanın kontrolünü elinizde tutmanızı sağlar.
Aşağıdaki sorunlarla karşı karşıya olduğunuzda faydalıdır:
- IP itibarı;
- coğrafi hedefleme;
- eşzamanlılık;
- ağ rotasyonu;
- kararlı oturumlar.
Örneğin, Geonode Residential Proxies, coğrafi hedeflemeyi ve hem dönen hem de sabit oturum yapılandırmalarını destekler.
Ancak, proxy katmanının üzerindeki her şeyden uygulamanız sorumlu olmaya devam eder.
3. Bir Veri Toplama API'si kullanın
Mimari:
uygulamanız → veri toplama API'si → hedef
Tarayıcıları, proxy seçimini ve veri çıkarma altyapısını kendiniz yönetmek yerine, URL'yi web verisi toplama için tasarlanmış bir hizmete gönderirsiniz.
Bu, gerçek gereksinim şu olduğunda genellikle daha uygun bir seçenektir:
"Bana sayfa içeriğini ver."
şu yerine:
"Bir anti-bot/tarayıcı altyapı ekibi yönetmek istiyorum."
Örneğin, Geonode'un Scraper API hizmeti, işlenmiş sayfa içeriğini HTML veya Markdown olarak döndürebilir ve JavaScript işleme, yönetilen proxy altyapısı, coğrafi hedefleme, toplu işleme ve tarama özellikleri sunar.
Buradaki önemli ayrım, karmaşıklığın kime ait olduğudur.
Proxy'lerde:
yığın üzerinde kontrol sizdedir.
Veri toplama API'sinde:
yığının daha büyük bir kısmını veri toplama platformu yönetir.
Hiçbir model evrensel olarak daha iyi değildir.
Her ikisi de farklı mühendislik sorunlarını çözer.
Proxy, Tarayıcı ve Veri Toplama API’si Karşılaştırması
| Çözüm | IP adresini değiştirir | JS çalıştırır | Tarayıcıyı yönetir | Veri çıkarma işlemini gerçekleştirir | Bakım gerektirir |
|---|
| Yalnızca proxy | Evet | Hayır | Hayır | Hayır | Yüksek |
| Playwright + proxy | Evet | Evet | Siz | Siz | Yüksek |
| Puppeteer + proxy | Evet | Evet | Siz | Siz | Yüksek |
| Veri Toplama API'si | Yönetilir | Evet, destekleniyorsa | Yönetilir | Yönetilir | Daha düşük |
İşte bu yüzden birine "sadece ev tipi proxy'leri kullan" demek eksik bir tavsiyedir.
Bazen tam da buna ihtiyaçları vardır.
Bazen proxy, çok daha büyük bir sorunun sadece bir parçasıdır.
DataDome Engellemelerinin Sorun Giderilmesi
İstekler başarısız olmaya başladığında, on şeyi aynı anda değiştirmeyin.
Katmanı teşhis edin.
Sorun: Tarayıcıda çalışıyor, komut dosyasında hata veriyor
İncelenmesi gereken olası alanlar:
- JavaScript yürütme;
- HTTP/TLS istemci farklılıkları;
- tarayıcı parmak izi;
- çerezler;
- oturum durumu.
Hata istemciden kaynaklanıyorsa, IP adresini değiştirmek bir etki yaratmayabilir.
Sorun: Başlangıçta çalışıyor, sonra engelleniyor
Şunlara bakın:
- istek sıklığı;
- tekrarlanan gezinme kalıpları;
- IP/oturum rotasyonu;
- artan IP itibar sorunları;
- oturum tutarlılığı.
İlk istek ile bininci istek aynı değildir.
Sorun: Veri merkezi IP'si başarısız oluyor, ev IP'si çalışıyor
Ağ itibarı muhtemelen kararın önemli bir parçasıdır.
Bu, diğer sinyallerin göz ardı edildiğini kanıtlamaz.
Sorun: Ev proxy'si de başarısız oluyor
Hemen ev proxy'sinin kötü olduğu sonucuna varmayın.
Şunları araştırın:
- tarayıcı/istemci parmak izi;
- TLS özellikleri;
- JavaScript gereksinimleri;
- çerezler;
- istek kalıpları;
- oturum tasarımı.
Sorun: CAPTCHA tekrar tekrar görünüyor
Bir CAPTCHA döngüsü, genel oturumun hâlâ şüpheli göründüğünü gösterebilir.
Bu sorunu bir semptom olarak değerlendirin, mutlaka temel neden olarak görmeyin.
Sorun: Farklı ülkelerde farklı sonuçlar ortaya çıkıyor
Şunları kontrol edin:
- sitenin coğrafi konuma göre farklı davranıp davranmadığını;
- içerik erişilebilirliğinin değişip değişmediğini;
- çerez durumunun tutarlı kalıp kalmadığını;
- IP coğrafi konumunun amaçlanan oturumla eşleşip eşleşmediğini.
DataDome, Ev Tipi Proxy’leri Algılar mı?
Algılayabilir.
Bu durum, DataDome’un algılama belgelerinde açıkça belirtilmiştir.
Ancak bu, her ev tipi proxy isteğinin engellendiği anlamına gelmez.
Eğer öyle olsaydı, paylaşımlı tüketici ağlarının ardındaki meşru kullanıcılar, çok büyük sayıda yanlış pozitif sorunlara yol açardı.
Daha doğru ifade şudur:
Bir ev tipi IP adresi, bir işarettir; insan ziyaretçinin kanıtı değildir.
Modern algılama sistemleri bunu diğer kanıtlarla birleştirir.
DataDome, Playwright'ı algılar mı?
DataDome, Playwright, Puppeteer ve Selenium gibi otomasyon çerçeveleri aracılığıyla donatılmış tarayıcıları kapsayan algılama modellerini belgelemektedir.
Bu, her Playwright oturumunun otomatik olarak engellendiği anlamına gelmez.
Bu, şu varsayımın:
"Playwright gerçek bir tarayıcı kullanır, bu nedenle algılanamaz"
yanlış olduğu anlamına gelir.
DataDome, Tarayıcı Parmak İzi Teknolojisini Kullanır mı?
Evet.
Tarayıcı ve cihaz parmak izi teknolojisi, DataDome’un tespit mimarisinin bir parçasını oluşturur.
Bu, sistemin User-Agent başlığı gibi basit tanımlayıcılara güvenmek yerine, tarayıcı ve yürütme ortamı tarafından ortaya konan bilgileri karşılaştırmasına olanak tanır.
DataDome, TLS Parmak İzi Teknolojisini Kullanıyor mu?
DataDome belgeleri, TLS parmak izlerine atıfta bulunur ve koruma API entegrasyonları için kullanılabilir sinyaller olarak JA3 ve JA4 parmak izlerini önerir.
Bu önemlidir, çünkü TLS bağlantısı, sıradan web uygulaması mantığı isteği görmeden önce kurulur.
Bu nedenle, bir veri toplayıcı HTTP başlıklarını mükemmel bir şekilde düzenlemiş olsa bile, yine de farklı bir alt düzey ağ parmak izi ortaya çıkarabilir.
DataDome Makine Öğrenimini Kullanıyor mu?
DataDome, tehdit algılama modellerini makine öğrenimi tabanlı ve sürekli güncellenen modeller olarak tanımlamaktadır.
Makine öğrenimi sihir değildir.
Buradaki pratik değeri, aşağıdakiler gibi tek bir statik kurala güvenmek yerine birçok sinyali ve kalıbı birleştirme yeteneğidir:
100 istekten sonra IP'yi engelle.
DataDome, AI Ajanlarını Engelleyebilir mi?
Evet.
Bot yönetimi pazarı, geleneksel kazıyıcıların ötesine geçerek AI ajanları ve LLM tarayıcılarına doğru giderek genişlemektedir.
DataDome artık ticari botları ve AI ajanlarını tanımlamayı ve kimlik doğrulamasını açıkça desteklerken, kimlik doğrulaması yapılmamış otomatik trafik ise tehdit algılama politikalarına tabi tutulabilir.
Daha fazla AI sistemi web sitelerini doğrudan tarayıp etkileşime girdikçe, bu durumun önemi giderek artacaktır.
DataDome’u Atlatabilir misiniz?
Bu genellikle yanlış bir mühendislik sorusudur.
Modern bir algılama sistemini ortadan kaldıracak kalıcı bir başlık, proxy türü veya tarayıcı bayrağı yoktur.
Belirli bir trafik hacminde bir uç noktada işe yarayan bir yapılandırma şu durumlarda başarısız olabilir:
- başka bir uç noktada;
- daha büyük ölçekte;
- başka bir tarayıcı sürümünde;
- algılama modelleri değiştiğinde.
Meşru web veri iş yükleri için daha sürdürülebilir soru şudur:
Scraping yığınımın hangi kısmı, isteğin otomasyon olarak sınıflandırılmasına neden oluyor ve bu katmanı kendim yönetmek istiyor muyum?
Bazen cevap ağ altyapısıdır.
Uygun bir proxy kurulumu kullanın.
Bazen cevap, sayfa görüntüleme sürecidir.
Bir tarayıcı kullanın.
Bazen cevap, tüm operasyonel yığınıdır.
Yönetilen bir veri toplama API'si kullanın.
Ve bazen doğru cevap, bunun yerine resmi bir API veya başka bir yetkili veri kaynağı kullanmaktır.
DataDome ve Cloudflare Karşılaştırması
DataDome ve Cloudflare, bot yönetimi pazarının bazı kısımlarında örtüşse de, bu iki ürün birbirinin aynısı olarak değerlendirilmemelidir.
Cloudflare, CDN, DNS, WAF, DDoS önleme ve bot yönetimi özelliklerini içeren geniş kapsamlı bir altyapı platformu sunar.
DataDome ise daha spesifik olarak web siteleri, mobil uygulamalar ve API’ler genelinde bot ve çevrimiçi dolandırıcılık tespitine odaklanmaktadır.
Ancak, veri toplayıcı geliştiricisinin bakış açısından çıkarılacak ders benzerdir:
modern bot önleme koruması, birden fazla katmanda çalışır.
Etkili bir strateji, yalnızca tek bir HTTP başlığının değiştirilmesine dayanamaz.
DataDome ve CAPTCHA Karşılaştırması
DataDome bir CAPTCHA hizmeti değildir.
CAPTCHA, tespit edildikten sonra uygulanabilecek olası çözümlerden biridir.
Bir istemcinin şüpheli olup olmadığına karar veren asıl sistem, bundan önce devreye girer.
Bu ayrım önemlidir, çünkü geliştiriciler genellikle "CAPTCHA'yı çözmeye" çalışmak için büyük çaba harcarlar, ancak bu sorunun ortaya çıkmasına neden olan sinyalleri göz ardı ederler.
Asıl sorulması gereken soru şudur:
Bu oturum neden ilk etapta sorgulandı?
Konut Proxy'lerinin Kullanılmasının Uygun Olduğu Durumlar
Konut proxy'leri, ağ katmanının önemli olduğu durumlarda faydalıdır.
Buna örnek olarak aşağıdakileri içeren meşru iş yükleri verilebilir:
- coğrafi bölgeye özgü genel erişimli içerik;
- yerelleştirilmiş arama sonuçları;
- bölgesel fiyatlandırma;
- ürün bulunabilirliği;
- pazar araştırması;
- dağıtık web veri toplama.
Kendi veri toplama aracınız üzerinde tam kontrol sahibi olmak istediğinizde özellikle kullanışlıdırlar.
Geonode'ın Konut Proxy'leri, coğrafi hedefleme ve yapılandırılabilir oturum davranışı ile konut IP yönlendirmesi sağlar.
Ancak bir proxy, aslında ne ise o olarak kalmalıdır:
ağ altyapısı.
Bir tarayıcı değildir.
Bir CAPTCHA sistemi değildir.
Bir veri toplama motoru değildir.
Ve bozuk bir parmak izini otomatik olarak onarmaz.
Scraper API'su Ne Zaman Daha Mantıklıdır?
Scraper API'su, bot önleme çalışmaları geliştirme sürecini domine etmeye başladığında cazip hale gelir.
Ekibiniz aşağıdakilere, verilerin kendilerini kullanmaya ayırdığı zamandan daha fazla zaman harcıyorsa, en azından yönetilen bir API'yi düşünmelisiniz:
- tarayıcı güncellemeleri;
- yeniden deneme mantığı;
- proxy koordinasyonu;
- görüntüleme;
- veri çıkarma;
- oturum yönetimi;
- başarısız istekler;
Geonode Scraper API ile bir uygulama, URL'leri gönderebilir ve çıkarılmış HTML veya Markdown alabilir; bu sırada hizmet, isteğin arkasındaki görüntüleme ve proxy altyapısını yönetir.
Buradaki ödünleşim oldukça açıktır:
Kendi başınıza geliştirmek size daha fazla kontrol sağlar.
Bir API kullanmak ise altyapı işlerini ortadan kaldırır.
Ürününüzün gerçek ihtiyaçlarına göre seçim yapın.
SSS
DataDome nedir?
DataDome, web siteleri, mobil uygulamalar ve API’ler genelinde otomatik ve kötü niyetli trafiği tespit etmek üzere tasarlanmış bir bot ve çevrimiçi dolandırıcılık koruma platformudur.
DataDome botları nasıl tespit eder?
IP itibarı, HTTP ve tarayıcı parmak izleri, TLS özellikleri, cihaz bilgileri, davranış kalıpları ve makine öğrenimi tespit modelleri dahil olmak üzere birçok sinyali bir araya getirir.
DataDome neden benim veri toplayıcımı engelliyor?
Nadiren tek bir genel neden vardır. IP adresi, HTTP/TLS istemcisi, tarayıcı ortamı, JavaScript desteği, oturum tutarlılığı veya istek davranışı gibi faktörlerin hepsi bu duruma katkıda bulunabilir.
DataDome CAPTCHA kullanıyor mu?
Evet, CAPTCHA şüpheli trafiğe karşı alınabilecek önlemlerden biridir. DataDome ayrıca görünmez bir Cihaz Kontrolü gerçekleştirebilir veya istekleri doğrudan engelleyebilir.
DataDome Cihaz Kontrolü nedir?
Cihaz Kontrolü, görünür bir kullanıcı etkileşimi gerektirmeden istemci tarafında kontroller gerçekleştiren ek bir doğrulama mekanizmasıdır. Cihaz ve yürütme sinyallerini değerlendirir ve sonuca bağlı olarak istemciye izin verebilir, sorgulayabilir veya engelleyebilir.
User-Agent'ımı değiştirmek DataDome'u atlatır mı?
User-Agent'ı değiştirmek yalnızca bir HTTP değerini değiştirir. TLS bağlantısını, tarayıcı ortamını, cihaz parmak izini, çerezleri veya davranışı otomatik olarak değiştirmez.
DataDome, başsız Chrome'u algılayabilir mi?
DataDome, Puppeteer, Selenium ve Playwright aracılığıyla donatılmış tarayıcılar da dahil olmak üzere, başsız ve otomatik tarayıcılar için özel algılama kategorilerini belgelemektedir.
DataDome, Playwright’ı algılayabilir mi?
Playwright tabanlı ortamlar da dahil olmak üzere, tarayıcı otomasyonuyla ilişkili özellikleri tanımlayabilir. Playwright kullanımı, bir oturumun otomatik olarak engelleneceği anlamına gelmez, ancak bu tür oturumlar doğası gereği görünmez olarak değerlendirilmemelidir.
DataDome, Puppeteer'ı algılayabilir mi?
Evet, DataDome, Puppeteer tabanlı otomasyon ve Puppeteer Extra Stealth'i kapsayan algılama modellerini belgelemektedir.
DataDome, konut proxy'lerini algılayabilir mi?
DataDome, konut proxy'leri üzerinden yönlendirilen trafikle ilgili algılama modellerine sahiptir. Bir konut IP'si, ağ kimliğini değiştirdiği için yine de yararlı olabilir, ancak otomatik trafiği otomatik olarak meşru hale getirmez.
DataDome ile korunan siteler için konut proxy'leri, veri merkezi proxy'lerinden daha mı iyidir?
Konut proxy'leri, sıradan tüketici trafiğine daha yakın bir ağ kimliği sağlayabilir; bu da tüketicilere yönelik sitelerde yararlı olabilir. Doğru seçim yine de hedefe, iş yüküne ve diğer algılama katmanlarına bağlıdır.
DataDome ile korunan bir siteyi taramak için tarayıcıya ihtiyacım var mı?
Korunan her sayfa için tarayıcı gerekli değildir. Ancak, istemci tarafında işleme veya Device Check'e dayanan web siteleri, temel bir HTTP istemcisinin sağlayamayacağı gerçek JavaScript yürütme ve tarayıcı durumuna ihtiyaç duyabilir.
Neden DataDome'dan 403 hataları alıyorum?
403 hatası, isteğin şüpheli veya otomatik olarak sınıflandırıldığını gösterebilir. Anti-bot sisteminin sorumlu olduğunu varsaymadan önce, yanıtın gerçekten DataDome'dan geldiğini doğrulayın.
Sayfa manuel olarak çalışırken neden Python'da çalışmıyor?
Normal tarayıcınız ve Python HTTP kütüphanesi, ağ, TLS, HTTP, JavaScript ve tarayıcı ortamları açısından birbirinden çok farklı sonuçlar üretir. Bir bot önleme sistemi, bu farklılıkların bazılarını algılayabilir.
Kazıyıcım neden birkaç istek için çalışıyor, sonra duruyor?
Olası nedenler arasında davranışsal algılama, istek sıklığı kalıpları, IP itibarındaki değişiklikler veya tutarsız oturumlar sayılabilir. Bot önleme sistemleri, her isteği tek başına değerlendirmek yerine, birden fazla istek üzerindeki etkinliği bir bütün olarak değerlendirebilir.
Proxy rotasyonu, DataDome sorununu çözer mi?
Tek başına çözmez.
Rotasyon, ağ kimliğini değiştirir. Tarayıcı parmak izini, TLS istemcisini, JavaScript ortamını veya istek davranışını otomatik olarak değiştirmez.
Kazıma API'si, proxy'lerden daha mı iyidir?
Her ikisi de farklı sorunları çözer.
Kazıyıcınızı kontrol etmek istediğinizde ve öncelikle ağ altyapısına ihtiyacınız olduğunda proxy'leri kullanın.
Tarayıcı, proxy, görüntüleme ve veri çıkarma altyapısının daha fazla kısmının sizin adınıza yönetilmesini istiyorsanız bir Kazıma API'si kullanın.
Sonuç
DataDome hakkında anlaşılması gereken en önemli nokta, tek bir “bot sinyali”nin olmadığıdır.
Modern bot algılama sistemleri, katmanlar arasında kapsamlı bir inceleme yapar.
Bir istek, sadece bir IP adresinden ibaret değildir.
Şunlardan oluşur:
bir IP
TLS bağlantısı kuran
HTTP başlıkları gönderen
bir tarayıcıdan veya uygulamadan
bir oturum içinde
geçmişi olan
ve belirli bir davranış kalıbına sahip.
Bu parçalar birbiriyle ne kadar uyumlu olursa, istemci o kadar tutarlı görünür.
Bu nedenle bir IP adresini değiştirmek bir sorunu çözebilir, ancak diğer beş sorunu çözmeden bırakabilir.
Bu nedenle Playwright, her algılama sorununu çözmeden JavaScript yürütme sorununu çözer.
Ve bu nedenle yönetilen veri toplama API'leri ilk etapta mevcuttur.
Tam kontrol gerekiyorsa, yığını kendiniz oluşturun ve ağ altyapısı olarak proxy'leri kullanın.
Tarayıcıları ve proxy koordinasyonunu yönetmeden esas olarak güvenilir web içeriğine ihtiyacınız varsa, bir veri toplama API'si kullanın.
Önemli olan, aslında hangi katmanı düzeltmeye çalıştığınızı bilmektir.