← Tüm rehberler

Rehberler

Yapay zekâ botları: hangisi gerçek, hangisi taklit ve her tarayıcı ne iş yapar

Yayın tarihi 7 Eki 2026

Kısaca

Kullanıcı aracısı (user agent) hiçbir şey kanıtlamaz; "GPTBot" yazmak herkesin elinde. Bir istek, IP adresi işletenin yayımladığı listenin içindeyse gerçekten OpenAI'dan, Anthropic'ten, Perplexity'den ya da Common Crawl'dan gelmiştir; Google, Bing ve Apple da liste yayımlıyor ve ayrıca ters DNS kontrolünü belgeliyor, Meta ve ByteDance ise yapay zekâ tarayıcıları için şu anda ikisini de belgelemiyor. Kendi sitemizde IP kontrolünden geçemeyen 16 GPTBot isteğinin hepsi kendi izleme aracımızdı; geriye kalan 52 istekte hata sıfırdı.

Bir tarayıcıyı doğrulamanın iki yolu ve hangi sağlayıcının hangisini sunduğu

User-agent başlığı, istemcinin kendisi hakkında söylediği bir iddiadır. Uptime izleme araçları, SEO araçları ve kazıyıcılar işlerine geldiğinde "GPTBot" ya da "PerplexityBot" diye gelir; yani user-agent saymak iddia saymaktır. Sağlayıcılar bu iddiayı istemcinin taklit edemeyeceği bir şeyle karşılaştırmanız için iki yol sunuyor.

  • IP listesi: işleten, tarayıcısının kullandığı adres aralıklarını bir JSON dosyası olarak yayımlar. İsteğin kaynak IP'sinin bu aralıklardan birine düşüp düşmediğine bakarsınız. OpenAI, Anthropic, Perplexity, Google, Microsoft (Bing), Apple ve Common Crawl böyle bir liste yayımlıyor. Dosyayı düzenli olarak yeniden çekin: Microsoft listesini her gün yenilemenizi istiyor, çünkü listeyi her an değiştirebiliyor.
  • Önce ters DNS, sonra ileri DNS: isteğin IP'si için ana makine adını sorgulayın, adın işletenin alan adıyla bittiğini kontrol edin, sonra o adı çözümleyip aynı IP'ye döndüğünü doğrulayın. İkinci adım şart, çünkü herkes kendi adresi için bir ters kayıt tanımlayabilir. Google, Microsoft, Apple ve Common Crawl bu yöntemi belgeliyor.
  • Hiçbiri: Meta'nın tarayıcı sayfası, 7 Ekim 2026'da okunduğu hâliyle, tarayıcılarının IP adreslerini izin listesine eklemenizi söylüyor ama ne bir liste ne de bir DNS yöntemi veriyor. ByteDance'in Bytespider'ı belgeleyen bir sayfasını ise hiç bulamadık.
  • robots.txt'deki her ad bir tarayıcı değildir. Google-Extended ve Applebot-Extended yalnızca robots.txt belirtecidir: loglarınızda hiçbir zaman user agent olarak görünmezler; Googlebot'un ya da Applebot'un çektiği içeriğin nasıl kullanılabileceğini yönetirler.

Hangi belirtece izin verip hangisini engelleyeceğiniz için robots.txt ve CDN denetimi rehberine bakın. Bu rehber onun arkasındaki başvuru tablosu.

OpenAI: GPTBot, OAI-SearchBot, ChatGPT-User

  • GPTBot. Amaç: eğitim; OpenAI bunu üretken yapay zekâ temel modellerini daha yararlı ve güvenli kılmak için kullanıyor. robots.txt belirteci: GPTBot; engellemek, OpenAI'a sitenin içeriğinin bu modellerin eğitiminde kullanılmaması gerektiğini bildirir. IP listesi: openai.com/gptbot.json. Doğrulama: IP listesi.
  • OAI-SearchBot. Amaç: arama dizini; web sitelerini ChatGPT'nin arama özelliklerinde öne çıkarır. robots.txt belirteci: OAI-SearchBot; OpenAI, bu tarayıcıyı engelleyen sitelerin ChatGPT arama cevaplarında gösterilmediğini ve bir robots.txt değişikliğinin sistemlerine ulaşmasının yaklaşık 24 saat sürdüğünü söylüyor. IP listesi: openai.com/searchbot.json. Doğrulama: IP listesi.
  • ChatGPT-User. Amaç: kullanıcının tetiklediği çekim; ChatGPT ve Custom GPT'lerdeki bazı kullanıcı eylemleri için. OpenAI, web'i otomatik olarak taramadığını söylüyor. robots.txt: OpenAI'a göre eylemi bir kullanıcı başlattığı için robots.txt kuralları uygulanmayabilir. IP listesi: openai.com/chatgpt-user.json. Doğrulama: IP listesi.
  • OAI-AdsBot. Amaç: ChatGPT'de reklam olarak gönderilen web sayfalarının güvenliğini kontrol etmek. IP listesi: openai.com/adsbot.json. Sayfa, robots.txt'ye nasıl davrandığını söylemiyor.
  • OpenAI, her robots.txt ayarının diğerlerinden bağımsız olduğunu belirtiyor: OAI-SearchBot'a izin verip GPTBot'u engelleyebilirsiniz.

Anthropic: ClaudeBot, Claude-SearchBot, Claude-User

  • ClaudeBot. Amaç: eğitim; Anthropic'in modellerinin eğitimine katkı sağlayabilecek web içeriğini toplar. robots.txt belirteci: ClaudeBot; engellemek, sitenin gelecekteki içeriğinin eğitim verisinden çıkarılması gerektiğini bildirir.
  • Claude-SearchBot. Amaç: arama dizini; Anthropic, Claude kullanıcılarına sunulan arama sonuçlarının kalitesini artırmak için web'de dolaştığını söylüyor. robots.txt belirteci: Claude-SearchBot.
  • Claude-User. Amaç: kullanıcının tetiklediği çekim; biri Claude'a bir soru sorduğunda Claude web sitelerine bu ajanla erişebilir. robots.txt belirteci: Claude-User; Anthropic, bunu kapatmanın sisteminin bir kullanıcı sorusuna cevap olarak içeriğinizi getirmesini engellediğini söylüyor.
  • robots.txt, üçü için de: Anthropic, botlarının robots.txt yönergelerine uyduğunu söylüyor ve standart dışı Crawl-delay uzantısını destekliyor. OpenAI ve Perplexity'nin aksine, kullanıcının tetiklediği ajan için bir istisna tanımıyor.
  • IP listesi, üçü için de: ortak tek bir dosya, claude.com/crawling/bots.json. Anthropic'e göre kaynak IP bu listedeyse tarayıcı Anthropic'ten geliyordur. Dosya, hangi aralığı üç bottan hangisinin kullandığını söylemiyor. Doğrulama: IP listesi. Anthropic ayrıca IP adreslerini engellemenin güvenilir bir ret yolu olmadığını, robots.txt kullanmak gerektiğini belirtiyor.

Perplexity: PerplexityBot, Perplexity-User

  • PerplexityBot. Amaç: arama dizini; web sitelerini Perplexity'nin arama sonuçlarında öne çıkarır ve bağlantılar. Perplexity, yapay zekâ temel modelleri için içerik taramakta kullanılmadığını söylüyor. robots.txt belirteci: PerplexityBot. IP listesi: perplexity.com/perplexitybot.json. Doğrulama: IP listesi.
  • Perplexity-User. Amaç: kullanıcının tetiklediği çekim; Perplexity içindeki kullanıcı eylemlerini destekler, web taramasında ya da eğitimde kullanılmaz. robots.txt: Perplexity, çekimi bir kullanıcı istediği için bu ajanın robots.txt kurallarını genellikle yok saydığını söylüyor. IP listesi: perplexity.com/perplexity-user.json. Doğrulama: IP listesi.

Google: Googlebot, Google-Extended ve AI Overviews

  • Googlebot. Amaç: arama dizini; bütün arama özellikleriyle birlikte Google Arama için. robots.txt belirteci: Googlebot. Google, ortak tarayıcılarının otomatik tarama yaparken robots.txt kurallarına her zaman uyduğunu söylüyor. Doğrulama: googlebot.com, google.com ya da googleusercontent.com'a çıkan ters DNS ve onu tutan bir ileri sorgu ya da developers.google.com/static/crawling/ipranges/common-crawlers.json IP listesi.
  • AI Overviews ve AI Mode'un kendine ait bir tarayıcısı yok. Google'ın yapay zekâ özellikleri sayfası, bir sayfanın dizine eklenmiş ve Google Arama'da snippet ile gösterilmeye uygun olması gerektiğini ve başka bir teknik koşul olmadığını söylüyor. Google'ın bu özelliklerde neyin gösterileceğini sınırlamak için işaret ettiği kontroller sıradan Arama kontrolleri: nosnippet, data-nosnippet, max-snippet ve noindex.
  • Google-Extended. Tarayıcı değil: Google, ayrı bir HTTP user agent'ı olmadığını söylüyor; yani loglarınızda hiç görünmez. Google'ın taradığı içeriğin gelecekteki Gemini modellerinin (Gemini Apps, Vertex AI API for Gemini) eğitiminde ve Gemini Apps ile Vertex AI'daki Grounding with Google Search'te kullanılıp kullanılamayacağını yöneten bir robots.txt belirtecidir. Google, Google Arama'ya dahil olmayı etkilemediğini ve bir sıralama sinyali olmadığını söylüyor.
  • Google, özel tarayıcılar ve kullanıcının tetiklediği çekiciler için ayrı IP dosyaları da yayımlıyor; bunlar ortak tarayıcı dosyasıyla aynı klasörde. Kullanıcının tetiklediği bir çekiciden gelen istek, Google'dan gelse bile Googlebot değildir.

Microsoft: Bingbot ve Copilot

  • Bingbot. Amaç: arama dizini; Bing'in standart tarayıcısı. Microsoft, Copilot için ayrı bir tarayıcı listelemiyor: webmaster yönergeleri Bing ve Copilot arama deneyimlerinin aynı tarama, dizinleme ve sıralama temeline dayandığını söylüyor ve robots.txt'de Bingbot'u engellemeyi kaçınılacaklar arasında sayıyor. robots.txt belirteci: bingbot.
  • Copilot'u yönetmek bir robots.txt belirteciyle değil, sayfadaki meta yönergeleriyle yapılıyor. Microsoft'a göre NOARCHIVE içeriği Copilot yanıtlarının ve grounding sonuçlarının dışında tutar, NOCACHE ise Copilot'u URL, başlık ve snippet ile sınırlar.
  • Doğrulama: search.msn.com ile biten bir ada çıkan ters DNS ve aynı IP'ye dönen ileri sorgu; Microsoft'un Verify Bingbot aracı; ya da Microsoft'un her gün yenilemenizi istediği bing.com/toolbox/bingbot.json IP listesi.

Apple: Applebot ve Applebot-Extended

  • Applebot. Amaç: arama dizini; Apple, topladığı verinin Spotlight, Siri ve Safari'deki arama teknolojisi gibi özellikleri beslediğini ve üretken yapay zekâ özelliklerinin arkasındaki Apple temel modellerinin eğitimine de yardımcı olabileceğini söylüyor. robots.txt belirteci: Applebot; Apple, Applebot'a yönelik robots.txt yönergelerine uyduğunu, dosya Applebot'u değil de Googlebot'u anıyorsa Googlebot yönergelerini izlediğini ve crawl-delay'e uymadığını söylüyor. Doğrulama: applebot.apple.com altında ters DNS ve onu tutan ileri sorgu ya da search.developer.apple.com/applebot.json IP listesi.
  • Applebot-Extended. Tarayıcı değil: Apple, web sayfalarını taramadığını söylüyor. Applebot'un zaten çektiği içeriğin Apple'ın genel amaçlı temel modellerini eğitip eğitemeyeceğini belirleyen bir robots.txt belirtecidir. Onu engelleyen sayfalar arama sonuçlarında yer almaya devam edebilir.

Meta, ByteDance ve Common Crawl

  • Meta-ExternalAgent. İşleten: Meta. Amaç: eğitim ve dizinleme; Meta, temel yapay zekâ modellerini eğitmek ya da içeriği doğrudan dizinleyerek ürünleri geliştirmek gibi amaçlarla tarama yaptığını söylüyor. robots.txt belirteci: meta-externalagent. IP listesi: Meta'nın tarayıcı sayfasında, 7 Ekim 2026'da okunduğu hâliyle, yok.
  • Meta-ExternalFetcher. İşleten: Meta. Amaç: tek tek bağlantıların kullanıcının tetiklediği çekimi; yapay zekânın kullanıcılar adına görev tamamlamasına yardım etmek de buna dahil. robots.txt: Meta, çekimi bir kullanıcı istediği için robots.txt'yi atlayabileceğini söylüyor. IP listesi: aynı sayfada yayımlanmış bir liste yok.
  • Bytespider. İşleten: ByteDance. ByteDance'in amacını, robots.txt davranışını ya da adreslerini belgeleyen bir sayfasını bulamadık; dolayısıyla buraya yazılacak bir sağlayıcı beyanı yok. Hakkında dolaşan her şey üçüncü taraflardan geliyor.
  • CCBot. İşleten: web tarama verisinden oluşan açık bir arşiv üreten ve sürdüren kâr amacı gütmeyen Common Crawl. robots.txt belirteci: CCBot; Common Crawl onun için Disallow kullanımını belgeliyor. IP listesi: index.commoncrawl.org/ccbot.json. Doğrulama: IP listesi ya da ters DNS (IPv4 adresleri crawl.commoncrawl.org altında çözümlenir; Common Crawl'a göre IPv6 için henüz ters DNS yok).

Kendi logumuz ne gösterdi

Tek site, bizimki: promvia.app, 26 Ağustos – 5 Ekim 2026. User agent'ı GPTBot, OAI-SearchBot, ChatGPT-User ya da PerplexityBot olduğunu söyleyen her isteği işletenin yayımladığı IP listesiyle karşılaştırdık. Ham hata oranları olarak okununca sonuç bir taklitçi sorunu gibi görünüyor.

  • GPTBot: 68 istekten 16'sı doğrulamadan geçemedi (%24). 16'sının hepsi bizdik. Geri kalan: 52'de 0.
  • PerplexityBot: 34'te 9 (%26). 9'unun hepsi bizdik. Geri kalan: 25'te 0.
  • OAI-SearchBot: 390'da 7 (%1,8). 7'sinin hepsi bizdik. Geri kalan: 383'te 0.
  • ChatGPT-User: 610'da 17 (%2,8). 7'si bizdik; 603'te 10'unu (%1,7) açıklayamıyoruz.
  • Perplexity-User logda hiç görünmedi.

"Biz" dediğimiz, ana sayfamızı her tarayıcının user agent'ıyla birer kez isteyen Promvia'nın haftalık tarayıcı erişim kontrolü ve elle test için kullandığımız bir adres. Bot user agent'ı gönderen bir izleme ya da SEO aracı kullanıyorsanız, sahte botları saymadan önce onun isteklerini çıkarın.

Doğrulama, dizin tarayıcıları hakkında söyleyebileceklerimizi de değiştirdi. Yalnızca doğrulanmış isteklere bakınca, ChatGPT'nin API cevabının bir promvia.app URL'sini kaynak gösterdiği 129 durumun 116'sında OAI-SearchBot o sayfayı önceden çekmişti; Perplexity'de PerplexityBot 174 durumun 174'ünde önceden çekmişti. Soruların hepsi markamızın adını anıyor; bu bir kural değil, tek bir sitenin kaydı. Satırlar ve betikle birlikte eşleştirmenin tamamı sunucu loglarını yapay zekâ alıntılarıyla eşleştirdik rehberinde.

Promvia tarayıcıları nasıl doğruluyor ve nerede doğrulayamıyor

  • Aralıklar nereden geliyor: Promvia haftada bir, pazartesi, işletenlerin IP listelerini her işletenin kendi yayımladığı dosyayı kopyalayan açık kaynaklı bir derleme üzerinden çekiyor ve tarayıcı başına önbelleğe alıyor.
  • "Doğrulandı" ne demek: istek bize CDN log bağlayıcınızdan ya da belirteçle kimliği doğrulanmış uç yönlendiricinizden geldi VE kaynak IP'si, user agent'ın adını verdiği tarayıcı için önbellekteki bir aralığın içinde. Bu iki koşuldan yalnızca biri bir iddiadır; o zaman kayıt "Algılandı" olarak kalır.
  • "Algılandı"da kalanlar: Bingbot, Bytespider ve Meta'nın ajanları. Bing'in listesini henüz yüklemiyoruz; ByteDance ve Meta ise tarayıcı listesi yayımlamıyor. Anthropic'in ortak tek listesi üç ajanını da doğruluyor (ClaudeBot, Claude-SearchBot ve Claude-User), çünkü Anthropic onu üçü için yayımlıyor. Googlebot ise yapay zekâ tarayıcısı olarak hiç sayılmıyor.
  • Meta hiç doğrulanmıyor. Elde olan tek liste, Meta'nın yönlendirdiği her adresi kapsayan ağ listesi; bir eşleşme isteğin Meta'nın tarayıcısından değil, yalnızca Meta'nın ağından geldiğini gösterir. Başka bir şey anlatan bir "Doğrulandı" yerine "Algılandı" göstermeyi tercih ediyoruz.
  • Aralıklar işletenlerin listelerini iki yönde de izliyor. Bir tarayıcının listesi eksiksiz gelirse yenileme bizim kopyamızın yerine geçer; işletenin geri çektiği bir aralık artık doğrulamaz. Liste hata verirse ya da boş gelirse önceki kopyayı silmeden tutarız; gerçek tarayıcılar en kötü ihtimalle "Algılandı" görünür, asla yanlış bir "Doğrulandı" olmaz.

Bu tablonun kapsamadığı iki konu için iki rehber var: robots.txt'ye ne yazacağınız için robots.txt ve CDN denetimi, llms.txt'nin okunup okunmadığı için llms.txt hakkında dürüst rehber. robots.txt'de bütün tarayıcıları reddedip erişimi lisans anlaşmalarıyla veren bir site örneği için Reddit ve ChatGPT kaynakçaları yazısına bakın.

Sık sorulan sorular

Bir GPTBot isteğinin gerçekten OpenAI'dan geldiğini nasıl anlarım?

Kaynak IP'sini OpenAI'ın GPTBot için yayımladığı openai.com/gptbot.json listesiyle karşılaştırın. OpenAI ters DNS yöntemi belgelemiyor; kontrol IP listesi. User agent tek başına hiçbir şey kanıtlamaz.

Google-Extended loglarımda görebileceğim bir tarayıcı mı?

Hayır. Google, Google-Extended'ın kendine ait bir HTTP user agent'ı olmadığını söylüyor. Googlebot'un zaten taradığı içeriğin Gemini modellerini eğitmekte ve Gemini cevaplarını temellendirmekte kullanılıp kullanılamayacağını yöneten bir robots.txt belirteci. Google Arama'ya dahil olmayı ya da sıralamayı etkilemez.

Yapay zekâ tarayıcıları robots.txt'ye uyar mı?

Eğitim ve dizin tarayıcıları için OpenAI, Anthropic, Perplexity, Google, Microsoft, Apple ve Common Crawl robots.txt kontrollerini belgeliyor. Kullanıcının tetiklediği çekiciler farklı: OpenAI robots.txt'nin ChatGPT-User'a uygulanmayabileceğini, Perplexity Perplexity-User'ın onu genellikle yok saydığını, Meta da Meta-ExternalFetcher'ın onu atlayabileceğini söylüyor. Anthropic ise Claude-User dahil üç botunun da uyduğunu söylüyor.

Hangi yapay zekâ tarayıcıları IP listesi yayımlamıyor?

7 Ekim 2026 itibarıyla Meta, tarayıcı sayfasında Meta-ExternalAgent ve Meta-ExternalFetcher için liste yayımlamıyor; Bytespider için de ByteDance'ten bir belge bulamadık. Anthropic ise üç Claude ajanı için ajan başına ayrı değil, ortak tek bir liste yayımlıyor.

Bugün nerede olduğunuzu görün

Sorularınızı 7 AI görünürlük yüzeyine kadar çalıştırın, başlangıç noktanızı alın — küçük koşumlar çoğunlukla bir dakika içinde biter. Ücretsiz plan, kredi kartı gerekmez.

Ücretsiz başlayın →Ücretsiz AI Trafik Kontrolünü deneyin

Okumaya devam edin

robots.txt ve CDN'inizi yapay zekâ botları için nasıl denetlersiniz →Sunucu loglarını yapay zekâ alıntılarıyla eşleştirdik: ChatGPT ve Perplexity'nin tarayıcıları bizi kaynak göstermeden önce ne yaptı →llms.txt nedir, gerçekte ne işe yarar? (dürüst rehber) →