Scraping

Wer blockiert die KI-Crawler? GPTBot, ClaudeBot und Co. bei den Top 10.000 Websites

Wir haben die robots.txt der Top 10.000 Domains ausgelesen. Jede fünfte Website blockiert mindestens einen KI-Crawler, während fast alle Suchmaschinen weiterhin willkommen heißen.

Chris Collins

6. Oktober 2026 · 10 Min. Lesezeit

KI-Unternehmen schicken ihre eigenen Crawler durchs Web, und Website-Betreiber antworten über robots.txt, die Klartextdatei, die automatisierten Besuchern mitteilt, was sie abrufen dürfen. Jedes größere KI-Unternehmen veröffentlicht die Namen, auf die seine Crawler hören, sodass eine Website einen, einige oder alle blockieren kann und dabei trotzdem Suchmaschinen willkommen heißt.

Wir wollten ein aktuelles Bild davon, wer das tut. Am 6. Oktober 2026 haben wir die robots.txt jeder der Top 10.000 Domains im Tranco-Ranking angefragt, die Regeln für 16 KI-Crawler und zwei Such-Crawler ausgewertet und festgehalten, welche davon jede Website auf ihre Startseite lässt. Dieser Leitfaden stellt die Ergebnisse, den von uns geschriebenen Evaluator und die Bedeutung für alle, die Webdaten sammeln, vor.

Wichtigste Erkenntnisse

  • 5.754 der Top 10.000 Domains lieferten eine robots.txt, die wir lesen konnten. Jede fünfte davon, 20,4%, blockiert mindestens einen KI-Crawler von ihrer Startseite.
  • Die am häufigsten blockierten Crawler sind CCBot von Common Crawl (16,2%), Bytespider von ByteDance (15,3%), GPTBot von OpenAI (15,1%) und ClaudeBot von Anthropic (14,0%).
  • Suchmaschinen werden fast nie blockiert: Googlebot von 2,6% und Bingbot von 3,3%, die meisten davon Websites, die jeden Crawler blockieren. 17,3% der Websites lassen beide Suchmaschinen herein, während sie mindestens einen KI-Crawler blockieren.
  • Viele Websites trennen Training von Beantwortung. Von den 871 Websites, die GPTBot blockieren, erlauben 345 weiterhin ChatGPT-User, der Seiten abruft, wenn eine Person ChatGPT danach fragt.
  • Je größer die Website, desto wahrscheinlicher blockiert sie: 29,5% der Top 1.000 blockieren mindestens einen KI-Crawler, gegenüber 18,8% der im Bereich 5.001 bis 10.000 platzierten.

Wie wir gemessen haben

Für jede Domain haben wir https://<domain>/robots.txt angefragt, mit Rückfall auf den www.-Host, mit einem User-Agent, der uns benannte und auf unsere Website verlinkte, in moderatem Tempo. Anschließend haben wir die Regeln für jeden Crawler gegen den Startseitenpfad / ausgewertet.

Wir folgten RFC 9309, dem robots.txt-Standard, statt der Abkürzung, die die meisten Bibliotheken nehmen:

  • Ein Crawler verwendet jede Gruppe, die ihn benennt, und greift nur dann auf die *-Gruppe zurück, wenn keine Gruppe ihn benennt.
  • Die längste passende Regel gewinnt, und Allow gewinnt bei Gleichstand.
  • Eine 4xx-Antwort bedeutet, dass es keine Regeln gibt; eine 5xx-Antwort bedeutet, dass alles verboten ist.

Der eingebaute Parser von Python wendet die erste passende Regel an statt die längste, was gängige Dateien wie Disallow: / gefolgt von Allow: /$ falsch liest, daher haben wir unseren eigenen Evaluator geschrieben und ihn gegen die Testfälle des Standards geprüft. Wir zählten einen Crawler als „blockiert”, wenn er die Startseite nicht abrufen darf, und notierten separat, ob die Datei den Crawler namentlich nennt oder ihn nur über * blockiert.

Von den 10.000 Domains lieferten 5.877 eine auswertbare robots.txt, und 5.754 davon waren eigenständige Websites; der Rest waren überwiegend API-Hosts, Content Delivery Networks und andere Domains, die keine Website bedienen. 460 antworteten mit einer HTML-Seite statt einer robots-Datei, was der Standard als „keine Regeln” behandelt.

Was wir gefunden haben

CrawlerBetreiberZweckVon Startseite blockiertIn Datei benannt
CCBotCommon CrawlOffenes Web-Archiv, weit verbreitet für KI-Training16,2%15,2%
BytespiderByteDanceCrawling für KI-Modelle15,3%13,1%
GPTBotOpenAITraining15,1%17,7%
ClaudeBotAnthropicTraining14,0%15,1%
meta-externalagentMetaTraining und KI-Produkte12,5%10,8%
Google-ExtendedGoogleTraining und Grounding von Gemini, getrennt von Search12,3%13,5%
anthropic-aiAnthropicÄlteres Anthropic-Token11,7%9,9%
Applebot-ExtendedAppleTraining, getrennt von Applebot11,7%10,1%
AmazonbotAmazonCrawling für Amazon-Dienste11,7%10,3%
cohere-aiCohereKI-Produkte11,7%9,2%
PerplexityBotPerplexitySuchindex für Antworten10,8%12,7%
ChatGPT-UserOpenAIRuft eine Seite ab, wenn ein Nutzer fragt9,4%11,7%
Perplexity-UserPerplexityRuft eine Seite ab, wenn ein Nutzer fragt7,7%6,2%
OAI-SearchBotOpenAISuchergebnisse in ChatGPT7,5%9,9%
Claude-UserAnthropicRuft eine Seite ab, wenn ein Nutzer fragt7,3%6,1%
Claude-SearchBotAnthropicSuchergebnisse in Claude7,2%6,1%
BingbotMicrosoftWeb-Suche3,3%7,4%
GooglebotGoogleWeb-Suche2,6%9,1%

Die Prozentangaben beziehen sich auf die 5.754 Websites. „Benannt” zählt Dateien, die den Crawler namentlich ansprechen, sei es um ihn zu blockieren oder willkommen zu heißen, weshalb sich die beiden Spalten unterscheiden: Manche Websites nennen einen Crawler nur, um ihn willkommen zu heißen, und 153 Websites blockieren jeden Crawler über *, ohne einen zu benennen.

Drei Muster

KI-Crawler werden blockiert; Suchmaschinen nicht. 17,3% der Websites lassen sowohl Googlebot als auch Bingbot auf die Startseite, während sie mindestens einen KI-Crawler blockieren. Nur 0,2% blockieren Googlebot namentlich. Website-Betreiber ziehen eine klare Linie zwischen für Suche indexiert zu werden und für KI gesammelt zu werden.

Training wird stärker blockiert als Beantwortung. Die Crawler, die Trainingsdaten sammeln, werden deutlich häufiger blockiert als diejenigen, die eine Seite abrufen, weil eine Person danach gefragt hat: GPTBot bei 15,1% der Websites gegenüber 9,4% bei ChatGPT-User, ClaudeBot bei 14,0% gegenüber 7,3% bei Claude-User. Von den 871 Websites, die GPTBot blockieren, erlauben 345 weiterhin ChatGPT-User, und von den 806, die ClaudeBot blockieren, erlauben 390 weiterhin Claude-User. Viele Websites wollen mit anderen Worten in KI-Antworten erscheinen, ohne zum Training beizutragen.

Blockierung steigt mit der Größe. Unter den Top 1.000 Websites blockieren 29,5% mindestens einen KI-Crawler und 21,0% blockieren GPTBot. Bei Websites im Bereich 5.001 bis 10.000 sinken diese Werte auf 18,8% und 13,9%. Große Verlage und Plattformen, deren Inhalte für das Training am wertvollsten sind, sind diejenigen, die am ehesten aussteigen.

Nur 5,2% der Websites blockieren alle fünf der bekanntesten KI-Crawler (GPTBot, ClaudeBot, Google-Extended, CCBot und PerplexityBot), während sie Googlebot weiterhin zulassen. Die meisten Opt-outs sind selektiv: Eine Website blockiert manche Unternehmen und andere nicht, oder blockiert Training und erlaubt Beantwortung.

Der Code

Das folgende Modul parst eine robots.txt-Datei und wertet sie für jeden Crawler nach den Regeln von RFC 9309 aus. Es hat keine Abhängigkeiten.

import re
from urllib.parse import quote, unquote


def parse_groups(text):
    """Split robots.txt into groups: a list of (user-agent tokens, [(allow, path)])."""
    groups, agents, rules, in_rules = [], [], [], False
    for raw in text.splitlines():
        line = raw.split("#", 1)[0].strip()
        if ":" not in line:
            continue
        key, value = (part.strip() for part in line.split(":", 1))
        key = key.lower()
        if key == "user-agent":
            if in_rules:                      # a user-agent line after rules starts a new group
                groups.append((agents, rules))
                agents, rules, in_rules = [], [], False
            agents.append(value.lower())
        elif key in ("allow", "disallow") and agents:
            in_rules = True
            if value:                         # an empty Disallow allows everything
                rules.append((key == "allow", value))
    if agents:
        groups.append((agents, rules))
    return groups


def rules_for(groups, product_token):
    """RFC 9309: use every group naming the crawler's product token; otherwise the '*' groups."""
    token = product_token.lower()
    named = [r for agents, rules in groups for r in rules if token in agents]
    if any(token in agents for agents, _ in groups):
        return named
    return [r for agents, rules in groups for r in rules if "*" in agents]


def _pattern(path):
    regex = "".join(".*" if ch == "*" else re.escape(ch) for ch in path.rstrip("$"))
    return re.compile(regex + ("$" if path.endswith("$") else ""))


def allowed(groups, product_token, path="/"):
    """Longest matching rule wins; Allow wins a tie (RFC 9309, section 2.2.2)."""
    target = quote(unquote(path), safe="/?=&*$%:@!,;~+")
    best_len, verdict = -1, True
    for allow, rule in rules_for(groups, product_token):
        rule = quote(unquote(rule), safe="/?=&*$%:@!,;~+")
        if _pattern(rule).match(target):
            length = len(rule)
            if length > best_len or (length == best_len and allow):
                best_len, verdict = length, allow
    return verdict


def names(groups, product_token):
    """Does the file address this crawler by name, rather than only through '*'?"""
    return any(product_token.lower() in agents for agents, _ in groups)

Und zur Überprüfung einer Website, hier unsere eigene:

import requests

from robots import parse_groups, allowed, names

text = requests.get("https://shifter.io/robots.txt", timeout=15,
                    headers={"User-Agent": "ExampleSurvey/1.0 (+https://example.com/bot)"}).text
groups = parse_groups(text)
for crawler in ["GPTBot", "ClaudeBot", "Google-Extended", "CCBot", "Googlebot"]:
    print(f"{crawler:16} homepage allowed: {allowed(groups, crawler, '/')}  named: {names(groups, crawler)}")

Unsere Datei benennt die wichtigsten KI-Crawler und erlaubt sie ausdrücklich, sodass alle fünf als erlaubt zurückkommen, und Googlebot ist über * erlaubt. Wir haben den Evaluator gegen 16 Fälle getestet, einschließlich Vorrang des längsten Treffers, der Gleichstandsregel, Wildcard- und Pfadende-Mustern, zusammengeführter Gruppen und leerer Dateien.

Was es für die Datensammlung bedeutet

  • robots.txt pro Crawler lesen, nicht nur für *. Eine Website, die über * jeden willkommen heißt, kann trotzdem einen namentlich genannten Crawler blockieren, und ein wachsender Anteil des Webs tut genau das.
  • Den eigenen Collector ehrlich identifizieren. Robots-Regeln funktionieren nur, wenn Crawler sagen, wer sie sind. Wenn Sie unter eigenem Namen sammeln, prüfen Sie die Regeln für diesen Namen und für den Zweck, für den Sie sammeln.
  • Die Unterscheidung respektieren, die Websites treffen. Viele Websites trennen inzwischen Suche, Training und bedarfsgesteuertes Abrufen. Ein Collector, der Trainingsdaten sammelt, sollte eine Blockierung von Trainings-Crawlern als auf sich selbst anwendbar behandeln, auch wenn der eigene Name nicht aufgeführt ist.
  • Regelmäßig neu prüfen. Opt-outs ändern sich, wenn Websites ihre Dateien aktualisieren; eine vor sechs Monaten erstellte Liste ist veraltet.

Unser Leitfaden zu robots.txt, KI-Opt-outs und Reservierungssignalen behandelt die weiteren Signale, die Websites verwenden, und den rechtlichen Kontext in Europa, und Best Practices für Web Scraping behandelt das Sammeln, ohne den besuchten Websites zu schaden. Pipelines für Trainingsdaten, die Opt-outs beim Abruf berücksichtigen müssen, werden in Aufbau großskaliger Trainingsdatensätze behandelt.

Grenzen der Messung

  • Nur Startseite. Wir haben den Pfad / ausgewertet. Viele Websites blockieren KI-Crawler von bestimmten Bereichen, etwa Artikeln oder Suchseiten, während die Startseite offen bleibt, sodass der Anteil der Websites, die KI-Crawler irgendwo einschränken, höher liegt als diese Zahlen.
  • Nur robots.txt. Websites signalisieren auch über HTTP-Header, Meta-Tags und Nutzungsbedingungen und setzen über Bot-Management durch. Eine Website, die einen Crawler nicht in robots.txt blockiert, kann ihn trotzdem auf Netzwerkebene blockieren.
  • Eine Momentaufnahme. Dies sind die Dateien, wie sie am 6. Oktober 2026 von einem Netzwerk ausgeliefert wurden.
  • Nur Top-Websites. Die Top 10.000 Domains sind nicht das gesamte Web; kleinere Websites verhalten sich möglicherweise anders.

Fazit

Jede fünfte Top-Website sagt inzwischen mindestens einem KI-Crawler, er solle von ihrer Startseite fernbleiben, während fast alle weiterhin Suchmaschinen willkommen heißen. Opt-outs sind selektiv: Trainings-Crawler werden häufiger blockiert als diejenigen, die Seiten für Nutzer abrufen, und die größten Websites blockieren am meisten.

Für alle, die Webdaten sammeln, lautet die praktische Lehre, robots.txt für den jeweiligen Crawler und Zweck zu lesen, mit einem Evaluator, der dem Standard folgt, und sie erneut zu prüfen, während das Web diese Linien immer wieder neu zieht.

Quellen und Referenzen

Bereit, loszulegen?

Testen Sie Shifters Residential-Proxys, 205M+ IPs, 195+ Länder, ab 0,75 $/GB.

Jetzt starten