Wissen

robots.txt, KI-Opt-outs und Reservierungssignale: Was Webdatensammler 2026 beachten sollten

robots.txt hat in der EU inzwischen rechtliches Gewicht, und neue KI-Signale verbreiten sich. Was jedes einzelne bedeutet, welche KI-Crawler sie beachten und wie Datenteams reagieren sollten.

James Meadow

James Meadow

26. September 2026 · 13 Min. Lesezeit

Für den größten Teil seines dreißigjährigen Bestehens war robots.txt eine Höflichkeit: eine Textdatei, die Crawler bat, bestimmte Pfade zu meiden, ohne dass etwas außer gutem Willen dahinterstand. Das hat sich geändert. 2022 wurde die Datei zu einem formalen Internetstandard. In der EU entscheiden maschinenlesbare Opt-outs inzwischen darüber, ob Text- und Data-Mining rechtmäßig ist, und Anbieter von KI-Modellen haben eine rechtliche Pflicht, diese zu finden und zu respektieren. Zugleich ist eine Reihe neuer Signale entstanden, die jeweils behaupten festzulegen, was eine Website KI-Systemen mit ihren Inhalten erlaubt.

Für alle, die öffentliche Webdaten sammeln, und besonders für alle, deren Daten am Ende KI-Modelle trainieren oder speisen, ist die praktische Frage einfach: Welche dieser Signale müssen Sie lesen, was bedeuten sie, und was sollten Sie damit tun? Dieser Leitfaden beschreibt den aktuellen Stand, mit Stand September 2026.

Die wichtigsten Punkte

  • robots.txt ist ein IETF-Standard, RFC 9309. Er definiert präzise Abgleichsregeln, stellt aber unmissverständlich klar, dass seine Regeln „keine Form der Zugriffsautorisierung” sind.
  • In der EU gilt die Ausnahme für kommerzielles Text- und Data-Mining nur dort, wo Rechteinhaber sich ihre Rechte nicht „in angemessener Form, wie z. B. mittels maschinenlesbarer Mittel” für online zugängliche Inhalte vorbehalten haben. Deutsche Gerichte haben entschieden, dass ein solcher Vorbehalt nur in maschinenlesbarer Form wirksam ist.
  • Anbieter von KI-Modellen mit allgemeinem Verwendungszweck sind seit dem 2. August 2025 verpflichtet, solche Vorbehalte zu identifizieren und einzuhalten. Die Befugnis der Kommission, sie mit Bußgeldern zu belegen, gilt ab dem 2. August 2026.
  • Es gibt neue Präferenzsignale, von Cloudflares Content Signals bis zum IETF-Entwurf für ein AI-Preferences-Vokabular, aber keines davon ist bereits ein fertiger Standard. Erfassen Sie sie trotzdem, auch wenn sie nicht bindend sind.
  • Die Nutzung eines Proxy-Netzwerks ändert nichts daran, was eine Website verlangt hat. Die Pflichten knüpfen an das an, was Sie sammeln und wie Sie es verwenden, nicht an die IP-Adresse, von der aus Sie es sammeln.

robots.txt ist jetzt ein Standard

RFC 9309, veröffentlicht im September 2022, machte aus einer De-facto-Konvention einen Proposed Standard. Mehrere seiner Regeln überraschen Menschen, die robots.txt-Dateien bisher nur mit bloßem Auge gelesen haben:

  • Die spezifischste Regel gewinnt. „Der spezifischste gefundene Treffer MUSS verwendet werden”, gemessen an der Länge der übereinstimmenden Regel, wobei allow bevorzugt wird, wenn eine allow- und eine disallow-Regel gleichwertig sind. Die Reihenfolge in der Datei spielt keine Rolle.
  • Der Agentenabgleich ist nicht groß-/kleinschreibungssensitiv, und ein Crawler ohne passende Gruppe fällt auf die *-Gruppe zurück.
  • Fehler bedeuten Unterschiedliches. Ist robots.txt nicht verfügbar, mit einer 4xx-Antwort, darf ein Crawler auf alles zugreifen. Ist die Datei wegen Server- oder Netzwerkfehlern nicht erreichbar, „MUSS der Crawler von vollständiger Sperrung ausgehen.”
  • Caching ist begrenzt. Crawler „SOLLTEN die zwischengespeicherte Version nicht länger als 24 Stunden verwenden, es sei denn, die robots.txt-Datei ist nicht erreichbar.”

Und die wichtigste Einschränkung: „Diese Regeln sind keine Form der Zugriffsautorisierung.” robots.txt macht Inhalte nicht privat, und sie zu ignorieren ist nicht dasselbe wie in ein System einzudringen. Was ihr in manchen Kontexten Gewicht verleiht, ist das Recht, nicht das Protokoll selbst.

Warum es in der EU rechtlich von Bedeutung ist

Die Urheberrechtsregeln der EU erlauben Text- und Data-Mining an rechtmäßig zugänglichen Inhalten, mit zwei unterschiedlichen Ausnahmen. Die eine betrifft Forschungsorganisationen und Einrichtungen des Kulturerbes, die wissenschaftliche Forschung betreiben, und kennt kein Opt-out. Die andere betrifft alle anderen, einschließlich kommerziellem Mining, gilt aber nur dort, wo die Nutzung „nicht ausdrücklich von den Rechtsinhabern in angemessener Form vorbehalten wurde, wie z. B. mittels maschinenlesbarer Mittel im Fall von online öffentlich zugänglich gemachten Inhalten.”

Der AI Act überträgt diese Regel dann auf KI. Anbieter von KI-Modellen mit allgemeinem Verwendungszweck müssen „eine Strategie einführen, um das Unionsrecht zum Urheberrecht und zu verwandten Schutzrechten einzuhalten und insbesondere, auch durch dem Stand der Technik entsprechende Technologien, einen Vorbehalt von Rechten zu identifizieren und einzuhalten”, der nach den Urheberrechtsregeln geäußert wurde. Diese Pflichten gelten seit dem 2. August 2025. Die Bußgeldbefugnisse der Kommission gegenüber Anbietern von KI-Modellen mit allgemeinem Verwendungszweck, bis zu 3% des weltweiten Umsatzes, gelten ab dem 2. August 2026, und Modelle, die vor August 2025 auf den Markt gebracht wurden, haben bis zum 2. August 2027 Zeit, die Vorgaben zu erfüllen.

Der freiwillige General-Purpose AI Code of Practice, veröffentlicht im Juli 2025, macht das konkret. Unterzeichner verpflichten sich, „Web-Crawler einzusetzen, die Anweisungen lesen und befolgen, die gemäß dem Robot Exclusion Protocol (robots.txt) ausgedrückt werden, wie es in” RFC 9309 „festgelegt ist”, sowie andere geeignete maschinenlesbare Protokolle zu identifizieren und einzuhalten. Zwei Vorbehalte im Code sind bemerkenswert. Die Einhaltung „stellt keine Einhaltung des Unionsrechts zum Urheberrecht und zu verwandten Schutzrechten dar.” Und die Verpflichtung berührt nicht, wie das Urheberrecht auf Inhalte anzuwenden ist, „die von Dritten aus dem Internet gescraped oder gecrawlt wurden” und von Unterzeichnern genutzt werden. Der Kauf eines Datensatzes wäscht nicht die Vorbehalte rein, die für seine Quellen galten.

Was Gerichte gesagt haben

Die Rechtsprechung bildet sich noch heraus, und zwei Entscheidungen zeigen die Richtung.

In Deutschland verklagte ein Fotograf die gemeinnützige Organisation LAION wegen der Nutzung seines Bildes in einem KI-Trainingsdatensatz. Die Hamburger Gerichte wiesen die Klage ab. In der Berufung entschied das Oberlandesgericht, in den Worten der Zusammenfassung des Bundesgerichtshofs, dass ein Vorbehalt für online zugängliche Werke nur „in maschinenlesbarer Form” wirksam ist und dass der Kläger nicht nachgewiesen habe, dass sein in natürlicher Sprache in Nutzungsbedingungen formulierter Vorbehalt zum maßgeblichen Zeitpunkt maschinenlesbar gewesen sei. Der Bundesgerichtshof verhandelte die Revision am 3. September 2026 und hat die Entscheidung für den 17. Dezember 2026 terminiert.

In den Niederlanden entschied ein Amsterdamer Gericht am 30. Oktober 2024 in einem Streit zwischen Zeitungsverlagen und einem Nachrichtenaggregator. Der Aggregator argumentierte, und die Verlage widersprachen dem nicht, dass ihre robots.txt nur bestimmte KI-Bots ausschloss, etwa GPTBot, ChatGPT-User und CCBot. Das genügte nicht, um festzustellen, dass Rechte in angemessener maschinenlesbarer Weise für die Nutzung durch den Aggregator vorbehalten worden waren, sodass die Ausnahme anwendbar war.

Beide Entscheidungen weisen in dieselbe Richtung: Maschinenlesbare Signale sind entscheidend, und ein auf bestimmte Bots gerichtetes Signal behält Rechte möglicherweise nicht gegenüber allen anderen vor. Keine der beiden ist eine abschließende Leitlinie, und beide hängen von den jeweiligen Umständen ab. Wenden Sie sich bei konkreten Fragen an einen Anwalt.

Die Signale, denen Sie begegnen werden

SignalWo es sich befindetStatusWas es ausdrückt
robots.txt Allow und Disallow/robots.txtIETF-Standard, RFC 9309Ob ein benannter Crawler auf einen Pfad zugreifen darf
Content SignalsZeilen in robots.txt, etwa Content-Signal: search=yes, ai-train=noCloudflare-Richtlinie, veröffentlicht September 2025Präferenzen für Suche, KI-Input und KI-Training
AI preferences (Content-Usage)robots.txt-Zeilen oder ein HTTP-Header, etwa Content-Usage: train-ai=nIETF-Working-Group-Entwürfe, noch keine StandardsPräferenzen für KI-Training, KI-Nutzung und Suche
TDMRep/.well-known/tdmrep.json, ein tdm-reservation-HTTP-Header oder ein HTML-Meta-TagW3C-Community-Group-Bericht, kein W3C-StandardOb Text- und Data-Mining-Rechte vorbehalten sind
NutzungsbedingungenDie Rechtsseiten der WebsiteVertrag und, in der EU, möglicherweise ein Vorbehalt, wenn maschinenlesbarWas auch immer die Nutzungsbedingungen der Website sagen

Zwei Details sind wichtig. Cloudflares Content Signals definieren search, ai-input (für Retrieval, Grounding und generierte Antworten) und ai-train, und die Richtlinie stellt fest, dass „Content-Signale Präferenzen ausdrücken; sie sind keine technischen Gegenmaßnahmen gegen Scraping.” Sie erklärt zudem, dass über die Signale ausgedrückte Einschränkungen ausdrückliche Rechtevorbehalte nach den EU-Urheberrechtsregeln sind. Die IETF-Entwürfe wiederum sind wirklich unfertig: Der aktuelle Vokabular-Entwurf trägt den Hinweis, dass sein Inhalt „DO NOT REFLECT CONSENSUS of the Working Group” [nicht den Konsens der Arbeitsgruppe widerspiegelt]. Es ist zu erwarten, dass sich die Bezeichnungen ändern.

Wie die großen KI-Crawler damit umgehen

Die Betreiber veröffentlichen ihre eigenen Regeln, und diese unterscheiden sich, besonders bei Abrufen im Auftrag eines Nutzers.

BetreiberAgentWas eine Sperrung laut Betreiber bewirkt
OpenAIGPTBotZeigt an, dass Inhalte „nicht zum Training generativer KI-Foundation-Modelle verwendet werden sollten”
OpenAIOAI-SearchBotDie Website wird nicht in ChatGPT-Suchantworten angezeigt, kann aber weiterhin als Navigationslink erscheinen
OpenAIChatGPT-UserNutzerinitiiert; „robots.txt-Regeln gelten möglicherweise nicht”
GoogleGoogle-ExtendedEin robots.txt-Token ohne eigenen User-Agent; steuert die Nutzung für Training und Grounding von Gemini-Modellen und „beeinflusst nicht die Aufnahme einer Website in die Google-Suche”
GoogleNutzerausgelöste Fetcher„ignorieren robots.txt-Regeln in der Regel”
AnthropicClaudeBot, Claude-User, Claude-SearchBotSperrung von ClaudeBot schließt zukünftige Inhalte vom Training aus; Sperrung von Claude-User verhindert Retrieval für Nutzeranfragen; die Bots befolgen robots.txt und crawl-delay

Für ein Datenteam lautet die Lehre daraus, dass „KI blockieren” kein einzelner Schalter ist. Eine Website kann Suchindexierung erlauben und gleichzeitig Training ablehnen, oder Training ablehnen und trotzdem live abgerufen werden, wenn ein Nutzer danach fragt. Lesen Sie die Signale für die Nutzung, die Sie tatsächlich vorhaben.

Wie viele Websites opt-out betreiben

Opt-outs haben schnell zugenommen. Die „Consent in Crisis”-Studie der Data Provenance Initiative, eine Prüfung von 14.000 Web-Domains, veröffentlicht im Juli 2024, ergab, dass robots.txt-Einschränkungen innerhalb eines einzigen Jahres „~5%+ aller Tokens in C4, oder 28%+ der aktivsten gepflegten, kritischen Quellen in C4, vollständig eingeschränkt” haben und dass „bei Einschränkungen durch Nutzungsbedingungen nunmehr volle 45% von C4 eingeschränkt sind.” Die Abdeckung ist an der Spitze des Webs jedoch ungleichmäßig: Cloudflare berichtete im Juli 2025, dass „nur etwa 37% der Top-10.000-Domains derzeit eine robots.txt-Datei haben” und dass GPTBot in 7,8% dieser Dateien untersagt war.

Was verantwortungsbewusstes Sammeln bedeutet

Ob Sie Modelle trainieren oder nicht, eine klare Richtlinie schützt Sie und die Websites, auf die Sie sich verlassen.

  1. robots.txt korrekt abrufen und befolgen. Nicht länger als 24 Stunden zwischenspeichern, Serverfehler als „alles sperren” behandeln und Regeln nach der RFC-9309-Methode abgleichen.
  2. Ihren Zweck kennen. Indexierung, Retrieval für Live-Antworten und Modelltraining sind unterschiedliche Nutzungen, und die neueren Signale behandeln sie unterschiedlich. Entscheiden Sie, welchem Zweck Ihre Sammlung dient, und lesen Sie die Signale für diese Nutzung.
  3. Die Signale zusammen mit den Daten festhalten. Speichern Sie die robots.txt-Regeln, Content-Signale und TDMRep-Header, die zum Zeitpunkt der Erfassung galten, zusammen mit jedem Datensatz. Wird ein Datensatz später für KI verwendet, zeigt dieser Nachweis, dass Vorbehalte identifiziert wurden. Er gehört in denselben Provenienznachweis wie der Blickpunkt und der Erfassungszeitpunkt.
  4. Nutzungsbedingungen mit einem Anwalt prüfen. Sie können überall vertraglich von Bedeutung sein, und in der EU können sie als Vorbehalt gelten, wenn sie maschinenlesbar formuliert sind.
  5. Ihre Sammlung im Tempo drosseln. Crawl-Limits einzuhalten und bei Last zurückzufahren gehört zum gleichen guten Glauben, wie in Rate Limiting und Request Throttling beschrieben.

Eine Warnung zu Tools: Pythons eingebautes urllib.robotparser wendet Regeln in Dateireihenfolge an statt nach dem spezifischsten Treffer. Bei Disallow: /shop gefolgt von Allow: /shop/public meldet es /shop/public/item als gesperrt; vertauscht man die beiden Zeilen, meldet es erlaubt. RFC 9309 sagt in beiden Fällen erlaubt. Ein kleiner Prüfer, der der RFC folgt und die AI-Preference-Zeilen erfasst, die er findet, sieht so aus:

import re
import urllib.error
import urllib.request


def _groups(text):
    """Parse robots.txt into (agents, rules, extras) groups, following RFC 9309 grouping."""
    groups, agents, rules, extras, last = [], [], [], [], None
    for raw in text.splitlines():
        line = raw.split("#", 1)[0].strip()
        if ":" not in line:
            continue
        key, value = (p.strip() for p in line.split(":", 1))
        key = key.lower()
        if key == "user-agent":
            if last != "user-agent" and agents:
                groups.append((agents, rules, extras))
                agents, rules, extras = [], [], []
            agents.append(value.lower())
        elif key in ("allow", "disallow") and agents:
            rules.append((key, value))
        elif key in ("content-signal", "content-usage") and agents:
            extras.append((key, value))
        last = key
    if agents:
        groups.append((agents, rules, extras))
    return groups


def _pattern(path):
    regex = re.escape(path).replace(r"\*", ".*")
    return re.compile(regex[:-2] + "$" if regex.endswith(r"\$") else regex)


def check(robots_txt, user_agent, path):
    """Allow/disallow per RFC 9309 (most specific match wins, allow on ties), plus AI signals."""
    token = user_agent.lower()
    groups = _groups(robots_txt)
    matched = [g for g in groups if token in g[0]] or [g for g in groups if "*" in g[0]]
    rules = [r for g in matched for r in g[1]]
    extras = [e for g in matched for e in g[2]]
    best = None
    for kind, value in rules:
        if value and _pattern(value).match(path):
            length = len(value)
            if best is None or length > best[1] or (length == best[1] and kind == "allow"):
                best = (kind, length)
    return {"allowed": best is None or best[0] == "allow", "signals": extras}


def fetch_robots(origin, opener=None):
    """Fetch robots.txt. Per RFC 9309: 4xx means no rules; 5xx or network failure means disallow all."""
    opener = opener or urllib.request.build_opener()
    try:
        with opener.open(origin.rstrip("/") + "/robots.txt", timeout=30) as r:
            return r.read(512 * 1024).decode("utf-8", "replace")
    except urllib.error.HTTPError as e:
        return "" if 400 <= e.code < 500 else "User-agent: *\nDisallow: /"
    except OSError:
        return "User-agent: *\nDisallow: /"

Es ist bewusst klein gehalten. Produktive Crawler sollten außerdem TDMRep-Header und die Datei /.well-known/tdmrep.json prüfen, wenn Training in Betracht kommt, und eine datierte Kopie jeder robots.txt-Datei aufbewahren, auf die sie sich verlassen haben.

Wo Proxys ins Bild passen

Residential Proxys ändern, woher eine Anfrage scheinbar kommt. Sie ändern nichts daran, was eine Website von Ihnen verlangt hat, und sie ändern nichts an Ihren Pflichten nach dem Urheberrecht oder den Nutzungsbedingungen einer Website. Die EU-Regeln knüpfen an die Nutzung der Inhalte an, und der Code of Practice hält ausdrücklich fest, dass Sammlung durch Dritte davon erfasst bleibt. Nutzen Sie ein Proxy-Netzwerk, um das Web so zu sehen, wie es echte Nutzer in einem bestimmten Markt sehen, um Last fair zu verteilen und ehrlich zu messen, und wenden Sie dieselben robots.txt- und Vorbehaltsprüfungen an, die Sie auch von Ihren eigenen Servern aus anwenden würden. Die umfassendere Begründung findet sich in ethischen Residential Proxys für KI-Datensammlung.

Fazit

robots.txt ist erwachsen geworden. Es ist ein Standard mit präzisen Regeln, und in der EU entscheiden maschinenlesbare Vorbehalte, die darauf aufbauen und daneben bestehen, inzwischen darüber, ob Text- und Data-Mining zulässig ist, wobei KI-Anbieter einer direkten rechtlichen Pflicht unterliegen, diese zu respektieren, und Bußgelder ab August 2026 möglich sind. Neue Signale für Suche, KI-Input und Training verbreiten sich schnell, obwohl die zugrunde liegenden Standards noch unfertig sind.

Für ein Datenteam bleibt die praktikable Richtlinie unabhängig davon, wie sich die Details entwickeln, dieselbe: robots.txt korrekt parsen, wissen, welchem Zweck die eigene Sammlung dient, jedes zum Zeitpunkt der Erfassung geltende Signal festhalten und Präferenzen, an die Sie nicht strikt gebunden sind, als aufbewahrenswerte Information behandeln statt als zu verwerfendes Rauschen. Die Teams, die das jetzt tun, werden es später nicht rekonstruieren müssen.

Quellen und Verweise

Dieser Artikel dient allgemeinen Informationszwecken und stellt keine Rechtsberatung dar. Wenden Sie sich zu Ihren Pflichten in der jeweiligen Rechtsordnung an einen Anwalt.

Bereit, loszulegen?

Testen Sie Shifters Residential-Proxys, 205M+ IPs, 195+ Länder, ab 0,75 $/GB.

Jetzt starten