Wissen

Web-Daten für das Training von KI und LLMs mit Residential-Proxys sammeln

Einen Trainings- oder Evaluierungs-Korpus zu bauen bedeutet, das Web in großem Maßstab und über Regionen hinweg zu crawlen, ohne blockiert zu werden. Hier passen Residential-Proxys hinein.

James Meadow

James Meadow

16. August 2026 · 8 Min. Lesezeit

Jedes Modell ist eine Wette auf seine Daten. Ob du von Grund auf vortrainierst, auf einer Domäne feinabstimmst, einen Retrieval-Korpus zusammenstellst, oder einen Evaluierungssatz baust, die Qualität und Breite dessen, was du aus dem Web sammelst, setzt eine Obergrenze dafür, was das Modell kann. Und Web-Daten in dem Maßstab zu sammeln, den ein Modell braucht, über Millionen von Seiten und viele Regionen, stößt auf dieselben Infrastrukturprobleme, die jeder große Crawler trifft: Ratenlimits pro IP, Inhalt, der je nach Geografie variiert, und Websites, die zunehmend alles blockieren, was wie ein automatisierter Crawler aussieht. Residential-Proxys sind die Sammelschicht, die diesen Crawl möglich macht, und hier passen sie hinein, zusammen mit den Teilen der Arbeit, die sie nicht lösen, die für KI-Daten mehr als sonst zählen.

Was KI-Teams wirklich sammeln

Die Form der Sammlung variiert mit dem Ziel. Korpora für das Vortraining und das fortgesetzte Vortraining sind breite, hochvolumige Textzüge über einen weiten Ausschnitt des öffentlichen Webs. Domänen-Feinabstimmung ist enger und tiefer, ein fokussierter Crawl der Websites, die für eine Aufgabe zählen. Retrieval-Korpora für ein RAG-System werden kuratiert und nach einem Zeitplan aufgefrischt, damit der Index nicht veraltet. Evaluierungs- und Benchmark-Sätze sind kleiner, müssen aber repräsentativ und sauber sein. Multimodale Arbeit fügt Bilder und andere Assets zusätzlich zum Text hinzu. Was all das teilt, ist eine Sammelschicht darunter: viele öffentliche Seiten zuverlässig abrufen, von dort, wo sie tatsächlich leben. Diese Schicht ist dieselbe, egal was darauf sitzt, und darum geht es im Rest dieses Beitrags.

Maßstab: warum eine IP das Web nicht crawlen kann

Das Web will keine einzelne Adresse, die Millionen von Seiten zieht. Die meisten Websites setzen Ratenlimits pro IP durch, und ein Crawler, der alles von einem Ort sendet, wird in Minuten gedrosselt, dann blockiert, und der Crawl stoppt weit unter dem Volumen, das ein Modell braucht. Selbst wo die Limits großzügig sind, ist eine einzige Verbindung ein Engpass gegen einen Korpus, der in Millionen von Dokumenten gemessen wird.

Den Crawl über viele Residential-IPs zu verteilen ist das, was ein langsames Rinnsal in einen Korpus verwandelt. Jede IP bleibt bequem innerhalb ihres eigenen Limits pro IP, während dein aggregierter Durchsatz mit dem Pool skaliert, was die Lastverteilungs-Logik ist, auf die sich jeder Sammler mit hohem Volumen stützt, und wofür unbegrenzte gleichzeitige Verbindungen da sind. Der Punkt ist nicht, irgendeine einzelne Website zu überwältigen, es geht darum, einen großen, höflichen Crawl über genug Adressen zu verteilen, sodass kein einzelnes Ziel mehr als eine gewöhnliche Menge Verkehr von irgendeiner von ihnen sieht.

Repräsentativität: ein Korpus ist nur so breit wie der Ort, von dem du sammelst

Das ist der Teil, der für Trainingsdaten spezifisch und leicht falsch zu machen ist. Ein Modell lernt die Verteilung dessen, womit es gefüttert wurde, also erbt ein Korpus, der gänzlich von einem Ort gesammelt wurde, den Web-Ausschnitt dieses Ortes. Viele Websites liefern je nach Region unterschiedlichen Inhalt: lokalisierte Seiten, andere Sprachen, regionsspezifische Kataloge, Preise und Verfügbarkeit, und manchmal gänzlich andere Startseiten. Crawle das Web aus einem einzigen Land, und du untersample systematisch alles, was dieses Land nicht sieht, und diese Verzerrung wird in das Modell eingebacken.

Länder- und, wenn es zählt, Stadt-Targeting lassen dich die Versionen von Seiten sammeln, die echte Nutzer in jeder Region sehen, sodass dein Korpus die geografische und sprachliche Spanne widerspiegelt, die du tatsächlich willst, statt des Zufalls, wo dein Crawler läuft. Wenn mehrsprachige Abdeckung oder regionale Balance ein Ziel ist, ist das kein Nice-to-have, es ist der Unterschied zwischen einem repräsentativen Datensatz und einem schiefen. Dasselbe Geo-Targeting, das regionsvariierenden Inhalt legitim erreicht, ist die Art, wie du Breite von Anfang an in die Daten baust.

Zugänglich bleiben, während Websites sich gegen Crawler verhärten

Websites sind merklich defensiver gegenüber automatisierter Sammlung geworden, und ein guter Teil dieser Verhärtung zielt geradewegs auf KI-Crawler. Bekannte Datacenter-IP-Bereiche und offensichtliche Bot-Signale werden schnell blockiert, und einige der größten Websites fordern jetzt Verkehr heraus oder weisen ihn ab, der nicht wie ein gewöhnlicher menschlicher Besucher aussieht. Ein Crawl, der von Datacenter-Adressen läuft, gibt zunehmend Blockaden und Challenge-Seiten statt Inhalt zurück.

Residential-Proxys leiten Anfragen durch echte IPs auf Haushaltsebene, sodass jede Anfrage wie ein normaler Besucher aussieht statt wie ein Server in einem Datacenter, und saubere Adressen mit guter Reputation kommen durch, wo markierte eine Challenge bekommen. Das ist notwendig, aber nicht hinreichend: die IP bringt dich durch die Tür, und der Rest ist, sich wie ein echter Client zu verhalten, was vernünftige Anfrageraten, einen ehrlichen Umgang mit den Signalen, die Blockaden auslösen, und kein Hämmern auf ein Ziel bedeutet, nur weil du kannst. Das Ziel ist, öffentliche Daten so zu sammeln, wie es ein Browser täte, nicht sich an einer Website vorbeizuzwängen, die entschieden hat, dass sie nicht gecrawlt werden will.

Aktualität: Korpora veralten

Ein Datensatz ist eine Momentaufnahme, und das Web bewegt sich. Retrieval-Korpora brauchen besonders regelmäßige Auffrisch-Crawls, damit der Index den aktuellen Zustand seiner Quellen widerspiegelt, und fortgesetztes Vortraining hängt davon ab, hereinzuholen, was neu ist. Das macht die Sammlung zu einer laufenden Pipeline statt einer einmaligen Aufgabe, und eine laufende Pipeline muss die Routen überleben, die sich mit der Zeit verschlechtern. Erkenne eine Blockade, einen Timeout, oder eine Challenge auf einer gegebenen IP, ziehe diese Route zurück, und mache auf einer frischen weiter, was das Failover-Muster ist, das einen langlaufenden Crawl am Leben hält. Nichts davon sollte blind laufen, also überwache die Pipeline: Erfolgsrate, Abdeckung, und Fehlermuster pro Quelle sagen dir, wann ein Ziel seine Verteidigung geändert hat oder ein Ausschnitt des Crawls stillschweigend fehlschlägt, bevor diese Lücke als fehlende Daten im nächsten Trainingslauf auftaucht.

Sammle verantwortungsvoll

Der ehrliche Teil, und für KI-Daten ist er nicht optional. Residential-Proxys sind Sammel-Infrastruktur, sie sind keine Erlaubnis. Einen Korpus verantwortungsvoll zu bauen bedeutet, nur öffentliche Daten zu sammeln, die robots-Direktiven und Nutzungsbedingungen jeder Website zu respektieren, und höflich zu crawlen, mit Ratenlimits und Backoff, sodass du die Websites, von denen du abhängst, nie verschlechterst. Genauso wichtig, und getrennt davon, ob du eine Seite technisch abrufen kannst, ist die Frage der Rechte: die Fähigkeit, Daten zu sammeln, ist nicht dasselbe wie das Recht, darauf zu trainieren, und Urheberrecht, Lizenzierung, und Regeln zu personenbezogenen Daten sind echte Einschränkungen, die über der Sammelschicht sitzen und die richtig hinzubekommen die Verantwortung des Teams ist. Behandle personenbezogene und sensible Daten mit Sorgfalt und im Rahmen des Gesetzes. Proxys lösen das Wie, öffentliche Seiten in großem Maßstab zu erreichen, das Was und das Dürfen sind Entscheidungen, die du weiterhin besitzt, und sie ernst zu nehmen ist das, was einen vertretbaren Datensatz von einer Belastung trennt.

Ein minimaler höflicher Crawl

Ein rotierender Residential-Proxy sieht für deinen Crawler aus wie ein gewöhnlicher Proxy. Das Targeting lebt im Benutzernamen auf dem Gateway, also rotiert ein US-Exit ohne Session-Kennung pro Anfrage und verteilt den Crawl über den Pool:

import time
import requests
PROXY = "http://customer-USERNAME-country-us:PASSWORD@p.shifter.io:443"
proxies = {"http": PROXY, "https": PROXY}
def fetch(url):
r = requests.get(url, proxies=proxies, timeout=20,
headers={"User-Agent": "research-crawler/1.0"})
r.raise_for_status()
return r.text
for url in urls: # your queue of public pages
try:
html = fetch(url)
store(html) # persist for the corpus
except requests.HTTPError:
retry_later(url) # on a block or timeout, back off and requeue
time.sleep(1.0) # be polite; do not hammer a single origin

Verteile die Warteschlange so, dass keine einzelne Website einen Schwall von einer IP sieht, mache bei Fehlern Backoff statt hart zu wiederholen, und für mehrsprachige oder regionale Abdeckung führe denselben Crawl mit verschiedenen Länder-Targets aus. Die allgemeinen Client-Muster übertragen sich aus der Anleitung zum Nutzen von Residential-Proxys mit Python, und wo ein Korpus session-konsistente Mehrseiten-Abrufe braucht, hält eine Sticky-Session eine IP für diese Sequenz.

Fazit

Web-Daten für das Training von KI und LLMs zu sammeln wird von drei Dingen begrenzt: dem Maßstab, den ein Modell braucht, den eine einzige IP nicht erreichen kann; der Repräsentativität, die ein guter Korpus verlangt, die ein einziger Ort nicht einfangen kann; und der steigenden Mauer aus Anti-Crawler-Verteidigungen, an der Datacenter-Adressen zunehmend nicht vorbeikommen. Residential-Proxys beantworten alle drei. Verteile den Crawl über einen großen Pool, sodass jede IP höflich bleibt und das Aggregat skaliert, ziele auf Länder und Städte, sodass der Korpus die Geografie und die Sprachen widerspiegelt, die du tatsächlich willst, leite durch saubere IPs auf Haushaltsebene, sodass Anfragen wie gewöhnliche Besucher aussehen, und mache Failover mit Überwachung, sodass ein kontinuierlicher Auffrisch-Crawl weiterläuft. Dann mache den Teil, den Proxys nicht machen: sammle nur öffentliche Daten, respektiere robots und Bedingungen, crawle höflich, und halte Lizenzierung und Privatsphäre über der Sammelschicht, wohin sie gehören.

Diese Sammelschicht ist das, wofür Residential-Proxys da sind, ein großer Pool echter IPs auf Haushaltsebene mit Länder- und Stadt-Targeting und Sticky-Sessions, wenn eine Sequenz sie braucht. Die Abrechnung pro GB bedeutet, dass du für die Daten zahlst, die du tatsächlich ziehst, was zu einer Arbeitslast passt, die von einem fokussierten Domänen-Crawl bis zu einem Korpus reicht, der in Millionen von Seiten gemessen wird.

Bereit, loszulegen?

Testen Sie Shifters Residential-Proxys, 205M+ IPs, 195+ Länder, ab $0.75/GB.

Jetzt starten