Gefälschte Bewertungen sind nicht mehr nur ein Reputationsproblem. Sie sind inzwischen auch ein rechtliches Problem in den Vereinigten Staaten, dem Vereinigten Königreich und der Europäischen Union, und die Plattformen, die Bewertungen hosten, entfernen sie zu Hunderten von Millionen. Für eine Marke, einen Marketplace oder ein Trust-and-Safety-Team stellt sich damit eine praktische Frage: Wie findet man Bewertungsbetrug über Tausende von Produkten hinweg, nicht nur bei dem einen Listing, über das sich jemand beschwert hat?
Dieser Leitfaden behandelt das Ausmaß des Problems, die Signale, die Kampagnen tatsächlich von echten Kunden unterscheiden, getesteten Code für die drei nützlichsten davon, und wie man Bewertungsdaten verantwortungsvoll sammelt.
Die wichtigsten Erkenntnisse
- Das Ausmaß ist groß. Google hat 2025 über 292 Millionen richtlinienwidrige Bewertungen auf Maps blockiert oder entfernt, und Amazon gibt an, 2023 mehr als 250 Millionen mutmaßlich gefälschte Bewertungen gestoppt zu haben.
- Bewertungen lesen funktioniert nicht. In einer bekannten Studie lagen menschliche Prüfer beim Erkennen gefälschter Hotelbewertungen nahe am Zufall, zwischen 53 % und 62 % korrekt, während ein trainierter Klassifikator etwa 90 % erreichte.
- Koordinierte Kampagnen hinterlassen Verhaltensspuren: Bewertungsschübe innerhalb weniger Tage, nahezu identische Formulierungen und Rezensenten ohne sonstige Historie.
- Signale kombinieren. In unserem Test war die Formulierungsähnlichkeit allein verrauscht, während Schübe kombiniert mit doppelten Formulierungen oder Konten mit nur einer Bewertung jede eingeschleuste gefälschte Bewertung erfassten, bei höchstens drei falsch positiven Ergebnissen.
- Behandeln Sie Flags als Hinweise für die menschliche Prüfung, pseudonymisieren Sie Rezensentendaten und prüfen Sie die rechtliche Lage, bevor Sie aufgrund von Ergebnissen handeln.
Wie groß das Problem ist
Die eigenen Transparenzzahlen der Plattformen vermitteln einen Eindruck vom Ausmaß:
| Plattform | Zahl | Zeitraum |
|---|---|---|
| Google Maps | Über 292 Millionen richtlinienwidrige Bewertungen blockiert oder entfernt; über 13 Millionen gefälschte Business-Profile entfernt | 2025 |
| Amazon | Mehr als 250 Millionen mutmaßlich gefälschte Bewertungen gestoppt | 2023 |
| Tripadvisor | 2,7 Millionen betrügerische Bewertungen von 31,1 Millionen eingereichten; 54 % des Betrugs waren Unternehmen, die sich selbst pushten; 214.000 KI-generierte Bewertungen entfernt | 2024 |
Das sind die Bewertungen, die erwischt wurden. Sie zeigen auch, wie Betrug meist aussieht: Bei Tripadvisor war mehr als die Hälfte Review-Boosting durch Unternehmen oder mit ihnen verbundene Personen, keine ausgefeilte Täuschung.
Die Regeln haben sich geändert
Drei große Märkte verbieten gefälschte Bewertungen inzwischen ausdrücklich:
- Vereinigte Staaten. Die Regel der Federal Trade Commission zu Verbraucherbewertungen und Testimonials, in Kraft seit Oktober 2024, verbietet gefälschte Bewertungen, das Kaufen positiver oder negativer Bewertungen, nicht offengelegte Insider-Bewertungen, unternehmenskontrollierte Bewertungsseiten, die als unabhängig dargestellt werden, sowie das Unterdrücken von Bewertungen, und erlaubt der Behörde, zivilrechtliche Strafen zu verhängen.
- Vereinigtes Königreich. Seit dem 6. April 2025 sind das Einreichen oder Beauftragen gefälschter Bewertungen, das Verschleiern von incentivierten Bewertungen und das Veröffentlichen von Bewertungen auf irreführende Weise verbotene Praktiken, und Unternehmen, die Bewertungen veröffentlichen, müssen angemessene Schritte unternehmen, um gefälschte zu verhindern und zu entfernen. Die Aufsichtsbehörde kann Bußgelder bis zu 10 % des weltweiten Umsatzes verhängen.
- Europäische Union. Seit Mai 2022 müssen Händler, die Bewertungen anzeigen, angeben, ob und wie sie prüfen, dass Bewertungen von Kunden stammen, die das Produkt tatsächlich genutzt oder gekauft haben, und das Einreichen oder Beauftragen gefälschter Bewertungen ist verboten.
Für Marketplaces und Bewertungsplattformen macht das Erkennung von einer netten Zusatzfunktion zu einem Teil der Compliance. Für Marken schafft es einen Weg, zu handeln, wenn Wettbewerber Bewertungen kaufen. Dies sind allgemeine Informationen, keine Rechtsberatung; konsultieren Sie einen Anwalt zu Ihrer eigenen Situation.
Warum das Lesen der Bewertungen nicht funktioniert
Die bekannteste akademische Studie zu diesem Problem, von Ott, Choi, Cardie und Hancock an der Cornell University, erstellte einen Satz von 800 Hotelbewertungen: 400 echte und 400 zur Täuschung verfasste. Drei menschliche Prüfer klassifizierten sie. Ihre Genauigkeit lag bei 53,1 %, 56,9 % und 61,9 %, und bei zweien der drei war der Unterschied zum Raten statistisch nicht signifikant. Alle drei neigten dazu, Bewertungen für echt zu halten. Ein auf Wortmustern trainierter Klassifikator erreichte 89,8 %.
Das hat zwei Folgen. Manuelle Stichprobenprüfungen werden die meisten Fälschungen übersehen. Und reine Texterkennung ist heute schwieriger als 2011: Ein Modell kann auf Abruf abwechslungsreiche, natürlich klingende Bewertungen schreiben, weshalb Tripadvisor KI-generierte Bewertungen inzwischen als eigene Kategorie ausweist. Die Signale, die besser standhalten, sind verhaltensbasiert: wann Bewertungen eintreffen, wer sie schreibt, und wie ähnlich sie einander sind.
Die Signale, die standhalten
| Signal | Was es erfasst | Schwäche |
|---|---|---|
| Schübe | Dutzende Bewertungen innerhalb weniger Tage bei einem Produkt, das normalerweise zwei pro Tag bekommt | Echte Spitzen nach einem Sale, einem Launch oder Presseberichten |
| Nahezu identische Formulierungen | Vorlagenbasierte Bewertungen mit kleinen Wortänderungen | Gängige Formulierungen in echten Bewertungen; vielfältiger KI-geschriebener Text |
| Konten mit nur einer Bewertung | Für eine einzelne Kampagne angelegte Rezensenten | Neue echte Kunden |
| Bewertungsform | Eine plötzliche Serie von Fünf-Sterne-Bewertungen mit wenig Details | Produkte, die tatsächlich gut sind |
| Produktübergreifende Überschneidungen | Dieselben Rezensenten erscheinen bei mehreren Produkten eines Verkäufers | Treue Kunden |
| Marktübergreifende Unterschiede | Ein Produkt wird in einem Länder-Storefront sehr unterschiedlich bewertet | Echte Unterschiede bei lokalen Versionen oder beim Service |
Kein einzelnes Signal ist zuverlässig. Ein Schub kann ein erfolgreicher Launch sein; ähnliche Formulierungen können eine gängige Phrase sein. Kampagnen zeigen tendenziell mehrere Signale gleichzeitig, was deren Kombination wirksam macht.
Der Code
Das folgende Modul implementiert drei dieser Signale und eine Möglichkeit, sie zu kombinieren. Es benötigt keine externen Bibliotheken. Rezensentennamen werden vor der Analyse durch gesalzene Hashes ersetzt, da Bewertungen personenbezogene Daten sind und die Analyse den Namen selbst nie benötigt.
import hashlib
import re
from collections import Counter, defaultdict
from statistics import median
def pseudonymise(author, salt):
"""Replace a reviewer's name with a stable token, so analysis never needs the name itself."""
return hashlib.sha256((salt + author).encode()).hexdigest()[:12]
def review_bursts(reviews, k=6.0, min_count=5):
"""Flag days whose review count is far above the product's typical day, using a robust baseline."""
daily = Counter(r["date"] for r in reviews)
counts = list(daily.values())
base = median(counts)
spread = median(abs(c - base) for c in counts) or 1
flagged = []
for day, n in sorted(daily.items()):
if n >= min_count and n > base + k * spread:
day_reviews = [r for r in reviews if r["date"] == day]
five_star = sum(r["rating"] == 5 for r in day_reviews) / n
flagged.append({"date": day, "reviews": n, "baseline": base, "five_star_share": round(five_star, 2)})
return flagged
def shingles(text, size=5):
text = re.sub(r"\s+", " ", text.lower()).strip()
return {text[i:i + size] for i in range(max(1, len(text) - size + 1))}
def near_duplicates(reviews, threshold=0.5):
"""Pairs of reviews by different reviewers whose wording overlaps heavily (Jaccard on 5-character shingles)."""
sets = [shingles(r["text"]) for r in reviews]
pairs = []
for i in range(len(reviews)):
for j in range(i + 1, len(reviews)):
if reviews[i]["reviewer"] == reviews[j]["reviewer"]:
continue
overlap = len(sets[i] & sets[j]) / len(sets[i] | sets[j])
if overlap >= threshold:
pairs.append((reviews[i]["id"], reviews[j]["id"], round(overlap, 2)))
return pairs
def one_review_accounts(reviews, history):
"""Share of reviewers in this set who have reviewed nothing else; history maps reviewer to their total reviews."""
reviewers = {r["reviewer"] for r in reviews}
return sum(history.get(x, 1) == 1 for x in reviewers) / len(reviewers)
def suspicious_reviews(reviews, history, threshold=0.5):
"""Combine the signals: a review is suspicious when it sits in a burst and either duplicates
other wording or comes from a one-review account."""
burst_days = {b["date"] for b in review_bursts(reviews)}
duplicated = defaultdict(int)
for a, b, _ in near_duplicates(reviews, threshold):
duplicated[a] += 1
duplicated[b] += 1
return [r["id"] for r in reviews
if r["date"] in burst_days and (duplicated[r["id"]] or history.get(r["reviewer"], 1) == 1)]
Der Schub-Detektor verwendet den Median und die mittlere absolute Abweichung vom Median statt Mittelwert und Standardabweichung, sodass der Schub selbst nicht die Baseline aufbläht, an der er gemessen wird. Der paarweise Vergleich in near_duplicates eignet sich gut für die Bewertungen eines einzelnen Produkts; bei einem ganzen Katalog sollten Sie Bewertungen zunächst nach Produkt oder Verkäufer gruppieren oder Locality-Sensitive Hashing einsetzen.
Wie er abschnitt
Wir haben den Code an einem konstruierten Datensatz getestet, bei dem die Antwort bekannt war: ein Produkt mit sechs Monaten organischer Bewertungen, zwischen 256 und 285 davon mit wenigen pro Tag, realistischen Bewertungen und abwechslungsreichen Formulierungen, plus eine eingeschleuste Kampagne von 40 vorlagenbasierten Fünf-Sterne-Bewertungen von neuen Konten über drei Tage. Wir haben den Test mit sechs verschiedenen Zufalls-Seeds durchgeführt.
| Prüfung | Ergebnis über sechs Durchläufe |
|---|---|
| Durch Schuberkennung gefundene Kampagnentage | Alle drei, jedes Mal; 13 bis 16 Bewertungen pro Tag gegenüber einer Baseline von 2 |
| Durch die kombinierte Regel erfasste eingeschleuste Bewertungen | 40 von 40, jedes Mal |
| Durch die kombinierte Regel fälschlich geflaggte echte Bewertungen | 0 bis 3 |
| Nahezu identische Paare mit einer echten Bewertung, nur anhand der Formulierung | 27 bis 42 |
| Rezensenten ohne sonstige Bewertungen | 81 % bis 100 % an Kampagnentagen, gegenüber 27 % bis 31 % insgesamt |
Die letzten beiden Zeilen sind die wichtigen. Formulierungsähnlichkeit allein flaggte Dutzende Paare mit echten Kunden, weil echte Bewertungen gewöhnliche Formulierungen teilen. Erst in Kombination mit einem Schub wurde sie präzise. Das ist das Muster, das man übernehmen sollte: Ein Signal nominiert, ein anderes bestätigt.
Ein konstruierter Test ist nicht die reale Welt. Echte Kampagnen verteilen Bewertungen über Wochen, variieren den Text und lassen Konten altern, bevor sie genutzt werden. Erwarten Sie in der Praxis eine geringere Trefferquote, stimmen Sie die Schwellenwerte an bereits bestätigten Fällen ab und behandeln Sie jedes Flag als Hinweis für eine menschliche Prüfung, nicht als Urteil.
Bewertungsdaten sammeln
Für die Erkennung werden die Bewertungen benötigt, mit Daten, Bewertungen und genügend Rezensentenkontext, um die Historie zu sehen. Beim Sammeln sind einige Punkte wichtig:
- Über Märkte hinweg sammeln. Dasselbe Produkt zeigt in verschiedenen Länder-Storefronts oft unterschiedliche Bewertungen, und Kampagnen zielen häufig auf einen bestimmten Markt ab. Jeden Storefront aus dem jeweiligen Land zu sammeln zeigt, was lokale Käufer sehen, derselbe Ansatz wie bei der Überwachung von Kundenbewertungen.
- Historie behalten. Schübe und Konten mit nur einer Bewertung lassen sich nur über die Zeit messen, daher sollten Sie nach einem festen Zeitplan sammeln und das Gesammelte aufbewahren.
- Personenbezogene Daten minimieren. Speichern Sie wo möglich pseudonymisierte Rezensenten-Tokens statt Namen, behalten Sie nur die Felder, die die Analyse nutzt, und legen Sie eine Aufbewahrungsfrist fest, wie unter Residential Proxies und DSGVO beschrieben.
- Innerhalb der Regeln bleiben. Sammeln Sie öffentliche Bewertungsseiten in moderatem Tempo, respektieren Sie die Nutzungsbedingungen jeder Seite, und lassen Sie alles hinter einem Login unangetastet.
Bewertungsbetrug tritt selten allein auf. Verkäufer, die Bewertungen kaufen, kapern oft auch Listings oder verkaufen Fälschungen, und Bewertungstexte benötigen zunehmend dieselbe Prüfung wie jeder andere KI-generierte Inhalt. Für Teams, die dies über viele Quellen hinweg betreiben, ist der umfassendere Workflow auf unserer Seite zu Content Moderation im großen Maßstab beschrieben.
Fazit
Gefälschte Bewertungen sind verbreitet, inzwischen in den größten Märkten ausdrücklich illegal und durch Lesen schwer zu erkennen. Was Kampagnen verrät, ist Verhalten: zu viele Bewertungen zu schnell, zu ähnlich zueinander, von Konten ohne sonstige Historie.
Sammeln Sie Bewertungen über die Zeit und über Märkte hinweg, pseudonymisieren Sie, wer sie geschrieben hat, kombinieren Sie Signale, sodass jedes die anderen bestätigt, und leiten Sie das, was Sie flaggen, an eine Person weiter, bevor jemand danach handelt.
Quellen und Referenzen
- Google, New ways we’re protecting businesses on Maps, Zahlen von 2025.
- Amazon, How Amazon maintains a trusted review experience.
- Tripadvisor, 2025 Transparency Report.
- Federal Trade Commission, final rule banning fake reviews and testimonials, August 2024.
- Ott, Choi, Cardie und Hancock, Finding Deceptive Opinion Spam by Any Stretch of the Imagination, ACL 2011.
- Konstruierter Testdatensatz und Code von Shifter, 2. Oktober 2026.