Wissen

Wie man gefälschte Bewertungen und Bewertungsbetrug im großen Maßstab erkennt

Gefälschte Bewertungen sind in den USA, Großbritannien und der EU verboten, und Plattformen entfernen Hunderte Millionen davon. Wie man Bewertungsbetrug bei vielen Produkten erkennt, mit getestetem Code.

Matt Brown

Matt Brown

2. Oktober 2026 · 10 Min. Lesezeit

Gefälschte Bewertungen sind nicht mehr nur ein Reputationsproblem. Sie sind inzwischen auch ein rechtliches Problem in den Vereinigten Staaten, dem Vereinigten Königreich und der Europäischen Union, und die Plattformen, die Bewertungen hosten, entfernen sie zu Hunderten von Millionen. Für eine Marke, einen Marketplace oder ein Trust-and-Safety-Team stellt sich damit eine praktische Frage: Wie findet man Bewertungsbetrug über Tausende von Produkten hinweg, nicht nur bei dem einen Listing, über das sich jemand beschwert hat?

Dieser Leitfaden behandelt das Ausmaß des Problems, die Signale, die Kampagnen tatsächlich von echten Kunden unterscheiden, getesteten Code für die drei nützlichsten davon, und wie man Bewertungsdaten verantwortungsvoll sammelt.

Die wichtigsten Erkenntnisse

  • Das Ausmaß ist groß. Google hat 2025 über 292 Millionen richtlinienwidrige Bewertungen auf Maps blockiert oder entfernt, und Amazon gibt an, 2023 mehr als 250 Millionen mutmaßlich gefälschte Bewertungen gestoppt zu haben.
  • Bewertungen lesen funktioniert nicht. In einer bekannten Studie lagen menschliche Prüfer beim Erkennen gefälschter Hotelbewertungen nahe am Zufall, zwischen 53 % und 62 % korrekt, während ein trainierter Klassifikator etwa 90 % erreichte.
  • Koordinierte Kampagnen hinterlassen Verhaltensspuren: Bewertungsschübe innerhalb weniger Tage, nahezu identische Formulierungen und Rezensenten ohne sonstige Historie.
  • Signale kombinieren. In unserem Test war die Formulierungsähnlichkeit allein verrauscht, während Schübe kombiniert mit doppelten Formulierungen oder Konten mit nur einer Bewertung jede eingeschleuste gefälschte Bewertung erfassten, bei höchstens drei falsch positiven Ergebnissen.
  • Behandeln Sie Flags als Hinweise für die menschliche Prüfung, pseudonymisieren Sie Rezensentendaten und prüfen Sie die rechtliche Lage, bevor Sie aufgrund von Ergebnissen handeln.

Wie groß das Problem ist

Die eigenen Transparenzzahlen der Plattformen vermitteln einen Eindruck vom Ausmaß:

PlattformZahlZeitraum
Google MapsÜber 292 Millionen richtlinienwidrige Bewertungen blockiert oder entfernt; über 13 Millionen gefälschte Business-Profile entfernt2025
AmazonMehr als 250 Millionen mutmaßlich gefälschte Bewertungen gestoppt2023
Tripadvisor2,7 Millionen betrügerische Bewertungen von 31,1 Millionen eingereichten; 54 % des Betrugs waren Unternehmen, die sich selbst pushten; 214.000 KI-generierte Bewertungen entfernt2024

Das sind die Bewertungen, die erwischt wurden. Sie zeigen auch, wie Betrug meist aussieht: Bei Tripadvisor war mehr als die Hälfte Review-Boosting durch Unternehmen oder mit ihnen verbundene Personen, keine ausgefeilte Täuschung.

Die Regeln haben sich geändert

Drei große Märkte verbieten gefälschte Bewertungen inzwischen ausdrücklich:

  • Vereinigte Staaten. Die Regel der Federal Trade Commission zu Verbraucherbewertungen und Testimonials, in Kraft seit Oktober 2024, verbietet gefälschte Bewertungen, das Kaufen positiver oder negativer Bewertungen, nicht offengelegte Insider-Bewertungen, unternehmenskontrollierte Bewertungsseiten, die als unabhängig dargestellt werden, sowie das Unterdrücken von Bewertungen, und erlaubt der Behörde, zivilrechtliche Strafen zu verhängen.
  • Vereinigtes Königreich. Seit dem 6. April 2025 sind das Einreichen oder Beauftragen gefälschter Bewertungen, das Verschleiern von incentivierten Bewertungen und das Veröffentlichen von Bewertungen auf irreführende Weise verbotene Praktiken, und Unternehmen, die Bewertungen veröffentlichen, müssen angemessene Schritte unternehmen, um gefälschte zu verhindern und zu entfernen. Die Aufsichtsbehörde kann Bußgelder bis zu 10 % des weltweiten Umsatzes verhängen.
  • Europäische Union. Seit Mai 2022 müssen Händler, die Bewertungen anzeigen, angeben, ob und wie sie prüfen, dass Bewertungen von Kunden stammen, die das Produkt tatsächlich genutzt oder gekauft haben, und das Einreichen oder Beauftragen gefälschter Bewertungen ist verboten.

Für Marketplaces und Bewertungsplattformen macht das Erkennung von einer netten Zusatzfunktion zu einem Teil der Compliance. Für Marken schafft es einen Weg, zu handeln, wenn Wettbewerber Bewertungen kaufen. Dies sind allgemeine Informationen, keine Rechtsberatung; konsultieren Sie einen Anwalt zu Ihrer eigenen Situation.

Warum das Lesen der Bewertungen nicht funktioniert

Die bekannteste akademische Studie zu diesem Problem, von Ott, Choi, Cardie und Hancock an der Cornell University, erstellte einen Satz von 800 Hotelbewertungen: 400 echte und 400 zur Täuschung verfasste. Drei menschliche Prüfer klassifizierten sie. Ihre Genauigkeit lag bei 53,1 %, 56,9 % und 61,9 %, und bei zweien der drei war der Unterschied zum Raten statistisch nicht signifikant. Alle drei neigten dazu, Bewertungen für echt zu halten. Ein auf Wortmustern trainierter Klassifikator erreichte 89,8 %.

Das hat zwei Folgen. Manuelle Stichprobenprüfungen werden die meisten Fälschungen übersehen. Und reine Texterkennung ist heute schwieriger als 2011: Ein Modell kann auf Abruf abwechslungsreiche, natürlich klingende Bewertungen schreiben, weshalb Tripadvisor KI-generierte Bewertungen inzwischen als eigene Kategorie ausweist. Die Signale, die besser standhalten, sind verhaltensbasiert: wann Bewertungen eintreffen, wer sie schreibt, und wie ähnlich sie einander sind.

Die Signale, die standhalten

SignalWas es erfasstSchwäche
SchübeDutzende Bewertungen innerhalb weniger Tage bei einem Produkt, das normalerweise zwei pro Tag bekommtEchte Spitzen nach einem Sale, einem Launch oder Presseberichten
Nahezu identische FormulierungenVorlagenbasierte Bewertungen mit kleinen WortänderungenGängige Formulierungen in echten Bewertungen; vielfältiger KI-geschriebener Text
Konten mit nur einer BewertungFür eine einzelne Kampagne angelegte RezensentenNeue echte Kunden
BewertungsformEine plötzliche Serie von Fünf-Sterne-Bewertungen mit wenig DetailsProdukte, die tatsächlich gut sind
Produktübergreifende ÜberschneidungenDieselben Rezensenten erscheinen bei mehreren Produkten eines VerkäufersTreue Kunden
Marktübergreifende UnterschiedeEin Produkt wird in einem Länder-Storefront sehr unterschiedlich bewertetEchte Unterschiede bei lokalen Versionen oder beim Service

Kein einzelnes Signal ist zuverlässig. Ein Schub kann ein erfolgreicher Launch sein; ähnliche Formulierungen können eine gängige Phrase sein. Kampagnen zeigen tendenziell mehrere Signale gleichzeitig, was deren Kombination wirksam macht.

Der Code

Das folgende Modul implementiert drei dieser Signale und eine Möglichkeit, sie zu kombinieren. Es benötigt keine externen Bibliotheken. Rezensentennamen werden vor der Analyse durch gesalzene Hashes ersetzt, da Bewertungen personenbezogene Daten sind und die Analyse den Namen selbst nie benötigt.

import hashlib
import re
from collections import Counter, defaultdict
from statistics import median


def pseudonymise(author, salt):
    """Replace a reviewer's name with a stable token, so analysis never needs the name itself."""
    return hashlib.sha256((salt + author).encode()).hexdigest()[:12]


def review_bursts(reviews, k=6.0, min_count=5):
    """Flag days whose review count is far above the product's typical day, using a robust baseline."""
    daily = Counter(r["date"] for r in reviews)
    counts = list(daily.values())
    base = median(counts)
    spread = median(abs(c - base) for c in counts) or 1
    flagged = []
    for day, n in sorted(daily.items()):
        if n >= min_count and n > base + k * spread:
            day_reviews = [r for r in reviews if r["date"] == day]
            five_star = sum(r["rating"] == 5 for r in day_reviews) / n
            flagged.append({"date": day, "reviews": n, "baseline": base, "five_star_share": round(five_star, 2)})
    return flagged


def shingles(text, size=5):
    text = re.sub(r"\s+", " ", text.lower()).strip()
    return {text[i:i + size] for i in range(max(1, len(text) - size + 1))}


def near_duplicates(reviews, threshold=0.5):
    """Pairs of reviews by different reviewers whose wording overlaps heavily (Jaccard on 5-character shingles)."""
    sets = [shingles(r["text"]) for r in reviews]
    pairs = []
    for i in range(len(reviews)):
        for j in range(i + 1, len(reviews)):
            if reviews[i]["reviewer"] == reviews[j]["reviewer"]:
                continue
            overlap = len(sets[i] & sets[j]) / len(sets[i] | sets[j])
            if overlap >= threshold:
                pairs.append((reviews[i]["id"], reviews[j]["id"], round(overlap, 2)))
    return pairs


def one_review_accounts(reviews, history):
    """Share of reviewers in this set who have reviewed nothing else; history maps reviewer to their total reviews."""
    reviewers = {r["reviewer"] for r in reviews}
    return sum(history.get(x, 1) == 1 for x in reviewers) / len(reviewers)


def suspicious_reviews(reviews, history, threshold=0.5):
    """Combine the signals: a review is suspicious when it sits in a burst and either duplicates
    other wording or comes from a one-review account."""
    burst_days = {b["date"] for b in review_bursts(reviews)}
    duplicated = defaultdict(int)
    for a, b, _ in near_duplicates(reviews, threshold):
        duplicated[a] += 1
        duplicated[b] += 1
    return [r["id"] for r in reviews
            if r["date"] in burst_days and (duplicated[r["id"]] or history.get(r["reviewer"], 1) == 1)]

Der Schub-Detektor verwendet den Median und die mittlere absolute Abweichung vom Median statt Mittelwert und Standardabweichung, sodass der Schub selbst nicht die Baseline aufbläht, an der er gemessen wird. Der paarweise Vergleich in near_duplicates eignet sich gut für die Bewertungen eines einzelnen Produkts; bei einem ganzen Katalog sollten Sie Bewertungen zunächst nach Produkt oder Verkäufer gruppieren oder Locality-Sensitive Hashing einsetzen.

Wie er abschnitt

Wir haben den Code an einem konstruierten Datensatz getestet, bei dem die Antwort bekannt war: ein Produkt mit sechs Monaten organischer Bewertungen, zwischen 256 und 285 davon mit wenigen pro Tag, realistischen Bewertungen und abwechslungsreichen Formulierungen, plus eine eingeschleuste Kampagne von 40 vorlagenbasierten Fünf-Sterne-Bewertungen von neuen Konten über drei Tage. Wir haben den Test mit sechs verschiedenen Zufalls-Seeds durchgeführt.

PrüfungErgebnis über sechs Durchläufe
Durch Schuberkennung gefundene KampagnentageAlle drei, jedes Mal; 13 bis 16 Bewertungen pro Tag gegenüber einer Baseline von 2
Durch die kombinierte Regel erfasste eingeschleuste Bewertungen40 von 40, jedes Mal
Durch die kombinierte Regel fälschlich geflaggte echte Bewertungen0 bis 3
Nahezu identische Paare mit einer echten Bewertung, nur anhand der Formulierung27 bis 42
Rezensenten ohne sonstige Bewertungen81 % bis 100 % an Kampagnentagen, gegenüber 27 % bis 31 % insgesamt

Die letzten beiden Zeilen sind die wichtigen. Formulierungsähnlichkeit allein flaggte Dutzende Paare mit echten Kunden, weil echte Bewertungen gewöhnliche Formulierungen teilen. Erst in Kombination mit einem Schub wurde sie präzise. Das ist das Muster, das man übernehmen sollte: Ein Signal nominiert, ein anderes bestätigt.

Ein konstruierter Test ist nicht die reale Welt. Echte Kampagnen verteilen Bewertungen über Wochen, variieren den Text und lassen Konten altern, bevor sie genutzt werden. Erwarten Sie in der Praxis eine geringere Trefferquote, stimmen Sie die Schwellenwerte an bereits bestätigten Fällen ab und behandeln Sie jedes Flag als Hinweis für eine menschliche Prüfung, nicht als Urteil.

Bewertungsdaten sammeln

Für die Erkennung werden die Bewertungen benötigt, mit Daten, Bewertungen und genügend Rezensentenkontext, um die Historie zu sehen. Beim Sammeln sind einige Punkte wichtig:

  • Über Märkte hinweg sammeln. Dasselbe Produkt zeigt in verschiedenen Länder-Storefronts oft unterschiedliche Bewertungen, und Kampagnen zielen häufig auf einen bestimmten Markt ab. Jeden Storefront aus dem jeweiligen Land zu sammeln zeigt, was lokale Käufer sehen, derselbe Ansatz wie bei der Überwachung von Kundenbewertungen.
  • Historie behalten. Schübe und Konten mit nur einer Bewertung lassen sich nur über die Zeit messen, daher sollten Sie nach einem festen Zeitplan sammeln und das Gesammelte aufbewahren.
  • Personenbezogene Daten minimieren. Speichern Sie wo möglich pseudonymisierte Rezensenten-Tokens statt Namen, behalten Sie nur die Felder, die die Analyse nutzt, und legen Sie eine Aufbewahrungsfrist fest, wie unter Residential Proxies und DSGVO beschrieben.
  • Innerhalb der Regeln bleiben. Sammeln Sie öffentliche Bewertungsseiten in moderatem Tempo, respektieren Sie die Nutzungsbedingungen jeder Seite, und lassen Sie alles hinter einem Login unangetastet.

Bewertungsbetrug tritt selten allein auf. Verkäufer, die Bewertungen kaufen, kapern oft auch Listings oder verkaufen Fälschungen, und Bewertungstexte benötigen zunehmend dieselbe Prüfung wie jeder andere KI-generierte Inhalt. Für Teams, die dies über viele Quellen hinweg betreiben, ist der umfassendere Workflow auf unserer Seite zu Content Moderation im großen Maßstab beschrieben.

Fazit

Gefälschte Bewertungen sind verbreitet, inzwischen in den größten Märkten ausdrücklich illegal und durch Lesen schwer zu erkennen. Was Kampagnen verrät, ist Verhalten: zu viele Bewertungen zu schnell, zu ähnlich zueinander, von Konten ohne sonstige Historie.

Sammeln Sie Bewertungen über die Zeit und über Märkte hinweg, pseudonymisieren Sie, wer sie geschrieben hat, kombinieren Sie Signale, sodass jedes die anderen bestätigt, und leiten Sie das, was Sie flaggen, an eine Person weiter, bevor jemand danach handelt.

Quellen und Referenzen

Bereit, loszulegen?

Testen Sie Shifters Residential-Proxys, 205M+ IPs, 195+ Länder, ab 0,75 $/GB.

Jetzt starten