Avaliações falsas já não são apenas um problema de reputação. Agora são também um problema legal nos Estados Unidos, no Reino Unido e na União Europeia, e as plataformas que hospedam avaliações removem centenas de milhões delas. Para uma marca, um marketplace ou uma equipe de confiança e segurança, isso levanta uma questão prática: como encontrar fraude em avaliações em milhares de produtos, e não apenas no único anúncio sobre o qual alguém reclamou?
Este guia cobre a escala do problema, os sinais que realmente separam campanhas de clientes reais, código testado para os três sinais mais úteis, e como coletar dados de avaliações de forma responsável.
Principais conclusões
- A escala é grande. O Google bloqueou ou removeu mais de 292 milhões de avaliações que violavam as políticas do Maps em 2025, e a Amazon afirma ter impedido mais de 250 milhões de avaliações falsas suspeitas em 2023.
- Ler as avaliações não funciona. Em um estudo conhecido, avaliadores humanos identificando avaliações falsas de hotéis tiveram desempenho próximo do acaso, entre 53% e 62% de acerto, enquanto um classificador treinado alcançou cerca de 90%.
- Campanhas coordenadas deixam rastros comportamentais: picos de avaliações em poucos dias, redação quase idêntica e avaliadores sem nenhum outro histórico.
- Combine sinais. Em nosso teste, a similaridade de redação sozinha era ruidosa, enquanto picos combinados com redação duplicada ou contas com uma única avaliação capturaram todas as avaliações falsas plantadas, com no máximo três falsos positivos.
- Trate os sinalizadores como pistas para revisão humana, pseudonimize os dados dos avaliadores e verifique a posição legal antes de agir sobre as descobertas.
O tamanho do problema
Os próprios números de transparência das plataformas dão uma ideia da escala:
| Plataforma | Número | Período |
|---|---|---|
| Google Maps | Mais de 292 milhões de avaliações que violavam as políticas bloqueadas ou removidas; mais de 13 milhões de perfis de empresas falsos removidos | 2025 |
| Amazon | Mais de 250 milhões de avaliações falsas suspeitas impedidas | 2023 |
| Tripadvisor | 2,7 milhões de avaliações fraudulentas de 31,1 milhões enviadas; 54% da fraude eram empresas se promovendo; 214.000 avaliações geradas por IA removidas | 2024 |
Essas são as avaliações que foram capturadas. Elas também mostram o que a fraude geralmente aparenta: no Tripadvisor, mais da metade era promoção de avaliações por empresas ou pessoas ligadas a elas, não um engano elaborado.
As regras mudaram
Três grandes mercados agora proíbem explicitamente avaliações falsas:
- Estados Unidos. A regra da Federal Trade Commission sobre avaliações e depoimentos de consumidores, em vigor desde outubro de 2024, proíbe avaliações falsas, a compra de avaliações positivas ou negativas, avaliações não divulgadas de pessoas internas à empresa, sites de avaliações controlados pela empresa apresentados como independentes, e a supressão de avaliações, e permite que a agência busque penalidades civis.
- Reino Unido. Desde 6 de abril de 2025, enviar ou encomendar avaliações falsas, ocultar avaliações incentivadas e publicar avaliações de forma enganosa são práticas proibidas, e empresas que publicam avaliações devem tomar medidas razoáveis para prevenir e remover avaliações falsas. O órgão regulador pode aplicar multa de até 10% do faturamento global.
- União Europeia. Desde maio de 2022, comerciantes que exibem avaliações devem informar se e como verificam que as avaliações vêm de clientes que de fato usaram ou compraram o produto, e enviar ou encomendar avaliações falsas é proibido.
Para marketplaces e publicadores de avaliações, isso transforma a detecção de algo desejável em parte da conformidade regulatória. Para marcas, isso cria um caminho para agir quando concorrentes compram avaliações. Esta é uma informação geral, não um aconselhamento jurídico; consulte um advogado sobre sua situação específica.
Por que ler as avaliações não funciona
O estudo acadêmico mais conhecido sobre o problema, de Ott, Choi, Cardie e Hancock, da Cornell, montou um conjunto de 800 avaliações de hotéis: 400 genuínas e 400 escritas para enganar. Três avaliadores humanos as classificaram. Sua precisão foi de 53,1%, 56,9% e 61,9%, e para dois dos três a diferença em relação ao chute não foi estatisticamente significativa. Todos os três tenderam a acreditar que as avaliações eram genuínas. Um classificador treinado em padrões de palavras alcançou 89,8%.
Isso tem duas implicações. Verificações manuais pontuais deixarão passar a maioria das falsas. E a detecção baseada apenas em texto é hoje mais difícil do que era em 2011: um modelo pode escrever avaliações variadas e com som natural sob demanda, motivo pelo qual o Tripadvisor agora reporta avaliações geradas por IA como uma categoria própria. Os sinais que se sustentam melhor são comportamentais: quando as avaliações chegam, quem as escreve e o quão semelhantes são entre si.
Os sinais que se sustentam
| Sinal | O que captura | Fraqueza |
|---|---|---|
| Picos | Dezenas de avaliações em poucos dias em um produto que normalmente recebe duas por dia | Picos genuínos após uma promoção, um lançamento ou cobertura da imprensa |
| Redação quase duplicada | Avaliações baseadas em modelo com pequenas trocas de palavras | Frases comuns em avaliações genuínas; texto variado escrito por IA |
| Contas com uma única avaliação | Avaliadores criados para uma única campanha | Novos clientes genuínos |
| Formato das notas | Uma sequência repentina de avaliações de cinco estrelas com pouco detalhe | Produtos que realmente são bons |
| Sobreposição entre produtos | Os mesmos avaliadores aparecendo nos produtos de um único vendedor | Clientes fiéis |
| Diferenças entre mercados | Um produto avaliado de forma muito diferente na vitrine de um país | Diferenças reais nas versões locais ou no atendimento |
Nenhum sinal isolado é confiável. Um pico pode ser um lançamento bem-sucedido; redação semelhante pode ser uma frase comum. Campanhas tendem a mostrar vários sinais ao mesmo tempo, o que é o que torna a combinação eficaz.
O código
O módulo abaixo implementa três desses sinais e uma forma de combiná-los. Não precisa de nenhuma biblioteca externa. Os nomes dos avaliadores são substituídos por hashes com salt antes da análise, já que avaliações são dados pessoais e a análise nunca precisa do nome em si.
import hashlib
import re
from collections import Counter, defaultdict
from statistics import median
def pseudonymise(author, salt):
"""Replace a reviewer's name with a stable token, so analysis never needs the name itself."""
return hashlib.sha256((salt + author).encode()).hexdigest()[:12]
def review_bursts(reviews, k=6.0, min_count=5):
"""Flag days whose review count is far above the product's typical day, using a robust baseline."""
daily = Counter(r["date"] for r in reviews)
counts = list(daily.values())
base = median(counts)
spread = median(abs(c - base) for c in counts) or 1
flagged = []
for day, n in sorted(daily.items()):
if n >= min_count and n > base + k * spread:
day_reviews = [r for r in reviews if r["date"] == day]
five_star = sum(r["rating"] == 5 for r in day_reviews) / n
flagged.append({"date": day, "reviews": n, "baseline": base, "five_star_share": round(five_star, 2)})
return flagged
def shingles(text, size=5):
text = re.sub(r"\s+", " ", text.lower()).strip()
return {text[i:i + size] for i in range(max(1, len(text) - size + 1))}
def near_duplicates(reviews, threshold=0.5):
"""Pairs of reviews by different reviewers whose wording overlaps heavily (Jaccard on 5-character shingles)."""
sets = [shingles(r["text"]) for r in reviews]
pairs = []
for i in range(len(reviews)):
for j in range(i + 1, len(reviews)):
if reviews[i]["reviewer"] == reviews[j]["reviewer"]:
continue
overlap = len(sets[i] & sets[j]) / len(sets[i] | sets[j])
if overlap >= threshold:
pairs.append((reviews[i]["id"], reviews[j]["id"], round(overlap, 2)))
return pairs
def one_review_accounts(reviews, history):
"""Share of reviewers in this set who have reviewed nothing else; history maps reviewer to their total reviews."""
reviewers = {r["reviewer"] for r in reviews}
return sum(history.get(x, 1) == 1 for x in reviewers) / len(reviewers)
def suspicious_reviews(reviews, history, threshold=0.5):
"""Combine the signals: a review is suspicious when it sits in a burst and either duplicates
other wording or comes from a one-review account."""
burst_days = {b["date"] for b in review_bursts(reviews)}
duplicated = defaultdict(int)
for a, b, _ in near_duplicates(reviews, threshold):
duplicated[a] += 1
duplicated[b] += 1
return [r["id"] for r in reviews
if r["date"] in burst_days and (duplicated[r["id"]] or history.get(r["reviewer"], 1) == 1)]
O detector de picos usa a mediana e o desvio absoluto mediano em vez da média e do desvio padrão, de modo que o próprio pico não infla a linha de base em relação à qual é medido. A comparação par a par em near_duplicates funciona bem para as avaliações de um único produto; em um catálogo inteiro, agrupe as avaliações por produto ou vendedor primeiro, ou use locality-sensitive hashing.
Como ele se saiu
Testamos o código em um conjunto de dados construído onde a resposta era conhecida: um produto com seis meses de avaliações orgânicas, entre 256 e 285 delas, a poucas por dia, com notas realistas e redação variada, mais uma campanha plantada de 40 avaliações de cinco estrelas baseadas em modelo, vindas de contas novas ao longo de três dias. Executamos com seis sementes aleatórias diferentes.
| Verificação | Resultado nas seis execuções |
|---|---|
| Dias de campanha encontrados pela detecção de picos | Todos os três, sempre; 13 a 16 avaliações por dia contra uma linha de base de 2 |
| Avaliações plantadas capturadas pela regra combinada | 40 de 40, sempre |
| Avaliações genuínas sinalizadas incorretamente pela regra combinada | 0 a 3 |
| Pares quase duplicados envolvendo uma avaliação genuína, apenas por redação | 27 a 42 |
| Avaliadores sem outras avaliações | 81% a 100% nos dias de campanha, contra 27% a 31% no geral |
As duas últimas linhas são as importantes. A similaridade de redação sozinha sinalizou dezenas de pares envolvendo clientes genuínos, porque avaliações reais compartilham frases comuns. Só quando combinada com um pico ela se tornou precisa. Esse é o padrão a reproduzir: deixe um sinal indicar e outro confirmar.
Um teste construído não é o mundo real. Campanhas reais distribuem avaliações ao longo de semanas, variam o texto e deixam as contas “amadurecerem” antes de usá-las. Espere uma recuperação menor na prática, ajuste os limiares com casos que você já confirmou, e trate cada sinalização como uma pista para um revisor humano, não como um veredito.
Coletando dados de avaliações
A detecção precisa das avaliações, com datas, notas e contexto suficiente sobre o avaliador para ver o histórico. Alguns pontos importam na coleta:
- Colete em vários mercados. O mesmo produto frequentemente mostra avaliações diferentes nas vitrines de países diferentes, e campanhas costumam mirar em um único mercado. Coletar cada vitrine de dentro de seu respectivo país mostra o que os compradores locais veem, a mesma abordagem usada para monitorar avaliações de clientes.
- Mantenha o histórico. Picos e contas com uma única avaliação só podem ser medidos ao longo do tempo, então colete em uma programação regular e mantenha o que foi coletado.
- Minimize dados pessoais. Armazene tokens pseudonimizados de avaliadores em vez de nomes sempre que possível, mantenha apenas os campos que a análise usa, e defina um período de retenção, conforme abordado em proxies residenciais e GDPR.
- Permaneça dentro das regras. Colete páginas públicas de avaliações em um ritmo moderado, respeite os termos de cada site e não toque em nada atrás de um login.
Fraude em avaliações raramente ocorre sozinha. Vendedores que compram avaliações também costumam sequestrar anúncios ou vender falsificações, e o texto das avaliações cada vez mais exige o mesmo escrutínio que qualquer outro conteúdo gerado por IA. Para equipes que fazem isso em várias fontes, o fluxo de trabalho mais amplo está descrito em nossa página de moderação de conteúdo em escala.
Conclusão
Avaliações falsas são comuns, agora explicitamente ilegais nos maiores mercados, e difíceis de identificar apenas lendo. O que denuncia as campanhas é o comportamento: avaliações demais, rápido demais, muito parecidas entre si, vindas de contas sem nenhum outro histórico.
Colete avaliações ao longo do tempo e em vários mercados, pseudonimize quem as escreveu, combine sinais para que um confirme o outro, e envie o que você sinalizar para uma pessoa antes que alguém aja com base nisso.
Fontes e referências
- Google, New ways we’re protecting businesses on Maps, dados de 2025.
- Amazon, How Amazon maintains a trusted review experience.
- Tripadvisor, 2025 Transparency Report.
- Federal Trade Commission, final rule banning fake reviews and testimonials, agosto de 2024.
- Ott, Choi, Cardie e Hancock, Finding Deceptive Opinion Spam by Any Stretch of the Imagination, ACL 2011.
- Conjunto de dados de teste construído e código por Shifter, 2 de outubro de 2026.