Las reseñas falsas ya no son solo un problema de reputación. Ahora también son un problema legal en Estados Unidos, el Reino Unido y la Unión Europea, y las plataformas que alojan reseñas las eliminan por cientos de millones. Para una marca, un marketplace o un equipo de confianza y seguridad, esto plantea una pregunta práctica: ¿cómo detectar el fraude en reseñas en miles de productos, no solo en el listado concreto sobre el que alguien se ha quejado?
Esta guía cubre la magnitud del problema, las señales que realmente distinguen las campañas de los clientes reales, código probado para las tres señales más útiles, y cómo recopilar datos de reseñas de forma responsable.
Puntos clave
- La escala es grande. Google bloqueó o eliminó más de 292 millones de reseñas que incumplían sus políticas en Maps en 2025, y Amazon afirma haber detenido más de 250 millones de reseñas falsas sospechosas en 2023.
- Leer las reseñas no funciona. En un estudio conocido, los jueces humanos que intentaban detectar reseñas falsas de hoteles obtuvieron resultados cercanos al azar, entre el 53% y el 62% de acierto, mientras que un clasificador entrenado alcanzó cerca del 90%.
- Las campañas coordinadas dejan rastros de comportamiento: ráfagas de reseñas en pocos días, redacciones casi idénticas y reseñadores sin ningún otro historial.
- Combina señales. En nuestra prueba, la similitud de redacción por sí sola generaba mucho ruido, mientras que las ráfagas combinadas con redacción duplicada o cuentas de una sola reseña detectaron todas las reseñas falsas plantadas con un máximo de tres falsos positivos.
- Trata las alertas como pistas para la revisión humana, seudonimiza los datos de los reseñadores y comprueba la situación legal antes de actuar sobre los hallazgos.
La magnitud del problema
Las propias cifras de transparencia de las plataformas dan una idea de la escala:
| Plataforma | Cifra | Periodo |
|---|---|---|
| Google Maps | Más de 292 millones de reseñas que incumplían las políticas bloqueadas o eliminadas; más de 13 millones de perfiles de empresa falsos eliminados | 2025 |
| Amazon | Más de 250 millones de reseñas falsas sospechosas detenidas | 2023 |
| Tripadvisor | 2,7 millones de reseñas fraudulentas de 31,1 millones enviadas; el 54% del fraude consistía en empresas que se promocionaban a sí mismas; 214.000 reseñas generadas por IA eliminadas | 2024 |
Esas son las reseñas que se detectaron. También muestran cómo es el fraude en su mayoría: en Tripadvisor, más de la mitad era promoción de reseñas por parte de empresas o personas vinculadas a ellas, no un engaño elaborado.
Las normas han cambiado
Tres mercados importantes prohíben ahora explícitamente las reseñas falsas:
- Estados Unidos. La norma de la Federal Trade Commission sobre reseñas y testimonios de consumidores, en vigor desde octubre de 2024, prohíbe las reseñas falsas, comprar reseñas positivas o negativas, reseñas de personas con vínculos internos no reveladas, sitios de reseñas controlados por la empresa presentados como independientes, y la supresión de reseñas, y permite a la agencia solicitar sanciones civiles.
- Reino Unido. Desde el 6 de abril de 2025, enviar o encargar reseñas falsas, ocultar reseñas incentivadas y publicar reseñas de forma engañosa son prácticas prohibidas, y las empresas que publican reseñas deben tomar medidas razonables para prevenir y eliminar las falsas. El regulador puede imponer multas de hasta el 10% de la facturación global.
- Unión Europea. Desde mayo de 2022, los comerciantes que muestran reseñas deben indicar si comprueban, y cómo, que las reseñas provienen de clientes que realmente usaron o compraron el producto, y se prohíbe enviar o encargar reseñas falsas.
Para los marketplaces y los editores de reseñas, esto convierte la detección en parte del cumplimiento normativo, algo que ya no es opcional. Para las marcas, crea una vía para actuar cuando los competidores compran reseñas. Esto es información general, no asesoramiento legal; consulta con un abogado sobre tu caso concreto.
Por qué leer las reseñas no funciona
El estudio académico más conocido sobre el problema, de Ott, Choi, Cardie y Hancock en Cornell, construyó un conjunto de 800 reseñas de hoteles: 400 genuinas y 400 escritas para engañar. Tres jueces humanos las clasificaron. Su precisión fue del 53,1%, 56,9% y 61,9%, y para dos de los tres la diferencia respecto al azar no fue estadísticamente significativa. Los tres tendían a creer que las reseñas eran genuinas. Un clasificador entrenado con patrones de palabras alcanzó el 89,8%.
Esto tiene dos implicaciones. Las comprobaciones manuales puntuales pasarán por alto la mayoría de las falsas. Y la detección basada solo en texto es ahora más difícil que en 2011: un modelo puede escribir reseñas variadas y de sonido natural bajo demanda, razón por la cual Tripadvisor ahora informa de las reseñas generadas por IA como su propia categoría. Las señales que se mantienen mejor son de comportamiento: cuándo llegan las reseñas, quién las escribe y cuán parecidas son entre sí.
Las señales que se mantienen
| Señal | Qué detecta | Debilidad |
|---|---|---|
| Ráfagas | Decenas de reseñas en pocos días en un producto que normalmente recibe dos al día | Picos genuinos tras una oferta, un lanzamiento o cobertura de prensa |
| Redacción casi duplicada | Reseñas plantilla con pequeños cambios de palabras | Frases comunes en reseñas genuinas; texto variado generado por IA |
| Cuentas de una sola reseña | Reseñadores creados para una única campaña | Clientes genuinos nuevos |
| Forma de las valoraciones | Una racha repentina de reseñas de cinco estrellas con poco detalle | Productos que realmente son buenos |
| Solapamiento entre productos | Los mismos reseñadores apareciendo en los productos de un mismo vendedor | Clientes fieles |
| Diferencias entre mercados | Un producto valorado de forma muy distinta en la tienda de un país | Diferencias reales en versiones locales o en el servicio |
Ninguna señal aislada es fiable. Una ráfaga puede ser un lanzamiento exitoso; una redacción similar puede ser una frase común. Las campañas tienden a mostrar varias señales a la vez, y eso es lo que hace que combinarlas sea eficaz.
El código
El módulo siguiente implementa tres de estas señales y una forma de combinarlas. No necesita bibliotecas externas. Los nombres de los reseñadores se sustituyen por hashes con sal antes del análisis, ya que las reseñas son datos personales y el análisis nunca necesita el nombre en sí.
import hashlib
import re
from collections import Counter, defaultdict
from statistics import median
def pseudonymise(author, salt):
"""Replace a reviewer's name with a stable token, so analysis never needs the name itself."""
return hashlib.sha256((salt + author).encode()).hexdigest()[:12]
def review_bursts(reviews, k=6.0, min_count=5):
"""Flag days whose review count is far above the product's typical day, using a robust baseline."""
daily = Counter(r["date"] for r in reviews)
counts = list(daily.values())
base = median(counts)
spread = median(abs(c - base) for c in counts) or 1
flagged = []
for day, n in sorted(daily.items()):
if n >= min_count and n > base + k * spread:
day_reviews = [r for r in reviews if r["date"] == day]
five_star = sum(r["rating"] == 5 for r in day_reviews) / n
flagged.append({"date": day, "reviews": n, "baseline": base, "five_star_share": round(five_star, 2)})
return flagged
def shingles(text, size=5):
text = re.sub(r"\s+", " ", text.lower()).strip()
return {text[i:i + size] for i in range(max(1, len(text) - size + 1))}
def near_duplicates(reviews, threshold=0.5):
"""Pairs of reviews by different reviewers whose wording overlaps heavily (Jaccard on 5-character shingles)."""
sets = [shingles(r["text"]) for r in reviews]
pairs = []
for i in range(len(reviews)):
for j in range(i + 1, len(reviews)):
if reviews[i]["reviewer"] == reviews[j]["reviewer"]:
continue
overlap = len(sets[i] & sets[j]) / len(sets[i] | sets[j])
if overlap >= threshold:
pairs.append((reviews[i]["id"], reviews[j]["id"], round(overlap, 2)))
return pairs
def one_review_accounts(reviews, history):
"""Share of reviewers in this set who have reviewed nothing else; history maps reviewer to their total reviews."""
reviewers = {r["reviewer"] for r in reviews}
return sum(history.get(x, 1) == 1 for x in reviewers) / len(reviewers)
def suspicious_reviews(reviews, history, threshold=0.5):
"""Combine the signals: a review is suspicious when it sits in a burst and either duplicates
other wording or comes from a one-review account."""
burst_days = {b["date"] for b in review_bursts(reviews)}
duplicated = defaultdict(int)
for a, b, _ in near_duplicates(reviews, threshold):
duplicated[a] += 1
duplicated[b] += 1
return [r["id"] for r in reviews
if r["date"] in burst_days and (duplicated[r["id"]] or history.get(r["reviewer"], 1) == 1)]
El detector de ráfagas usa la mediana y la desviación absoluta respecto a la mediana en lugar de la media y la desviación estándar, de modo que la propia ráfaga no infle la línea base con la que se mide. La comparación por pares en near_duplicates funciona bien para las reseñas de un solo producto; en todo un catálogo, agrupa las reseñas por producto o vendedor primero, o utiliza hashing sensible a la localidad.
Cómo funcionó
Probamos el código con un conjunto de datos construido donde se conocía la respuesta: un producto con seis meses de reseñas orgánicas, entre 256 y 285 de ellas a razón de unas pocas al día con valoraciones realistas y redacción variada, más una campaña plantada de 40 reseñas plantilla de cinco estrellas de cuentas nuevas a lo largo de tres días. Lo ejecutamos con seis semillas aleatorias distintas.
| Comprobación | Resultado en seis ejecuciones |
|---|---|
| Días de campaña detectados por la detección de ráfagas | Los tres, siempre; de 13 a 16 reseñas al día frente a una línea base de 2 |
| Reseñas plantadas detectadas por la regla combinada | 40 de 40, siempre |
| Reseñas genuinas marcadas erróneamente por la regla combinada | De 0 a 3 |
| Pares de redacción casi duplicada que implicaban una reseña genuina, solo por redacción | De 27 a 42 |
| Reseñadores sin ninguna otra reseña | Del 81% al 100% en días de campaña, frente al 27%-31% en general |
Las dos últimas filas son las importantes. La similitud de redacción por sí sola marcó decenas de pares que implicaban a clientes genuinos, porque las reseñas reales comparten frases habituales. Solo al combinarla con una ráfaga se volvió precisa. Ese es el patrón a reproducir: que una señal proponga y otra confirme.
Una prueba construida no es el mundo real. Las campañas reales reparten las reseñas a lo largo de semanas, varían el texto y maduran sus cuentas antes de usarlas. Espera una recuperación menor en la práctica, ajusta los umbrales con casos que ya hayas confirmado, y trata cada alerta como una pista para un revisor humano, no como un veredicto.
Recopilación de datos de reseñas
La detección necesita las reseñas, con fechas, valoraciones y suficiente contexto del reseñador para ver su historial. Algunos puntos importan al recopilarlas:
- Recopila en distintos mercados. El mismo producto a menudo muestra reseñas distintas en las tiendas de diferentes países, y las campañas suelen dirigirse a un mercado concreto. Recopilar cada tienda desde dentro de su país muestra lo que ven los compradores locales, el mismo enfoque usado para monitorizar reseñas de clientes.
- Conserva el historial. Las ráfagas y las cuentas de una sola reseña solo pueden medirse a lo largo del tiempo, así que recopila con regularidad y conserva lo recopilado.
- Minimiza los datos personales. Almacena tokens seudonimizados de los reseñadores en lugar de nombres cuando sea posible, conserva solo los campos que usa el análisis, y establece un periodo de retención, tal como se trata en proxies residenciales y RGPD.
- Mantente dentro de las normas. Recopila páginas públicas de reseñas a un ritmo moderado, respeta los términos de cada sitio, y deja intacto cualquier contenido que esté tras un inicio de sesión.
El fraude en reseñas rara vez viaja solo. Los vendedores que compran reseñas también suelen secuestrar listados o vender falsificaciones, y el texto de las reseñas necesita cada vez más el mismo escrutinio que cualquier otro contenido generado por IA. Para los equipos que gestionan esto en muchas fuentes, el flujo de trabajo más amplio se describe en nuestra página de moderación de contenido a gran escala.
En resumen
Las reseñas falsas son habituales, ahora están explícitamente prohibidas en los mercados más grandes, y son difíciles de detectar leyéndolas. Lo que delata a las campañas es el comportamiento: demasiadas reseñas demasiado rápido, demasiado parecidas entre sí, de cuentas sin ningún otro historial.
Recopila reseñas a lo largo del tiempo y en distintos mercados, seudonimiza quién las escribió, combina señales para que cada una confirme a las demás, y envía lo marcado a una persona antes de que nadie actúe en consecuencia.
Fuentes y referencias
- Google, New ways we’re protecting businesses on Maps, cifras de 2025.
- Amazon, How Amazon maintains a trusted review experience.
- Tripadvisor, 2025 Transparency Report.
- Federal Trade Commission, final rule banning fake reviews and testimonials, agosto de 2024.
- Ott, Choi, Cardie y Hancock, Finding Deceptive Opinion Spam by Any Stretch of the Imagination, ACL 2011.
- Conjunto de datos de prueba construido y código por Shifter, 2 de octubre de 2026.