El grounding es lo que convierte a un modelo de lenguaje de algo que suena correcto en algo que puede demostrar su razonamiento. Una respuesta fundamentada (grounded) se construye a partir de evidencia recuperada en el momento de la pregunta, y señala las fuentes que utilizó, de modo que un lector, u otro sistema, pueda verificarla.
Para los agentes que actúan en la web, el grounding en datos en vivo no es opcional. Sus preguntas tratan sobre precios de hoy, disponibilidad ahora mismo y lo que dice una página esta mañana. Este artículo explica qué es el grounding, cómo funciona un bucle de grounding sobre la web en vivo, y los puntos donde falla sin que nadie se percate. El argumento de por qué la infraestructura residencial importa para el grounding se expone en por qué los LLM necesitan proxies residenciales para el grounding de IA.
Qué es el grounding de LLM, y qué no es
| Enfoque | De dónde procede el conocimiento | Actualidad | Puede citar fuentes |
|---|---|---|---|
| Solo conocimiento del modelo | Datos de entrenamiento, fijos en los pesos | Tan antiguo como el corte de entrenamiento | No |
| Fine-tuning | Nuevos datos entrenados en los pesos | Tan antiguo como la última ejecución de entrenamiento | No |
| Recuperación sobre un índice privado | Documentos indexados de antemano | Tan reciente como la última indexación | Sí |
| Grounding en la web en vivo | Páginas buscadas y obtenidas en el momento de la respuesta | Actual | Sí |
El grounding es la práctica de restringir la respuesta a la evidencia recuperada y citarla. Tanto la recuperación sobre los propios documentos como el grounding en la web en vivo cumplen este criterio. Lo que distingue al grounding en la web en vivo es que la evidencia se obtiene en el momento en que se formula la pregunta, que es lo que necesitan los agentes para cualquier cosa sensible al tiempo, local o fuera de sus datos de entrenamiento.
El bucle de grounding
Un bucle de grounding en la web en vivo para un agente suele tener siete pasos.
- Planificar la consulta. Convertir la solicitud del usuario en una o varias consultas de búsqueda, incluyendo el mercado y el idioma que debe reflejar la respuesta.
- Buscar. Obtener fuentes candidatas de un motor de búsqueda.
- Seleccionar. Elegir qué resultados leer, priorizando fuentes primarias y autorizadas.
- Obtener. Recuperar las páginas.
- Extraer. Sacar los pasajes relevantes de cada página.
- Responder con citas. Generar la respuesta a partir de los pasajes, citando cada afirmación.
- Verificar. Comprobar que cada afirmación está realmente respaldada por el pasaje que cita.
Cada paso tiene un presupuesto de latencia. La búsqueda y la obtención dominan, y obtener varias fuentes en paralelo suele ser lo que mantiene a un agente con capacidad de respuesta.
Dónde falla el grounding
La mayoría de los fallos de grounding no producen errores. Producen respuestas confiadas construidas sobre evidencia mala.
Obtenciones bloqueadas o desafiadas. Una obtención que devuelve una página de desafío o una carcasa vacía no le da al modelo nada con lo que trabajar, y un modelo al que no se le da nada tiende a rellenar el hueco desde su memoria. La solución es hacer explícitos los fallos de obtención: pasar al modelo un claro “esta fuente no pudo ser recuperada” en lugar de un contexto vacío, y preferir responder con menos fuentes antes que responder a partir de fuentes inventadas.
Mercado o idioma incorrectos. Una página obtenida desde el país equivocado puede mostrar precios, disponibilidad o incluso productos distintos. Si el agente está respondiendo a un usuario en Madrid, la evidencia debe reflejar Madrid. Hacer coincidir las señales de idioma y zona horaria con la salida también importa; véase cómo hacer coincidir geo, zona horaria y locale del proxy.
Cachés obsoletas. Almacenar en caché las páginas obtenidas ahorra tiempo y dinero, y una caché que sobrevive más que la actualidad que necesita la pregunta devuelve silenciosamente los hechos de ayer. Definan la vida útil de la caché según el tipo de consulta: corta para precios y noticias, larga para material de referencia.
Contenido que solo existe tras el renderizado. Muchas páginas cargan sus datos con JavaScript. Una obtención simple devuelve el marco sin los hechos; véase cuándo se necesita una API de web scraping.
Instrucciones ocultas en páginas obtenidas. Este es el fallo de seguridad específico de los agentes. Una página web puede contener texto escrito para parecer instrucciones dirigidas al modelo. Un agente que trate el contenido obtenido como instrucciones puede ser manipulado para filtrar datos o realizar acciones que su usuario nunca pidió. Traten cada página obtenida como datos no confiables, nunca como órdenes: mantengan el texto recuperado claramente separado de las instrucciones del agente, restrinjan qué herramientas puede invocar el agente en función del contenido recuperado, y exijan confirmación para acciones con consecuencias.
Deriva de citas. Una página citada puede cambiar después de que se haya dado la respuesta. Conserven una instantánea o hash del pasaje citado, para que la cita siga siendo verificable.
Dónde encajan los proxies y las API en el bucle
Dos pasos del bucle tocan la web abierta: la búsqueda y la obtención.
La búsqueda suele gestionarse mejor mediante una API de SERP, que devuelve resultados estructurados para una ubicación y dispositivo dados sin que el agente tenga que navegar por un motor de búsqueda. El razonamiento está en por qué los agentes de IA necesitan API de SERP en tiempo real.
La obtención es donde importa la infraestructura de proxies. Los agentes obtienen datos de muchos sitios sin relación entre sí, en muchos mercados, a menudo en paralelo, y los sitios que más importan suelen ser los que están más protegidos. Las salidas residenciales en el mercado del usuario devuelven la página que vería un usuario local. Con la puerta de enlace de Shifter, el mercado y la sesión se establecen en las credenciales frente a p.shifter.io:443:
customer-USERNAME-country-es-city-madrid:PASSWORD
customer-USERNAME-country-es-city-madrid-sid-task-5521-ttl-600:PASSWORD
La primera línea rota la salida en cada solicitud, lo cual conviene para obtener varias fuentes independientes en paralelo. La segunda mantiene una salida durante diez minutos, lo cual conviene para una tarea de varias páginas en un mismo sitio donde importa la consistencia. El compromiso se explica en proxies residenciales fijos frente a rotativos.
Para páginas renderizadas, una API de web scraping gestiona el navegador, los reintentos y la extracción en una sola solicitud, y cobra solo por las respuestas exitosas. La visión de producto de la infraestructura para agentes está en la página de proxies para agentes de IA, y los criterios para elegir un proveedor están en los mejores proxies para agentes de IA que navegan por la web.
Actualidad, coste y latencia
Cada respuesta fundamentada cuesta un número de búsquedas más un número de obtenciones, y cada una añade latencia. Tres prácticas mantienen ambos aspectos bajo control.
- Obtengan en paralelo y deténganse pronto en cuanto suficientes fuentes independientes coincidan.
- Almacenen en caché según el tipo de pregunta, con vidas útiles que coincidan con la rapidez con la que cambian los hechos subyacentes.
- Prioricen las fuentes primarias. Una página autorizada vale más que varias páginas que la resumen.
Evaluar un agente fundamentado
Midan el grounding directamente, no solo la calidad de la respuesta.
| Métrica | Qué mide |
|---|---|
| Grounding (fundamentación) | Proporción de afirmaciones respaldadas por el pasaje que citan |
| Precisión de citas | Si la página citada realmente contiene la afirmación |
| Actualidad | Cuán reciente era la evidencia para preguntas sensibles al tiempo |
| Tasa de fallos de obtención | Con qué frecuencia no se pudo recuperar la evidencia, por sitio y mercado |
| Tasa de respuestas no respaldadas | Con qué frecuencia el agente respondió a pesar de no tener evidencia |
Construyan un conjunto de pruebas de preguntas sensibles al tiempo y específicas de mercado cuyas respuestas cambien, y vuelvan a ejecutarlo con regularidad. Un agente fundamentado que aprueba hoy puede fallar el mes que viene porque una fuente cambió su marcado.
Mantenerse del lado correcto
Los agentes navegan en nombre de personas, y deben comportarse en consecuencia: respetar los términos del sitio y las reglas de rastreo, mantener las tasas de solicitud proporcionadas, no eludir inicios de sesión o muros de pago, y llevar un registro de qué se obtuvo y cuándo. El planteamiento más amplio está en proxies residenciales éticos para la recopilación de datos de IA.
Preguntas frecuentes
¿Es el grounding lo mismo que la generación aumentada por recuperación?
La generación aumentada por recuperación es una forma de hacer grounding. El grounding es la práctica más amplia de vincular las respuestas a evidencia recuperada y citable, ya sea de un índice privado o de la web en vivo.
¿Necesitan los agentes proxies para fundamentarse en datos de la web en vivo?
A bajo volumen, quizá no. A escala, a través de muchos sitios y mercados, las obtenciones desde una única dirección se ven limitadas o bloqueadas, y las obtenciones bloqueadas son el fallo silencioso de grounding más común.
¿Cómo protegemos a un agente de instrucciones ocultas en páginas web?
Traten el contenido obtenido como datos no confiables, manténganlo separado de las instrucciones del agente, limiten qué herramientas puede activar el contenido recuperado, y exijan confirmación para acciones con consecuencias.
¿Debería el agente navegar directamente por los motores de búsqueda?
Una API de SERP suele ser más rápida, más económica y más fiable para el paso de búsqueda. La navegación se reserva mejor para obtener las páginas que devuelve la búsqueda.
En resumen
El grounding hace que las respuestas de un agente sean verificables al construirlas a partir de evidencia obtenida en el momento de la pregunta y citándola. El bucle es sencillo: planificar, buscar, seleccionar, obtener, extraer, responder, verificar. Los fallos son silenciosos: obtenciones bloqueadas rellenadas desde la memoria, páginas del mercado equivocado, cachés obsoletas, contenido sin renderizar, instrucciones ocultas y citas que se desvían.
Hagan explícitos los fallos de obtención, obtengan datos del mercado del usuario, almacenen en caché según el tipo de pregunta, traten el texto recuperado como no confiable, y midan el grounding directamente. Para saber en qué se diferencian los datos de entrenamiento de los datos de grounding, véase cómo construir conjuntos de datos de entrenamiento a gran escala a partir de la web abierta.