Grounding é o que transforma um modelo de linguagem de algo que parece certo em algo que consegue mostrar seu trabalho. Uma resposta fundamentada (grounded) é construída a partir de evidências recuperadas no momento da pergunta, e ela aponta para as fontes usadas, para que um leitor, ou outro sistema, possa verificar.
Para agentes que atuam na web, o grounding em dados ao vivo não é opcional. As perguntas deles são sobre preços hoje, disponibilidade agora e o que uma página diz nesta manhã. Este texto explicativo cobre o que é grounding, como funciona um loop de grounding na web ao vivo, e os pontos em que ele falha sem que ninguém perceba. O argumento de por que a infraestrutura residencial importa para o grounding está exposto em why LLMs need residential proxies for AI grounding.
O que é grounding de LLM, e o que não é
| Abordagem | De onde vem o conhecimento | Atualidade | Pode citar fontes |
|---|---|---|---|
| Conhecimento do modelo isoladamente | Dados de treinamento, fixos nos pesos | Tão antigo quanto o corte do treinamento | Não |
| Fine-tuning | Novos dados treinados nos pesos | Tão antigo quanto a última rodada de treinamento | Não |
| Retrieval sobre um índice privado | Documentos indexados previamente | Tão atual quanto a última indexação | Sim |
| Grounding na web ao vivo | Páginas pesquisadas e buscadas no momento da resposta | Atual | Sim |
Grounding é a prática de restringir a resposta a evidências recuperadas e citá-las. Tanto o retrieval sobre seus próprios documentos quanto o grounding na web ao vivo se qualificam. O que distingue o grounding na web ao vivo é que a evidência é buscada no momento em que a pergunta é feita, o que é o que os agentes precisam para qualquer coisa sensível ao tempo, local ou fora de seus dados de treinamento.
O loop de grounding
Um loop de grounding na web ao vivo para um agente geralmente tem sete etapas.
- Planejar a consulta. Transformar a solicitação do usuário em uma ou mais consultas de busca, incluindo o mercado e o idioma que a resposta deve refletir.
- Buscar. Obter fontes candidatas de um mecanismo de busca.
- Selecionar. Escolher quais resultados ler, priorizando fontes primárias e autoritativas.
- Buscar (fetch). Recuperar as páginas.
- Extrair. Retirar as passagens relevantes de cada página.
- Responder com citações. Gerar a resposta a partir das passagens, citando cada afirmação.
- Verificar. Checar que cada afirmação é de fato sustentada pela passagem que ela cita.
Cada etapa tem um orçamento de latência. Busca e fetch dominam, e buscar várias fontes em paralelo é geralmente o que mantém um agente responsivo.
Onde o grounding falha
A maioria das falhas de grounding não produz erros. Elas produzem respostas confiantes construídas sobre evidências ruins.
Fetches bloqueados ou desafiados. Um fetch que retorna uma página de desafio ou uma casca vazia não dá ao modelo nada com que trabalhar, e um modelo que não recebe nada tende a preencher a lacuna a partir da memória. A correção é tornar explícitas as falhas de fetch: passar ao modelo um claro “esta fonte não pôde ser recuperada” em vez de um contexto vazio, e preferir responder com menos fontes a responder a partir de fontes inventadas.
Mercado ou idioma errado. Uma página buscada no país errado pode mostrar preços, disponibilidade ou até produtos diferentes. Se o agente está respondendo para um usuário em Madri, a evidência deve refletir Madri. Alinhar sinais de idioma e fuso horário ao ponto de saída também importa; veja matching proxy geo, timezone and locale.
Caches desatualizados. Fazer cache de páginas buscadas economiza tempo e dinheiro, e um cache que dura mais do que a atualidade que a pergunta exige silenciosamente retorna fatos de ontem. Defina o tempo de vida do cache por tipo de consulta, curto para preços e notícias, longo para material de referência.
Conteúdo que só existe após a renderização. Muitas páginas carregam seus dados com JavaScript. Um fetch simples retorna a estrutura sem os fatos; veja when you need a web scraping API.
Instruções ocultas em páginas buscadas. Esta é a falha de segurança específica de agentes. Uma página web pode conter texto escrito para se parecer com instruções ao modelo. Um agente que trata o conteúdo buscado como instruções pode ser manipulado a vazar dados ou tomar ações que seu usuário nunca solicitou. Trate cada página buscada como dado não confiável, nunca como comandos: mantenha o texto recuperado claramente separado das instruções do agente, restrinja quais ferramentas o agente pode chamar com base no conteúdo recuperado, e exija confirmação para ações relevantes.
Deriva de citação. Uma página citada pode mudar depois que a resposta é dada. Mantenha um snapshot ou hash da passagem que foi citada, para que a citação permaneça verificável.
Onde proxies e APIs se encaixam no loop
Duas etapas do loop tocam a web aberta: busca e fetch.
Busca geralmente é melhor tratada por uma API de SERP, que retorna resultados estruturados para uma dada localização e dispositivo sem que o agente precise navegar em um mecanismo de busca. O raciocínio está em why AI agents need real-time SERP APIs.
Fetch é onde a infraestrutura de proxy importa. Agentes buscam em muitos sites não relacionados, em muitos mercados, muitas vezes em paralelo, e os sites que mais importam tendem a ser os mais defendidos. Pontos de saída residenciais no mercado do usuário retornam a página que um usuário local veria. Com o gateway Shifter, o mercado e a sessão são definidos nas credenciais contra p.shifter.io:443:
customer-USERNAME-country-es-city-madrid:PASSWORD
customer-USERNAME-country-es-city-madrid-sid-task-5521-ttl-600:PASSWORD
A primeira linha rotaciona o ponto de saída a cada requisição, o que serve para buscar várias fontes independentes em paralelo. A segunda mantém um ponto de saída por dez minutos, o que serve para uma tarefa de múltiplas páginas em um único site em que a consistência importa. O trade-off está em sticky vs rotating residential proxies.
Para páginas renderizadas, uma API de web scraping lida com o navegador, as novas tentativas e a extração em uma única requisição, e cobra apenas por respostas bem-sucedidas. A visão de produto sobre infraestrutura de agentes está na página proxies for AI agents, e os critérios para escolher um provedor estão em best proxies for AI agents that browse the web.
Atualidade, custo e latência
Cada resposta fundamentada custa um número de buscas mais um número de fetches, e cada um adiciona latência. Três práticas mantêm ambos sob controle.
- Buscar em paralelo e parar mais cedo assim que fontes independentes suficientes concordarem.
- Fazer cache por tipo de pergunta, com tempos de vida que correspondam à velocidade com que os fatos subjacentes mudam.
- Preferir fontes primárias. Uma página autoritativa vale mais do que várias páginas que a resumem.
Avaliando um agente fundamentado (grounded)
Meça o grounding diretamente, não apenas a qualidade da resposta.
| Métrica | O que mede |
|---|---|
| Groundedness | Proporção de afirmações sustentadas pela passagem que citam |
| Precisão de citação | Se a página citada de fato contém a afirmação |
| Atualidade | Quão recente era a evidência para perguntas sensíveis ao tempo |
| Taxa de falha de fetch | Com que frequência a evidência não pôde ser recuperada, por site e mercado |
| Taxa de respostas não sustentadas | Com que frequência o agente respondeu mesmo sem evidência |
Construa um conjunto de teste de perguntas sensíveis ao tempo e específicas de mercado cujas respostas mudam, e o reexecute periodicamente. Um agente fundamentado que passa hoje pode falhar no mês seguinte porque uma fonte mudou sua marcação.
Ficando do lado certo disso
Agentes navegam em nome de pessoas, e devem se comportar de acordo: respeitar os termos do site e as regras de crawler, manter taxas de requisição proporcionais, não contornar logins ou paywalls, e manter um registro do que foi buscado e quando. A visão mais ampla está em ethical residential proxies for AI data collection.
FAQ
Grounding é a mesma coisa que retrieval-augmented generation?
Retrieval-augmented generation é uma forma de fazer grounding. Grounding é a prática mais ampla de vincular respostas a evidências recuperadas e citáveis, seja de um índice privado ou da web ao vivo.
Agentes precisam de proxies para fazer grounding em dados da web ao vivo?
Em baixo volume, talvez não. Em escala, em muitos sites e mercados, fetches de um único endereço são limitados ou bloqueados, e fetches bloqueados são a falha silenciosa de grounding mais comum.
Como protegemos um agente contra instruções ocultas em páginas web?
Trate o conteúdo buscado como dado não confiável, mantenha-o separado das instruções do agente, limite quais ferramentas o conteúdo recuperado pode acionar, e exija confirmação para ações relevantes.
O agente deve navegar diretamente em mecanismos de busca?
Uma API de SERP geralmente é mais rápida, mais barata e mais confiável para a etapa de busca. A navegação é melhor reservada para buscar as páginas que a busca retorna.
Resumindo
Grounding torna as respostas de um agente verificáveis ao construí-las a partir de evidências buscadas no momento da pergunta e citá-las. O loop é simples: planejar, buscar, selecionar, fetch, extrair, responder, verificar. As falhas são silenciosas: fetches bloqueados preenchidos a partir da memória, páginas do mercado errado, caches desatualizados, conteúdo não renderizado, instruções ocultas e citações que sofrem deriva.
Torne as falhas de fetch explícitas, busque no mercado do usuário, faça cache por tipo de pergunta, trate o texto recuperado como não confiável, e meça o groundedness diretamente. Para entender como os dados de treinamento diferem dos dados de grounding, veja how to build large-scale training datasets from the open web.