Conhecimento

Como Empresas Imobiliárias Usam APIs de Web Scraping para Inteligência de Mercado

Os portais imobiliários são repletos de JavaScript, paginados e localizados. Como as equipes do setor imobiliário usam uma API de web scraping como camada de coleta, e quanto isso custa.

Matt Brown

Matt Brown

14 de setembro de 2026 · 9 min de leitura

Equipes do setor imobiliário não querem operar infraestrutura de scraping. Elas querem saber onde a oferta está aumentando, onde os preços estão sendo reduzidos, quanto os imóveis comparáveis estão pedindo e por quanto tempo o estoque permanece parado. A camada de coleta é um meio para isso, e para muitas equipes uma web scraping API é a forma mais direta de obtê-la sem contratar para automação de navegador e operações de proxy.

O que coletar e como modelar isso depois de coletado é abordado em outros posts deste blog: avaliações, aluguéis e dados de hipoteca, um feed de dados do mercado imobiliário em tempo real, e agregação de anúncios entre portais. Este texto trata da própria camada de coleta: por que os portais imobiliários empurram as equipes para uma API, como a API se mapeia nas páginas do setor imobiliário e como funciona a economia.

Why property portals are awkward to collect

Quatro características dos sites do setor imobiliário os tornam mais difíceis do que a maioria.

They are built for maps and scrolling, not pages. Os resultados de busca carregam via JavaScript conforme um mapa se move ou uma lista rola, então uma requisição HTTP simples frequentemente retorna um shell vazio.

Results are paginated and cursor-driven. Passar da página um para a página dois frequentemente depende de estado no servidor, o que quebra a busca ingênua página por página.

They are localised. Os portais servem conteúdo por país e às vezes por região, então o que você vê depende de onde a requisição parece se originar.

They are defended. Um inventário de alto valor e atualizado com frequência atrai tráfego automatizado, e os portais o protegem de acordo.

Lidar com essas quatro questões internamente significa navegadores headless, gerenciamento de proxies, lógica de retentativas e ajuste de fingerprint. Uma web scraping API reúne tudo isso em uma única requisição.

How the API maps onto real estate pages

Com a Shifter Web Scraping API, cada problema dos portais tem um controle direto.

Map and list views. render_js=1 executa a página em Chrome headless sem custo extra de crédito, e wait_for_css mantém a captura em espera até que os cards de anúncio tenham realmente renderizado. Instruções JavaScript podem rolar a página ou clicar em um controle de “carregar mais” antes da captura. Veja renderização de JavaScript.

Result cards. extract_rules com um tipo list retorna todos os cards de anúncio de uma página como JSON, um objeto por anúncio, sem que você precise de um parser HTML no seu lado.

Pagination. session_id mantém cookies, estado do navegador e o IP de origem entre requisições, de modo que um conjunto de resultados guiado por cursor possa ser percorrido em ordem. As sessões expiram após 10 minutos de inatividade, e o país deve permanecer o mesmo durante toda a vida de uma sessão. Veja sessões e proxies.

Localisation. country recebe um código ISO alpha-2 por requisição. A geolocalização global e o pool de IPs residenciais via premium_proxy=1 estão disponíveis nos planos Growth e superiores.

Evidence. screenshot=1 captura a página renderizada, útil quando a condição de um anúncio em um determinado momento importa, como um corte de preço ou uma retirada.

Long renders. webhook=<URL> entrega a resposta ao seu endpoint quando estiver pronta, em vez de manter uma conexão aberta.

Uma requisição de resultados de busca para um mercado se parece com isto:

curl "https://scrape.shifter.io/v1?api_key=YOUR_API_KEY\
&url=https%3A%2F%2Fportal.example.com%2Fsearch%3Fcity%3Dlyon\
&render_js=1&wait_for_css=.listing-card\
&country=fr&premium_proxy=1&session_id=lyon-walk-03\
&extract_rules=%7B%22listings%22%3A%7B%22selector%22%3A%22.listing-card%22%2C%22type%22%3A%22list%22%2C%22item%22%3A%7B%22price%22%3A%7B%22selector%22%3A%22.price%22%2C%22output%22%3A%22text%22%7D%2C%22area%22%3A%7B%22selector%22%3A%22.area%22%2C%22output%22%3A%22text%22%7D%2C%22link%22%3A%7B%22selector%22%3A%22a%22%2C%22output%22%3A%22%40href%22%7D%7D%7D%7D"

A URL de destino é codificada em URL porque carrega sua própria query string, que de outra forma seria lida como parâmetros da requisição da API. A resposta é um único objeto JSON com um array listings. Um campo cujo seletor não encontra nada retorna como null, o que é relevante para o monitoramento, como abordado a seguir.

How different teams use it

Acquisitions and investment teams observam submercados-alvo em busca de nova oferta e reduções de preço, e usam o momento dos cortes como sinal de negociação. O que precisam é de detecção de eventos no dia seguinte em um conjunto definido de áreas, não uma varredura nacional.

Brokerages acompanham sua participação de anúncios em relação aos concorrentes por área, e a velocidade com que os anúncios concorrentes se movem. Mantenha isso no nível da corretora: os dados de contato do corretor nos anúncios são dados pessoais e raramente são o que a análise precisa.

PropTech products constroem comparáveis e feeds de anúncios para seus próprios usuários. Aqui a API é uma entrada para um pipeline de normalização, e as definições de campo diferem por portal e país.

Rental operators monitoram os aluguéis pedidos e concessões em seus submercados. As concessões frequentemente estão no texto da descrição em vez de em um campo de preço, então as regras de extração devem capturar a descrição, não apenas o valor do aluguel em destaque.

Lenders and insurers acompanham as condições de mercado nas áreas em que têm exposição. O limite é dados de mercado publicados, nunca informações individuais de tomadores de empréstimo ou ocupantes.

The economics: design around the credit

Um crédito compra uma requisição bem-sucedida, seja o que essa requisição retornar. Renderização, regras de extração, screenshots e as próprias retentativas da API estão incluídas, e requisições com falha ou erros do destino não são cobradas.

Isso tem uma consequência direta de design para o setor imobiliário. Uma página de resultados de busca que retorna quarenta cards de anúncio custa o mesmo único crédito que uma página de detalhe que retorna um único anúncio. Portanto, o padrão eficiente é coletar a partir das páginas de resultado sempre que o card trouxer os campos necessários, preço, área, quartos, link, e buscar uma página de detalhe apenas quando um anúncio for novo ou seu card tiver mudado.

Para um mercado com alguns milhares de anúncios ativos, essa diferença costuma ser de uma ordem de magnitude em créditos. Isso também melhora a atualidade dos dados, porque você pode revisitar as páginas de resultado com mais frequência pelo mesmo gasto.

Mais duas alavancas de custo. Atualize em uma cadência que corresponda à velocidade de cada mercado, já que diariamente é suficiente para a maioria das superfícies de anúncios. E fique atento aos créditos gastos em relação às linhas que foram parseadas corretamente, porque um seletor quebrado ainda consome um crédito para cada resposta bem-sucedida, mas inútil.

Monitor for silent breakage

Os portais são redesenhados, e um seletor alterado não faz a requisição falhar. Ela retorna null, a requisição é bem-sucedida e o crédito é gasto.

Acompanhe a taxa de null por campo, por portal e por país em uma janela contínua, e alerte quando ela saltar em relação à linha de base. Versione suas regras de extração para que uma correção possa ser rastreada, e armazene as respostas brutas antes do parsing para que uma regra corrigida possa ser reaplicada sem pagar para buscar novamente. O padrão de carregamento é apresentado em levando dados da web scraping API para o SQL.

When an API is the right collection layer, and when it is not

Choose the API quando a renderização e o tratamento de anti-bot forem o principal fardo, quando a equipe for pequena ou focada em dados em vez de infraestrutura, e quando uma cobrança previsível por sucesso importar mais do que o menor custo unitário possível.

Choose self-managed proxies quando precisar de fluxos de navegador totalmente personalizados, operar em uma escala em que possuir a própria stack seja mais barato, ou já tiver engenheiros de scraping. A abordagem baseada em proxy é abordada em proxies para dados do setor imobiliário.

Choose a licensed feed first sempre que existir um para o seu mercado. A cobertura e a qualidade dos campos geralmente são melhores, e os termos são claros. Use a coleta para o que uma licença não fornece.

Staying on the right side of it

Respeite os termos de cada portal e mantenha os volumes de requisição proporcionais. Trate os detalhes de proprietários, corretores e ocupantes como dados pessoais por padrão e remova-os na ingestão quando a análise não precisar deles. Use screenshots como evidência do que um anúncio mostrava, não como material para republicação. O enquadramento mais amplo está em proxies residenciais e conformidade com o GDPR.

FAQ

Preciso de renderização de JavaScript para portais imobiliários?

Para a maioria dos portais modernos, sim, porque os resultados de anúncios carregam depois da página inicial. Custa o mesmo crédito que uma busca estática, então há pouco motivo para não ativá-la onde os resultados são renderizados no lado do cliente.

Uma única API pode cobrir portais em vários países?

Sim, com country definido por requisição e uma sessão por mercado. A geolocalização global requer um plano Growth ou superior.

Como percorrer resultados de busca paginados de forma confiável?

Use um session_id por busca, mantenha o país constante dentro dela, e mantenha o percurso em movimento, já que as sessões expiram após 10 minutos de inatividade.

É mais barato fazer scraping de páginas de detalhe ou de páginas de resultado?

Páginas de resultado, sempre que o card do anúncio trouxer os campos necessários. Um crédito retorna muitos anúncios, e as páginas de detalhe podem ser reservadas para anúncios novos ou alterados.

The bottom line

Para a maioria das equipes do setor imobiliário, a parte difícil da inteligência de mercado não é decidir o que medir. É obter dados confiáveis de portais construídos para mapas, rolagem e visitantes humanos. Uma web scraping API transforma renderização, paginação, localização e retentativas em parâmetros de requisição, e cobra apenas quando os dados chegam.

Projete em torno do crédito coletando primeiro das páginas de resultado, percorra buscas com sessões por mercado, observe as taxas de null para detectar quebras silenciosas, e adote um feed licenciado sempre que existir um. O produto está na página Web Scraping API, com planos na página de preços, e o caso de uso mais amplo na página de setor imobiliário.

Pronto para começar?

Experimente os proxies residenciais da Shifter, mais de 205M IPs, mais de 195 países, a partir de $ 0,75/GB.

Começar