@Asim_Arman fez uma verificação rápida nas suas 3 fontes antes de recomendar qualquer coisa e tem uma boa notícia para uma delas — HouseCall Pro na verdade não está no Cloudflare e seu /feed/ funciona perfeitamente se você apenas adiciona um User-Agent de navegador real no nó HTTP Request. testei com um Mozilla/5.0 UA contra Housecall Pro e recebi um RSS XML válido. seu 403 lá é quase certamente porque o nó HTTP Request do n8n usa um UA genérico (ou nenhum) e o site tem um filtro básico de UA. mude para RSS Feed Read apontando para Housecall Pro com override de User-Agent e pronto para esse, sem necessidade de scraping.
Jobber (getjobber.com) está genuinamente no Cloudflare — header cf-ray presente nas respostas — e não há RSS para a seção academy. HVAC Informed também não expõe RSS. esses dois genuinamente precisam de um serviço de scraping.
sobre a questão de contornar o Cloudflare nativamente, não há jeito real de fazer isso no n8n. o desafio deles requer executar JS para resolver proof-of-work mais fingerprinting comportamental, e o nó HTTP Request é um cliente http puro sem motor de navegador. as libs estilo cloudscraper de 2022-2023 estão todas quebradas contra o Cloudflare atual, então os poucos nós da comunidade que as envolvem não funcionam.
headers tipo navegador corrigem filtros básicos de UA (que é o que o 403 do HouseCall Pro na verdade era, ironicamente) mas não fazem nada contra o verdadeiro desafio Cloudflare — eles fazem fingerprint de TLS, JA3, timing de requisição, e execução JS além apenas headers.
para ScrapingBee vs Apify vs BrightData — para seu caso de uso (digest diário de baixo volume, apenas 2 sites precisando scraping real) ScrapingBee ou Firecrawl é o mais limpo. comparação aproximada:
{
"scrapingbee": {"per_request": "~$0.001-0.005", "fit": "baixo-médio volume, simples, rápido"},
"scraperapi": {"per_request": "~$0.001-0.003", "fit": "comparável ao scrapingbee"},
"firecrawl": {"per_request": "~$0.001", "fit": "scrape-para-markdown, saída pronta para LLM"},
"brightdata": {"per_request": "~$0.005-0.02", "fit": "alvos mais difíceis, caro mas mais confiável"},
"apify": {"per_request": "varia", "fit": "fluxos multi-página complexos"}
}
ScrapingBee chamado via HTTP Request fica assim:
{
"method": "GET",
"url": "https://app.scrapingbee.com/api/v1/",
"qs": {
"api_key": "<sua_chave>",
"url": "https://www.getjobber.com/academy/",
"render_js": "true",
"premium_proxy": "true"
}
}
o estado final é um RSS Feed Read para HouseCall Pro, duas chamadas HTTP ScrapingBee para Jobber e HVAC Informed, depois parse → digest. muito mais barato do que tratar os 3 como protegidos por Cloudflare quando apenas um na verdade está.