Resumo em 30 segundos
Em 30 segundos
- O que é: a camada de web data feita para IA. Uma API que busca, raspa, mapeia, crawleia e interage com páginas, entregando markdown limpo ou JSON por schema.
- O que faz diferente: saída pronta para RAG, preço previsível (1 crédito por página, JavaScript incluso), o maior projeto open source da categoria e a camada agêntica mais completa do mercado: MCP, CLI, skills, Interact e Agent.
- O que não faz: não tem a rede de proxies da Bright Data para alvos fortemente defendidos, não tem o marketplace de scrapers prontos nem a orquestração da Apify, e não é o mais barato para raspar muita página fácil.
- Regra prática: destino é LLM/RAG e alvos são públicos, Firecrawl. Alvo é defendido, Bright Data. Já existe scraper pronto, Apify. Volume alto em sites simples, Zyte.
O que é o Firecrawl
O Firecrawl nasceu em 2024, saiu da Y Combinator e virou, pelos seus próprios números, o maior repositório open source da categoria: 188 mil stars, 10 mil forks e mais de 6 mil commits. A tese é simples: a web foi feita para humanos, e modelos precisam de texto limpo. O produto transforma qualquer URL em markdown, HTML, screenshot ou JSON estruturado em uma chamada de API.
Hoje a empresa se descreve como a camada de infraestrutura para a IA encontrar, ler e agir na web. São mais de 5 bilhões de requisições servidas, 150 mil empresas e 1,25 milhão de desenvolvedores, segundo ela. Em 2026 levantou uma Série B de US$75 milhões para construir a Alexandria, uma biblioteca de conteúdo licenciado, e aposta que o futuro não é só raspar, é licenciar e indexar.
- 96%cobertura alegada em benchmark próprio (1.000 URLs)
- 3,4 slatência P95 alegada, feita para agentes em tempo real
- 5 bi+requisições servidas pela plataforma
- US$75 miSérie B em 2026, para a Alexandria
Sete coisas que ele faz diferente
-
Markdown por padrão, porque RAG vive de chunk limpo
A saída padrão é markdown sem menu, sem cookie banner e sem rodapé. Segundo a empresa, até 93% menos tokens de entrada que o HTML da mesma página: menos custo de embedding e menos ruído na recuperação. Entre os comparados, nenhum é markdown-first da mesma forma; Bright Data e Apify devolvem dado cru e deixam a limpeza com você. [1]
-
Uma API só para a jornada inteira
Search, scrape, map, crawl, batch, interact, agent e monitor compartilham a mesma conta de créditos. Você começa por uma pergunta (search), descobre as URLs (map), puxa o site inteiro (crawl) e opera páginas com clique e formulário (interact). A maioria dos concorrentes vende produtos separados, cada um com seu medidor. [1]
-
Preço que dá para calcular de cabeça
1 crédito por página em scrape, crawl, map e monitor, com renderização de JavaScript inclusa. O plano grátis dá 1.000 créditos por mês, renovados todo mês. O Hobby fica em US$16 (no anual) e o Standard cobre 100 mil páginas por US$83 (no anual). Compare com cobrança por GB de proxy, por unidade de computação (Apify) ou por resposta classificada por dificuldade (Zyte). [2]
-
Open source de verdade, com ressalva
O núcleo é AGPL-3.0 e os SDKs são MIT. Dá para rodar em casa via docker-compose, e o repositório é o maior da categoria. A ressalva: a camada anti-bot gerenciada (o Fire-engine) não está no código aberto. Self-host entrega o núcleo, não o cloud. [3]
-
Nascido para agentes, não adaptado para eles
É o único da comparação com MCP oficial (mais de 400 mil instalações, diz a empresa), CLI, skills publicadas para Claude Code e Codex e um onboarding em que o próprio agente tira a API key sozinho, lendo um SKILL.md público. O Interact abre o navegador do Firecrawl e deixa o agente clicar, digitar e navegar por prompt. [1]
-
Alexandria: de raspador a biblioteca
A aposta mais nova é não depender só de raspagem: a Alexandria indexa 113 milhões de fontes licenciadas de 93 provedores, e os endpoints de papers do Research Index são gratuitos. É o movimento para virar a biblioteca da superinteligência, nas palavras da empresa, e o destino da Série B. [1]
-
DX acima da média, SDK para todo lado
Nove SDKs oficiais (Python, Node, Go, Rust, Java, Elixir, Ruby, .NET e PHP), mais CLI e REST puro, com integrações prontas para n8n, Zapier, Lovable e LangChain. Para time pequeno, é a diferença entre subir em uma tarde e subir em uma sprint. [3]
O que ele não faz, e quem faz
-
Raspar alvos fortemente defendidos
A própria Firecrawl divulga 96% de cobertura. Os 4% que sobram são frequentemente os sites mais valiosos: marketplaces, redes sociais, painéis com login. Existe modo stealth, mas não existe uma rede de proxies própria em escala. [4][7]
Quem fazBright Data, com rede de proxies residenciais na casa das centenas de milhões de IPs e o Web Unlocker, que promete vencer Cloudflare, DataDome e PerimeterX.
-
Scrapers prontos por site
No Firecrawl você descreve a extração ou deixa o Agent navegar. Não existe loja de conectores para alvos populares. [5]
Quem fazApify, com milhares de Actors da comunidade, e Bright Data, com centenas de scrapers por domínio.
-
Orquestração e agendamento como plataforma
O Firecrawl entrega endpoints; montar o pipeline, o retry e o agendamento é com você. [6]
Quem fazApify, com datasets, agendamentos e Actors encadeados num só lugar.
-
Ser o mais barato em volume de páginas fáceis
A US$0,83 por 1.000 páginas no Standard anual, o Firecrawl é competitivo, mas não imbatível. [4]
Quem fazZyte, que desce a US$0,06 por 1.000 respostas simples com compromisso, e Crawl4AI, que é gratuito (você paga o servidor).
-
Self-host sem letras miúdas
O self-host é AGPL-3.0: se você oferecer aquilo como serviço, precisa publicar suas modificações. E a camada anti-bot gerenciada fica de fora. [3]
Quem faz completoCrawl4AI, Apache-2.0, sem medidor e sem vendor. O preço: você vira seu próprio time de proxy e anti-bot.
Os cinco ombro a ombro
Números de lista checados em 3 de outubro de 2026 nas fontes do fim da página. Valores de Bright Data e Zyte variam por produto, tier e promoção. [4][5]
| Critério | Firecrawl | Bright Data | Apify | Zyte | Crawl4AI |
|---|---|---|---|---|---|
| Foco | LLM, RAG e agentes | Coleta empresarial em escala | Automação e marketplace | Coleta com preço por dificuldade | Self-host sem medidor |
| Cobrança | 1 crédito por página, JS incluso | Por registro entregue | Plano + unidade de computação | Por resposta bem-sucedida, por tier | Grátis, no seu servidor |
| Entrada | Grátis: 1.000 créditos/mês; Hobby US$16 no anual | Grátis limitado; paga por uso | US$19/mês + uso | US$5 de teste; paga por uso | US$0 + infraestrutura |
| Anti-bot | Stealth e proxies gerenciados (5 créditos/página) | Web Unlocker, centenas de milhões de IPs | Depende do Actor escolhido | Tiers de dificuldade | Você resolve, com seus proxies |
| Scrapers prontos | Não | Centenas | Milhares de Actors | Via Scrapy, você escreve | Não |
| Self-host | Sim, núcleo AGPL-3.0 | Não | Não (a lib Crawlee é aberta) | Não (o Scrapy, sim) | Sim, Apache-2.0 |
| Licença do núcleo | AGPL-3.0; SDKs MIT | Proprietário | Proprietário | Proprietário | Apache-2.0 |
Arraste a tabela para o lado para ver todas as colunas.
Pegadinhas de custo, antes de dimensionar
-
403 e 404 custam 1 crédito
A página volta com erro, mas consome crédito. Só o scrape que não retorna resultado nenhum é gratuito.
-
JSON tipado custa +4 créditos por página
Extração estruturada no Standard sai perto de US$4,15 por 1.000 páginas, não US$0,83.
-
Stealth sai por 5 créditos por página
Site defendido custa cinco vezes mais que site comum, e o resultado não é garantido.
-
Interact consome 2 créditos por minuto de navegador
Fluxo longo de cliques e formulários fica caro rápido. Teste com poucas páginas antes de escalar.
-
Créditos não acumulam nos planos menores
Hobby, Standard e Growth perdem o saldo não usado no fim do mês. Só o Scale carrega por um mês.
-
Agent ainda é preview
5 execuções grátis por dia e preço dinâmico por execução. Não é para produção crítica ainda.
Uma linha por cenário
- Vai alimentar LLM, RAG ou agente, e os alvos são públicosFirecrawl
- Os alvos são fortemente defendidos, ou a exigência é enterprise com SLABright Data
- Já existe um Actor para o site exato, ou você quer orquestração prontaApify
- São muitos sites simples e o preço por página manda no orçamentoZyte
- O orçamento é zero, ou os dados não podem sair da sua infraestruturaCrawl4AI
- Vai fazer as duas coisas, extração limpa e alvos difíceisFirecrawl + Bright Data
Como este dossiê foi feito
Pesquisa feita em 3 de outubro de 2026, só com fontes públicas. Números de produto, preço e cobertura vêm das páginas oficiais da Firecrawl, que tem interesse na própria narrativa, e de benchmarks divulgados por ela. Os contrapontos vêm de comparativos independentes e do comparativo da Bright Data, também parte interessada. Não houve benchmark hands-on: onde as fontes divergem, o divergente está sinalizado no texto.
- Firecrawl, site oficial: firecrawl.dev (produto, números da empresa, Alexandria, Série B)
- Firecrawl, preços e tabela de créditos, vigentes em 4 de setembro de 2026: firecrawl.dev/pricing
- Firecrawl, repositório no GitHub: github.com/firecrawl/firecrawl (AGPL-3.0, SDKs MIT, 188 mil stars)
- DevToolLab, "Best Web Scraping APIs for AI in 2026", 3 de setembro de 2026: devtoollab.com/blog/best-web-scraping-apis-for-ai (custo por 100 mil páginas, Crawl4AI 81 mil stars, stealth a 5 créditos)
- ClawEngine, "Firecrawl vs Bright Data vs Apify for LLMs", julho de 2026: clawengine.ai (o que nenhum deles faz, preço por 1.000 páginas tipadas)
- Archit Jain, "Apify vs Bright Data vs Firecrawl: Honest Comparison for 2026", abril de 2026: architjn.com (quem ganha em cada cenário)
- Bright Data, "Bright Data vs Firecrawl", 2026: brightdata.com/blog/comparison (comparativo da concorrente; útil pelo contraponto, enviesado por definição)