Os agentes de rastreamento, também chamados de rastreadores ou crawlers, executam a etapa inicial do processo de descoberta e coleta da informação da web. Eles navegam por hyperlinks para descobrir, recuperar URLs e processar seu conteúdo.
Podemos dizer que a atuação dos crawlers alimenta a web moderna. Nos buscadores tradicionais, a descoberta, ingestão e estruturação de dados são a base dos índices. E nos sistemas de IA, eles atuam no treinamento de modelos e na recuperação em tempo real (RAG).
O SEO técnico otimiza a arquitetura de sites, reduzindo fricções e acelerando a rastreabilidade para agentes de busca e sistemas de IA.
Ao oferecer informação de maneira estruturada, organizar a arquitetura do site de forma lógica e orientar a navegação dos robôs, é possível obter maior visibilidade. E o contrário também é verdadeiro: quando um crawler não consegue ler uma página (ou parte dela), ela fica literalmente invisível para os buscadores e IAs. É o que acontece em sites lentos ou que dependem de JavaScript para exibir conteúdo, por exemplo.
O que é um agente de rastreamento no ecossistema de SEO técnico?
Ontologicamente, agentes de rastreamento são clientes HTTP projetados para percorrer a internet de forma autônoma. Seu objetivo é descobrir novas páginas e extrair o seu conteúdo, em um ciclo automático e ininterrupto, que ocorre em larga escala.
Primeiro, o agente acessa e baixa um conjunto inicial de URLs (seed set). Ao baixar o seu conteúdo, ele extrai também os links internos e externos daquela página. Essas novas URLs são enviadas a uma fila de requisição (URL frontier), para que o processo se reinicie.
A anatomia dos agentes de rastreamento modernos contém:
Identificação via cabeçalho HTTP User-Agent: o cabeçalho user-agent especifica a cadeia de produto, versão de software, descrição do agente de rastreamento e, opcionalmente, um campo com o e-mail do administrador. Ou seja, é o identificador de um crawler. A normativa RFC 9110 define o padrão para os user-agents;
Endereço de IP de origem: o endereço de IP é uma credencial que identifica onde a requisição de rastreamento se origina. Por meio dele, servidores podem aplicar políticas de controle de tráfego;
Assinaturas criptográficas e validação DNS/WAF: são ferramentas adicionais de validação, que não podem ser facilmente forjadas por terceiros. Buscadores e sistemas de IA declaram listas de IP oficiais, que podem ser checadas automaticamente em firewalls.
Os três elementos são vetores de identificação e validação, que permitem uma navegação transparente, da qual os donos de site podem escolher ou não fazer parte. Ainda assim, é possível haver golpes (o chamado spoofing).
Por fim, é importante diferenciar os agentes legítimos e os maliciosos.
Os agentes éticos obedecem rigorosamente aos padrões RFC 9110, normativa de semântica da web, e à RFC 9309, que detalha o protocolo de exclusão de robôs. Antes de explorar um domínio, esses crawlers acessam o arquivo robots.txt e obedecem às regras de permissão e restrição (allow e disallow) presentes ali.
Já os agentes maliciosos agem livremente. Eles violam regras do robots.txt, forjam user-agents para mascarar sua identidade e se passar por outro crawler, e realizam raspagens de dados sem autorização.
A taxonomia dos agentes modernos
Com a evolução natural da web, dos mecanismos de busca e dos sistemas de Inteligência Artificial, os agentes de rastreamento especializaram-se em quatro categorias:
Indexação clássica: percorrem a web para alimentar índices que estruturam mecanismos de busca, como o Bing e o Google;
Pré-treinamento de modelos: percorrem a web em busca de dados textuais, que são tratados para treinamento e aprimoramento de Modelos de Linguagem de Grande Escala (LLMs);
RAG: atuam sob demanda para realizar pesquisas na web em tempo real dentro de assistentes de IA, de modo a tornar a resposta mais coerente e bem fundamentada. Subdivide-se entre agentes de busca automatizada e disparados por ações de usuário;
Diagnóstico, auditoria e validação técnica: agentes especializados, que varrem a web para realizar tarefas altamente específicas, como validar anúncios ou possibilitar auditorias de SEO.
Categoria
Propósito
Exemplos
Indexação clássica (motores de busca algorítmicos)
Rastreiam a web recursivamente para alimentar os índices dos buscadores tradicionais
Os principais agentes de rastreamento de SEO da atualidade
Veja abaixo uma lista com os principais rastreadores do mercado, quais empresas os desenvolvem, qual é o seu user-agent e a qual categoria pertencem.
Nome
Empresa
User-Agent
Categoria
Googlebot
Google
Googlebot/2.1
Indexação clássica
Bingbot
Microsoft
bingbot/2.0
Indexação clássica
Applebot
Apple
Applebot
Indexação clássica
DuckDuckBot
DuckDuckGo
DuckDuckBot/1.1
Indexação clássica
YandexBot
Yandex
YandexBot/3.0
Indexação clássica
Baiduspider
Baidu
Baiduspider/2.0
Indexação clássica
GPTBot
OpenAI
GPTBot/1.2
Ingestão de IA (pré-treinamento)
ClaudeBot
Anthropic
ClaudeBot/1.0
Ingestão de IA (pré-treinamento)
Google-Extended
Google
Sem User-Agent próprio (token de robots.txt)
Ingestão de IA (pré-treinamento)
Applebot-Extended
Apple
Sem User-Agent próprio (token de robots.txt)
Ingestão de IA (pré-treinamento)
Meta-ExternalAgent
Meta
meta-externalagent/1.1
Ingestão de IA (pré-treinamento)
Bytespider
ByteDance
Bytespider
Ingestão de IA (pré-treinamento)
CCBot
Common Crawl
CCBot/2.0
Ingestão de IA (pré-treinamento)
Amazonbot
Amazon
Amazonbot/0.1
Ingestão de IA (pré-treinamento)
OAI-SearchBot
OpenAI
OAI-SearchBot/1.0
IA em tempo real (RAG e ações de usuário)
ChatGPT-User
OpenAI
ChatGPT-User/1.0
IA em tempo real (RAG e ações de usuário)
Claude-SearchBot
Anthropic
Claude-SearchBot
IA em tempo real (RAG e ações de usuário)
Claude-User
Anthropic
Claude-User/1.0
IA em tempo real (RAG e ações de usuário)
PerplexityBot
Perplexity AI
PerplexityBot/1.0
IA em tempo real (RAG e ações de usuário)
Perplexity-User
Perplexity AI
Perplexity-User/1.0
IA em tempo real (RAG e ações de usuário)
Meta-ExternalFetcher
Meta
meta-externalfetcher/1.1
IA em tempo real (RAG e ações de usuário)
AdIdxBot
Microsoft
adidxbot/2.0
Diagnóstico, auditoria e validação técnica
OAI-AdsBot
OpenAI
OAI-AdsBot/1.0
Diagnóstico, auditoria e validação técnica
AdsBot-Google
Google
AdsBot-Google
Diagnóstico, auditoria e validação técnica
Screaming Frog
Screaming Frog
Screaming Frog SEO Spider/20.0
Diagnóstico, auditoria e validação técnica
AhrefsBot
Ahrefs
AhrefsBot/7.0
Diagnóstico, auditoria e validação técnica
SemrushBot
Semrush
SemrushBot
Diagnóstico, auditoria e validação técnica
Essa lista não é definitiva. Há inúmeros agentes de rastreamento funcionando e o ecossistema expande rapidamente. Os números de versão do user-agent também mudam conforme os programas são melhorados.
A rastreabilidade como pilar zero e sua conexão com os 6 pilares do SEO técnico
Rastreabilidade é o fundamento do SEO técnico. Ou seja, a fundação sobre a qual toda arquitetura de otimização é construída. Se um agente de rastreamento não puder descobrir, fazer requisições e coletar o conteúdo de uma página com eficiência, ela não estará presente nos mecanismos de busca e nem será citada nas respostas de IA.
Podemos considerar 6 pilares do SEO técnico, todos conectados à rastreabilidade, que funciona como pilar zero:
Tempo de resposta do servidor: o tempo de resposta inicial (medido pelo TTFB, ou Time to First Byte) e o status HTTP de resposta determinam a frequência de visitação dos agentes. Códigos de erro 5xx indicam que a taxa de rastreamento deve ser menor, enquanto códigos 200 indicam sucesso;
Arquitetura de links internos: a ordenação dos links internos determina como o agente navegará pelo site. Por meio de diretórios bem organizados, listas de URLs em sitemap e gestão eficiente de parâmetros, o rastreador consegue acessar tudo o que precisa de maneira rápida e direta, sem o risco de ignorar links importantes;
Renderização web: o modo como o site entrega o conteúdo interfere diretamente no funcionamento dos agentes. Renderização do lado do cliente (CSR) exige um alto custo de processamento e pode impedir o rastreio de certos elementos da página. Esses problemas não ocorrem quando todo o conteúdo é disponibilizado via HTML, na renderização do lado do servidor (SSR);
Indexabilidade:indexação é a conversão do conteúdo rastreado em um dado estruturado dentro de um índice. Ou seja, é a etapa posterior do processo de SEO, que resulta na página disponível aos visitantes. É possível que uma página seja rastreada, mas não indexada;
Performance web: a performance de um site é definida por sua velocidade de carregamento, estabilidade visual e interatividade. Os agentes ajustam a velocidade da varredura e a taxa de rastreio com base na latência apresentada pelo servidor. Serviços de entrega de conteúdo (CDN) e políticas eficientes de cache ajudam a contornar o problema;
Dados estruturados: o uso de JSON-LD para padronizar dados estruturados, seguindo o padrão schema, facilita a rastreabilidade ao entregar informações em formatos nativamente legíveis por máquinas. Em vez de analisar apenas o HTML e o seu conteúdo textual, o crawler pode consumir os dados estruturados diretamente, acelerando a extração de informações.
A dualidade no consumo de motores de busca tradicionais e motores de geração de informação (LLMs e RAG)
Hoje, o SEO técnico atende a dois tipos diferentes de sistema, ambos estruturados em torno de agentes de rastreamento: os buscadores tradicionais e os assistentes de IA. Apesar de suas diferenças, os dois dependem de um site rastreável, de baixa latência e estruturalmente previsível.
A tabela abaixo sintetiza essa dualidade no consumo de informação:
Menções da marca em texto, citações nas respostas da IA
Veja agora os detalhes sobre cada um dos sistemas.
1. Motores de busca tradicionais (sistemas de índice invertido)
Inicialmente, os mecanismos de busca usavam agentes de rastreamento para construir índices invertidos, conforme explicam Manning et al. (2009). Neste formato, palavras-chave são associadas às páginas em que elas aparecem. As URLs então são ranqueadas de acordo com a sua autoridade e relevância para cada pesquisa.
Nas últimas décadas, o modelo evoluiu muito. Hoje, os buscadores continuam a usar rastreadores para alimentar os índices, mas não dependem mais da presença exata de um termo em uma página para ranquear. Eles são altamente contextuais, compreendendo o contexto e o significado das palavras para gerar respostas precisas às buscas dos visitantes.
O fluxo de consumo de informação nos buscadores tradicionais compreende:
Rastreamento: agentes de busca, como o Googlebot ou o Bingbot, descobrem novas URLs, realizam requisições HTTP automatizadas e baixam o conteúdo das páginas;
Renderização: o buscador executa os scripts das páginas, simulando o navegador de um usuário humano, para construir a árvore DOM e “enxergar” os recursos visuais da página;
Análise sintática: o código HTML é limpo, tokenizado e passa por um pré-processamento linguístico;
Indexação: o conteúdo extraído é mapeado no índice invertido, que é acessado a cada vez que um visitante faz uma busca;
Ranqueamento: ao receber uma pesquisa, o sistema calcula a relevância de cada página, exibindo-as em ordem. Há uma série de sinais e subsistemas responsáveis pelo ranqueamento. No Google, existem algumas centenas.
O SEO técnico contribui para tornar as páginas elegíveis a esse processo. Portanto, as métricas de sucesso se relacionam com a visibilidade nos buscadores. As principais são o posicionamento na SERP, a taxa de cliques e o tráfego orgânico direto. Estes, por sua vez, se correlacionam com faturamento e sucesso comercial para as marcas.
2. Motores de geração de informação (RAG e LLMs)
Diferentemente dos buscadores, os motores de geração de informação entregam respostas prontas ao visitante. Hoje, o formato mais tradicional é o de chatbots de IA, como o ChatGPT, o Claude e o Gemini.
Eles também usam os rastreadores em diferentes etapas da geração das respostas. No entanto, a função é diferente: em vez de recuperar documentos, eles processam seu conteúdo para gerar respostas inéditas, em linguagem natural, combinando os seus dados de treinamento e recuperação em tempo real.
O fluxo de consumo de informações nesses sistemas é:
Requisição: os robôs fazem requisições de acesso às páginas. No caso do RAG, a requisição ocorre em tempo real, no momento em que o visitante faz uma pergunta à IA;
Vetorização: o texto é dividido em blocos (chunks), que são transformados em sequências numéricas. As sequências são comparadas a outras, dentro de uma base vetorial, para identificar os trechos mais relevantes para responder a um prompt;
Síntese generativa: blocos recuperados de diversas páginas são adicionados à janela de contexto da LLM e usados na formulação de uma resposta original. No caso da recuperação em tempo real, há menção aos sites de onde os blocos foram extraídos.
As métricas de sucesso são as menções à marca no corpo do texto, o que indica que elas são proeminentes na base de dados do modelo, e as citações nas respostas, que indicam que o site foi considerado uma fonte confiável na formulação da resposta.
No entanto, a questão dos KPIs de SEO para IA é, em geral, complexa. Nas últimas décadas, o mercado se organizou para contabilizar cliques, dando pouca ênfase ao que ocorre antes e depois deles. A IA mudou esse paradigma, promovendo o aumento de buscas zero cliques, cujo impacto é difícil de mensurar.
Governança de agentes e engenharia de tráfego
A governança de agentes de rastreamento é o conjunto de ações para gerenciar o tráfego automatizado no servidor. Esses controles protegem sites da sobrecarga e dos agentes maliciosos, e guiam os robôs para os diretórios que trazem valor do ponto de vista de SEO.
Temos como principais implementações técnicas:
Configuração do arquivo robots.txt de acordo com a RFC 9309;
Gestão de carga de rastreamento via códigos HTTP, usando o cabeçalho retry-after;
Validação de agentes via FCrDNS (Forward-Confirmed Reverse DNS);
Estratégias de opt-out para IA, bloqueando agentes de treinamento de LLMs sem impactar a indexação nos buscadores tradicionais.
Veja abaixo como aplicá-las.
Configuração do robots.txt
O arquivo robots.txt orienta como os agentes de rastreamento devem navegar pelo site. Por meio de diretivas allow ou disallow, donos de sites podem definir quais diretórios podem ser rastreados.
As orientações podem ser gerais, aplicáveis a qualquer agente, ou específicas, variando para cada agente (Googlebot, GPTBot, PerplexityBot, etc.).
Todas as diretrizes devem obedecer à sintaxe RFC 9309. Pressione as frases abaixo para ver exemplos.
1. Diretriz para permitir acesso de todos os bots ao site,excetoaos diretóriosadmin,privatee/api/*.json$
# Exemplo de arquitetura de governança no robots.txt
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /private/*
Disallow: /api/*.json$
2. Diretriz específica ao Googlebot, que bloqueia apenas o rastreamento do diretórioprivate
# Regra específica para o Googlebot
User-agent: Googlebot
Allow: /
Disallow: /private/
Gestão de carga de rastreamento via códigos HTTP
Se o volume de requisições for muito grande, o dono do site pode pedir que os web crawlers reduzam o ritmo. Isso é feito por meio das respostas HTTP, que indicam por que houve falhas. Também é possível pedir para que os agentes retomem as requisições futuramente.
Considerando a documentação do Googlebot, o web crawler mais relevante para SEO, três respostas indicam um sinal de sobrecarga:
429 (Too Many Requests): o agente excedeu o limite de requisições para o período;
503 (Service Unavailable): o servidor está incapaz de atender à solicitação;
500 (Internal Server Error): código para falha genérica no servidor.
O crawler retoma o ritmo normal apenas quando esses erros diminuem.
A RFC 9110 especifica ainda o cabeçalho retry-after, que informa por quanto tempo o crawler deve esperar antes de fazer uma nova requisição. Pode ser um número de segundos ou uma data específica.
Nem todos os crawlers interpretam as respostas HTTP da mesma forma. Os agentes maliciosos notoriamente ignoram os códigos de sobrecarga e continuam tentando rastrear. E, mesmo entre os agentes éticos, pode haver pequenas variações, como tratar 429 e 503 como idênticos, ou não respeitar o cabeçalho retry-after.
Validação de agentes via FCrDNS (Forward-Confirmed Reverse DNS)
Como o cabeçalho HTTP User-Agent pode ser facilmente falsificado, a validação de agentes deve ser feita em nível de rede em casos suspeitos, por meio do método FCrDNS (Forward-Confirmed Reverse DNS).
O FCrDNS funciona em duas etapas:
DNS reverso e registro PTR: o servidor pega o endereço IP de onde veio a requisição e consulta o registro PTR desse IP, para descobrir o nome de domínio associado. Em seguida, confere se esse nome pertence ao domínio oficial do buscador, como .googlebot.com para o Google ou .search.msn.com para o Bing;
DNS direto, registros A/AAAA: o servidor pega o nome de domínio obtido e consulta os registros A (IPv4) ou AAAA (IPv6) dele. A validação só é aprovada se o IP retornado for igual ao IP que fez a requisição HTTP.
Estratégias de opt-out para IA sem prejudicar o SEO tradicional
Donos de sites podem impedir que seu conteúdo seja usado para treinar IAs, sem afetar o SEO.
As principais big techs do mercado diferenciam os rastreadores responsáveis por cada tarefa. Logo, basta usar diretivas específicas para cada um no arquivo robots.txt.
Veja uma tabela de referência para os principais nomes do mercado:
Perguntas frequentes sobre agentes de rastreamento
Qual é a diferença entre um agente de rastreamento e um agente de renderização?
O agente de rastreamento é responsável por fazer requisições HTTP e baixar conteúdo HTML, CSS e JS de uma URL. Já o agente de renderização executa os scripts, constrói o DOM e gera a mesma visualização que o visitante humano verá.
Como o SEO técnico impacta a capacidade de citação em respostas de IA (RAG)?
O SEO técnico garante que os conteúdos sejam acessíveis para os crawlers de IA, sem bloqueios de renderização ou sobrecarga de servidor. Além disso, uma arquitetura de site limpa, com dados estruturados facilmente disponíveis e HTML coerente, facilita os processos de chunking e vetorização necessários para que um conteúdo seja incorporado à resposta da IA.
O que acontece se a rastreabilidade de um site for negligenciada?
Negligenciar a rastreabilidade prejudica todo o SEO de um site. Se as páginas não puderem ser rastreadas, também ficarão de fora do índice, o que se traduz na perda completa de visibilidade.
Essa perda de visibilidade pode ser diagnosticada a partir de problemas como:
Baixa frequência de rastreamento;
Desindexação do conteúdo já publicado no site;
Atrasos na indexação de conteúdos novos;
Demora para as atualizações de conteúdo se refletirem no Google e nas IAs;
Sobrecargas de servidor.
Otimize o SEO técnico do seu site
A SEO Happy Hour oferece consultorias de SEO técnico para diagnosticar problemas de rastreabilidade e indexabilidade. Levantamos as principais otimizações necessárias para que os agentes de rastreamento acessem as páginas mais importantes do seu site, sem consumir recursos desnecessários. Entre em contato e saiba mais.
Elyson Gums é redator na SEO Happy Hour. Trabalha com redação e produção de conteúdo para projetos de SEO e inbound marketing desde 2014, em segmentos B2C e B2B. É bacharel em Jornalismo (Univali/SC) e mestre em Comunicação Social (UFPR).
Comentários