Por trás de cada resposta e de cada citação no ChatGPT, está um sistema de recuperação de informações em três camadas:
- Uma série de índices que listam páginas úteis;
- Um cache que guarda cópias do que já foi acessado;
- Uma ferramenta de busca que pesquisa e abre páginas em tempo real.
É esse sistema que define quais páginas são pesquisadas e lidas, quais marcas são mencionadas e quais sites são citados, e porque apenas a metade do que é consultado é efetivamente usado na resposta de um prompt.
Este guia reúne as principais pesquisas e descobertas sobre os sistemas internos do ChatGPT, feitas pelos especialistas Olivier de Segonzac (França), Suganthan Mohanadasan (Noruega) e Dan Petrovic (Austrália). Atualizaremos esta página conforme novas informações forem descobertas.
Como mapear o que acontece nos bastidores do ChatGPT
Todas as pesquisas sobre o sistema de recuperação de informações do ChatGPT avaliam os dados que o assistente de IA envia ao navegador.
Para acessá-los, basta abrir o Chrome DevTools e ir até a aba Network. Os pesquisadores enviam diversos prompts e analisam os padrões que aparecem ali, como a presença de determinados campos e as menções a determinados índices e sistemas internos que não são publicamente documentados pela OpenAI.
Há algumas extensões que coletam os dados presentes ali de forma automatizada, como a Fanoutfox.
O sistema muda com bastante frequência. Em apenas quatro meses, de junho a agosto de 2026, houve uma série de alterações significativas:
A estrutura básica segue a mesma, mas os detalhes mudam o tempo inteiro.
Como o ChatGPT realiza a pesquisa na web
Para pesquisar na web, o ChatGPT segue os passos:
- Determina se é necessário pesquisar na web;
- Identifica se o visitante está no modo Instant (padrão) ou Thinking (de raciocínio avançado);
- Classifica os prompts;
- Decide em quais índices pesquisar dependendo dessa classificação (índices internos, Bing, dados raspados do Google, feeds de produto, etc.);
- Recupera snippets de algumas dezenas de páginas, dependendo da complexidade do prompt (título H1 + 200 primeiros caracteres de texto, dificilmente puxa a metadescrição);
- Armazena as páginas em cache (versão completa da página);
- No modo Thinking, abre em tempo real um grupo pequeno de páginas para ler além do snippet.
Esse processo pode ser dividido em três camadas: o índice, o cache e a abertura de páginas, sendo esta última exclusiva para o modo Thinking.
Inicialmente, Suganthan Mohanadasan identificou seis classificações de prompts, demarcados no campo turn_user_case: instant_search, shopping, text, local, thinking e image_generation. Em agosto de 2026, ele identificou novas verticais:
- fast: busca geral na web;
- product: consulta em catálogos, para produtos físicos. Possivelmente acessa feeds de produtos;
- business: pesquisa para negócios locais, que ocorre em duas etapas. Primeiro, há uma busca por uma frase. Quando o ChatGPT já tem uma lista de negócios, ele verifica-os um a um antes de fazer as recomendações;
- image: autoexplicativo, são buscas por imagens:
- genui_run: é a sigla para Interface de Usuário (UI) generativa. Aciona diretamente widgets, como gráficos interativos e calendários. Não há citações nas respostas.
E, sobre o que acontece depois da busca na web, seu site pode ser:
- Buscado: seu site foi puxado para contexto, mas aparece só no campo result_source, sem presença direta na resposta;
- Citado: seu site foi vinculado como fonte de uma frase específica;
- Mencionado: sua marca aparece diretamente no texto da resposta, com ou sem link.
Veja a seguir os detalhes das três camadas do sistema de recuperação de informações do ChatGPT.
1. O índice e a descoberta de páginas
Índices são listas de páginas que um buscador ou uma IA consultam. Eles são acessados sempre que os dados de treinamento do modelo são considerados insuficientes para gerar uma resposta.
O principal índice do ChatGPT é o Bing, da Microsoft. Mas, além dele, outros podem ser acionados, dependendo do tipo de prompt:
- Labrador: fluxo geral que combina busca na web via Bing, notícias, ArXiv, Reddit, YouTube e Wikipedia;
- bright e oxylabs: busca geral na web usando o índice do Google de maneira indireta, através de scraping;
- P1/P2/P3: para prompts comerciais, usando feeds da OpenAI e do Google como referência;
- B1/B3, Yelp e TripAdvisor: para pesquisas locais. No Brasil, possivelmente outros diretórios são usados, como o ReclameAqui.
Pesquisas comerciais e locais não passam pelo fluxo de pesquisa geral na web. Os pipelines buscam informação diretamente em feeds e em listagens de negócios.
2. Cache de leitura
O ChatGPT mantém uma versão de cada página acessada salva em cache.
As principais características do cache do ChatGPT são:
- Compartilhamento entre usuários: um cache gerado em busca no plano gratuito no Brasil pode ser usado para alimentar uma resposta de uma conta paga nos EUA;
- Rastreamento com base na popularidade: a frequência de novos rastreamentos das páginas armazenadas em cache é definida pelo uso do arquivo. Quanto mais requisitado, mais rastreado;
- O cache ignora diretivas de controle: em testes feitos por Jérôme Salomon, as cópias foram usadas mais de 90 dias após a requisição original e sem respeitar diretrizes como Cache-Control: no-store e noindex;
- Conversão para markdown: as páginas completas são convertidas de HTML para MD. Nesse processo, scripts, iframes e JSON-LD são removidos. O texto alternativo das imagens é preservado e o texto escondido por CSS ainda é extraído;
- Limites de rastreamento: os crawlers da OpenAI não executam JavaScript e ignoram completamente as páginas com mais de 4 MB (raramente uma página chega a esse tamanho);
- A data do rastreamento fica registrada: um parâmetro de API mostra a data do último crawl da cópia armazenada de uma URL.
3. Abertura de páginas em tempo real
No modo thinking, o ChatGPT abre páginas em tempo real. É diferente das outras duas camadas, que usa snippets, versões em cache e os dados armazenados em índice para estabelecer as citações.
Durante o processo de “pensar” para responder, o ChatGPT efetivamente acessa e lê as páginas.
Olivier de Segonzac define os dois sistemas de maneira diferente: instant, que raramente abre páginas, e thinking, responsável pela maioria das aberturas. Durante seus testes, o pesquisador chegou aos seguintes números:
- De 61332 URLs que entraram na barra lateral de fontes, 5032 se tornaram a fonte principal de uma citação;
- Dessas 5032, apenas 759 foram abertas;
- Todas as aberturas ocorreram no modo thinking;
- Páginas abertas têm 74% de chance de serem citadas;
- Nas páginas apenas recuperadas, sem abertura, a chance cai para 7%.
Ou seja, um site pode ser recuperado, mas raramente citado. E, aparentemente, o modo do ChatGPT tem influência nesses números. Outras pesquisas, como as realizadas por Dan Petrovic e Ahrefs já haviam demonstrado, com outras metodologias, as diferenças nas taxas de recuperação e citação.
Essas URLs abertas no modo Thinking não são identificáveis. Elas não têm o parâmetro utm_source=chatgpt.com, que aparece nos links clicáveis aos visitantes humanos. Portanto, esse tráfego aparece como “direto” ou similar nos analytics de marketing.
O único rastro que essa leitura deixa é o user-agent ChatGPT-User nos logs de servidor do site.
Atualização de agosto de 2026: mudanças no modo Thinking
Em agosto de 2026, o modo Thinking foi liberado para contas gratuitas do ChatGPT, junto de um botão chamado Think.
Olivier de Segonzac descobriu que usar esse modo altera o que o ChatGPT vê e cita. As principais mudanças documentadas foram:
- Em contas gratuitas usando o novo modo (Free Think), a lista de páginas consultadas quase dobra (de 15,1 para 35,3 URLs por conversas);
- O Free Think tira 74,7% das páginas do índice labrador, 3,1% do Google e 22% do oxylabs. O Thinking pago tira 75,3% do Google e 24,7 do labrador;
- O modo Thinking pago reduziu as query fan-outs de 3,56 para 1,90 por conversas, e URLs de 47,2 para 33,9; domínios de 21,9 para 15,5 (em esforço médio). Em esforço avançado, a queda é ainda maior (de 67 para 40,5 URLs);
- O uso do operador site: aumentou: 3,5% (free Instant) → 10,8% (free Think) → 41,9% (Thinking pago, esforço médio) → 58,1% (esforço alto).
A implicação é que duas pessoas com a mesma pergunta podem receber respostas completamente diferentes. E mais: o conjunto de sites consultado pode ser diferente, dependendo de como a pessoa configurou o ChatGPT para responder ao prompt.
E, nem sempre a boa posição no Google se correlaciona diretamente com visibilidade no ChatGPT. No conjunto de recuperação Free Think, os demais índices da OpenAI é quem define as páginas que podem receber citações.
Por que há tanta diferença entre os modos?
A principal razão para resultados tão diferentes é a economia.
O Modo Instant é o “básico” do ChatGPT. O visitante não paga, então ele recebe a versão mais simplificada da busca, que acessa apenas os índices internos da OpenAI e lê snippets.
Já no modo Thinking, a pessoa paga para ter um alto nível de raciocínio na resposta. O ChatGPT entrega por meio de consultas mais caras, com abertura de páginas em tempo real e acesso a dados do Google, mais caros de obter.
Tudo o que custa mais caro fica reservado ao modo pago, ou é usado apenas quando não existe outra forma de entregar uma boa resposta.
Atualização de agosto de 2026: a nova linguagem das buscas no ChatGPT
Entre 16 e 20 de agosto de 2026, a forma como o ChatGPT registra suas próprias buscas mudou por completo. As chamadas de busca, que apareciam em JSON, agora aparecem em linhas, com um formato bem particular.
As principais características desse novo modelo são:
- A ausência do campo search_queries, que permitia ver a query fan-out no ChatGPT;
- Mudança no formato de buscas. Cada linha traz um tipo de chamada, a consulta, um número, um domínio e uma estimativa do tamanho de texto que deve ser recuperado de cada página;
- A hipótese é que o número seja a janela de frescor para cada busca. Por exemplo, para cotações de ações, buscar páginas atualizadas nos últimos 2 dias, para resultados de futebol 7 dias, buscas informativas 30 dias e assim por diante;
- O campo de domínio substitui o operador site:, que era usado para checar um site específico. Se o domínio que o modelo “lembra” estiver desatualizado, a pesquisa será feita no site errado;
- O formato de widget (genui_run) não recebe citações diretas.
O mistério das citações ao Reddit
Ainda em agosto, o Reddit parou de ser citado pelo ChatGPT, sem motivo aparente.
Suganthan Mohanadasan, em suas investigações sobre o sistema de recuperação de informação, traçou algumas hipóteses sobre o que deve ter acontecido. Dan Petrovic chegou a conclusões parecidas, em pesquisa do ano passado.
O Reddit é consultado para contexto, mas não é a “fonte final”, que sustenta as passagens presentes na resposta do prompt. Por isso ele tem uma frequência tão alta de rastreamento, mas tão baixa de citações.
Mohanadasan detalha o seguinte exemplo:
fast|best AI live chat support Intercom Gorgias Zendesk Ada Tidio Crisp reddit|365|reddit.com
Nele, o ChatGPT está fazendo uma busca geral na web, pelo termo “suporte para chat ao vivo com IA”. Antes de fazer a pesquisa, o modelo já sabe quais marcas buscar. A busca sobre essas marcas foi feita diretamente no Reddit, com uma janela de frescor de 365 dias.
Ou seja, a IA não perguntou ao Reddit “quais são as melhores plataformas”. Ele perguntou o que as pessoas acham das seis ferramentas que já foram julgadas relevantes.
Nesta conversa, 84 das 221 URLs recuperadas foram do Reddit, mas nenhuma delas recebeu o crédito. O padrão se repetiu em outras consultas também.
Trata-se apenas de uma hipótese, impossível de confirmar apenas com os dados de tráfego. Mas é um movimento que outros pesquisadores já observaram também, e que pode indicar um esforço para “proteger” a integridade das respostas da IA.
O Reddit tornou-se o site mais citado pelos principais assistentes de IA do mercado, pois traz perspectivas humanas em formato de texto, facilmente extraídas de comentários. Assim, surgiram campanhas de marketing dentro do Reddit, com o objetivo de manipular as respostas.
Deixar de citar diretamente as páginas seria uma forma de desencorajar essa abordagem de marketing.
Recomendações de GEO para o ChatGPT
A partir dessas análises do sistema de recuperação de informações do ChatGPT, podemos elencar algumas práticas para que a IA encontre seu site quando pesquisar na web, e cite-o sempre que possível.
Entre as ações que você pode adotar, estão:
- Continue investindo em SEO. A otimização tradicional de sites cobre os pré-requisitos básicos para estar bem ranqueado nos índices dos buscadores, consultados em diversos fluxos de pesquisa do ChatGPT;
- Incluir as informações mais importantes no H1 e nas 200 primeiras palavras do texto;
- Não mensurar a visibilidade na IA apenas por UTMs, pois elas nem sempre são aplicadas corretamente;
- Incluir informações importantes, como o preço, em HTML, já que certos crawlers de IA não rodam JS;
- Organize seu conteúdo em torno de perguntas reais que as pessoas provavelmente fazem às IAs;
- Mantenha suas páginas abaixo de 4 MB (idealmente, abaixo de 2 MB, para não ter problemas com o Google). A menos que seu site seja muito mal otimizado, você estará sempre dentro desse limite;
- Pense em títulos como frases completas e informativas, pois eles podem ser extraídos na sua totalidade;
- Mantenha a metadescrição otimizada. Por mais que ela raramente seja usada nos pipelines do ChatGPT, ainda são úteis para o Google;
- Atualize suas páginas importantes com frequência, construindo autoridade para elas com consistência;
- Veja se o ChatGPT conhece o domínio que você está usando hoje e faça os redirecionamentos necessários;
- Para e-commerces: atualize seus feeds de produtos;
- Para negócios locais: garanta que o seu site tem perfis atualizados em listagens e diretórios relevantes, como Google Meu Negócio e Reclame Aqui;
- Construa o seu branding, já que, frequentemente, a IA escolhe quais marcas recomendar antes de pesquisar qualquer página na web;
- Prepare-se para o formato de layouts interativos, pois a OpenAI já está começando a incorporá-lo ao seu pipeline.
Para ter apoio profissional na aplicação dessas estratégias, entre em contato com a SEO Happy Hour. Temos décadas de experiência na otimização de site e estamos apoiando grandes empresas na transição para as buscas com IA.
Comentários