Rastrear Tráfego de IA no WordPress: Configuração Completa

Rastrear Tráfego de IA no WordPress: Configuração Completa

Como rastrear tráfego de IA no WordPress: a configuração necessária

Qual é a configuração para rastrear tráfego de IA no WordPress?

Para rastrear tráfego de IA no WordPress você precisa de três camadas configuradas ao mesmo tempo: (1) um robots.txt que permita ou controle explicitamente o acesso de robôs como GPTBot, ClaudeBot, PerplexityBot e Google-Extended; (2) uma forma de capturar e filtrar os logs de acesso do servidor pelo user-agent, já que ferramentas de analytics baseadas em JavaScript (como o Google Analytics 4 "puro") não capturam bots de IA que apenas leem o HTML; e (3) um painel ou plugin que cruze esses logs com as páginas visitadas, mostrando quantas vezes cada IA leu cada URL e, quando possível, quantas visitas humanas chegaram depois de uma citação. Sem essas três camadas juntas, você só vê "parte" do tráfego de IA — normalmente apenas o clique humano que veio de uma citação, não a leitura do robô que gerou essa citação.

Isso é diferente de rastrear tráfego humano. Um robô de IA não executa JavaScript, não dispara pixels de conversão e não aparece no Google Analytics como sessão — ele aparece (ou não) nos logs de acesso do servidor. É por isso que muitos sites WordPress "acham" que não recebem tráfego de IA, quando na verdade só não estão olhando no lugar certo.

Passo 1: ajustar o robots.txt para os robôs de IA

O WordPress gera um robots.txt virtual por padrão, mas ele raramente trata os robôs de IA de forma específica. Você precisa decidir, para cada robô, se ele pode ler seu conteúdo:

  • GPTBot (OpenAI/ChatGPT)
  • ClaudeBot (Anthropic/Claude)
  • PerplexityBot (Perplexity)
  • Google-Extended (Gemini e AI Overviews)
  • Bytespider, Amazonbot e outros bots de treinamento

Se algum desses estiver bloqueado (o que é comum em instalações com Cloudflare, Wordfence ou outros firewalls agressivos por padrão), sua marca simplesmente não é vista pelas IAs — não é que a resposta te ignore, é que o robô nunca conseguiu ler a página. Editar o robots.txt manualmente (via plugin de SEO ou acesso a arquivos) resolve a permissão, mas não garante que o firewall também deixe passar.

Passo 2: verificar bloqueios reais de Cloudflare e WAF

Aqui está o ponto que mais gera falso diagnóstico: o robots.txt pode estar liberado e, ainda assim, o firewall (Cloudflare, um WAF de hospedagem, ou o próprio Wordfence) bloquear a requisição antes que ela chegue ao WordPress. O único jeito confiável de saber é fazer um teste real: buscar a página com o user-agent exato do GPTBot (ou ClaudeBot, PerplexityBot) e ver o código de resposta HTTP. Se vier 403 ou uma página de desafio JavaScript, o robô não está lendo seu conteúdo, mesmo que o robots.txt diga "permitido".

Esse é um dos motivos pelos quais a Citalya oferece uma auditoria de acesso dos robôs de IA que faz exatamente isso: confere o robots.txt, roda o teste real com o user-agent de cada robô, verifica se o conteúdo é legível sem JavaScript, checa dados estruturados, Open Graph e a existência de llms.txt, e repete essa varredura automaticamente toda semana, alertando quando algo quebra (uma atualização de plugin de segurança, por exemplo, que passa a bloquear um bot sem avisar).

Passo 3: capturar tráfego de IA nos logs do servidor

Depois de garantir que os robôs conseguem ler o site, o próximo desafio é registrar isso de forma utilizável. Existem três caminhos comuns em WordPress:

  1. Logs brutos do servidor (Apache/Nginx): sempre têm o dado, mas exigem parsing manual ou script para filtrar por user-agent — inviável para quem não tem rotina técnica.
  2. Plugin de log de acesso: adiciona uma camada de rastreamento dentro do WordPress, mas pode pesar no desempenho do site se não for bem configurado.
  3. Infraestrutura que já registra isso nativamente: quando o site roda em uma estrutura preparada para isso, o registro de qual robô leu qual página acontece sem instalar nada adicional. É o caso das páginas publicadas pela Citalya, que roda na própria infraestrutura da plataforma e já contabiliza quais IAs (GPTBot, ClaudeBot, PerplexityBot etc.) acessaram cada página e quantas visitas humanas chegaram depois, vindas de cada IA.

Se seu WordPress é autogerenciado e você precisa manter tudo nele, o caminho realista é combinar um plugin de logs com exportação periódica e cruzar manualmente com a lista de IPs e user-agents conhecidos de cada robô — um trabalho manual que precisa ser repetido, porque as IAs mudam de user-agent e de faixa de IP com frequência.

Passo 4: complementar com GA4, GTM e dados estruturados

O tráfego de IA tem duas pontas: o robô que lê (rastreamento de crawler) e o humano que clica depois de ver a marca citada numa resposta de IA (rastreamento de conversão). Para a segunda ponta, GA4 e Google Tag Manager continuam válidos, desde que você configure a origem corretamente — muitos cliques de resultados de IA chegam sem parâmetro UTM e caem em "referral" ou "direto", distorcendo a análise se não houver um filtro dedicado.

Do lado do conteúdo, ter JSON-LD (Article e FAQ), canonical, Open Graph e sitemap.xml bem configurados aumenta a chance de a página ser lida e citada corretamente pelas IAs, o que é a origem do tráfego que você quer medir depois.

Checklist rápido de configuração

  • robots.txt permite explicitamente os robôs de IA que você quer monitorar
  • Teste real com user-agent de cada bot retorna 200, não 403 ou desafio
  • Firewall/WAF/Cloudflare configurado para não bloquear esses user-agents
  • Conteúdo principal legível sem depender de JavaScript
  • Dados estruturados (JSON-LD), Open Graph e llms.txt presentes
  • Algum mecanismo de log que registre visitas de GPTBot, ClaudeBot, PerplexityBot etc. por página
  • GA4/GTM configurados para capturar cliques humanos vindos de respostas de IA
  • Auditoria repetida periodicamente, não só uma vez

Por que isso é mais difícil em WordPress autogerenciado

WordPress dá liberdade total, mas cada peça dessa configuração vive em lugar diferente — robots.txt em um plugin, firewall em outro serviço, logs em um terceiro sistema, analytics em um quarto. Cada atualização de plugin de segurança pode silenciosamente voltar a bloquear um robô que estava liberado, e isso normalmente só é percebido quando alguém nota que a marca "desapareceu" das respostas de IA, semanas depois.

É esse cenário que motivou a Citalya a construir a auditoria de acesso dos robôs de IA como uma rotina automática e não como uma checagem pontual: ela roda sozinha toda semana e avisa quando algo quebra, além de registrar, para quem publica páginas na própria infraestrutura da plataforma, exatamente quais IAs leram cada conteúdo e quantas visitas vieram de cada uma delas — sem precisar montar essa engenharia de logs manualmente dentro do WordPress.

Se o seu objetivo não é só configurar o rastreamento, mas entender se sua marca está de fato sendo citada, em que posição, com que tom e à frente de quais concorrentes nas respostas do ChatGPT, Gemini, Perplexity, Grok, Claude e Google AI Overviews, vale começar pela auditoria gratuita de site disponível na página inicial da Citalya, sem cadastro, e depois avaliar o teste grátis de 7 dias para acompanhar isso de forma contínua.

Perguntas frequentes

O Google Analytics 4 sozinho já mostra tráfego de robôs de IA?

Não. O GA4 depende de JavaScript para registrar sessões, e a maioria dos robôs de IA não executa JavaScript. Ele só mostra cliques humanos que chegaram depois de uma citação, não a leitura do robô.

Bloquear todos os bots no Wordfence ou Cloudflare afeta minha citação em IAs?

Sim. Se GPTBot, ClaudeBot, PerplexityBot ou Google-Extended forem bloqueados pelo firewall, mesmo com robots.txt liberado, sua página não é lida e não pode ser citada nas respostas dessas IAs.

Preciso instalar um plugin específico para rastrear tráfego de IA no WordPress?

Você pode usar um plugin de logs combinado com parsing manual de user-agents, mas isso exige manutenção constante, porque as IAs mudam identificadores com frequência. Infraestruturas que já registram isso nativamente eliminam essa manutenção.

O que é o arquivo llms.txt e ele é necessário?

É um arquivo que orienta como sistemas de IA podem interpretar o conteúdo do site. Ainda não é padrão universal, mas complementa o robots.txt e já é verificado em auditorias de acesso de robôs, incluindo a da Citalya.

Com que frequência devo checar se os robôs de IA ainda acessam meu site?

Idealmente toda semana, porque atualizações de plugins de segurança ou mudanças no WAF podem bloquear um robô sem aviso. Auditorias automáticas recorrentes evitam que isso passe meses sem ser notado.

Continue lendo