Meu site está bloqueado para bots de IA — como descobrir e desbloquear para citações?
Como saber se seu site está bloqueado para bots de IA
Para descobrir se o seu site está bloqueado para bots de IA, verifique três pontos na ordem: o arquivo robots.txt (procurando regras que barrem GPTBot, ClaudeBot, PerplexityBot ou Google-Extended), a configuração de firewall/WAF (Cloudflare e serviços parecidos frequentemente bloqueiam esses robôs por padrão, mesmo sem você perceber) e se o conteúdo principal da página depende de JavaScript para aparecer (muitos crawlers de IA leem HTML puro e ignoram conteúdo renderizado só no navegador). Se qualquer um desses três itens estiver errado, o site pode estar totalmente invisível para ferramentas como ChatGPT, Gemini, Perplexity e Google AI Overviews — mesmo que ele apareça normalmente no Google.
O problema é que essas barreiras raramente são intencionais. Elas vêm de configurações padrão de hospedagem, plugins de segurança ou templates que ninguém revisou pensando em bots de IA — porque até pouco tempo atrás, ninguém precisava pensar nisso.
Por que isso importa agora
Ferramentas como ChatGPT, Perplexity e o Google AI Overviews não indexam páginas do zero como o Google faz há vinte anos. Elas dependem de crawlers próprios — GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot, Google-Extended, entre outros — que precisam visitar e ler seu site para depois poderem citá-lo em uma resposta gerada. Se esse robô é bloqueado na porta de entrada, não existe chance de a marca aparecer numa resposta de IA, não importa quão bom seja o conteúdo.
Isso é especialmente crítico para negócios que já investem em conteúdo e SEO tradicional: o trabalho de anos pode estar rendendo zero visibilidade em IA simplesmente porque um bloqueio técnico nunca foi checado.
Passo a passo para descobrir o bloqueio
- Abra o robots.txt do seu domínio (endereço padrão:
seusite.com.br/robots.txt) e procure por linhas comoUser-agent: GPTBotseguidas deDisallow: /. Isso barra explicitamente o crawler da OpenAI. - Verifique regras equivalentes para outros bots: ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended e Bingbot (usado também por parte da infraestrutura de IA da Microsoft).
- Teste o WAF ou CDN (Cloudflare é o caso mais comum). Muitos planos têm regras de "bot fight mode" ativadas por padrão que bloqueiam qualquer user-agent identificado como automação, incluindo bots de IA legítimos. Isso não aparece no robots.txt — é um bloqueio na camada de rede, então precisa de um teste real de requisição simulando o user-agent do bot.
- Cheque a renderização sem JavaScript: desative o JS no navegador (ou use uma ferramenta de "view source") e veja se o conteúdo principal ainda aparece. Se a página fica em branco, um crawler de IA provavelmente também vê uma página em branco.
- Confirme a existência de dados estruturados (JSON-LD de Article, FAQ, Organization) e de um arquivo
llms.txt, que começa a ser adotado como forma de orientar IAs sobre o que podem ler e citar no seu domínio.
Fazer essa checagem manualmente é possível, mas trabalhoso e fácil de errar — principalmente o teste de WAF, que exige simular o user-agent de cada bot separadamente e repetir isso periodicamente, já que provedores mudam regras de segurança sem aviso.
Como desbloquear o site para bots de IA
Depois de identificar o problema, o desbloqueio segue por partes:
- No robots.txt: remova ou ajuste as linhas
Disallowreferentes aos user-agents de IA que você quer permitir. É possível liberar uns e manter outros bloqueados, dependendo da estratégia da empresa. - No WAF/CDN: crie exceções (allowlist) para os user-agents oficiais dos bots de IA, geralmente na seção de regras de firewall ou "bot management" do painel do provedor.
- No conteúdo: garanta que as informações essenciais — nome da empresa, produto, preço, diferenciais, perguntas frequentes — estejam no HTML renderizado no servidor, não apenas montadas via JavaScript no navegador.
- Em dados estruturados: adicione marcação JSON-LD de Article e FAQPage nas páginas de conteúdo, e Organization na página inicial, para facilitar a extração de fatos pelas IAs.
- Crie um llms.txt: um arquivo simples na raiz do domínio, similar ao robots.txt, mas voltado a orientar modelos de linguagem sobre o conteúdo do site.
Por que isso precisa ser monitorado, não só corrigido uma vez
Um erro comum é tratar o desbloqueio como tarefa única. Na prática, atualizações de plugins de segurança, mudanças de CDN, migrações de hospedagem ou ajustes de outra equipe podem reintroduzir um bloqueio meses depois — silenciosamente. A marca some das respostas de IA e ninguém percebe até revisar métricas de tráfego, o que pode levar semanas.
É por isso que uma auditoria pontual resolve o sintoma, mas não o problema recorrente. O ideal é um processo que rode sozinho, com frequência, comparando o estado atual do site com o anterior e avisando quando algo muda.
Onde o Citalya entra nesse processo
O Citalya foi desenhado justamente para cobrir essa lacuna entre "eu acho que meu site está acessível" e "eu tenho certeza, com teste real, de que está". A auditoria de acesso dos robôs de IA do Citalya verifica o robots.txt, faz uma busca real da página usando o user-agent do GPTBot (o que revela bloqueios de Cloudflare ou WAF que passariam despercebidos), confere se o conteúdo é legível sem JavaScript, valida dados estruturados, Open Graph e a presença de llms.txt — e guarda um histórico dessas checagens, rodando automaticamente toda semana com alerta quando algo quebra.
Além da auditoria, o Citalya acompanha o pulso diário de citação e faz uma varredura semanal completa em seis IAs (ChatGPT, Gemini, Perplexity, Grok, Claude e Google AI Overviews), mostrando a posição exata em que a marca aparece, o tom da menção (positivo, neutro ou negativo) e como isso se compara aos concorrentes em cada resposta — inclusive concorrentes novos que a empresa ainda não tinha mapeado. Quando o site está tecnicamente pronto para ser lido pelas IAs, o Citalya também escreve e publica páginas no domínio próprio do cliente, 100% sem marca do Citalya, já com o SEO técnico completo (título, meta description, JSON-LD, canonical, Open Graph, sitemap.xml, robots.txt e llms.txt), sempre com revisão e aprovação do cliente antes de qualquer publicação.
É possível começar pela auditoria gratuita de site na página inicial do Citalya, sem necessidade de cadastro, só para entender o ponto de partida técnico antes de decidir os próximos passos.
Checklist rápido antes de seguir em frente
- robots.txt permite os bots de IA que interessam à sua estratégia
- WAF/CDN não bloqueia esses mesmos user-agents
- Conteúdo principal aparece sem depender de JavaScript
- JSON-LD de Article, FAQPage e Organization presentes
- Arquivo llms.txt publicado na raiz do domínio
- Processo de checagem recorrente, não apenas uma verificação isolada
Se depois de rodar esse checklist a resposta ainda for "não tenho certeza" para algum item, vale medir o quanto sua marca já é citada (ou não) nas principais IAs hoje, para entender o tamanho real da oportunidade perdida e decidir com dados o que priorizar primeiro.
Perguntas frequentes
GPTBot bloqueado significa que meu site nunca vai aparecer no ChatGPT?
Não necessariamente na busca em tempo real do ChatGPT, mas afeta o treinamento futuro de modelos e pode impactar diretamente ferramentas como Perplexity, que dependem de crawling ativo para citar fontes.
Bloquear bots de IA no robots.txt impede a indexação no Google?
Não. Google usa o Googlebot para busca tradicional, separado dos crawlers de IA como Google-Extended (usado para treinar modelos). É possível bloquear um sem afetar o outro.
Cloudflare bloqueia bots de IA por padrão?
Depende do plano e das configurações de segurança ativadas. Muitos recursos de "bot fight mode" tratam crawlers de IA como tráfego suspeito, mesmo sendo bots legítimos e identificados.
Com que frequência devo checar se meu site está acessível para IA?
O ideal é uma checagem semanal, já que mudanças de segurança, hospedagem ou plugins podem reintroduzir bloqueios sem aviso prévio.
Desbloquear o site garante que a IA vai citar minha marca?
Não garante, mas é pré-requisito. Sem acesso técnico ao conteúdo, a citação é impossível; com acesso liberado, o conteúdo ainda precisa ser relevante e bem estruturado para ser escolhido pela IA.



