Com treballem amb IA

SEO tècnic

Una web pot carregar perfectament per a una persona i, alhora, estar parcialment tancada per a Google, ChatGPT, Perplexity, Claude o altres sistemes de descobriment. Aquest checklist explica què cal revisar abans de culpar el contingut.

Truca'nsEscriunos

SEO tècnic:

Checklist tècnic per no bloquejar cercadors ni rastrejadors d’IA

Com treballem amb IA / SEO tècnic

29 juliol 2026 · 12 min de lectura

Una web pot carregar perfectament per a una persona i, alhora, estar parcialment tancada per a Google, ChatGPT, Perplexity, Claude o altres sistemes de descobriment. Aquest checklist explica què cal revisar abans de culpar el contingut.

Punts clau

  • Robots.txt gestiona el rastreig; no és una capa de privacitat ni garanteix noindex.
  • Un navegador pot rebre 200 mentre un crawler rep 403, 429 o un challenge de WAF.
  • Cloudflare i els rate limits han de protegir endpoints sensibles sense amagar pàgines públiques importants.
  • Sitemap, canonical i hreflang ajuden cercadors i assistents a entendre l’estructura.

El problema real: una web oberta a persones pot estar tancada a màquines

Molts equips comproven una pàgina obrint-la al navegador. Si carrega, assumeixen que tot va bé. Per a SEO i visibilitat ia això no basta. Un rastrejador pot rebre una resposta diferent per user agent, ubicació, IP, freqüència o regla de seguretat.

El cas habitual és una pàgina de servei que torna 200 a un visitant normal però 403 o 429 a Google-Extended, gptbot, OAI-SearchBot, perplexitybot o claudebot. En aquest cas el primer problema no és el copy: és l’accés.

Robots.txt: controlar rastreig no és controlar indexació

Google descriu robots.txt com una manera d’indicar quines URLs poden rastrejar els crawlers i de gestionar càrrega de servidor. No s’ha d’utilitzar com a mecanisme de privacitat ni com a substitut de noindex.

Per a visibilitat ia, la decisió pràctica és separar cercadors generals, bots de cerca o resposta d’IA i bots d’entrenament. Alguns pot convenir permetre’ls i altres limitar-los, però la decisió ha de ser intencionada.

  • Comprovar que robots.txt torna 200 i no serveix una versió antiga en cache.
  • Incloure la línia sitemap amb la URL correcta del sitemap XML.
  • Evitar disallow amplis sobre carpetes amb serveis, articles, imatges clau o recursos CSS/JS.
  • Documentar qualsevol bloqueig explícit a bots IA.

Codis HTTP que canvien la lectura del lloc

Els codis HTTP són senyals bàsiques d’accessibilitat. Un 200 entrega contingut. Un 301 pot consolidar una migració. Un 404 o 410 comunica absència. Un 403 indica bloqueig. Un 429 indica massa peticions. Un 5xx indica fallada de servidor.

L’auditoria ha de provar aquests codis amb diversos user agents. Validar només amb navegador deixa fora molts problemes perquè la fallada sol aparèixer quan la petició sembla d’un crawler.

  • 200 per a pàgines públiques indexables.
  • 301 per a redireccions permanents.
  • 404 o 410 per a contingut eliminat de veritat.
  • 403 només quan hi ha una raó clara per bloquejar.
  • 429 amb cura: pot ser útil contra abús, però problemàtic per a crawlers legítims.

Cloudflare i WAF: protegir sense amagar la web

Cloudflare permet regles personalitzades, challenges, rate limiting i excepcions. Són eines útils, però una configuració agressiva pot fer que una web publicada sigui gairebé invisible per als rastrejadors.

La resposta correcta no sol ser permetre tots els bots a tot arreu. És millor protegir login, formularis, APIs internes i paràmetres abusables, mantenint accessibles les pàgines públiques importants.

  • Separar pàgines públiques, formularis, administració i endpoints dinàmics.
  • Identificar quina regla causa cada 403 o 429 abans de tocar el WAF.
  • Provar googlebot, OAI-SearchBot, gptbot, ChatGPT-User, claudebot, perplexitybot i Applebot.
  • Preferir excepcions precises abans que desactivar proteccions globals.

Sitemap, canonical i hreflang: senyals d’estructura

El sitemap no força la indexació, però ajuda al descobriment i comunica URLs modificades. És important quan el contingut és nou, multilingüe o encara no té molts enllaços interns.

Canonical i hreflang completen l’estructura. Canonical apunta a la versió preferida. Hreflang connecta versions equivalents en castellà, anglès i català perquè no competeixin sense context.

  • Cada URL indexable ha de tenir canonical absolut.
  • Cada grup multilingüe ha de connectar equivalents ES, EN i CA.
  • El sitemap ha d’actualitzar lastmod quan una pàgina es reescriu substancialment.
  • Les URLs del sitemap han de tornar 200, no cadenes llargues de redireccions.

Bots IA que convé revisar per separat

No tots els bots IA tenen el mateix objectiu. OpenAI separa crawlers per a cerca, entrenament i peticions iniciades per usuaris. Anthropic documenta agents diferents. Perplexity documenta el seu rastrejador per a resultats de cerca.

Si una empresa vol visibilitat en assistents, bloquejar tot el que tingui relació amb IA pot ser contraproduent. Si necessita limitar l’ús de contingut, permetre-ho tot sense política també pot ser mala decisió.

  • OAI-SearchBot i ChatGPT-User per a escenaris de cerca o petició d’usuari a OpenAI.
  • GPTBot quan la política de l’empresa permet o limita ús d’entrenament.
  • ClaudeBot i Claude-User segons la política d’accés desitjada.
  • PerplexityBot si l’empresa vol aparèixer com a font a Perplexity.
  • Googlebot per a Google Search i Google-Extended com a control separat vinculat a IA de Google.

Checklist operatiu abans de publicar una pàgina important

Abans de donar per acabada una landing, servei o article, cal passar un checklist tècnic mínim. Evita que el contingut existeixi només per a usuaris que ja coneixen la URL.

La revisió s’ha de fer a producció perquè els problemes reals solen venir de CDN, WAF, cache, redireccions, SSL o regles del hosting.

  • URL final amb 200 per a navegador i bots rellevants.
  • Sense bloqueig accidental a robots.txt.
  • Canonical cap a la URL final.
  • URL al sitemap i sitemap enllaçat des de robots.txt.
  • Si hi ha idiomes, hreflang creua totes les versions equivalents.
  • Contingut principal present en HTML.
  • Title, description, H1, dades estructurades i enllaços interns coherents.
  • Cloudflare sense challenge, 403 o 429 per als bots permesos.

Convertir l’auditoria en decisions

La sortida útil no és una llista enorme d’errors. És una decisió per URL: indexar, redirigir, eliminar amb 410, mantenir bloquejada o millorar.

Per a visibilitat ia, les pàgines prioritàries són les que expliquen què fa l’empresa, a qui serveix, on treballa i per què és fiable.

Fonts consultades

Whatsapp

Citas Online