smart_toy SEO técnico

Comprobador de robots.txt

Valida robots.txt para problemas de rastreo y acceso de bots.

Analiza robots.txt en busca de errores de sintaxis, disallow accidentales y reglas para bots de IA que pueden bloquear visibilidad.

build_circle Prueba la herramienta gratuita
star

Puntos clave

  • check_circle robots.txt es la primera puerta que leen los rastreadores; un error tipográfico en Disallow puede bloquear árboles de caminos enteros.
  • check_circle Comprobador de robots.txt analiza la precedencia, los comodines y los grupos de agentes de usuario según las especificaciones de Google.
  • check_circle Bloquear las rutas CSS o JS puede impedir la renderización y perjudicar indirectamente la indexación y los resultados enriquecidos.
  • check_circle Los rastreadores de IA como GPTBot y ClaudeBot leen el mismo archivo; documentar políticas de permiso o rechazo intencionales.
  • check_circle Robots.txt no es seguridad: las URL confidenciales aún necesitan autenticación, no solo rechazar líneas.
  • check_circle Siempre empareje los cambios de robots con pruebas de recuperación en rutas de dinero y directorios de activos después de la implementación.
  • check_circle Valide las directivas del mapa del sitio en robots.txt resuelva a través de HTTPS en su host canónico.
smart_toy

¿Qué es el comprobador de robots.txt?

robots.txt es un archivo de texto sin formato en la raíz de su dominio que indica a los rastreadores compatibles qué rutas URL pueden solicitar. Sigue el Protocolo de exclusión de robots: las líneas de agente de usuario nombran a los bots, las líneas Permitir y No permitir definen patrones de ruta y las directivas opcionales de mapas del sitio apuntan a fuentes de descubrimiento XML. Los motores de búsqueda, incluido Googlebot, consultan robots.txt antes de buscar. Muchos rastreadores de IA, incluidos OpenAI GPTBot y Anthropic ClaudeBot, también respetan el archivo cuando están configurados para hacerlo.

HeyLead Comprobador de robots.txt recupera su robots.txt en vivo, analiza la precedencia de las reglas y resalta errores de sintaxis, comodines demasiado amplios y bloqueos accidentales en rutas de marketing, activos estáticos o puntos finales AJAX necesarios para la renderización. La auditoría mapea cómo los principales robots de búsqueda y los rastreadores LLM comunes interpretarían cada grupo de reglas, de modo que marketing, asuntos legales y de ingeniería compartan una visión objetiva de la política de rastreo. Esto es importante porque los errores de los robots son silenciosos: las clasificaciones pueden colapsar antes de que los análisis expliquen por qué desaparecieron las impresiones.

El verificador va más allá de la validación de sí o no. Explica cuándo no permitir impide que Google vea etiquetas noindex en esas URL, cuándo entran en conflicto grupos duplicados de agentes de usuario y cuándo las plantillas copiadas bloquean las rutas /wp-content/ o /api/ que necesita su pila. Para el SEO de la era de la IA, robots.txt es parte de su contrato de rastreo público. Permitir bots de IA de buena reputación en las páginas de documentación y servicios puede aumentar la precisión de las citas; El bloqueo de los raspadores reduce el ruido. La denegación general accidental de despliegues de preparación sigue siendo uno de los errores de lanzamiento catastróficos más comunes.

Utilice la herramienta antes de eliminar bloques provisionales en todo el sitio, después de migraciones de CDN o perimetrales, al incorporar dominios adquiridos y siempre que DevOps edite reglas perimetrales. Combine los resultados con metarobots en URL individuales, higiene de mapas de sitio XML y llms.txt para obtener orientación específica del modelo que robots.txt no puede expresar. Trate cada cambio de robots.txt como una versión de producción: control de versiones, revisión por pares, validación inmediata y un archivo de reversión guardado.

Los sitios empresariales a menudo sirven robots.txt desde CDN, balanceadores de carga y origen de forma independiente. El verificador ayuda a detectar desviaciones cuando las reglas marginales anulan las expectativas de marketing. Los comodines merecen un análisis especial: un solo Disallow: /*? El patrón puede bloquear la navegación por facetas que aún canonicalizas en otros lugares. Documente cada grupo de agentes de usuario con propietarios en su wiki interno para que los departamentos legal, SEO y DevOps no se enfrenten a tickets conflictivos. Cuando bloquee intencionalmente los rastreadores de capacitación, indique el motivo comercial en los comentarios y refleje los datos públicos en llms.txt para los modelos que sí permite.

insights

Por qué es importante la validación de robots.txt para el acceso de rastreo y la visibilidad de la IA

Una sola línea incorrecta de No permitir puede eliminar su blog, catálogo de productos o sitio completo de los rastreadores educados mientras el sitio aún se ve bien para los visitantes humanos. Debido a que robots.txt se almacena en caché y se revisa según una programación, los errores persisten el tiempo suficiente como para dañar los objetivos de canalización trimestrales. Los equipos de marketing pueden culpar a la calidad del contenido cuando el problema real es un comodín demasiado amplio agregado durante un susto de seguridad. La política de rastreadores de IA también vive aquí. Las marcas que debaten si ChatGPT o Perplexity pueden entrenar o recuperar contenido de páginas públicas necesitan reglas explícitas y revisadas en lugar de valores predeterminados heredados de WordPress. Bloquear todo puede proteger la propiedad intelectual en caminos seleccionados, pero también renuncia al control narrativo en las respuestas generativas. La validación crea documentación para las partes interesadas legales y una línea de base para la estrategia GEO intencional. La política de rastreo es una política de marca en la era de la IA. Los clientes potenciales preguntan a los asistentes qué hace usted antes de visitar su sitio; Si los robots de buena reputación no pueden obtener documentos y precios, las respuestas se sintetizan a partir de la cobertura de prensa y los foros. La validación de robots también protege la representación: las capturas de pantalla de Google Search Console aparecen en blanco cuando las rutas CSS y JS no están permitidas. Trate las revisiones de robots.txt como obligatorias en la gestión de cambios estilo SOC2 cada vez que los equipos de infraestructura toquen WAF, CDN o tablas de enrutamiento de origen. Las auditorías trimestrales de robots detectan actualizaciones de complementos que agregan silenciosamente reglas de no permitir para árboles /uploads/ completos que aún necesita indexar para la búsqueda de imágenes.

arrow_forward Evita bloqueos accidentales en todo el sitio que anulan las impresiones orgánicas.
arrow_forward Mantiene abiertas CSS, JS y rutas de imágenes para que Google pueda representar las páginas correctamente.
arrow_forward El robot de IA de documentos permite y no permite decisiones para la alineación entre equipos.
arrow_forward Valida las referencias de mapas del sitio que aceleran el descubrimiento después del lanzamiento.
arrow_forward Muestra errores de sintaxis que hacen que los analizadores ignoren las reglas previstas.
arrow_forward Reduce el tiempo de depuración cuando la velocidad de rastreo cae después de cambios en la infraestructura.
play_circle

Cómo usar esta herramienta

  1. 1

    Ingrese la raíz del sitio

    Recuperamos /robots.txt de su dominio automáticamente.

  2. 2

    Reglas de escaneo

    Consulte permitir y no permitir patrones por usuario-agente.

  3. 3

    Ajustar con cuidado

    Desbloquee las rutas del dinero antes de abrir carpetas de bajo valor.

fact_check

Qué comprueba esta herramienta

verified

Informe de errores del analizador

Enumera números de línea y tokens que infringen los analizadores estándar.

verified

La ruta crítica permite pruebas

Investiga si los principales robots pueden acceder a rutas de dinero.

verified

Reglas de ruta de activos

Comprueba JS, CSS y los directorios de imágenes necesarios para la renderización.

verified

Marca de directivas no admitidas

Notas sobre retrasos en el rastreo y líneas no estándar que los principales robots pueden ignorar.

verified

Resumen de la política del bot de IA

Muestra la autorización o no autorización explícita para rastreadores LLM comunes.

verified

Presencia de referencia en el mapa del sitio

Verifica que las URL del mapa del sitio declaradas respondan correctamente.

engineering

Guía técnica

Señales, estándares y qué corregir cuando una comprobación falla.

code

Reglas de sintaxis y precedencia

El analizador informa números de línea, directivas no válidas y resultados de coincidencia más larga para rutas de dinero y directorios de activos representativos.
code

Matriz de IA y robots de búsqueda

Asigna Googlebot, Bingbot, GPTBot, ClaudeBot y PerplexityBot a sus grupos declarados.
code

Validación de la directiva del mapa del sitio

Confirma que las URL del mapa del sitio devuelven 200 XML a través de HTTPS en el host preferido.
code

Detección de deriva ambiental

Compara robots.txt en vivo con patrones conocidos de no permitir etapas que nunca deberían ejecutarse en producción.
school

En profundidad

rule

Prioridad de reglas y comportamiento de comodines

Google evalúa Permitir y No permitir según la regla de coincidencia más larga dentro de un grupo de agente de usuario. Los comodines * y los anclajes finales $ permiten un control preciso de la ruta, pero también permiten una amplitud catastrófica cuando se copian incorrectamente. El verificador simula solicitudes contra rutas de muestra que le interesan: /blog/, /wp-admin/admin-ajax.php, /api/search y carpetas de activos CDN.

Orden dentro de grupos

Se acumulan varias líneas no permitidas; no asuma que las líneas posteriores anulan las anteriores sin la lógica de coincidencia más larga.

Separar grupos de usuarios-agentes

Las reglas de GPTBot no se aplican al robot de Google a menos que duplique la política intencionalmente.

code

Representación de dependencias y rutas de activos

Google necesita JavaScript y CSS para representar muchas pilas modernas. Bloquear /wp-includes/, /assets/ o la salida del paquete puede producir capturas de pantalla vacías en Search Console y una indexación débil en plantillas con mucho JavaScript. Valide las rutas de los activos siempre que los equipos de seguridad propongan prohibiciones amplias.

Valores predeterminados de WordPress

Bloquee /wp-admin/ pero permita admin-ajax.php y los recursos del tema en /wp-content/uploads/ cuando sean públicos.

Interfaces sin cabeza

Confirme que las rutas de API necesarias para la hidratación no estén prohibidas mientras el HTML de marketing permanezca abierto.

psychology

Matriz de políticas de rastreadores de IA

Los robots de IA de buena reputación se identifican mediante tokens de agente de usuario. Las marcas estratégicas permiten la recuperación de documentos, precios y soporte mientras bloquean áreas de la cuenta. Documentar decisiones para revisión legal. Bloquear a todos los agentes desconocidos es tentador, pero puede incluir a futuros socios que quieras que te citen.

Emparejar con llms.txt

Las puertas de los robots van a buscar; llms.txt selecciona qué páginas son más importantes para obtener respuestas.

Monitorear citaciones

Después de los cambios de política, muestre indicaciones de marca en las principales interfaces de IA para comprobar los cambios de precisión.

compare

robots.txt versus metarobots

No permitir impide la recuperación, por lo que Google no puede ver etiquetas noindex en la página en URL no permitidas. A veces, los equipos no permiten las URL que pretendían noindex, creando URL huérfanas que permanecen extrañamente en los informes. Utilice robots para el control del presupuesto a nivel de ruta y meta para la intención de índice a nivel de página cuando se permita la recuperación.

Páginas críticas sin índice

Permitir buscar, aplicar noindex y eliminar de los mapas del sitio para una exclusión duradera.

Patrones de puesta en escena

No permitir por completo la puesta en escena está bien; intercambie el archivo antes de la transición de DNS, no horas después.

compare

Ejemplos

thumb_up Ejemplos recomendados

Bloque de administración de WordPress con permiso AJAX

User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php

Bloquea el panel de control y al mismo tiempo permite la interfaz AJAX requerida para temas y complementos.

Declaración del mapa del sitio

User-agent: * Disallow: /cart/ Disallow: /checkout/ Sitemap: https://example.com/sitemap_index.xml

Separa las rutas que no son de SEO del feed de descubrimiento en un host HTTPS canónico.

El bot de IA dirigido permite

User-agent: GPTBot Allow: /docs/ Allow: /blog/ User-agent: GPTBot Disallow: /account/

Política explícita para el contenido de conocimiento público al tiempo que se protegen las áreas registradas.

Bloque de búsqueda facetado

User-agent: * Disallow: /*?filter= Disallow: /*?sort=

Reduce el ruido de rastreo de duplicados parametrizados cuando se combina con una estrategia canónica.

thumb_down Ejemplos que conviene evitar

Error tipográfico en todo el sitio

User-agent: * Disallow: /

Bloquea todas las rutas en el dominio para ese grupo de agente de usuario.

Bloqueando todos los activos

User-agent: * Disallow: /wp-content/

Evita que Googlebot obtenga CSS y JS necesarios para representar páginas de WordPress.

Línea de sintaxis no válida

Agente de usuario * No permitir /blog/

Los dos puntos faltantes interrumpen los analizadores; las reglas pueden ser ignoradas de manera impredecible.

Referencia del mapa del sitio HTTP

Mapa del sitio: http://example.com/sitemap.xml sobre la producción HTTPS

Señales mixtas y redireccionamientos desperdician el presupuesto de rastreo en variantes de host heredadas.

rule

Buenas prácticas y errores comunes

check_circle Buenas prácticas

  • done Control de versiones robots.txt junto con los principales lanzamientos con comentarios de cambios.
  • done Pruebe las rutas permitidas con herramientas de búsqueda inmediatamente después de cada edición.
  • done Incluya todos los índices de mapas de sitio HTTPS XML que genera su complemento SEO.
  • done Documente las decisiones de los bots de IA en la wiki interna vinculada desde los tickets de cambio.
  • done Mantenga una copia de seguridad fechada antes de realizar reemplazos de plantillas al por mayor.
  • done ¿Reglas comodín de revisión por pares que tocan / o ? personajes.

cancel Errores comunes

  • close No permitir/debido a un error tipográfico o una plantilla de preparación no comentada.
  • close Copiar archivos de robots de la competencia sin mapear su estructura de URL.
  • close Bloquear /wp-content/ en WordPress sin comprender el impacto del renderizado.
  • close Suponiendo que no permitir se eliminan las URL del índice de Google al instante.
lightbulb

Casos de uso habituales

task_alt

Control de calidad previo al lanzamiento antes de eliminar los bloqueos de prohibición de preparación en todo el sitio.

task_alt

Documente la política intencional de rastreadores de IA para la alineación legal y de marketing.

task_alt

Audite configuraciones de múltiples dominios en las que CDN proporcione un archivo de robots diferente al de origen.

task_alt

Solucionar problemas de caídas repentinas de rastreo después de que DevOps edita las reglas perimetrales.

task_alt

Validar que los entregables de la transferencia de la agencia incluyan la producción correcta robots.txt.

groups

Para quién es esta herramienta

person Los equipos de DevOps y SEO comparten la propiedad de la configuración de origen y borde. person Propietarios de WordPress y Shopify verificando las reglas de robots generados por complementos. person Empresas que equilibran la visibilidad de la IA con la protección de la propiedad intelectual en rutas seleccionadas. person Agencias que realizan revisiones de acceso de rastreo durante la incorporación técnica.
dictionary

Glosario

Agente de usuario
Línea que nombra a qué rastreador se aplica un grupo de reglas, o * para todos.
No permitir
Los rastreadores de prefijos de ruta no deben realizar solicitudes según las normas de rastreo educado.
Permitir
Excepción dentro de un árbol no permitido, evaluada según la prioridad de coincidencia más larga.
Directiva de mapa del sitio
robots.txt línea que dirige a los rastreadores a las URL del mapa del sitio XML.
GPTBot
Agente de usuario del rastreador OpenAI para productos de capacitación y recuperación.
retraso de rastreo
Directiva no estándar que algunos bots ignoran; Prefiera los límites de tasas de CDN.
Protocolo de exclusión de robots
Estándar de facto que rige la sintaxis y el comportamiento de robots.txt.
buscar
Solicitud HTTP emitida por un rastreador para recuperar un recurso URL.
quiz

Preguntas frecuentes

¿Quieres una auditoría más completa?

HeyLead revisa tu sitio, tus competidores y tus oportunidades de crecimiento, sin presión comercial.

Solicitar auditoría gratuita arrow_forward