Comprobador de robots.txt
Valida robots.txt para problemas de rastreo y acceso de bots.
Analiza robots.txt en busca de errores de sintaxis, disallow accidentales y reglas para bots de IA que pueden bloquear visibilidad.
list En esta página expand_more
- Puntos clave
- ¿Qué es el comprobador de robots.txt?
- Por qué es importante la validación de robots.txt para el acceso de rastreo y la visibilidad de la IA
- Cómo usar esta herramienta
- Qué comprueba esta herramienta
- Guía técnica
- En profundidad
- Ejemplos
- Buenas prácticas y errores
- Casos de uso
- Para quién es esta herramienta
- Glosario
- Preguntas frecuentes
- Herramientas relacionadas
Puntos clave
- check_circle robots.txt es la primera puerta que leen los rastreadores; un error tipográfico en Disallow puede bloquear árboles de caminos enteros.
- check_circle Comprobador de robots.txt analiza la precedencia, los comodines y los grupos de agentes de usuario según las especificaciones de Google.
- check_circle Bloquear las rutas CSS o JS puede impedir la renderización y perjudicar indirectamente la indexación y los resultados enriquecidos.
- check_circle Los rastreadores de IA como GPTBot y ClaudeBot leen el mismo archivo; documentar políticas de permiso o rechazo intencionales.
- check_circle Robots.txt no es seguridad: las URL confidenciales aún necesitan autenticación, no solo rechazar líneas.
- check_circle Siempre empareje los cambios de robots con pruebas de recuperación en rutas de dinero y directorios de activos después de la implementación.
- check_circle Valide las directivas del mapa del sitio en robots.txt resuelva a través de HTTPS en su host canónico.
¿Qué es el comprobador de robots.txt?
robots.txt es un archivo de texto sin formato en la raíz de su dominio que indica a los rastreadores compatibles qué rutas URL pueden solicitar. Sigue el Protocolo de exclusión de robots: las líneas de agente de usuario nombran a los bots, las líneas Permitir y No permitir definen patrones de ruta y las directivas opcionales de mapas del sitio apuntan a fuentes de descubrimiento XML. Los motores de búsqueda, incluido Googlebot, consultan robots.txt antes de buscar. Muchos rastreadores de IA, incluidos OpenAI GPTBot y Anthropic ClaudeBot, también respetan el archivo cuando están configurados para hacerlo.
HeyLead Comprobador de robots.txt recupera su robots.txt en vivo, analiza la precedencia de las reglas y resalta errores de sintaxis, comodines demasiado amplios y bloqueos accidentales en rutas de marketing, activos estáticos o puntos finales AJAX necesarios para la renderización. La auditoría mapea cómo los principales robots de búsqueda y los rastreadores LLM comunes interpretarían cada grupo de reglas, de modo que marketing, asuntos legales y de ingeniería compartan una visión objetiva de la política de rastreo. Esto es importante porque los errores de los robots son silenciosos: las clasificaciones pueden colapsar antes de que los análisis expliquen por qué desaparecieron las impresiones.
El verificador va más allá de la validación de sí o no. Explica cuándo no permitir impide que Google vea etiquetas noindex en esas URL, cuándo entran en conflicto grupos duplicados de agentes de usuario y cuándo las plantillas copiadas bloquean las rutas /wp-content/ o /api/ que necesita su pila. Para el SEO de la era de la IA, robots.txt es parte de su contrato de rastreo público. Permitir bots de IA de buena reputación en las páginas de documentación y servicios puede aumentar la precisión de las citas; El bloqueo de los raspadores reduce el ruido. La denegación general accidental de despliegues de preparación sigue siendo uno de los errores de lanzamiento catastróficos más comunes.
Utilice la herramienta antes de eliminar bloques provisionales en todo el sitio, después de migraciones de CDN o perimetrales, al incorporar dominios adquiridos y siempre que DevOps edite reglas perimetrales. Combine los resultados con metarobots en URL individuales, higiene de mapas de sitio XML y llms.txt para obtener orientación específica del modelo que robots.txt no puede expresar. Trate cada cambio de robots.txt como una versión de producción: control de versiones, revisión por pares, validación inmediata y un archivo de reversión guardado.
Los sitios empresariales a menudo sirven robots.txt desde CDN, balanceadores de carga y origen de forma independiente. El verificador ayuda a detectar desviaciones cuando las reglas marginales anulan las expectativas de marketing. Los comodines merecen un análisis especial: un solo Disallow: /*? El patrón puede bloquear la navegación por facetas que aún canonicalizas en otros lugares. Documente cada grupo de agentes de usuario con propietarios en su wiki interno para que los departamentos legal, SEO y DevOps no se enfrenten a tickets conflictivos. Cuando bloquee intencionalmente los rastreadores de capacitación, indique el motivo comercial en los comentarios y refleje los datos públicos en llms.txt para los modelos que sí permite.
Por qué es importante la validación de robots.txt para el acceso de rastreo y la visibilidad de la IA
Una sola línea incorrecta de No permitir puede eliminar su blog, catálogo de productos o sitio completo de los rastreadores educados mientras el sitio aún se ve bien para los visitantes humanos. Debido a que robots.txt se almacena en caché y se revisa según una programación, los errores persisten el tiempo suficiente como para dañar los objetivos de canalización trimestrales. Los equipos de marketing pueden culpar a la calidad del contenido cuando el problema real es un comodín demasiado amplio agregado durante un susto de seguridad. La política de rastreadores de IA también vive aquí. Las marcas que debaten si ChatGPT o Perplexity pueden entrenar o recuperar contenido de páginas públicas necesitan reglas explícitas y revisadas en lugar de valores predeterminados heredados de WordPress. Bloquear todo puede proteger la propiedad intelectual en caminos seleccionados, pero también renuncia al control narrativo en las respuestas generativas. La validación crea documentación para las partes interesadas legales y una línea de base para la estrategia GEO intencional. La política de rastreo es una política de marca en la era de la IA. Los clientes potenciales preguntan a los asistentes qué hace usted antes de visitar su sitio; Si los robots de buena reputación no pueden obtener documentos y precios, las respuestas se sintetizan a partir de la cobertura de prensa y los foros. La validación de robots también protege la representación: las capturas de pantalla de Google Search Console aparecen en blanco cuando las rutas CSS y JS no están permitidas. Trate las revisiones de robots.txt como obligatorias en la gestión de cambios estilo SOC2 cada vez que los equipos de infraestructura toquen WAF, CDN o tablas de enrutamiento de origen. Las auditorías trimestrales de robots detectan actualizaciones de complementos que agregan silenciosamente reglas de no permitir para árboles /uploads/ completos que aún necesita indexar para la búsqueda de imágenes.
Cómo usar esta herramienta
- 1
Ingrese la raíz del sitio
Recuperamos /robots.txt de su dominio automáticamente.
- 2
Reglas de escaneo
Consulte permitir y no permitir patrones por usuario-agente.
- 3
Ajustar con cuidado
Desbloquee las rutas del dinero antes de abrir carpetas de bajo valor.
Qué comprueba esta herramienta
Informe de errores del analizador
Enumera números de línea y tokens que infringen los analizadores estándar.
La ruta crítica permite pruebas
Investiga si los principales robots pueden acceder a rutas de dinero.
Reglas de ruta de activos
Comprueba JS, CSS y los directorios de imágenes necesarios para la renderización.
Marca de directivas no admitidas
Notas sobre retrasos en el rastreo y líneas no estándar que los principales robots pueden ignorar.
Resumen de la política del bot de IA
Muestra la autorización o no autorización explícita para rastreadores LLM comunes.
Presencia de referencia en el mapa del sitio
Verifica que las URL del mapa del sitio declaradas respondan correctamente.
Guía técnica
Señales, estándares y qué corregir cuando una comprobación falla.
Matriz de IA y robots de búsqueda
Validación de la directiva del mapa del sitio
Detección de deriva ambiental
En profundidad
Prioridad de reglas y comportamiento de comodines
Google evalúa Permitir y No permitir según la regla de coincidencia más larga dentro de un grupo de agente de usuario. Los comodines * y los anclajes finales $ permiten un control preciso de la ruta, pero también permiten una amplitud catastrófica cuando se copian incorrectamente. El verificador simula solicitudes contra rutas de muestra que le interesan: /blog/, /wp-admin/admin-ajax.php, /api/search y carpetas de activos CDN.
Orden dentro de grupos
Se acumulan varias líneas no permitidas; no asuma que las líneas posteriores anulan las anteriores sin la lógica de coincidencia más larga.
Separar grupos de usuarios-agentes
Las reglas de GPTBot no se aplican al robot de Google a menos que duplique la política intencionalmente.
Representación de dependencias y rutas de activos
Google necesita JavaScript y CSS para representar muchas pilas modernas. Bloquear /wp-includes/, /assets/ o la salida del paquete puede producir capturas de pantalla vacías en Search Console y una indexación débil en plantillas con mucho JavaScript. Valide las rutas de los activos siempre que los equipos de seguridad propongan prohibiciones amplias.
Valores predeterminados de WordPress
Bloquee /wp-admin/ pero permita admin-ajax.php y los recursos del tema en /wp-content/uploads/ cuando sean públicos.
Interfaces sin cabeza
Confirme que las rutas de API necesarias para la hidratación no estén prohibidas mientras el HTML de marketing permanezca abierto.
Matriz de políticas de rastreadores de IA
Los robots de IA de buena reputación se identifican mediante tokens de agente de usuario. Las marcas estratégicas permiten la recuperación de documentos, precios y soporte mientras bloquean áreas de la cuenta. Documentar decisiones para revisión legal. Bloquear a todos los agentes desconocidos es tentador, pero puede incluir a futuros socios que quieras que te citen.
Emparejar con llms.txt
Las puertas de los robots van a buscar; llms.txt selecciona qué páginas son más importantes para obtener respuestas.
Monitorear citaciones
Después de los cambios de política, muestre indicaciones de marca en las principales interfaces de IA para comprobar los cambios de precisión.
robots.txt versus metarobots
No permitir impide la recuperación, por lo que Google no puede ver etiquetas noindex en la página en URL no permitidas. A veces, los equipos no permiten las URL que pretendían noindex, creando URL huérfanas que permanecen extrañamente en los informes. Utilice robots para el control del presupuesto a nivel de ruta y meta para la intención de índice a nivel de página cuando se permita la recuperación.
Páginas críticas sin índice
Permitir buscar, aplicar noindex y eliminar de los mapas del sitio para una exclusión duradera.
Patrones de puesta en escena
No permitir por completo la puesta en escena está bien; intercambie el archivo antes de la transición de DNS, no horas después.
Ejemplos
thumb_up Ejemplos recomendados
Bloque de administración de WordPress con permiso AJAX
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php Bloquea el panel de control y al mismo tiempo permite la interfaz AJAX requerida para temas y complementos.
Declaración del mapa del sitio
User-agent: *
Disallow: /cart/
Disallow: /checkout/
Sitemap: https://example.com/sitemap_index.xml Separa las rutas que no son de SEO del feed de descubrimiento en un host HTTPS canónico.
El bot de IA dirigido permite
User-agent: GPTBot
Allow: /docs/
Allow: /blog/
User-agent: GPTBot
Disallow: /account/ Política explícita para el contenido de conocimiento público al tiempo que se protegen las áreas registradas.
Bloque de búsqueda facetado
User-agent: *
Disallow: /*?filter=
Disallow: /*?sort= Reduce el ruido de rastreo de duplicados parametrizados cuando se combina con una estrategia canónica.
thumb_down Ejemplos que conviene evitar
Error tipográfico en todo el sitio
User-agent: *
Disallow: / Bloquea todas las rutas en el dominio para ese grupo de agente de usuario.
Bloqueando todos los activos
User-agent: *
Disallow: /wp-content/ Evita que Googlebot obtenga CSS y JS necesarios para representar páginas de WordPress.
Línea de sintaxis no válida
Agente de usuario *
No permitir /blog/ Los dos puntos faltantes interrumpen los analizadores; las reglas pueden ser ignoradas de manera impredecible.
Referencia del mapa del sitio HTTP
Mapa del sitio: http://example.com/sitemap.xml sobre la producción HTTPS Señales mixtas y redireccionamientos desperdician el presupuesto de rastreo en variantes de host heredadas.
Buenas prácticas y errores comunes
check_circle Buenas prácticas
- done Control de versiones robots.txt junto con los principales lanzamientos con comentarios de cambios.
- done Pruebe las rutas permitidas con herramientas de búsqueda inmediatamente después de cada edición.
- done Incluya todos los índices de mapas de sitio HTTPS XML que genera su complemento SEO.
- done Documente las decisiones de los bots de IA en la wiki interna vinculada desde los tickets de cambio.
- done Mantenga una copia de seguridad fechada antes de realizar reemplazos de plantillas al por mayor.
- done ¿Reglas comodín de revisión por pares que tocan / o ? personajes.
cancel Errores comunes
- close No permitir/debido a un error tipográfico o una plantilla de preparación no comentada.
- close Copiar archivos de robots de la competencia sin mapear su estructura de URL.
- close Bloquear /wp-content/ en WordPress sin comprender el impacto del renderizado.
- close Suponiendo que no permitir se eliminan las URL del índice de Google al instante.
Casos de uso habituales
Control de calidad previo al lanzamiento antes de eliminar los bloqueos de prohibición de preparación en todo el sitio.
Documente la política intencional de rastreadores de IA para la alineación legal y de marketing.
Audite configuraciones de múltiples dominios en las que CDN proporcione un archivo de robots diferente al de origen.
Solucionar problemas de caídas repentinas de rastreo después de que DevOps edita las reglas perimetrales.
Validar que los entregables de la transferencia de la agencia incluyan la producción correcta robots.txt.
Para quién es esta herramienta
Glosario
- Agente de usuario
- Línea que nombra a qué rastreador se aplica un grupo de reglas, o * para todos.
- No permitir
- Los rastreadores de prefijos de ruta no deben realizar solicitudes según las normas de rastreo educado.
- Permitir
- Excepción dentro de un árbol no permitido, evaluada según la prioridad de coincidencia más larga.
- Directiva de mapa del sitio
- robots.txt línea que dirige a los rastreadores a las URL del mapa del sitio XML.
- GPTBot
- Agente de usuario del rastreador OpenAI para productos de capacitación y recuperación.
- retraso de rastreo
- Directiva no estándar que algunos bots ignoran; Prefiera los límites de tasas de CDN.
- Protocolo de exclusión de robots
- Estándar de facto que rige la sintaxis y el comportamiento de robots.txt.
- buscar
- Solicitud HTTP emitida por un rastreador para recuperar un recurso URL.
Preguntas frecuentes
¿Quieres una auditoría más completa?
HeyLead revisa tu sitio, tus competidores y tus oportunidades de crecimiento, sin presión comercial.
Solicitar auditoría gratuita arrow_forward