Procesamiento local

HERRAMIENTAS PARA DEVELOPERS

probar robots.txt online

Pega tu robots.txt, añade las URLs que quieras comprobar y elige un rastreador. Obtienes un veredicto por URL —bloqueada o permitida— con la regla y la línea exactas que lo decidieron. Un Disallow de más puede dejar una sección entera fuera del índice durante semanas sin que nadie se entere.

Usar herramienta

PROCESAMIENTO LOCAL

Todo ocurre en tu navegador

El archivo y el texto no salen de tu dispositivo.

Pega tu robots.txt arriba. Si no indicas URLs, solo se revisa la sintaxis.

Qué revisa el analizador

Agrupa las directivas por User-agent y lista las reglas Allow y Disallow que le corresponden a cada uno, además de los Sitemap declarados. Así ves de un vistazo si una regla pensada para un bot concreto está afectando a todos, que es el error más caro y más frecuente.

El error que más tráfico cuesta

Un Disallow: / bajo User-agent: * bloquea el rastreo completo del sitio. Suele colarse al pasar de un entorno de preproducción a producción, porque en preproducción esa regla es la correcta. El resultado es una caída de indexación que no dispara ninguna alerta hasta que las páginas empiezan a desaparecer.

Bloquear rastreo no es desindexar

Robots.txt controla si un rastreador puede leer una URL, no si puede mostrarla en resultados. Una página bloqueada con Disallow puede seguir apareciendo en Google si hay enlaces externos apuntando a ella, porque el buscador conoce la URL aunque no pueda leer su contenido. Para sacar una página del índice necesitas una etiqueta noindex, y para eso el rastreador tiene que poder leer la página.

PREGUNTAS FRECUENTES

¿Se sube mi archivo a algún servidor?

No. El texto que pegas se procesa con JavaScript en tu propio navegador y no viaja por la red en ningún momento.

¿Comprueba si una URL concreta está bloqueada?

Sí, es justo para lo que sirve. Añade una URL por línea, elige un user-agent y cada una vuelve como bloqueada o permitida, con la regla y la línea que lo decidieron. La coincidencia sigue el RFC 9309: gana la regla más larga, en empate gana Allow, y un bot con grupo propio ignora el grupo de * en vez de sumarlo.

¿Dónde debe estar el archivo robots.txt?

En la raíz del dominio, en /robots.txt. Un archivo colocado en un subdirectorio no se tiene en cuenta, y cada subdominio necesita el suyo propio.

¿Qué pasa si mi sitio no tiene robots.txt?

Se interpreta como permiso para rastrear todo el sitio. No tener el archivo no es un error en sí mismo, aunque pierdes el sitio donde declarar tu sitemap.