Saltar al contenido

SEO y posicionamiento

Bloqueada por robots.txt: qué significa y cómo se arregla de verdad

Diagrama: bloquear el rastreo no es sacar del indice

Si abriste Search Console y te encontraste con «Bloqueada por robots.txt» o con «Indexada aunque bloqueada por robots.txt», lo primero es entender que no son el mismo problema, y que uno de los dos casi nunca se arregla como la gente cree.

La confusión de fondo es siempre la misma: se piensa que robots.txt sirve para que una página no salga en Google. No sirve para eso. Sirve para otra cosa, y esa diferencia es la que explica los dos avisos.

Rastrear e indexar son cosas distintas

Un buscador hace dos trabajos separados sobre tu sitio:

  • Rastrear es entrar a leer la página. Es lo que controla el archivo robots.txt.
  • Indexar es guardarla en el catálogo del que salen los resultados de búsqueda. Eso lo controla la etiqueta noindex.

La propia documentación de Google es tajante en este punto: el robots.txt se usa «principalmente para gestionar el tráfico de rastreadores» y no es un mecanismo para mantener una página fuera de Google. Si otro sitio enlaza una dirección tuya bloqueada, Google puede indexar esa dirección sin haberla leído jamás. Por eso aparece en los resultados sin descripción: literalmente no sabe qué hay dentro.

Diagrama que compara Disallow en robots.txt, que impide al rastreador entrar, con la etiqueta noindex, que le deja entrar y le indica no indexar. Abajo se advierte que combinarlas no funciona.
La diferencia entre bloquear el rastreo y sacar del índice, y por qué combinarlos no funciona.

«Bloqueada por robots.txt»

Significa que Google quiso entrar y tu robots.txt se lo impidió. La página no aparece en los resultados.

Lo primero es decidir si eso es un problema. Muchas veces no lo es: el panel de administración, el carrito, las páginas de agradecimiento o los resultados internos de búsqueda están mejor fuera. El aviso solo importa si afecta a una página que sí querías posicionar.

Cómo se arregla

  1. En Search Console, entra en Páginas → Bloqueada por robots.txt y exporta la lista.
  2. Marca cuáles deberían aparecer en Google y cuáles no. Sé selectivo: más páginas indexadas no es lo mismo que más tráfico.
  3. Para las que sí, quita la línea Disallow que las está bloqueando.
  4. Pide a Google que vuelva a leer el archivo desde Configuración → robots.txt.
  5. Solicita la indexación de cada dirección con la herramienta de inspección de URL.

«Indexada aunque bloqueada por robots.txt»

Este es el que descoloca a todo el mundo. Significa que la dirección sí está en el índice a pesar del bloqueo, porque Google la descubrió por enlaces desde otros sitios. Suele mostrarse sin descripción, con un texto del tipo «no hay información disponible para esta página».

Aquí hay que decidir qué quieres:

Si quieres que aparezca bien

Quita el Disallow y solicita la indexación. Google entrará, leerá el contenido y sustituirá ese resultado vacío por uno normal.

Si quieres que desaparezca

Y aquí está la trampa que cuesta meses a mucha gente:

El orden correcto es:

  1. Quita la línea Disallow del robots.txt.
  2. Añade la etiqueta noindex en la página, o la cabecera X-Robots-Tag: noindex si es un archivo que no es HTML.
  3. Espera a que Google vuelva a rastrear. Puedes acelerarlo pidiendo la indexación de esa dirección: suena contradictorio, pero lo que consigues es que entre antes y lea el noindex.
  4. Si tienes prisa, usa además Eliminaciones en Search Console. Es una ocultación temporal de unos seis meses, suficiente para que el noindex haga su trabajo definitivo.

Las otras dos formas de desindexar

La etiqueta noindex no es la única vía. Google reconoce tres, y todas comparten un requisito: que el rastreador pueda llegar a la página.

  • Contraseña. Si el contenido está detrás de un acceso, no se indexa. Es lo indicado para áreas privadas de clientes.
  • Eliminarla. Devolver 404 o, mejor, 410 si la retirada es definitiva. El 410 le dice a Google que no vuelva a intentarlo.
  • noindex. Lo adecuado cuando la página debe seguir existiendo y siendo accesible para las personas, pero no salir en búsquedas.

Cómo evitar que vuelva a pasar

  • Decide antes de bloquear. Antes de escribir un Disallow, pregúntate si lo que quieres es ahorrar rastreo o evitar que aparezca. Son objetivos distintos con herramientas distintas.
  • Revisa Search Console una vez al mes. Los avisos aparecen semanas antes de que el tráfico se resienta.
  • Cuidado al pasar de un sitio en pruebas a producción. El Disallow: / que protegía el entorno de desarrollo es la causa número uno de sitios enteros invisibles tras un lanzamiento.
  • No bloquees CSS ni JavaScript. Google necesita cargarlos para ver la página como la ve una persona. Bloquearlos empeora la evaluación.

Qué se pierde si no lo arreglas

Una página importante fuera del índice no recibe ni una visita desde el buscador, y tu competencia ocupa ese espacio. Al revés, una página que no debería estar indexada —un panel interno, una versión duplicada, un documento privado— puede exponer información y diluir la autoridad del sitio entre direcciones que no aportan nada.

La regla es sencilla: que se indexe lo que aporta valor y quede fuera lo que no. Todo lo demás es ruido.

Preguntas frecuentes

¿Bloquear una página en robots.txt la saca de Google?

No. El archivo robots.txt controla el rastreo, no la indexación. Google lo dice de forma explícita en su documentación: no es un mecanismo para mantener una página fuera del buscador. Si otros sitios enlazan esa dirección, Google puede indexarla sin haberla visitado nunca, y aparecerá sin descripción.

¿Cuál es la forma correcta de sacar una página del índice?

Hay tres, y las tres funcionan porque permiten que Google llegue a la página y entienda qué hacer con ella: la etiqueta noindex, proteger la página con contraseña, o eliminarla y devolver 404 o 410.

¿Puedo usar Disallow y noindex a la vez?

No, y es el error más común. Si el Disallow impide el rastreo, Google nunca entra a la página y por tanto nunca ve la etiqueta noindex. La instrucción queda escrita pero no se lee. Para desindexar hay que quitar primero el Disallow.

¿Cuánto tarda en desaparecer una página del índice?

Depende de la frecuencia con la que Google rastree tu sitio: desde unos días hasta varias semanas. Puedes acelerarlo pidiendo la retirada temporal desde la herramienta de eliminaciones de Search Console, que la oculta unos seis meses mientras el noindex hace efecto de forma definitiva.

¿»Bloqueada por robots.txt» es siempre un problema?

No. En muchos casos es exactamente lo que quieres: el panel de administración, los resultados internos de búsqueda o las páginas de carrito no tienen por qué rastrearse. El aviso solo importa cuando afecta a una página que sí querías que apareciera.

Compartir

Cuéntanos qué quieres construir o automatizar

Media hora de conversación y te decimos qué se puede mejorar en tu operación, cuánto cuesta y en cuánto tiempo. Sin compromiso.

Solicitar diagnóstico