¿Qué es Crawling?
El crawling o rastreo es el proceso mediante el cual los crawlers de los motores de búsqueda descubren URLs y solicitan sus recursos para conocer su contenido. En Google, Googlebot puede descubrir páginas mediante enlaces, sitemaps y otras fuentes, y después rastrearlas y renderizarlas. El rastreo habilita una posible indexación, pero no garantiza que una URL entre al índice ni que aparezca en resultados.
¿Qué es el crawling?
Los motores de búsqueda utilizan programas automatizados —crawlers, bots o spiders— para descubrir y recuperar recursos de la web. En Google, ese crawler se conoce como Googlebot. Google descubre nuevas URLs principalmente a partir de enlaces en páginas que ya conoce y de archivos sitemap; una vez descubierta una URL, puede decidir rastrearla para obtener su contenido.
Rastrear no consiste solo en descargar HTML. Durante el proceso Google puede recuperar recursos y renderizar JavaScript con una versión reciente de Chrome para interpretar contenido que se genera en el navegador. Aun así, descubrir una URL no obliga a Googlebot a rastrearla, y rastrearla tampoco obliga a Google a indexarla.
La frecuencia de rastreo tampoco es un atributo fijo de una página. Google determina algorítmicamente qué sitios y URLs rastrear, con qué frecuencia y cuántas solicitudes realizar. La disponibilidad del servidor, los cambios detectados, la demanda de rastreo y otras señales modifican ese comportamiento con el tiempo.
El crawling no es una garantía de visibilidad: es una condición técnica para que Google pueda procesar el contenido de una URL. Después todavía quedan la indexación y la publicación de resultados.
Lisandro IserteCrawling, indexación y publicación en resultados
Google describe la Búsqueda en tres grandes etapas: crawling, indexación y publicación de resultados. Separarlas evita diagnosticar como “problema de SEO” situaciones que tienen causas completamente distintas.
La cadena no debe interpretarse como una regla absoluta del tipo “si no fue rastreada, la URL jamás puede aparecer”. Google advierte que una URL bloqueada mediante robots.txt puede llegar a mostrarse en resultados si el buscador conoce su existencia por otras fuentes, aunque no haya rastreado su contenido. Por eso controlar crawling y controlar indexación son problemas diferentes.
Crawl budget: qué es y cuándo importa
El crawl budget no es una cuota diaria fija asignada a cada sitio. La documentación actual de Google lo define como el conjunto de URLs de un sitio que Google puede y quiere rastrear. Surge de dos componentes principales: crawl capacity limit y crawl demand.
Para la mayoría de los sitios no hace falta “optimizar crawl budget” como proyecto independiente. La guía avanzada de Google está orientada principalmente a sitios muy grandes o que cambian con mucha frecuencia: como referencia aproximada, menciona sitios de más de un millón de páginas con cambios semanales, sitios de más de diez mil páginas con cambios diarios, o propiedades con muchas URLs en estado Discovered – currently not indexed. Google aclara que esos números son orientativos, no umbrales exactos.
Cuando sí existe un problema de eficiencia de rastreo, las medidas útiles suelen ser gestionar el inventario de URLs, consolidar duplicados, devolver 404/410 para contenido eliminado, mantener sitemaps actualizados, evitar cadenas largas de redirecciones y mejorar la capacidad de respuesta del servidor. Si el objetivo es que Google no rastree determinadas URLs irrelevantes, robots.txt puede ser apropiado; usar noindex no ahorra la solicitud inicial porque Google necesita acceder a la página para leer esa regla.
Qué puede frenar el descubrimiento o el rastreo
No todo problema de crawling es un “bloqueo”. Algunas configuraciones impiden directamente el acceso y otras reducen la probabilidad o velocidad de descubrimiento. Conviene distinguirlas antes de intervenir.
Disallow puede impedir que Googlebot solicite determinadas URLs. Sirve para gestionar crawling, no para garantizar que una URL desaparezca de los resultados. rastreables desde otras páginas encontrables. Un sitemap ayuda al descubrimiento, pero no reemplaza una arquitectura de enlaces útil.noindex no pertenece a esta lista de bloqueos de crawling. Es una regla de indexación. Para que funcione, Google debe poder rastrear la página y leer la metaetiqueta o el encabezado HTTP correspondiente. Si robots.txt impide el acceso, Google puede no llegar a ver el noindex.
Errores comunes con el crawling
Usar robots.txt para sacar una página de Google
robots.txt controla solicitudes de crawling. Una URL bloqueada puede seguir siendo conocida y aparecer en resultados con información limitada si otras páginas enlazan a ella. Si el objetivo es impedir la indexación, hay que elegir un mecanismo de indexación o acceso apropiado.
Bloquear con robots.txt una página que depende de noindex
Google necesita rastrear la URL para leer la regla noindex. Si primero se impide el acceso mediante robots.txt, la directiva puede no ser vista. Las dos herramientas resuelven problemas diferentes y pueden entrar en conflicto cuando se combinan sin criterio.
Obsesionarse con crawl budget en un sitio que no lo necesita
El crawl budget es una preocupación avanzada para sitios muy grandes, muy cambiantes o con problemas claros de descubrimiento. En sitios normales suele ser más útil mantener sitemap, arquitectura, respuesta del servidor y estado de indexación en buen orden que intentar manipular una supuesta cuota diaria.
Creer que un sitemap garantiza crawling o indexación
El sitemap ayuda a Google a conocer URLs nuevas o actualizadas, pero no obliga al crawler a visitar cada URL ni garantiza que una página sea indexada. Es una señal de descubrimiento, no una orden.
Usar noindex como técnica de ahorro de crawl budget
Si Google debe solicitar la URL para leer noindex, el rastreo ya ocurrió. En sitios donde el objetivo real es evitar solicitudes sobre inventario irrelevante, Google recomienda gestionar ese inventario y usar las herramientas de crawling adecuadas.
Confundir “rastreada” con “indexada”
Una solicitud de Googlebot confirma actividad de crawling, no inclusión en el índice. Para diagnosticar una URL hay que separar evidencia de rastreo, estado de indexación y visibilidad ante consultas.
Preguntas frecuentes sobre crawling
¿Qué es el crawling en SEO?
El crawling o rastreo es el proceso mediante el cual los crawlers de los motores de búsqueda descubren URLs y solicitan sus recursos para conocer su contenido. En Google, Googlebot puede descubrir URLs mediante enlaces, sitemaps y otras fuentes, y después rastrearlas y renderizarlas. Que una URL sea rastreada no garantiza que se indexe ni que aparezca en los resultados de búsqueda.
¿Cuál es la diferencia entre crawling e indexación?
El crawling consiste en descubrir y recuperar una página o recurso. La indexación ocurre después: Google analiza el contenido rastreado, determina cuestiones como duplicación y canonicalización, y decide si la información puede incorporarse al índice. Una página rastreada puede no indexarse. Además, una URL bloqueada por robots.txt puede llegar a aparecer en resultados sin que Google haya rastreado su contenido, por ejemplo si otras páginas enlazan a ella.
¿Qué es el crawl budget?
El crawl budget es la cantidad y el conjunto de URLs de un sitio que Google puede y quiere rastrear. Google lo explica actualmente a partir de dos componentes principales: crawl capacity limit, que protege la capacidad del servidor, y crawl demand, que refleja cuánto interés tienen sus sistemas en volver a rastrear determinadas URLs. No es una cuota diaria fija y, para la mayoría de los sitios pequeños o medianos, no requiere una optimización específica.
¿Cómo saber si Google está rastreando mi sitio?
Google Search Console permite revisar el informe de estadísticas de rastreo a nivel de sitio y usar Inspección de URL para consultar el estado de una página y probar una URL publicada. Para saber con precisión cuándo Googlebot solicitó URLs concretas, los logs del servidor son la fuente más directa. Rastreo e indexación deben analizarse por separado: que Googlebot haya solicitado una URL no significa que esté indexada.
¿Cómo evitar que Google rastree ciertas páginas?
Si el objetivo es impedir que Googlebot solicite determinadas URLs, se usa robots.txt. Si el objetivo es evitar que una página aparezca en Google, robots.txt no es suficiente: la página debe permanecer accesible al crawler para que Google pueda leer una regla noindex, o debe protegerse mediante autenticación, eliminarse o utilizarse otro método adecuado. Bloquear con robots.txt una URL que también tiene noindex puede impedir que Google vea esa directiva.
Referencias clave
Google Search Central. In-depth guide to how Google Search works. Google for Developers.
Google Crawling Infrastructure. Optimize your crawl budget. Google for Developers.
Google Search Central. Introducción a los archivos robots.txt. Google for Developers.
Google Search Central. Impedir que la Búsqueda indexe páginas con noindex. Google for Developers.
Google Search Central. Troubleshoot Google Search crawling errors. Google for Developers.
Términos relacionados