¿Qué es Crawling?

Autor: Lisandro IserteÚltima actualización: 10 de agosto de 2026
Crawling en pocas palabras

El crawling o rastreo es el proceso mediante el cual los crawlers de los motores de búsqueda descubren URLs y solicitan sus recursos para conocer su contenido. En Google, Googlebot puede descubrir páginas mediante enlaces, sitemaps y otras fuentes, y después rastrearlas y renderizarlas. El rastreo habilita una posible indexación, pero no garantiza que una URL entre al índice ni que aparezca en resultados.

¿Qué es el crawling?

Los motores de búsqueda utilizan programas automatizados —crawlers, bots o spiders— para descubrir y recuperar recursos de la web. En Google, ese crawler se conoce como Googlebot. Google descubre nuevas URLs principalmente a partir de enlaces en páginas que ya conoce y de archivos sitemap; una vez descubierta una URL, puede decidir rastrearla para obtener su contenido.

Rastrear no consiste solo en descargar HTML. Durante el proceso Google puede recuperar recursos y renderizar JavaScript con una versión reciente de Chrome para interpretar contenido que se genera en el navegador. Aun así, descubrir una URL no obliga a Googlebot a rastrearla, y rastrearla tampoco obliga a Google a indexarla.

La frecuencia de rastreo tampoco es un atributo fijo de una página. Google determina algorítmicamente qué sitios y URLs rastrear, con qué frecuencia y cuántas solicitudes realizar. La disponibilidad del servidor, los cambios detectados, la demanda de rastreo y otras señales modifican ese comportamiento con el tiempo.

El crawling no es una garantía de visibilidad: es una condición técnica para que Google pueda procesar el contenido de una URL. Después todavía quedan la indexación y la publicación de resultados.

Lisandro Iserte

Crawling, indexación y publicación en resultados

Google describe la Búsqueda en tres grandes etapas: crawling, indexación y publicación de resultados. Separarlas evita diagnosticar como “problema de SEO” situaciones que tienen causas completamente distintas.

1
CrawlingGoogle descubre URLs y, cuando decide rastrearlas, descarga sus recursos y puede renderizar la página. Problemas de servidor, red, autenticación o reglas de robots.txt pueden limitar el acceso.
2
IndexaciónGoogle analiza el contenido recuperado, procesa señales y metadatos, agrupa duplicados y selecciona una URL canónica. No todo lo rastreado termina almacenado en el índice.
3
Publicación de resultadosAnte una consulta, Google busca en su índice y determina qué resultados son relevantes para mostrar. El posicionamiento ocurre en este contexto; una página indexada no tiene garantizada una posición visible para una consulta determinada.

La cadena no debe interpretarse como una regla absoluta del tipo “si no fue rastreada, la URL jamás puede aparecer”. Google advierte que una URL bloqueada mediante robots.txt puede llegar a mostrarse en resultados si el buscador conoce su existencia por otras fuentes, aunque no haya rastreado su contenido. Por eso controlar crawling y controlar indexación son problemas diferentes.

Crawl budget: qué es y cuándo importa

El crawl budget no es una cuota diaria fija asignada a cada sitio. La documentación actual de Google lo define como el conjunto de URLs de un sitio que Google puede y quiere rastrear. Surge de dos componentes principales: crawl capacity limit y crawl demand.

Componente 01Crawl capacity limitLimita cuánto puede rastrear Google sin sobrecargar el servidor. Si el sitio responde con latencia creciente, errores 5xx o señales de rate limiting, Google puede reducir la intensidad del rastreo.
Componente 02Crawl demandExpresa cuánto interés tienen los sistemas de Google en rastrear determinadas URLs. Puede variar con el tamaño del sitio, frecuencia de actualización, calidad, relevancia, popularidad y antigüedad de la copia conocida.

Para la mayoría de los sitios no hace falta “optimizar crawl budget” como proyecto independiente. La guía avanzada de Google está orientada principalmente a sitios muy grandes o que cambian con mucha frecuencia: como referencia aproximada, menciona sitios de más de un millón de páginas con cambios semanales, sitios de más de diez mil páginas con cambios diarios, o propiedades con muchas URLs en estado Discovered – currently not indexed. Google aclara que esos números son orientativos, no umbrales exactos.

Cuando sí existe un problema de eficiencia de rastreo, las medidas útiles suelen ser gestionar el inventario de URLs, consolidar duplicados, devolver 404/410 para contenido eliminado, mantener sitemaps actualizados, evitar cadenas largas de redirecciones y mejorar la capacidad de respuesta del servidor. Si el objetivo es que Google no rastree determinadas URLs irrelevantes, robots.txt puede ser apropiado; usar noindex no ahorra la solicitud inicial porque Google necesita acceder a la página para leer esa regla.

Qué puede frenar el descubrimiento o el rastreo

No todo problema de crawling es un “bloqueo”. Algunas configuraciones impiden directamente el acceso y otras reducen la probabilidad o velocidad de descubrimiento. Conviene distinguirlas antes de intervenir.

Accesorobots.txtUna regla Disallow puede impedir que Googlebot solicite determinadas URLs. Sirve para gestionar crawling, no para garantizar que una URL desaparezca de los resultados.
InfraestructuraErrores de servidor, red o capacidadErrores 5xx, problemas de red, latencia elevada o límites de capacidad pueden reducir o impedir las solicitudes. Google intenta ajustar su ritmo para no sobrecargar el servidor.
DescubrimientoEnlaces no rastreables o arquitectura débilGooglebot descubre muchas URLs siguiendo enlaces. Las páginas importantes deberían ser alcanzables mediante enlaces rastreables desde otras páginas encontrables. Un sitemap ayuda al descubrimiento, pero no reemplaza una arquitectura de enlaces útil.
AccesoAutenticación o contenido no accesibleSi una página requiere inicio de sesión o no está disponible públicamente para Googlebot, el crawler no puede recuperar su contenido como una página pública ordinaria.

noindex no pertenece a esta lista de bloqueos de crawling. Es una regla de indexación. Para que funcione, Google debe poder rastrear la página y leer la metaetiqueta o el encabezado HTTP correspondiente. Si robots.txt impide el acceso, Google puede no llegar a ver el noindex.

Errores comunes con el crawling

Usar robots.txt para sacar una página de Google

robots.txt controla solicitudes de crawling. Una URL bloqueada puede seguir siendo conocida y aparecer en resultados con información limitada si otras páginas enlazan a ella. Si el objetivo es impedir la indexación, hay que elegir un mecanismo de indexación o acceso apropiado.

Bloquear con robots.txt una página que depende de noindex

Google necesita rastrear la URL para leer la regla noindex. Si primero se impide el acceso mediante robots.txt, la directiva puede no ser vista. Las dos herramientas resuelven problemas diferentes y pueden entrar en conflicto cuando se combinan sin criterio.

Obsesionarse con crawl budget en un sitio que no lo necesita

El crawl budget es una preocupación avanzada para sitios muy grandes, muy cambiantes o con problemas claros de descubrimiento. En sitios normales suele ser más útil mantener sitemap, arquitectura, respuesta del servidor y estado de indexación en buen orden que intentar manipular una supuesta cuota diaria.

Creer que un sitemap garantiza crawling o indexación

El sitemap ayuda a Google a conocer URLs nuevas o actualizadas, pero no obliga al crawler a visitar cada URL ni garantiza que una página sea indexada. Es una señal de descubrimiento, no una orden.

Usar noindex como técnica de ahorro de crawl budget

Si Google debe solicitar la URL para leer noindex, el rastreo ya ocurrió. En sitios donde el objetivo real es evitar solicitudes sobre inventario irrelevante, Google recomienda gestionar ese inventario y usar las herramientas de crawling adecuadas.

Confundir “rastreada” con “indexada”

Una solicitud de Googlebot confirma actividad de crawling, no inclusión en el índice. Para diagnosticar una URL hay que separar evidencia de rastreo, estado de indexación y visibilidad ante consultas.

Preguntas frecuentes sobre crawling

¿Qué es el crawling en SEO?

El crawling o rastreo es el proceso mediante el cual los crawlers de los motores de búsqueda descubren URLs y solicitan sus recursos para conocer su contenido. En Google, Googlebot puede descubrir URLs mediante enlaces, sitemaps y otras fuentes, y después rastrearlas y renderizarlas. Que una URL sea rastreada no garantiza que se indexe ni que aparezca en los resultados de búsqueda.

¿Cuál es la diferencia entre crawling e indexación?

El crawling consiste en descubrir y recuperar una página o recurso. La indexación ocurre después: Google analiza el contenido rastreado, determina cuestiones como duplicación y canonicalización, y decide si la información puede incorporarse al índice. Una página rastreada puede no indexarse. Además, una URL bloqueada por robots.txt puede llegar a aparecer en resultados sin que Google haya rastreado su contenido, por ejemplo si otras páginas enlazan a ella.

¿Qué es el crawl budget?

El crawl budget es la cantidad y el conjunto de URLs de un sitio que Google puede y quiere rastrear. Google lo explica actualmente a partir de dos componentes principales: crawl capacity limit, que protege la capacidad del servidor, y crawl demand, que refleja cuánto interés tienen sus sistemas en volver a rastrear determinadas URLs. No es una cuota diaria fija y, para la mayoría de los sitios pequeños o medianos, no requiere una optimización específica.

¿Cómo saber si Google está rastreando mi sitio?

Google Search Console permite revisar el informe de estadísticas de rastreo a nivel de sitio y usar Inspección de URL para consultar el estado de una página y probar una URL publicada. Para saber con precisión cuándo Googlebot solicitó URLs concretas, los logs del servidor son la fuente más directa. Rastreo e indexación deben analizarse por separado: que Googlebot haya solicitado una URL no significa que esté indexada.

¿Cómo evitar que Google rastree ciertas páginas?

Si el objetivo es impedir que Googlebot solicite determinadas URLs, se usa robots.txt. Si el objetivo es evitar que una página aparezca en Google, robots.txt no es suficiente: la página debe permanecer accesible al crawler para que Google pueda leer una regla noindex, o debe protegerse mediante autenticación, eliminarse o utilizarse otro método adecuado. Bloquear con robots.txt una URL que también tiene noindex puede impedir que Google vea esa directiva.

Referencias clave

Google Search Central. In-depth guide to how Google Search works. Google for Developers.

Google Crawling Infrastructure. Optimize your crawl budget. Google for Developers.

Google Search Central. Introducción a los archivos robots.txt. Google for Developers.

Google Search Central. Impedir que la Búsqueda indexe páginas con noindex. Google for Developers.

Google Search Central. Troubleshoot Google Search crawling errors. Google for Developers.

Términos relacionados