Ana Fernández / SEO

Crawl budget: qué es y cuándo vale la pena trabajarlo

Qué es el crawl budget de Google, cuándo importa según su guía y cómo medirlo con Search Console, logs de Googlebot y el tiempo hasta rastrear lo que vende.

8 de octubre de 2026 10 min de lecturapor Ana Fernández

El crawl budget es la cantidad de tiempo y recursos que Google dedica a rastrear tu sitio web, y es de esos temas que suenan tan técnicos que nadie en la reunión quiere votar en contra. Alguien dice "tenemos que mejorar el crawl budget", todos asienten y, de pronto, hay un proyecto SEO de tres meses andando.

Antes de abrirlo, yo revisaría algo más simple: si el buscador está llegando tarde a las páginas que podrían generar negocio. Si la respuesta es no, el presupuesto de rastreo probablemente esté bien y el problema de tráfico anda por otro lado.

En esta guía te cuento qué es el crawl budget, cómo saber si tu web de verdad tiene un problema, qué lo desperdicia, cómo medirlo con Search Console y logs, y qué cambios sí lo mueven.

¿Qué es el crawl budget?

El crawl budget, o presupuesto de rastreo, es el conjunto de URLs que Google puede y quiere rastrear en tu sitio durante un periodo. Su guía sobre el presupuesto de rastreo lo define como el tiempo y los recursos que asigna a cada host, y cada nombre de host cuenta como un sitio distinto (www.tusitio.com y blog.tusitio.com tienen presupuestos separados).

Tampoco hay un panel donde consultarlo, porque sale del cruce de dos fuerzas: la capacidad de tu servidor para aguantar visitas y la demanda que tiene tu contenido para el buscador. En inglés vas a ver estas dos piezas como crawl rate limit y crawl demand.

Límite de capacidad de rastreo

El límite de capacidad de rastreo es el techo que Google se pone para no botarte el servidor. Controla cuántas conexiones abren los rastreadores a la vez y cuánto duran. Todos los sitios parten con el mismo límite, bastante conservador, y sube si el servidor responde rápido y estable.

Si la latencia sube o aparecen errores 5xx o 429, la capacidad de rastreo baja y las visitas del bot también. Aquí importa el tiempo de respuesta del servidor (lo que demora en entregar el HTML), más que la velocidad de carga que ve el usuario.

Demanda de rastreo

La demanda de rastreo es cuánto quiere rastrearte Google, y depende de la popularidad de tus URLs, de cada cuánto cambian y del inventario que conoce de tu sitio. Según la guía oficial, esa lista de direcciones conocidas es el factor que más puedes controlar: si el buscador conoce miles de direcciones duplicadas o inútiles, va a perder tiempo en ellas.

Los eventos grandes, como una migración, también disparan la demanda porque hay que volver a procesar todo con las direcciones nuevas (algo que conviene tener en cuenta si estás dimensionando el riesgo de una migración).

¿Tengo un problema de crawl budget?

La propia guía de Google dice para quién es este tema, y la lista es corta:

Tipo de webCuándo aplica según la guía
Sitios grandesMás de 1 millón de páginas únicas que cambian más o menos una vez a la semana
Sitios medianos o grandesMás de 10.000 páginas únicas que cambian a diario
Cualquier webUna parte grande de sus URLs aparece en Search Console como "Descubierta: actualmente sin indexar"

Si tu web no calza con ninguna fila, la recomendación oficial es tener el sitemap al día y revisar el informe de indexación de páginas. Mi criterio va por el mismo lado: si tienes 300 páginas y las nuevas se rastrean sin demora, yo no dedicaría tres meses a este tema.

Ojo con la tercera fila, porque ahí se confunde todo. Te cuento un caso propio. De los 32 artículos en español que publicamos en este blog entre el 11 de septiembre y el 2 de octubre de 2026, al 5 de octubre 15 estaban indexados, a 10 Google ni siquiera los conocía ("URL desconocida") y 7 los había visto sin indexarlos.

Parece un problema de crawl budget de manual. Pero este sitio tiene unos pocos cientos de URLs, y el buscador tiene capacidad de sobra para recorrerlas todas.

Lo que pasaba era más poco glamoroso: varios artículos nuevos colgaban solo del listado del blog, sin enlaces desde páginas con contenido que ya recibe visitas. Eso se llama problema de descubrimiento, y se trabaja con enlaces internos.

Mi regla práctica: hablo de crawl budget cuando el sitio es grande y además hay páginas que venden esperando su turno. Si solo se cumple una de las dos condiciones, el problema SEO está en otra parte.

¿Qué se come el presupuesto de rastreo?

En sitios grandes, el lío casi nunca es que Google rastree poco. Lo que pasa es que rastrea mucho contenido que no le importa a nadie, empezando por tu equipo comercial.

Piensa en un ecommerce con 200.000 productos y filtros de color, talla, marca y precio. De pronto, una misma polera negra talla M tiene 80 URLs distintas.

El bot puede pasarse el día recorriendo "polera-negra-talla-m-ordenada-por-precio" mientras los productos nuevos, que sí podrían vender, esperan (es un ejemplo, pero te apuesto que algo parecido existe en tu catálogo).

Lo que más se come el presupuesto, en el orden en que suelo encontrarlo:

  • Filtros y parámetros. Cada combinación de filtros crea una dirección nueva con casi el mismo contenido. Cinco filtros con cuatro valores cada uno ya generan miles de combinaciones por categoría.
  • Paginación y búsqueda interna. Las páginas 40, 41 y 42 de un listado al que nadie llega, o resultados de búsqueda interna que quedaron enlazados.
  • Soft 404. Fichas vacías que dicen "no hay resultados" pero responden con código 200. Como el código dice que todo está bien, el bot las sigue visitando.
  • Cadenas de redirección. Cada salto es una petición más, y después de varias migraciones se acumulan solas.
  • Contenido duplicado. Versiones con y sin barra final, con mayúsculas o con parámetros de campaña. Cada copia es una dirección más que rastrear.

Ninguna de estas cosas la decidió alguien un día en una reunión de SEO. Se fueron dando solas, plantilla a plantilla, año a año.

¿Cómo medir el crawl budget?

Aviso que viene la parte árida (prometo que es corta): no hay una métrica oficial de crawl budget, así que lo que se mide es cómo se comporta el buscador en tu web. Yo lo hago en cuatro pasos.

  1. Estadísticas de rastreo en Search Console. Están en Configuración y Google las guarda para los últimos 90 días. Mira el total de solicitudes, el tiempo de respuesta promedio y el desglose por código y por tipo de página. Mucho 3xx suele indicar redirecciones encadenadas; mucho 404, enlaces rotos.

  2. Logs de 30 días. Los logs del servidor muestran qué rastreó Googlebot de verdad, sin interpretación. Filtra las visitas reales del bot (verificando que la IP sea de Google) y agrúpalas por plantilla: fichas de producto, categorías, filtros, parámetros, paginación y búsqueda interna.

  3. El porcentaje que se va a lo que no quieres indexar. Supongamos 1.000.000 de visitas del bot al mes. Suena muy bien.

    Hasta que descubres que el 38% se fue a filtros y parámetros que ni siquiera quieres en Google. Ahí la conversación cambia hacia qué estás dejando que el bot recorra.

  4. Cuánto demora en llegar a lo nuevo que vende. Para cada producto o landing nueva, compara la fecha en que publicaste el contenido con la primera visita de Google en los logs. Si una ficha nueva demora semanas mientras un filtro se visita a diario, ahí tienes tu problema de crawl budget, medido en algo que le importa al negocio.

Ese cuarto paso es el que más me sirve para decidir si el crawl budget merece un proyecto. Las estadísticas de rastreo te dicen cuánto se rastrea y con qué frecuencia; el tiempo hasta la primera visita te dice si el buscador está llegando tarde a lo que importa.

¿Cómo optimizar el crawl budget?

Si los números dicen que sí hay un problema de crawl budget, este es el orden en que yo trabajaría con el equipo de desarrollo.

  1. Ordena el inventario. Compara tres listas: lo que dice tu sitemap, lo que encuentra un crawler siguiendo enlaces y lo que el bot visita según los logs. Las diferencias son el diagnóstico.
  2. Bloquea, consolida o elimina según el caso. Cada herramienta hace una cosa distinta, y usar la equivocada es de los errores más caros del tema:
Quiero que la URL...UsoQué pasa con el rastreo
No se rastreerobots.txtEl bot deja de pedirla. Ojo: si recibe enlaces, puede seguir apareciendo sin contenido
No aparezca en el buscadornoindexEl bot la sigue pidiendo para leer la etiqueta, así que no ahorra presupuesto
Se consolide con otracanonicalEs una señal para agrupar contenido duplicado, y el buscador puede ignorarla
Desaparezca para siempre404 o 410Queda claro que no hay que volver
  1. Arregla los soft 404 y aplana las cadenas de redirección. Cada regla debería apuntar directo al destino final.
  2. Mantén sitemaps honestos. Segméntalos por tipo de página y usa lastmod solo cuando el contenido cambió de verdad. Si tu CMS le pone la fecha de hoy a 40.000 fichas cada noche, el buscador deja de creerle al lastmod (más sobre esto en por qué Google no está usando tu sitemap).
  3. Cuida el servidor. Respuestas rápidas y estables suben el límite de capacidad. Responder 304 (Not Modified) cuando una ficha no cambió permite que el bot reutilice su copia en caché.
  4. Acerca lo que vende a la home. Los rastreadores llegan antes y con más frecuencia a lo que está a pocos clics. Cuando crawleamos un sitio web enterprise medimos la profundidad de clic promedio por plantilla, y la regla que usamos es que todo lo comercial quede a 3 clics o menos. En una web de 200.000 direcciones eso se trabaja por plantilla: un módulo de 60 hubs temáticos con 40 enlaces cada uno reacomoda 2.400 fichas con un solo cambio (la lógica completa está en estructura en silo).

Si al ordenar las URLs aparecen miles de páginas que no aportan contenido útil, la poda de contenido es el paso siguiente.

¿Qué no mejora el crawl budget?

Hay algunas ideas sobre el crawl budget que circulan bastante en SEO técnico y conviene descartar:

  • Poner noindex para ahorrar rastreo. El bot igual tiene que pedir la página para ver la etiqueta. Si quieres que no la visite, el camino es robots.txt.
  • Reenviar el sitemap todos los días. Ayuda a descubrir direcciones, pero no le asigna más presupuesto a tu web.
  • Configurar crawl-delay en robots.txt. Googlebot ignora esa directiva.
  • Celebrar que el rastreo total subió. Que el bot recorra más filtros no mejora nada. Lo que quieres ver es que baje lo inútil y suba lo que vende.
  • Esperar que más autoridad lo arregle todo. La popularidad sube la demanda, pero si tu sitio está lleno de duplicados, esa demanda extra se gasta en duplicados.

¿Los bots de IA gastan el mismo presupuesto?

En parte. Google aclara que el límite de capacidad se comparte entre todos sus rastreadores: Googlebot, AdsBot y el de Google Shopping sacan del mismo depósito. Google-Extended, que suele aparecer en esta conversación, es un control en robots.txt para decidir si tu contenido entrena a Gemini, sin ser un bot aparte.

Los bots de otras empresas, como GPTBot de OpenAI (que recopila contenido para entrenar sus modelos), ClaudeBot o PerplexityBot, no gastan el presupuesto de Google, pero sí consumen tu servidor. Y si el servidor se pone lento, la capacidad de rastreo baja para todos.

Por eso vale la pena separarlos por user-agent en los mismos logs y ver cuánto pesan. Mi criterio por defecto es dejar pasar a los bots de búsqueda de IA (como OAI-SearchBot o PerplexityBot), porque bloquearlos también significa que no te pueden citar; si el problema es el entrenamiento, eso se decide aparte.

Preguntas frecuentes

¿El crawl budget afecta al posicionamiento SEO?

No directamente: Google no lo usa como factor para ordenar resultados. El efecto es indirecto, porque lo que no se rastrea no entra a la indexación, y una página fuera del índice no puede posicionar.

¿Un sitemap aumenta el crawl budget?

No. Un buen mapa del sitio ayuda a encontrar tus páginas nuevas más rápido, pero no hace que tu sitio reciba más visitas del bot.

Lo que revisaría esta semana

Antes de pedir presupuesto para un proyecto de crawl budget, haría tres cosas que no cuestan nada. Mira en Search Console si tienes muchas direcciones en "Descubierta: actualmente sin indexar". Elige 10 páginas nuevas que deberían vender y revisa cuánto demoró Google en visitarlas.

Y si tienes logs, calcula qué porcentaje de las visitas se va a páginas que no quieres en Google. Si lo que vende se rastrea el mismo día y el desperdicio es chico, guarda ese presupuesto para un problema que sí tengas (y si no, una auditoría SEO completa te ordena el resto).

Recurso gratuito semanal

Recibe los recursos de SEO enterprise antes que nadie

Cada semana publicamos un recurso gratuito nuevo: auditorías interactivas, calculadoras, checklists y plantillas que usamos de verdad con clientes enterprise. Deja tu email y te lo enviamos primero.

Sin spam. Puedes darte de baja cuando quieras.

Consultoría SEO enterprise

¿Quieres aplicar esto a tu marca?

Diseñamos programas SEO y GEO de extremo a extremo conectados a pipeline y revenue. Equipo senior, ejecución semanal, reporting ejecutivo.