Neubox /Herramientas /robots.txt
Ver Planes
🖥️ Hosting & Servidor

Generador de
robots.txt

Controla qué páginas rastrean los buscadores. Configura reglas para Google, Bing, AI crawlers y más. Presets para WordPress, Shopify y tiendas online.

Presets rápidos

Rastreadores principales

Permitir todos los bots

Indexación completa (recomendado por defecto)

Bloquear todos los bots

Útil para sitios en staging o desarrollo

Bloquear bots AI (GPTBot, CCBot, etc.)

Protege tu contenido de crawlers de IA

Rutas a bloquear (Disallow)

Rutas permitidas explícitamente (Allow)

Opciones adicionales

robots.txt
# Selecciona opciones para generar robots.txt

Probar URL contra las reglas

💡 Puntos clave sobre robots.txt

  • • Los bots éticos respetan el robots.txt; los maliciosos no
  • • Colócalo en la raíz: tudominio.com/robots.txt
  • • No incluyas URLs que no quieras que nadie sepa que existen
  • • Google puede tardar días en procesar cambios
  • • Usa Google Search Console para pruebas avanzadas

Guía completa del archivo robots.txt

Todo lo que necesitas saber para controlar cómo los buscadores rastrean tu sitio.

¿Qué es el archivo robots.txt?

El archivo robots.txt implementa el Robots Exclusion Protocol, un estándar de 1994 adoptado por todos los buscadores respetables. Es un archivo de texto plano que le indica a los bots rastreadores (Googlebot, Bingbot, etc.) qué páginas pueden visitar y cuáles deben ignorar.

A diferencia de la etiqueta noindex, robots.txt actúa antes de que el bot llegue a la página, si está bloqueada, el bot ni siquiera intenta visitarla. Esto es útil para proteger áreas de administración, páginas de staging o secciones que consumen mucho crawl budget.

En 2024-2025, robots.txt se ha vuelto más relevante que nunca gracias a los AI crawlers de OpenAI (GPTBot), Anthropic (Claude-Web), Google (Google-Extended) y otros, que también respetan este protocolo.

¿Cómo publicar el robots.txt? Paso a paso

1

Genera el archivo con esta herramienta

Configura las reglas usando los controles de arriba y haz clic en Descargar para obtener el archivo robots.txt listo para usar.

2

Súbelo a la raíz de tu hosting

  1. Entra a cPanel → Administrador de Archivos → carpeta public_html
  2. Si ya existe un robots.txt, haz clic derecho → Editar o reemplázalo
  3. Si no existe: + Archivo con nombre exacto robots.txt
  4. Pega el contenido generado y guarda los cambios
3

Verifica que sea accesible

Abre tu navegador y visita https://tudominio.com/robots.txt. Debe mostrarse el contenido del archivo como texto plano. Si ves un error 404, el archivo no está en la carpeta correcta.

4

Valida en Google Search Console

Ve a Google Search Console → ConfiguraciónRobots.txt. Ahí puedes ver el archivo que Google tiene almacenado en caché y probar URLs específicas para verificar si están bloqueadas o permitidas.

5

Agrega el sitemap al final

Añade esta línea al final de tu robots.txt: Sitemap: https://tudominio.com/sitemap.xml. Todos los buscadores la leerán automáticamente para encontrar tu mapa del sitio.

Casos de uso más comunes

Proteger áreas privadas

Bloquea /admin/, /dashboard/, /login/ para evitar que aparezcan en Google y ahorrar crawl budget.

Optimizar crawl budget

En sitios grandes, bloquea páginas de paginación y filtros de búsqueda para que Google indexe lo que importa.

Bloquear AI crawlers

Impide que GPTBot, Claude-Web y otros bots de IA usen tu contenido para entrenar sus modelos.

Entornos de staging

Bloquea todo tu sitio de prueba con Disallow: / para evitar que Google indexe versiones en desarrollo.

¿Dónde va el robots.txt?

📁 public_html/

📄 robots.txt ← aquí

📄 index.php

📄 sitemap.xml

📄 .htaccess

📁 wp-content/

El robots.txt siempre debe estar en la raíz del dominio. Los buscadores lo buscan exclusivamente en tudominio.com/robots.txt, no en subdirectorios.

Error crítico a evitar

Nunca pongas esto en tu robots.txt de producción:

User-agent: *
Disallow: /

Esto bloquea todo el sitio y Google dejará de indexar todas tus páginas.

Tip: AI crawlers 2025

Para bloquear los bots de IA más importantes, agrega al inicio de tu robots.txt:

User-agent: GPTBot
Disallow: /

User-agent: Claude-Web
Disallow: /

User-agent: Google-Extended
Disallow: /

Preguntas frecuentes sobre robots.txt

Las dudas más comunes sobre indexación y rastreo