Rastreadores de IA y robots.txt: ¿bloquear o permitir?
La mayoría de los negocios locales deberían permitir a los rastreadores de IA detrás de la búsqueda y las respuestas. Esto es lo que hace cada uno, líneas de ejemplo para robots.txt, y los límites del archivo.

Para la mayoría de los negocios locales, permítelos. Un rastreador de IA es un programa que visita tus páginas, y los que están detrás de la búsqueda con IA, como OAI-SearchBot, PerplexityBot y Claude-SearchBot, necesitan acceso si quieres que te encuentren. Bloquearlos es opcional, y se trata sobre todo de si tu contenido puede usarse para entrenamiento.
Esta guía es parte de la guía completa de AEO. Los nombres y propósitos de abajo vienen de la documentación de cada empresa, vigente en septiembre de 2026. Los nombres cambian, así que revisa la fuente antes de editar nada.
¿Qué es un rastreador, y qué es robots.txt?
Un rastreador es un programa que visita páginas web automáticamente para leerlas. El rastreador de Google, Googlebot, construye el índice de búsqueda. Las empresas de IA operan sus propios rastreadores para funciones de búsqueda, para solicitudes de usuarios y para entrenar sus modelos.
robots.txt es un archivo de texto plano en la raíz de tu sitio web, en tusitio.com/robots.txt. La documentación de Google dice que le indica a los rastreadores qué URLs pueden visitar. Más que escribir código, haces una lista de reglas: qué rastreador, y qué partes del sitio puede o no visitar. Muchos constructores de sitios web crean el archivo por ti.
¿Qué rastreadores de IA existen, y para qué sirve cada uno?
Cada empresa separa sus rastreadores por función. Esa separación es lo que te permite permitir la búsqueda y bloquear el entrenamiento, o al revés.
- OAI-SearchBot (OpenAI): muestra sitios web en las funciones de búsqueda de ChatGPT. OpenAI dice que un sitio que lo bloquea no aparecerá en las respuestas de búsqueda de ChatGPT.
- GPTBot (OpenAI): rastrea contenido que puede usarse para entrenar los modelos base de IA generativa de OpenAI. Bloquearlo indica que tu contenido no debería usarse para entrenamiento.
- ChatGPT-User (OpenAI): se usa para ciertas acciones que un usuario realiza en ChatGPT y en GPTs personalizados. OpenAI dice que las reglas de robots.txt pueden no aplicar, porque una persona inició la acción.
- Claude-SearchBot (Anthropic): analiza contenido para mejorar la calidad de los resultados de búsqueda de Claude. Anthropic dice que bloquearlo puede reducir tu visibilidad en esos resultados.
- ClaudeBot (Anthropic): recolecta contenido público de la web que puede contribuir al entrenamiento. Restringirlo indica que tu contenido futuro debería excluirse de los conjuntos de datos de entrenamiento.
- Claude-User (Anthropic): puede acceder a un sitio web cuando un usuario de Claude hace una pregunta que lo necesita. Bloquearlo evita que Claude obtenga tus páginas para preguntas de usuarios.
- PerplexityBot (Perplexity): muestra y enlaza sitios web en los resultados de búsqueda de Perplexity. Perplexity dice que no se usa para rastrear contenido para modelos base de IA, y recomienda permitirlo.
- Perplexity-User (Perplexity): visita páginas cuando la pregunta de un usuario lo requiere. Perplexity dice que por lo general ignora las reglas de robots.txt, porque un usuario solicitó la consulta.
- Googlebot (Google): construye el índice de búsqueda de Google. Google dice que una página debe estar indexada y ser elegible para mostrarse con un fragmento para aparecer en AI Overviews o en el Modo IA, y las directrices de robots.txt para Googlebot son el control.
- Google-Extended (Google): un token de robots.txt que te permite administrar si el contenido que rastrea Google puede usarse para entrenar futuros modelos Gemini y para fundamentar respuestas en Gemini Apps y Vertex AI. Google dice que no afecta la inclusión en la Búsqueda de Google ni funciona como señal de posicionamiento.
¿Un negocio local debería permitirlos o bloquearlos?
La mayoría de los negocios locales quiere que los encuentren, así que la respuesta por defecto es permitir los rastreadores de búsqueda y dejar el archivo como está. Si OAI-SearchBot no puede leer tu sitio, OpenAI dice que la búsqueda de ChatGPT no lo va a mostrar. La misma lógica aplica a los otros rastreadores de búsqueda de la lista. Cómo tratan tus páginas las propias funciones de IA de Google está cubierto en los resúmenes de IA de Google y tu negocio local.
El entrenamiento es una pregunta aparte, y es tu decisión. Bloquear a GPTBot, ClaudeBot o Google-Extended les pide a esas empresas que no usen tu contenido para entrenamiento. OpenAI dice que cada configuración es independiente, así que puedes bloquear a GPTBot y seguir permitiendo a OAI-SearchBot. La contrapartida es una inferencia, no un resultado documentado: un modelo entrenado sin tus páginas puede saber menos de ti de memoria, así que dependes más de que los rastreadores de búsqueda en vivo te encuentren.
Una taquería, un consultorio dental o un plomero típico tienen poca razón para bloquear algo. El riesgo más grande para un negocio pequeño es bloquear por accidente. Eso puede pasar cuando un sitio se construyó con una opción de ocultarse de la búsqueda que nunca se desactivó. WordPress, por ejemplo, tiene una opción en Ajustes, Lectura llamada Disuadir a los motores de búsqueda de indexar este sitio, que les pide a los buscadores que se salten tus páginas. Los plugins de seguridad y los firewalls también pueden bloquear rastreadores sin tocar robots.txt para nada.
¿Cómo revisas el tuyo, y cómo se ven las líneas?
Escribe tusitio.com/robots.txt en tu navegador. Si ves una página de texto, ese es el archivo. Busca una línea que diga Disallow: / bajo User-agent: *, que le pide a todo rastreador que se salte el sitio completo. Si encuentras una que no era tu intención, pídele a quien maneje tu sitio que la quite.
Para permitir todo, deja el archivo como está, o dilo explícitamente con estas dos líneas.
- User-agent: *
- Allow: /
Para que te sigan encontrando en la búsqueda mientras les pides a los rastreadores de entrenamiento que se salten tu contenido, agrega un grupo para cada uno. Cada línea User-agent empieza un grupo nuevo, y la línea Disallow debajo aplica solo a ese rastreador.
- User-agent: GPTBot
- Disallow: /
- User-agent: ClaudeBot
- Disallow: /
- User-agent: Google-Extended
- Disallow: /
Deja fuera de ese archivo a OAI-SearchBot, PerplexityBot, Claude-SearchBot y Googlebot, o dale a cada uno una línea Allow: /. Bajo las reglas estándar, un grupo que nombra a un rastreador tiene prioridad sobre el grupo general User-agent: * para ese rastreador, aunque la documentación de Google señala que los rastreadores pueden interpretar las reglas de forma distinta.
¿robots.txt es un candado?
No, es una solicitud. La documentación de Google dice que las instrucciones en robots.txt no pueden hacer cumplir el comportamiento de un rastreador, y que depende de cada rastreador obedecerlas. Los rastreadores serios lo hacen. OpenAI dice que las reglas de robots.txt pueden no aplicar a ChatGPT-User, y Perplexity dice que Perplexity-User por lo general las ignora, porque una persona pidió la página. Google también dice que robots.txt no es una forma de mantener una página fuera de Google. Para eso, usa noindex o una contraseña.
Anthropic agrega una advertencia sobre bloquear direcciones IP en vez de usar robots.txt: dice que hacerlo puede no funcionar correctamente, porque le impide a Anthropic leer tu archivo robots.txt. No pongas nada privado en una página pública esperando que una línea de robots.txt lo proteja. Ponlo detrás de un inicio de sesión.
Los cambios tampoco son instantáneos. OpenAI dice que puede tardar cerca de 24 horas después de actualizar robots.txt para que sus sistemas se ajusten.
¿Cómo se relaciona robots.txt con llms.txt?
Hacen trabajos opuestos. robots.txt dice qué rastreadores pueden visitar qué partes de tu sitio. llms.txt es una hoja de datos en texto plano sobre tu negocio. Uno controla el acceso, y el otro te describe.
Sé realista sobre el segundo. La guía de Google dice que la Búsqueda de Google ignora los archivos de texto para IA, y la documentación de rastreadores de OpenAI, Anthropic y Perplexity describe controles de robots.txt y no describe llms.txt. El panel de Growrank te genera un archivo llms.txt como hoja de datos, y no cuesta nada publicarlo, pero trátalo como un extra ordenado y no como una palanca de posicionamiento.
Para el resto de lo básico en un solo lugar, mira la lista de SEO gratis para negocios pequeños. Para ver si algo de esto cambia lo que dicen los asistentes de ti, el panel de Growrank registra sus respuestas cada semana; mira los planes y la prueba gratis.
Preguntas frecuentes
¿Un negocio local debería bloquear a los rastreadores de IA?
Casi siempre no. Los negocios que quieren que los encuentren necesitan que rastreadores de búsqueda como OAI-SearchBot, PerplexityBot, Claude-SearchBot y Googlebot lleguen a sus páginas. OpenAI dice que un sitio que bloquea a OAI-SearchBot no aparecerá en las respuestas de búsqueda de ChatGPT. Bloquear a los rastreadores de entrenamiento es una decisión aparte y personal.
¿Cuál es la diferencia entre GPTBot y OAI-SearchBot?
Hacen trabajos distintos. OpenAI dice que OAI-SearchBot muestra sitios web en las funciones de búsqueda de ChatGPT, mientras que GPTBot rastrea contenido que puede usarse para entrenar sus modelos base de IA generativa. Cada configuración es independiente, así que puedes permitir uno y bloquear el otro.
¿Bloquear a GPTBot va a quitar mi negocio de ChatGPT?
OpenAI dice que bloquear a GPTBot indica que tu contenido no debería usarse para entrenamiento, y que su rastreador de búsqueda es una configuración aparte. Así que bloquear solo a GPTBot no impide que OAI-SearchBot te muestre en las respuestas de búsqueda. Si un modelo entrenado sin tus páginas sabe menos de ti de memoria, eso no está documentado.
¿Dónde encuentro mi archivo robots.txt?
Escribe tu dominio seguido de /robots.txt en un navegador, por ejemplo tusitio.com/robots.txt. Si aparece una página de texto, ese es tu archivo. Tu constructor de sitios web o tu proveedor de hosting puede dejarte editarlo desde una pantalla de configuración. Si no aparece nada, tu sitio puede no tener uno, lo que normalmente significa que los rastreadores pueden visitar todo.
¿robots.txt evita que la IA use mi contenido?
Solo para los rastreadores que deciden obedecerlo. Google dice que robots.txt no puede hacer cumplir el comportamiento de un rastreador, y OpenAI y Perplexity dicen que las acciones que inicia un usuario pueden no seguirlo. Es una solicitud educada. El contenido que necesitas mantener privado va detrás de un inicio de sesión, no en una página pública.
Sigue leyendo
¿Quieres ver qué dice la IA de tu negocio? Gratis por 7 días, luego $39/mes.
Empieza gratis