Central : (511) 578 0427
Nextel : 115*136

RPM: *0234873
Movistar: 952023675

Activación en 30 minutos.

Luego de verificado el pago, habilitaremos su cuenta en un período menor a 20 minutos.
Panel de Contro Propio

Panel de Contro Propio.
Servidores Seguros

Servidores Seguros.
Respado de tu Web.

Nosotros respaldamos el contenido de tu web guardando una copia de seguridad.
Soporte Técnico 24 horas

Seguridad de toda su información al 100%

PREGUNTA FRECUENTE

¿ Qué es un archivo robots.txt ?

El fichero robots.txt es un archivo de texto que dicta unas recomendaciones para que todos los crawlers y robots de buscadores cumplan (recomendaciones, no obligaciones)

Un crawler es un robot de una entidad (generalmente buscadores) que acceden a las páginas web de un sitio para buscar información en ella, añadirla en los buscadores, etc. También son llamados spiders, arañas, bots o indexadores.

Por ejemplo, Googlebot es el nombre del crawler del buscador Google. También existen otros como:

■Mediapartners-Google, que es el crawler que se encarga de revisar los anuncios de Google Adsense.
■Googlebot-Image, robot indexador de imagenes del buscador de Google.
■Slurp, crawler de indexación del buscador Yahoo!
■noxtrumbot, del buscador Noxtrum.
■Scooter, del buscador Altavista.
Y muchísimos más. Si establecemos un control en nuestro robots.txt, podremos conseguir una serie de beneficios:

■Impedir acceso a robots determinados: Puede parecer contradictorio, pero algunos crawlers no nos proporcionarán sino problemas. Algunos robots no son de buscadores, e incluso algunos robots no son ni amigos. Pero de eso ya hablaremos más tarde.
■Reducir la sobrecarga del servidor: Podrás controlar el flujo de algunos robots. Algunos de ellos son un verdadero descontrol de peticiones que pueden llegar a saturar tu servidor.
■Prohibir zonas: Nos puede interesar tener disponible una zona en nuestra web, que sea accesible para algunos, pero que no aparezca en buscadores.
■Eliminar contenido duplicado: Uno de los casos más importantes, que casi siempre es olvidado por los webmasters. Si eliminamos la duplicidad de contenido, los buscadores nos puntuaran muy alto, aumentando el flujo de visitas.
■Fijar mapas del sitio: También es posible acoplar un sitemap para indicar el buen camino a los robots.
¿Y entonces, que hay que hacer? Es muy sencillo.

Sólo tenemos que crear un fichero de texto robots.txt y comenzar a escribir en el. Partiré del siguiente ejemplo donde permitimos la entrada a todos los crawlers (igual que sin ningún robots.txt):

User-agent: *
Disallow:
En User-agent debemos introducir el nombre del robot, y a continuación las rutas donde queremos prohibir que acceda. Algunos ejemplos:

■Disallow: / prohibe la entrada a todo el sitio.
■Disallow: /foro/ prohibe la entrada a los documentos del directorio foro.
■Disallow: permite la entrada a todo el sitio.
En algunos casos suele utilizarse en lugar de Disallow, la palabra Allow. Aunque por definición es correcta, es conveniente no utilizarla, puesto que las rutas omitidas se asumen que están permitidas por defecto, y algunos crawlers no entienden la palabra Allow.

Es posible acumular varios Disallow bajo un mismo User-agent, pero no podemos utilizar varios User-agent encima de un Disallow. Bien, algún ejemplo:

# Crawler de MSN
User-agent: msnbot
Disallow: /links.html
Disallow: /private/
Disallow: /photos/
Este código impide al crawler del buscador de Live (MSN) acceder a la página links.html, y las carpetas private y photos (y todo su contenido) de nuestro sitio.

Añadiendo el carácter # al principio de una linea podemos escribir comentarios que no interpretará el crawler.

Es posible ir acumulando reglas para distintos crawlers, formando un robots.txt más largo y completo. Cada vez que escribamos un User-agent deberemos dejar una linea en blanco de separación. Además, existe una ligera adaptación que permiten usar comodines ($ y *) en las rutas en algunos crawlers (sólo Googlebot y Slurp):

User-agent: Slurp
Disallow: /*.js$
Disallow: /2006/*
Disallow: /2007/*
Disallow: /articulos/*/pagina/*
Se está indicando al robot de Yahoo, que no indexe los ficheros que terminen en .js (javascript), direcciones que empiecen por 2007 o 2006 (fechas), ni artículos con la palabra pagina (paginado de comentarios). Estos casos pertenecen a la idea de no indexar contenido duplicado.

En la mayoría de los blogs, puedes acceder a un mismo artículo por las direcciones:

■blog.com/articulo/titulo, la dirección principal.
■blog.com/2007/04/, el archivo del mes.
■blog.com/articulo/titulo/feed, feed RSS del artículo.
■blog.com/articulo/titulo/pagina/2, pagina 2 de comentarios.
Todo esto es contenido duplicado, una de las razones más importantes de penalización para un buscador, a no ser, claro, que te las ingenies para que sólo sea accesible desde una dirección. A la hora de ver los resultados te asombrarás lo bien que estarás quedando ante los ojos de Google, por ejemplo.

Hay que tener mucho cuidado con usar cosas como Disallow: /pagina o Disallow: /*pagina, puesto que en lugar de bloquear lo que queríamos (carpeta pagina o artículos paginados), terminen bloqueando direcciones como /decorar-mi-pagina o /paginas-para-amigos/.

Si revisas estadísticas y demás, también puedes observar que a veces algunos crawlers «se pasan» revisando nuestro sitio, y funden a peticiones a nuestro pobre servidor. Existe una manera de tranquilizar a los robots:

User-agent: noxtrumbot
Crawl-delay: 30
Con esto le decimos al robot de noxtrum que espere 30 segundos entre cada acceso. Cuidado, porque Crawl-delay no lo soportan todos los crawlers (al menos MSNBot y Slurp si lo soportan, y Googlebot desde el panel de webmasters también).

Finalmente, podemos también incluir un mapa del sitio en nuestro robots.txt de la siguiente forma:

Sitemap: http://www.inkawebdesign.com/sitemap.xml
En RobotsTXT.org podrás encontrar documentación oficial si quieres profundizar y en esta búsqueda de Google encontrarás muchos robots.txt de ejemplo, incluso robots.txt optimizados para tu tipo de web. Además, también tienes un validador de robots.txt.

Publicado el : 2011-02-19 03:48:20

Te damos todas las facilidades
para Contactarnos

Central : (511) 650 2360
Nextel : 115 * 136
RPM : *0234873
Movistar : 952023675
MSN : info@creatuhost.com

Ultimos Tutoriales

Manuales y Tutoriales Online
Manuales y tutoriales de programacion y diseño, cursos y manuales de todos los lenguajes de programacion asi como d ... leer más

PHPDesigner 2009
PHPDesigner 2009 es un excelente editor de programación. PHPDesigner 2009 sirve como editor de código PHP pero t ... leer más

Configuración y uso de foros PHPBB
phpBB es un sistema de foros gratuito basado en un conjunto de paquetes de código programados en el popular lenguaj ... leer más

Configuración Outlook Express
Outlook Express fue un cliente de correo electrónico y de noticias de red producido por Microsoft para sus platafor ... leer más

Configurar cuenta de correo en Mozilla Thunderbird
Mozilla Thunderbird (anteriormente Minotaur) es un cliente de correo electrónico de la Fundación Mozilla. El objeti ... leer más

Winamp
Winamp es un reproductor multimedia, para la plataforma Microsoft Windows creado el 21 de abril de 1997 y distribui ... leer más

Compras Seguras en Línea con las Principales Tarjetas de Crédito y Paypal

Posicionamiento Web

Hosting Reseller

Centro de Soporte

Redes Sociales

Cpanel en Español

CPanel es el panel de control para empresas de alojamiento web líder en el mercado. Su atractiva interfaz web es la preferida por los usuarios de miles de compañías en todo el mundo.

Activación en 30 minutos.

Panel de Contro Propio

Servidores Seguros

Respado de tu Web.

Soporte Técnico 24 horas