自助建站 >> 全网营销 >>经验分享 >> 什么是robots.txt文件？在网站优化中有什么作用？怎么设置robots.txt文件？

详细内容

什么是robots.txt文件？在网站优化中有什么作用？怎么设置robots.txt文件？

什么是robots.txt文件？在网站优化中有什么作用？怎么设置robots.txt文件？

robots如果没有写，蜘蛛就会抓取网站所有的文件，不利于优化，更不利于保护需要保护的数据，比如用户信息；

robots文件如果没有设置好，会严重影响网站内容收录，以及对网站重要内容的保护，下面我为大家详细分析robots文件的应用以及存在的误区。

一、怎么查询robots.txt文件

robots.txt文件都是放在网站根目录下面，我们只要在域名后面输入robots.txt，然后按确认键，就会弹出robots文件内容，如图所示：

二、robots.txt文件使用误区

误区1，不去设置robots.txt文件，认为网站所有文件都可以被抓取，默认让搜索引擎抓取整个的网站文件。

现实不是这样的，蜘蛛每次来抓取网站先会抓取robots.txt文件，如果文件不存在，蜘蛛就会认为是死链，就在网站日志记录为死链，严重影响蜘蛛友好度。

误区2、在robots.txt文件中设置所有的文件都允许搜索引擎蜘蛛抓取，让搜索引擎能够收录更多页面。

其实搜索引擎蜘蛛对于网站程序脚本、css样式、js文件等，很难被搜索引擎收录，就算收录了，也只会浪费服务器资源，这种对网站保护性很差，对蜘蛛体验不友好。

误区3、在robots.txt文件中设置不抓取整个网站内容。

这样操作是尤其错误的，不让抓取意味着整个网站都不会被搜索引擎收录，不被收录的话，关键词难以获得排名，再好的营销内容，也难以被用户看到。

三、正确对待robots.txt使用技巧

网站都是由许多文件组成，比如我们常见的有后台管理文件、程序脚本、附件、数据库文件、编码文件、样式表文件、模板文件、导航图片和背景图片等等，有些文件是不需要搜索引擎去收录的，直接屏蔽蜘蛛抓取，让蜘蛛更好的爬行需要被抓取的内容，减轻蜘蛛负担，提高抓取效率。切记网站不要空着不去设置robots.txt文件。

Robots.txt 是存放在站点根目录下的一个纯文本文件。虽然它的设置很简单，但是作用却很强大。它可以指定搜索引擎蜘蛛只抓取指定的内容，或者是禁止搜索引擎蜘蛛抓取网站的部分或全部内容。

使用方法:

Robots.txt 文件应该放在网站根目录下，并且该文件是可以通过互联网进行访问的。

例如：如果您的网站地址是： http://www.80cloud.com.com/

那么，该文件必须能够通过： http://www.80cloud.com.com /robots.txt 打开并看到里面的内容。

格式：

User-agent:

用于描述搜索引擎蜘蛛的名字，在" Robots.txt "文件中，如果有多条User-agent记录说明有多个搜索引擎蜘蛛会受到该协议的限制，对该文件来说，至少要有一条User-agent记录。如果该项的值设为*，则该协议对任何搜索引擎蜘蛛均有效，在" Robots.txt "文件中，"User-agent:*"这样的记录只能有一条。

Disallow:

用于描述不希望被访问到的一个URL，这个URL可以是一条完整的路径，也可以是部分的，任何以Disallow开头的URL均不会被Robot访问到。

举例：

例一："Disallow:/help"是指/help.html 和/help/index.html都不允许搜索引擎蜘蛛抓取。

例二："Disallow:/help/"是指允许搜索引擎蜘蛛抓取/help.html，而不能抓取/help/index.html。

例三：Disallow记录为空说明该网站的所有页面都允许被搜索引擎抓取，在"/robots.txt"文件中，至少要有一条Disallow记录。如果"/robots.txt"是一个空文件，则对于所有的搜索引擎蜘蛛，该网站都是开放的可以被抓取的。

#:Robots.txt 协议中的注释符。

综合例子：

例一：通过"/robots.txt"禁止所有搜索引擎蜘蛛抓取"/bin/cgi/"目录，以及 "/tmp/"目录和 /foo.html 文件，设置方法如下：

User-agent: *

Disallow: /bin/cgi/

Disallow: /tmp/

Disallow: /foo.html

例二：通过"/robots.txt"只允许某个搜索引擎抓取，而禁止其他的搜索引擎抓取。如：只允许名为"slurp"的搜索引擎蜘蛛抓取，而拒绝其他的搜索引擎蜘蛛抓取 "/cgi/" 目录下的内容，设置方法如下：

User-agent: *

Disallow: /cgi/

User-agent: slurp

Disallow:

例三：禁止任何搜索引擎抓取我的网站，设置方法如下：

User-agent: *

Disallow: /

例四：只禁止某个搜索引擎抓取我的网站如：只禁止名为“slurp”的搜索引擎蜘蛛抓取，设置方法如下：

User-agent: slurp

Disallow: /

朋友们，看完上面的文章，你明白robots的用处和用法了吗？

上一篇做好这些，解决网站内页不收录的问题下一篇网站搜索引擎优化的原理是啥