福利彩票入门基础知识|双色球中奖秘籍100%
您当前位置:网站首页 >> 网络编程 >> 网页设计 >> HTML >> 如何写robots.txt(robots.txt文件中应该屏?#25991;?#20123;目录)

如何写robots.txt(robots.txt文件中应该屏?#25991;?#20123;目录)

2013-06-30 10:45:34 来源:旭日站长 浏览:177

动态搞笑?#35745;?/a>  每日一笑话,快乐一辈子


 一、什么是robots.txt
  笔者引用百度站长工具中后段话来解释。搜索引擎使用spider程序自动访问互联网上的网页并获取网页信息。spider在访问一个网站时,会首先会检查该网站的根域下是否有一个叫做 robots.txt的纯文本文件,这个文件用于指定spider在您网站上的抓取?#27573;А?#24744;可以在您的网站?#20889;?#24314;一个robots.txt,在文件中声明 该网站中不想被搜索引擎收录的部分或者指定搜索引擎只收录特定的部分。
  二、robots.txt文件对网站有什么?#20040;?br>  1、快速增加网站权重和访问量;
  2、禁止某些文件被搜索引擎索引,可以节省服务器带宽和网站访问速度;
  3、为搜索引擎提供一个简洁明了的索引环境
  三、哪些网站?#21738;?#24405;需要使用robots.txt文件禁止抓取
  1)、?#35745;?#30446;录
  ?#35745;?#26159;构成网站的主要组成元素。随着现在建站越来越方便,大量CMS的出现,真正做到了会打字就会建网站,而正是因为如此方便,网上出现了大量的同质化模板网站,被反复使用,这样的网站搜索引擎是肯定不?#19981;?#30340;,就算是你的网站被收录了,那你的效果也是很差的。如果你非要用这种网站的话,建议你应该在robots.txt文件中进行屏蔽,通常的网站?#35745;?#30446;录是:imags 或者 img;
  2)、网站模板目录
  如上面 ?#35745;?#30446;录 中所说,CMS的?#30475;?#21644;灵活,也导致了很多同质化的网站模板的出现和滥用,高度的重复性模板在搜索引擎中形成了一种冗余,且模板文件常常与生成文件高度相似,同样?#33258;?#25104;雷同内容的出现。对搜索引擎很不友好,?#29616;?#30340;直接被搜索引擎打入冷宫,不得翻身,很多CMS有拥有独立?#21738;?#26495;存放目录,因此,应该进行模板目录的屏蔽。通常模板目录的文件目录是:templets
  3)、CSS、JS目录的屏蔽
  
CSS目录文件在搜索引擎的抓取中没有?#20040;Γ?#20063;无法提供有价值的信息。所以强烈建议站长朋友们在Robots.txt文件中将其进行屏蔽,以提高搜索引擎的索引质量。为搜索引擎提供一个简洁明了的索引环境更易提升网站友好性。CSS样式?#21738;?#24405;通常情况下是:CSS 或者 style
  JS文件在搜索引擎中无法进行识别,这里只是建议,可以对其进行屏蔽,这样做也有一个?#20040;Γ何?#25628;索引擎提供一个简洁明了的索引环境;
  4)、屏蔽双页面?#21738;?#23481;
  这里拿DEDECMS来举例吧。大家都知道DEDECMS可以使用静态和动态URL进行同一篇内容的访问,如果你生成全站静态了,那你必须屏蔽动态地址的URL链接。这里有两个?#20040;Γ?、搜索引擎对静态的URL比动态的URL更友好、更容?#36164;?#24405;;2、?#20048;?#38745;态、动态URL能访?#37322;?#19968;篇文?#38706;?#34987;搜索引擎判为重复内容。这样做对搜索引擎友好性来说是有益无害的。
  5)、模板缓存目录
  
很多CMS程序都有缓存目录,这?#21482;?#23384;目录的?#20040;?#25105;想不用说大家也清楚了吧,可以?#27973;?#26377;效的提升网站的访问速度,减少网站带宽,对用户体验也是很好的。不过,这样的缓存目录也有一定的缺点,那就是会让搜索引擎进行重复的抓取,一个网站中内容重复也是大祭,对网站百害而无一利。很多使用CMS建站的朋?#35759;?#27809;有注意到,必须要引起重视。
  6)被?#22659;哪?#24405;
  死链过多,对搜索引擎优化来说,是致命的。不能不引起站长的高度重视,。在网站的发展过程中,目录的?#22659;?#21644;调整是不可避免的,如果你的网站当前目录不存在了,?#28508;?#39035;?#28304;?#30446;录进行robots屏蔽,并返回正确的404错误页面(注意:在IIS中,有的朋友在设置404错误的时候,设?#20040;?#22312;问题,在自定义错误页面一项中,404错误的正确设置应该是选择:默?#29616;?或者 文件,而不应该是:URL,以?#20048;?#25628;索引擎返回200的状态码。至于怎么设置,网上教程很多,大家要吧搜索一下)
  这里有一个争议性的问题,关于网站后台管理目录是否需要进行屏蔽,其实这个可有可无。在能保证网站安全的情况下,如果你的网站运营规模较小,就算网站管理目录出现在robots.txt文件中,也没有多大问题,这个我?#24067;?#36807;很多网站这样设置的;但如果你的网站运营规模较大,竞争夺手过多,强烈建议千万别出现任何你网站后台管理目录的信息,以防被别有用心的人利用,损害你的利益;其实搜索引擎越来越智能,对于网站的管理目录还是能很好的识别,并?#29260;?#32034;引的。另外,大家在做网站后台的时候,也可以在页面元标签中添加:进行搜索引擎的屏蔽抓取。
  最后,需要说明一点,很多站长朋友?#19981;?#25226;站点地图地址放在robots.txt文件中,当然这里并不是去屏蔽搜索引擎,而是让搜索引擎在第一次索引网站的时候便能通过站点地图快速的抓取网站内容。这里需要注意一下:

1、站点地图的制作一定要规范;

2、网站一定要有高质?#24247;哪?#23481;;

发表评论
网名:
评论:
验证:
共有0人对本文发表评论查看所有评论(网友评论仅供表达个人看法,并不表明本站同意其观点或证实其描述)
powered by 旭日软件(http://www.qqmcx.tw) 。
威尼斯人官网,旭日软件园-提供免费小软件下载,电脑教程和QQ表情包下载为主要宗旨.同时有网站运营,编程教程,网?#31243;?#25928;,手机教程,游戏攻略和IT资讯等内容,打造常用软件下载、内容丰富的站长学习!
福利彩票入门基础知识 恒大股票 2013上证指数走势图 新浪模拟炒股 南京股票配资公司 股票涨跌百分比 万科股票行情 葛洲坝股票分析 炒股有风险 上证指数是什么意思 今日大盘上证指数