SEO优化

联系方式:153 1215 0221

浦东SEO-网站日志掌握蜘蛛的动向

  通过网站日志可以清楚的得知用户在什么IP、什么时间、用什么操作系统、什么浏览器、什么分辨率显示器的情况下访问了你网站的哪个页面 ,是否访问成功。对于专业从事搜索引擎优化工作者而言,网站日志可以记录各搜索引擎蜘蛛机器人爬行网站的详细情况,例如:哪个IP的百 度蜘蛛机器人在哪天访问了网站多少次,访问了哪些页面,以及访问页面时返回的HTTP状态码。

浦东SEO-网站日志掌握蜘蛛的动向
 
  常见的蜘蛛名称:
 
  Baiduspider:百度蜘蛛
 
  Baiduspider-Image:百度图片蜘蛛
 
  Googlebot:谷歌机器人
 
  Googlebot-Image:谷歌图片机器人
 
  360Spider:360蜘蛛
 
  sogou spider:搜狗蜘蛛
 

  什么是网站日志:https://baike.baidu.com/item/%E7%BD%91%E7%AB%99%E6%97%A5%E5%BF%97/8933494?fr=aladdin

 
  简单理解:网站日志记录了网站与用户之间的交互信息,通过相应状态码标识在文档里,它包括服务器的一些错误请求记录,你可以清晰的查看:用户访问时间,访问的页面,来访的IP,搜索引擎抓取的页面,以及一些错误的请求。

浦东SEO-网站日志掌握蜘蛛的动向
 

  网站日志的作用

 
  1、通过网站日志可以了解蜘蛛对网站的基本爬取情况,可以知道蜘蛛的爬取轨迹和爬取量。
 
  2、网站的更新频率也和网站日志中蜘蛛抓取的频率有关,一般来说更新频率越高,蜘蛛的抓取频率越高,而我们网站的更新不仅仅只是新内容的添加同时还有我们的微调操作。
 
  3、我们可以根据网站日志的反应情况,对我们的空间的某些事情和问题提前进行预警,因为服务器如果出问题的话在网站日志中会第一时间反映出来,要知道服务器的稳定速度和打开速度两者都会直接影响我们的网站。
 
  4、通过网站日志我们可以知道网站的那些页面是很受蜘蛛欢迎的,而哪些页面是蜘蛛连碰都不去碰的,同时我们还能发现有一些蜘蛛由于是过度爬取对我们的服务器资源损耗是很大的,我们要进行屏蔽工作。
 

  如何下载网站日志:https://jingyan.baidu.com/article/597a064365516c312b5243cc.html

 
  1、首先我们的空间要支持网站日志下载,这一点是很重要的,在购买空间时候需事先了解下是否支持日志下载,因为有的服务商是不提供这项服务的,如果支持的话空间后台一般都有日志WebLog日志下载这个功能把它下载到根目录在用FTP传到本地就可以,服务器的话可以设置将日志文件下载到指定路径。
 
  2、这里有个很重要的问题,网站日志强烈建议设置成每小时生成一次,小型的企业站和页面内容较少的网站可以设置成一天,它默认是一天,如果内容多或者大型站设置成一天生成一次,那么一天只生成一个文件,这个文件会相当的大,我们有时电脑打开是会造成死机,设置的话找空间商协调设置即可。

浦东SEO-网站日志掌握蜘蛛的动向
 

  网站日志的分析:https://jingyan.baidu.com/article/59703552de7eaf8fc00740c7.html

 
  1、网站日志中数据量过大,所以我们一般需要借助网站日志分析工具来查看。常用的日志分析工具有:光年日志分析工具、web log exploer、WPS表格等
 
  117.26.203.167 - - [02/May/2011:01:57:44 -0700] "GET/index.php HTTP/1.1" 500 19967 "-" "Mozilla/4.0 (compatible; MSIE 8.0;Windows NT 5.1; Trident/4.0; AskTbCS-ST/5.11.3.15590; .NET CLR 2.0.50727; Alexa Toolbar)"
 
  分析:
 
  117.26.203.167访问ip;
 
  02/May/2011:01:57:44 -0700访问日期 -时区;
 
  GET/index.php HTTP/1.1根据HTTP/1.1协议抓取(域名下)/index.php这个页面(GET表示服务器动作);
 
  500服务器响应状态码;
 
  服务器响应状态码通常状态码有以下几种:200,301,302,304,404,500等。200代表用户成功的获取到了所请求的文件,如果是搜索引擎,则证明蜘蛛在这次爬行中顺利的发现了一些新的内容。而301则代表用户所访问的某个页面url已经做了301重定向(永久性)处理,302则是暂时性重定向。404则代表所访问的页面已经不存在了,或者说访问的url根本就是个错误的。500则是服务器的错误。
 
  19967表示抓取了19967个字节;
 
  Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 5.1; Trident/4.0; AskTbCS-ST/5.11.3.15590; .NET CLR 2.0.50727; Alexa Toolbar表示访问者使用火狐浏览器及Alexa Toolbar等访问端信息;
 
  2、如果你的日志里格式不是如此,则代表日志格式设置不同。
 
  3、很多日志里可以看到 200 0 0和200 0 64则都代表正常抓取。
 
  4、抓取频率是通过查看每日的日志里百度蜘蛛抓取次数来获知。抓取频率并没有一个规范的时间表或频率数字,我们一般通过多日的日志对比来判断,当然,我们希望百度蜘蛛每日抓取的次数越多越好。
 
  5、有时候我们的路径不统一出现带斜杠和不带斜杠的问题,蜘蛛会自动识别为301跳转到带斜杠的页面,这里我们就发现了搜索引擎是可以判断我们的目录的,所以我们要对我们的目录进行统一。
 
  6、我们分析日志分析时间长了,我们能够看出蜘蛛的抓取规律,同一目录下面的单个文件的抓取频率间隔和不同目录的抓取频率间隔都可以看出来,这些抓取频率间隔时间是蜘蛛根据网站权重和网站更新频率来自动确定的。
 
  7、蜘蛛对于我们的页面的抓取是分等级的,是根据权重依次递减的,一般顺序为首页、目录页、内页。

浦东SEO-网站日志掌握蜘蛛的动向
 

  网站日志对SEO的影响

 
  1、404状态码
 
  有利于及时发现死链接,为网站结构设计提供宝贵意见,有利于内链的优化。值得注意的是你需要重点关注图片的404状态码,百度图片推广所来的流量也不容小觑。
 
  2、302状态码
 
  在日常SEO工作中,蝙蝠侠IT的建议,既然是跳转,我们尽量都使用301重定向的跳转,简单理解就是完全跳转与传递权重,而302是临时跳转,并不友好。
 
  而我们经常讨论的域名劫持,往往也都是通过302跳转完成的。
 
  3、304状态码
 
  早几年,我们经常喜欢讨论百度快照为什么不更新,其中304状态码就是一个初期的预警,它代表蜘蛛二次抓取的内容在服务器并没有改变。
 
  通常我们尽量避免首页、列表页、TAG页,长期产生这个状态码,它一定程度上反应网站更新缓慢,但这并不代表网站质量低下,所以对这个状态码要一分为二。

上一篇:没有了