如何提高spider抓取网站?提高spider抓取策略(1)

阅读 14231  ·  发布日期 2020-08-24 17:25  ·  温州雄霸网络科技有限公司|建站|APP小程序制作|做网站SEO推广优化
【摘要】 SEO网站优化SEOER,每天都要时刻关注百度蜘蛛有没有来抓取网站,抓取了网站哪些内容,没有抓取网站哪些内容,再没有抓取的页面上观察调整网站的问题。想要提高爬虫抓取频率可以从几个方面着手,简单介绍提高spider抓取网站的策略。 提高spider抓取策略有哪些?一、抓取友好性:抓取压力调配降低对网站的访问压力带宽造成访... 【温州小程序开发,温州微信公众号,平阳做网站,平阳网站建设公司,平阳小程序商城制作,昆阳万全做网站,鳌江水头小程序,萧江腾蛟微信公众号,山门顺溪南雁海西南麂凤卧麻步怀溪网络网店服务,政采云网店管理服务】...
SEO网站优化SEOER,每天都要时刻关注百度蜘蛛有没有来抓取网站,抓取了网站哪些内容,没有抓取网站哪些内容,再没有抓取的页面上观察调整网站的问题。
想要提高爬虫抓取频率可以从几个方面着手,简单介绍提高spider抓取网站的策略。
 提高spider抓取策略有哪些?一、抓取友好性:
抓取压力调配降低对网站的访问压力带宽造成访问压力大,会直接影响网站的正常用户访问,为了不影响网站的正常用户访问,又能让spider抓取有价值性的页面。
1、IP压力控制如果一个域名下存在多个IP,或者是多个域名下对应同一个IP,需要根据IP和域名多种条件进行压力调配控制。
也可以在站长平台中使用压力反馈工具,人工调配对网站的抓取压力,这样spider会优先根据站长的要求进行抓取压力控制。
2、站点的抓取速度如果在同一个站点,抓取速度控制有两类:
第一类,一段时间内的抓取频率;第二类,一段时间内的抓取流量。
同一个站点在不同的时间内抓取的速度是不同的,根据站点的类型来设置。
 二、常用抓取返回码示意1、404:
“NOT FOUND”,表示该网页已经失效,通常在库中删除,spider如果发现这条URL是不会抓取的。
2、503:
“Service Unavailable”,表示该网页暂时不能访问。
网页返回503状态码,百度spider不会直接删除这条URL,再访问多次的情况下,网页如果恢复正常,就能正常抓取。
如果继续返回503,才会认为是失效链接,从库中删除。
3、403:
“Forbidden”, 表示该网页目前禁止访问。
如果生成的是新的URL,spider是暂时不会抓取,也是会再访问多次;如果是被收录的URL,不会直接删除,短期内同样反复访问几次。
如果网页正常访问,则正常抓取;如果仍然禁止访问,那么这条URL也会被认为是失效链接,从库中删除。
4、301:
“Moved Permanently”, 表示该网页重定向到新的URL。
如果站点需要更换域名、站点改版的情况下,需要设置301重定向,也可以在站长平台上网站改版工具提交,有效减少网站的流量损失。
阅读本文的人还可以阅读:
网站换域名或网页内容改版对网站有什么影响?网站换域名注意事项如何提高spider抓取网站?提高spider抓取策略(2) [温州网站建设公司-SEO技巧]