python 爬虫学习笔记Day1

  1. 爬虫的使用场景

-通用爬虫

抓取系统重要组成部分,抓取的是一整张页面数据

-聚焦爬虫

是建立在通用爬虫的基础之上,抓取的是页面特定的局部内容

-增量式爬虫

检测网站中数据更新的情况,只会抓取网站中最新更新出来的数据


  1. 爬虫的矛与盾

反爬机制

门户网站,可以通过制定相应的策略或者技术手段,防止爬虫程序进行网站数据爬取

反反爬策略

爬虫程序可以通过制定相关的策略或者技术手段,破解门户网站中具备的反爬机制,从而获取门户网站的数据


robots.txt协议(君子协议)

规定了网站中哪些数据可以被爬虫爬取,哪些数据不可以爬取。

例:movie.douban.com/robots.txt


0个评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
下载 APP