python 爬虫学习笔记Day1
- 爬虫的使用场景
-通用爬虫
抓取系统重要组成部分,抓取的是一整张页面数据
-聚焦爬虫
是建立在通用爬虫的基础之上,抓取的是页面特定的局部内容
-增量式爬虫
检测网站中数据更新的情况,只会抓取网站中最新更新出来的数据
- 爬虫的矛与盾
反爬机制
门户网站,可以通过制定相应的策略或者技术手段,防止爬虫程序进行网站数据爬取
反反爬策略
爬虫程序可以通过制定相关的策略或者技术手段,破解门户网站中具备的反爬机制,从而获取门户网站的数据
robots.txt协议(君子协议)
规定了网站中哪些数据可以被爬虫爬取,哪些数据不可以爬取。
评论
问答助学
相关内容
0个评论
全部评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
