首页 运维 网络学院 查看内容

常见的反爬虫及应对措施

2017-3-30 11:55 |来自: 互联网 4545 0

摘要: 想成为一个全栈工程师:做爬虫是你达到全栈的最好选择,爬虫嘛,往复杂了无非就是多机器多节点超大规模数据的分布式抓取,或者超级难防的反爬虫机制。验证码需要图像识别,高深的来点机器学习,学习爬虫使你成为一个 ...

想成为一个全栈工程师:做爬虫是你达到全栈的最好选择,爬虫嘛,往复杂了无非就是多机器多节点超大规模数据的分布式抓取,或者超级难防的反爬虫机制。验证码需要图像识别,高深的来点机器学习,学习爬虫使你成为一个全栈工程师。

1.动态页面:

直接上selenium+phantomJS或者自己分析js,有些网站用ajax也比较容易找到

2.封IP:

简单点买点代理IP,免费的代理IP太不稳定了,或者上tor,洋葱路由每次访问网站的IP都不一样,非常适合爬虫,但在天朝用这个速度实在是太慢了。

3.有验证码的:

识别喽,简单的就去花钱请人打码,极验验证可以看我之前的文章

4.headers:

这个不用说,但是还可以换成百度,谷歌这些搜索引擎的headers。百度:User-agent: Baiduspider等等

5.flash:

有些变态的网站把数据用Flash的方式展示,这就需要分析AMF协议了,对Flash控件反编译,分析出秘钥

以上仅是一点拙见,欢迎大家有什么的在评论留言。

欢迎大家关注我的头条号”难得python”,多多点赞。

本文出处: http://www.toutiao.com/a6391733394439749889/
声明:文章版权归原作者所有 部分文章转自互联网 如有侵权请联系 [邮箱地址] 删除

路过

雷人

握手

鲜花

鸡蛋

最新评论

返回顶部