想成为一个全栈工程师:做爬虫是你达到全栈的最好选择,爬虫嘛,往复杂了无非就是多机器多节点超大规模数据的分布式抓取,或者超级难防的反爬虫机制。验证码需要图像识别,高深的来点机器学习,学习爬虫使你成为一个全栈工程师。 1.动态页面:直接上selenium+phantomJS或者自己分析js,有些网站用ajax也比较容易找到 2.封IP:简单点买点代理IP,免费的代理IP太不稳定了,或者上tor,洋葱路由每次访问网站的IP都不一样,非常适合爬虫,但在天朝用这个速度实在是太慢了。 3.有验证码的:识别喽,简单的就去花钱请人打码,极验验证可以看我之前的文章 4.headers:这个不用说,但是还可以换成百度,谷歌这些搜索引擎的headers。百度:User-agent: Baiduspider等等 5.flash:有些变态的网站把数据用Flash的方式展示,这就需要分析AMF协议了,对Flash控件反编译,分析出秘钥 以上仅是一点拙见,欢迎大家有什么的在评论留言。 欢迎大家关注我的头条号”难得python”,多多点赞。 |
| 本文出处: http://www.toutiao.com/a6391733394439749889/ |
|
声明:文章版权归原作者所有 部分文章转自互联网 如有侵权请联系
[邮箱地址] 删除
|