在爬虫入门到精通第四讲中,我们了解了如何下载网页,这一节就是如何从下载的网页中获取我们想要的内容 万能匹配html = u"""
<!DOCTYPE html>
<html lang="en">
<head>
<meta charset="UTF-8">
<title>文章的标题</title>
</head>
<body>
<div id="app" class="container">
<h1>h1文字</h1>
<label for="input">Input</label>
<textarea id="input" rows="10" class="form-control">
</body>
</html>
"""我们要获取的html 如上所示, 假如我们要获取 文章的标题 这几个文字,那么我们应该怎么做呢? 我们只要能定位到它,也就能获取到它 那么,如何定位到它呢? 很简单,根据它两边的内容. 我们很简单的能发现 它 左边是<title> ,右边是</title> 所以,我们如何找到 文章的标题 这几个文字呢,只要左边是 下面用程序写出来
可以看到我们正确匹配到了 文章的标题 , 我们首先来看 我们可以发现这就是我们上面讲的,左边是
最后
正则表达式语法(声明我们要匹配的字符串是什么格式的)图片来自 博客园
re中所有的flags解释
最后再来一个案例,还是上面的html,我们需要匹配的内容是h1文字代码如下
本文使用notebook编写完成, 全文在github上 总结看完本篇文章后,你应该要: 学会最通用的一种正则表达式 re.findall('左右的字符串(.*?)右边的字符串',等待匹配的字符串,flags)大家想深入了解正则表达式的话 请 先看这一篇 正则表达式30分钟入门教程 再看这一篇 Regular expression operations 最后的最后,收藏的大哥们,能帮忙点个赞么~ |
|
声明:文章版权归原作者所有 部分文章转自互联网 如有侵权请联系
[邮箱地址] 删除
|