你真的了解吗?python爬虫之BeautifulSoup的解析方法

网安智编 厦门萤点网络科技 2026-04-27 00:22 7 0
爬虫之简介 ** Soup提供一些简单的、式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱,通过解析文档为用户提供需要抓取的数据,因为简单,所以不需要多少代码就可以写出一个完整的应用程序。 Soup自动将输入文档转换为编码,输出...

爬虫之简介

** Soup提供一些简单的、式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱,通过解析文档为用户提供需要抓取的数据,因为简单,所以不需要多少代码就可以写出一个完整的应用程序。 Soup自动将输入文档转换为编码,输出文档转换为utf-8编码。你不需要考虑编码方式,除非文档没有指定一个编码方式,这时, Soup就不能自动识别编码方式了。然后,你仅仅需要说明一下原始编码方式就可以了。

Soup已成为和lxml、一样出色的解释器,为用户灵活地提供不同的解析策略或强劲的速度。**

安装创建对象

html = """
The Dormouse's story

The Dormouse's story

Once upon a time there were three little sisters; and their names were , Lacie and Tillie; and they lived at the bottom of a well.

...

"""

Tag

Tag就是html中的一个标签,用就能解析出来Tag的具体内容,具体的格式为soup.name,其中name是html下的标签,具体实例如下:

注意:

这里的格式只能获取这些标签的第一个,后面会讲到获取多个标签的方法。其中对于Tag有两个重要的属性name和attrs,分别表示名字和属性,介绍如下:

get

get方法用于得到标签下的属性值,注意这是一个重要的方法,在许多场合都能用到,比如你要得到

标签下的图像url,那么就可以用soup.img.get('src'),具体解析如下:

    print soup.p.get("class")   #得到第一个p标签下的src属性

得到标签下的文本内容,只有在此标签下没有子标签,或者只有一个子标签的情况下才能返回其中的内容,否则返回的是None具体实例如下:

    print soup.p.string #在上面的一段文本中p标签没有子标签,因此能够正确返回文本的内容
    
    print soup.html.string  #这里得到的就是None,因为这里的html中有很多的子标签

()

可以获得一个标签中的所有文本内容,包括子孙节点的内容,这是最常用的方法

搜索文档树( name , attrs , , text , ** )

是用于搜索节点中所有符合过滤条件的节点

name参数:是Tag的名字,如p,div,title .....

    ps=soup.find_all("p")
    for p in ps:
        print p.get('class')   #得到p标签下的class属性

soup.find_all(["a", "b"])   

参数,就是传入属性和对应的属性值,或者一些其他的表达式

# [
foo!
] data_soup.find_all(attrs={"data-foo": "value"}) #注意这里的atts不仅能够搜索特殊属性,亦可以搜索普通属性 soup.find_all("p",attrs={'class':'title','id':'value'}) #相当与soup.find_all('p',class_='title',id='value')

beautiful soup python教程_python爬虫 beautifulsoup_beautiful soup tag属性

text参数:通过 text 参数可以搜搜文档中的字符串内容.与 name 参数的可选值一样, text 参数接受 字符串 , 正则表达式 , 列表, True

soup.find_all(text="Elsie")
# [u'Elsie']
 
soup.find_all(text=["Tillie", "Elsie", "Lacie"])
# [u'Elsie', u'Lacie', u'Tillie']
 
soup.find_all(text=re.compile("Dormouse"))
[u"The Dormouse's story", u"The Dormouse's story"]

limit参数:() 方法返回全部的搜索结构,如果文档树很大那么搜索会很慢.如果我们不需要全部结果,可以使用 limit 参数限制返回结果的数量.效果与SQL中的limit关键字类似,当搜索到的结果数量达到 limit 的限制时,就停止搜索返回结果.

文档树中有3个tag符合搜索条件,但结果只返回了2个,因为我们限制了返回数量,代码如下:

soup.find_all("a", limit=2)
# [Elsie,
#  Lacie]

参数:调用tag的 () 方法时,会检索当前tag的所有子孙节点,如果只想搜索tag的直接子节点,可以使用参数 =False

find( name , attrs , , text , ** )

它与 () 方法唯一的区别是 () 方法的返回结果是值包含一个元素的列表,而 find() 方法直接返回结果,就是直接返回第一匹配到的元素,不是列表,不用遍历,如soup.find("p").get("class")

css选择器

我们在写 CSS 时,标签名不加任何修饰,类名前加点,id名前加#,在这里我们也可以利用类似的方法来筛选元素,用到的方法是 soup.(),返回类型是 list

通过标签名查找

print soup.select('title') 
#[The Dormouse's story]
print soup.select('a')
#[, Lacie, Tillie]

通过类名查找

print soup.select('.sister')
#[, Lacie, Tillie]

通过id名查找

print soup.select('#link1')
#[]

组合查找

学过css的都知道css选择器,如p #link1是查找p标签下的id属性为link1的标签

print soup.select('p #link1')    #查找p标签中内容为id属性为link1的标签
#[]
print soup.select("head > title")   #直接查找子标签
#[The Dormouse's story]  

属性查找

查找时还可以加入属性元素,属性需要用中括号括起来,注意属性和标签属于同一节点,所以中间不能加空格,否则会无法匹配到。

print soup.select('a[class="sister"]')
#[, Lacie, Tillie]
print soup.select('a[href="http://example.com/elsie"]')
#[]

同样,属性仍然可以与上述查找方式组合,不在同一节点的空格隔开,同一节点的不加空格,代码如下:

print soup.select('p a[href="http://example.com/elsie"]')
#[]

以上的 方法返回的结果都是列表形式,可以遍历形式输出,然后用 () 方法来获取它的内容


soup = BeautifulSoup(html, 'lxml')
print type(soup.select('title'))
print soup.select('title')[0].get_text()
for title in soup.select('title'):
    print title.get_text()