python

当前位置:中华考试网 >> python >> python爬虫 >> 文章内容

python爬虫中BeautifulSoup有哪些种类?

来源:中华考试网  [2020年11月11日]  【

  作为python中优秀获取数据的工具,Beautiful Soup种类也比较多。每一个种类对应着不同的知识点,小伙伴们学习的时候要用心记忆。当然知识不是一天就能学会的,就像罗马也不是一天就建成的。勤学勤练才是进阶python大神的唯一路径。接下来就开始我们今天对于Beautiful Soup的学习吧。

  一、Tag

  Tag 是什么?通俗点讲就是 HTML 中的一个个标签,例如

  

  Elsie

  二、NavigableString

  既然我们已经得到了标签的内容,那么问题来了,我们要想获取标签内部的文字怎么办呢?很简单,用 .string 即可,例如

  print soup.p.string

  #The Dormouse's story

  三、BeautifulSoup

  BeautifulSoup 对象表示的是一个文档的全部内容。大部分时候,可以把它当作 Tag 对象,是一个特殊的 Tag,我们可以分别获取它的类型,名称,以及属性来感受一下

  print type(soup.name)

  #

  print soup.name

  # [document]

  print soup.attrs

  #{} 空字典

  四、Comment

  Comment 对象是一个特殊类型的 NavigableString 对象,其实输出的内容仍然不包括注释符号,但是如果不好好处理它,可能会对我们的文本处理造成意想不到的麻烦。 我们找一个带注释的标签

  print soup.a

  print soup.a.string

  print type(soup.a.string)

  以上就是python爬虫中Beautiful Soup的4个种类。

责编:fushihao

上一篇:python3爬虫:常用网络爬虫模块和技术

下一篇: 没有了

  • 会计考试
  • 建筑工程
  • 职业资格
  • 医药考试
  • 外语考试
  • 学历考试