# from HTMLParser import HTMLParser
from html.parser import HTMLParser # 将字符串格式的html文本转成html

class MyHTMLParser(HTMLParser):
    def __init__(self):
        HTMLParser.__init__(self)
        self.data = []
    def handle_startendtag(self, tag, attrs):
        pass
    def handle_endtag(self, tag):
        pass
    def handle_data(self, data):
        if data.count('\n') == 0:
            self.data.append(data)

if __name__ == '__main__':
    parser = MyHTMLParser()
    for i in conn(): # 获取文章
        content = i[0]
        parser.feed(content)
        parser.data # 通过这个可以获取去标签后的内容列表

参考:https://www.cnblogs.com/AlwinXu/p/5492033.html

相关文章:

  • 2021-11-08
  • 2021-09-03
  • 2022-12-23
  • 2022-12-23
  • 2021-05-19
  • 2022-12-23
  • 2022-12-23
  • 2022-02-26
猜你喜欢
  • 2022-12-23
  • 2021-06-17
  • 2021-08-23
  • 2022-12-23
  • 2022-12-23
  • 2022-12-23
相关资源
相似解决方案