【发布时间】:2020-06-17 13:31:05
【问题描述】:
是否有人尝试使用 BeautifulSoup 或任何其他网络抓取库以及使用正则表达式从风险因素部分(即公司的 EDGAR 10-K 文件中的项目 1A)中提取个体风险因素。
如果你能提供 github 或伪代码,或者至少提供一些帮助,我可以继续前进。
编辑: 10-Ks的一些例子
- https://www.sec.gov/Archives/edgar/data/1350653/000156459018005156/atec-10k_20171231.htm
- https://www.sec.gov/Archives/edgar/data/1591890/000149315218003887/form10-k.htm
- https://www.sec.gov/Archives/edgar/data/750574/000119312518080325/d472492d10k.htm
- https://www.sec.gov/Archives/edgar/data/773840/000093041318000292/c89913_10k.htm
- https://www.sec.gov/Archives/edgar/data/12927/000001292718000007/a201712dec3110k.htm
我给出了不止一个示例,因为 HTML 代码在所有示例中都非常随机,以至于使用单一类型的 RegEx 很困难。
【问题讨论】:
-
你能分享包含Section 1A的10-K填充样本的URL吗?
-
我已经编辑了问题请检查。
-
需要提取哪些信息?将整个 1A 部分作为文本?
-
是的,项目 1A 之间的文本。第 1B 项的风险因素。并且中间的文本被标题(可能是粗体或斜体)分成几部分,所有这些标题都有不同的主题。所以我需要将所有这些部分提取到不同的文本文件中。
标签: html python-3.x regex web-scraping beautifulsoup