【发布时间】:2021-05-11 12:00:42
【问题描述】:
我正在做一个文档摘要 NLP 项目,所以我想从维基百科中提取 Elon Musk 的生物。我试图在维基百科库 (API) 的帮助下提取它,
我首先尝试使用页面标题(即 Elon Musk),但它给了我一个页面错误PageError: Page id "e on musk" does not match any pages. Try another id! 你注意到它显示的页面 id "e on musk" 然后我尝试使用它的页面 id 编号(即 Q317521)它输出我关于一些植物的结果'Matthiola incana'
这是我的代码
import wikipedia
elon = wikipedia.page('Elon Musk').content
elon
# outputs
PageError: Page id "e on musk" does not match any pages. Try another id!
elon = wikipedia.page('Q317521').content
elon
# outputs (shorted)
Matthiola incana is a species of flowering plant in the cabbage family Brassicaceae. Common names include Brompton stock,
我尝试了 Alan turn 不起作用,还尝试了 Albert_Einstein,它显示出奇怪的输出,就像 Elon Musk 一样。
但是,它与 Nikola Tesla、Michio Kaku、Narendra Modi 等人合作,这表明我没有做错。
【问题讨论】:
标签: python-3.x wikipedia text-extraction data-extraction