【发布时间】:2017-03-19 02:33:58
【问题描述】:
我正在尝试从特定网站或整个网络中抓取期刊的影响因子。我一直在寻找一些接近但运气不好的东西..
这是我第一次尝试使用 python 进行网络抓取。我试图找到最简单的方法。
我有一份属于期刊的 ISSN 编号列表,我想从 Web 或特定站点检索它们的影响因子值。该列表有超过 50K 的值,因此手动搜索这些值实际上很困难。
输入类型
Index,JOURNALNAME,ISSN,Impact Factor 2015,URL,ABBV,SUBJECT
1,4OR-A Quarterly Journal of Operations Research,1619-4500,,,4OR Q J OPER RES,Management Science
2,Aaohn Journal,0891-0162,,,AAOHN J,
3,Aapg Bulletin,0149-1423,,,AAPG BULL,Engineering
4,AAPS Journal,1550-7416,,,AAPS J,Medicine
5,Aaps Pharmscitech,1530-9932,,,AAPS PHARMSCITECH,
6,Aatcc Review,1532-8813,,,AATCC REV,
7,Abdominal Imaging,0942-8925,,,ABDOM IMAGING,
8,Abhandlungen Aus Dem Mathematischen Seminar Der Universitat Hamburg,0025-5858,,,ABH MATH SEM HAMBURG,
9,Abstract and Applied Analysis,1085-3375,,,ABSTR APPL ANAL,Math
10,Academic Emergency Medicine,1069-6563,,,ACAD EMERG MED,Medicine
需要什么?
上面的输入有一列 ISSN 编号。阅读 ISSN 号码并在researchgate.net 或网络中搜索。然后找到个别网页搜索Impact Factor 2015并检索值,将其放在ISSN号旁边的空白处,并将检索到的URL放在它旁边
这样网络搜索也可以限制为一个站点和一个关键字搜索值..空的可以保留为“NAN”
提前感谢您的建议和帮助
【问题讨论】:
-
请检查 web-scraping 库中的 Python,例如 beautifulsoup 或 scrapy。那里也有大量很棒的教程。我认为熊猫标签有点不适合您的问题。完成抓取后,熊猫将很有用。
-
@su79eu7k 谢谢你的建议,从..开始。但是这样的事情可能实现吗?
-
根据this 博文:“任何可以在网页上查看的内容都可以被抓取。期间。” 现在,在某些情况下可能会非常困难这样做,但是对于像您上面这样的网站,这当然是可行的。
标签: python pandas web-scraping screen-scraping