【发布时间】:2015-07-19 17:27:52
【问题描述】:
我正在尝试从该网站提取一些信息,即:
比例(处女座 + GA + Shapley):29 pc/arcsec = 0.029 kpc/arcsec = 1.72 kpc/arcmin = 0.10 Mpc/度
但 : 之后的所有内容都取决于 galtype。
我编写了一个使用 beautifulsoup 和 urllib 并返回一些信息的代码,但我正在努力将数据进一步减少到我想要的信息。如何获得我想要的信息?
galname='M82'
a='http://ned.ipac.caltech.edu/cgi-bin/objsearch?objname='+galname+'&extend'+\
'=no&hconst=73&omegam=0.27&omegav=0.73&corr_z=1&out_csys=Equatorial&out_equinox=J2000.0&obj'+\
'_sort=RA+or+Longitude&of=pre_text&zv_breaker=30000.0&list_limit=5&img_stamp=YES'
print a
import urllib
f = urllib.urlopen(a)
from bs4 import BeautifulSoup
soup=BeautifulSoup(f)
soup.find_all(text=re.compile('Virgo')) and soup.find_all(text=re.compile('GA')) and soup.find_all(text=re.compile('Shapley'))
【问题讨论】:
-
不要使用
urllib,这是一个糟糕的API。使用requests,它实际上是标准库,而且是一个漂亮的 API。 -
你想要的输出是什么?
-
有一行写着 'D (Virgo + GA + Shapley) :' 我需要这一行(主要是该行的第一个数字)
标签: python beautifulsoup urllib