【发布时间】:2014-02-27 11:20:17
【问题描述】:
我必须过滤包含 Python 中的子字符串的 jsonpath 表达式中的 URL 列表,我尝试了以下但无法获得所需的结果。
我提到了http://goessner.net/articles/JsonPath/和http://mikelev.in/2012/08/implementing-jsonpath-in-python-with-examples/
以下是我尝试过的所有方法的详细信息:
我的 json 响应:
{
"127.0.0.1": {
"URLs": [
"http://www.test.ca/",
"http://b.scorecardresearch.com/p?ns__t=1387392184071&ns__c=ISO-8859-1&c1=3&c3=_es_7948950&c4=56568219&c5=105139691&c6=&c10=1&c11=1016510&c13=728x90&c16=dfa&c2=14397547&ax_iframe=2&ns_ce_mod=vce_st&ns__p=1387391507295&ax_cid=14397547&ax_bl=0&ax_blt=1228&ns_ad_event=show&ns_ad_id=DCF277937840&ns_ad_sz=728x90",
"http://cdn.media.ca/a/mediative/sites/test_en.js",
"http://pt200233.unica.com/ntpage.gif?js=1&ts=1387392184554.791&lc=http%3A%2F%2Fwww.test.ca%2F%3Fni_title%3D%2Fhome%2Fhomepage&rf=http%3A%2F%2Fwww.test.ca%2F&rs=1680x1050&cd=32&ln=en&tz=GMT%20-05%3A00&jv=1&ck=UnicaID%3DwQVZatfvXZ5-YZ0yaPj&m.pn=homepage&m.mlc=%2Fhome&m.cv_c13=ctest-new&m.cv_c14=en&m.utv=ut.ctest.2.2.131022.74&m.host=www.test.ca&m.page=%2Fhome%2Fhomepage&m.mlc0=home&ets=1387392184559.194&site=test",
]
}
}
上面的Json响应被解析为:
parsed_input = json.loads(urllib.urlopen('<URL for the above JSON response>').read())
为了从 JSON 响应中获取所有 URL 的列表,我尝试了以下方法,效果很好:
'\n'.join(jsonpath.jsonpath(parsed_input, '$..URLs[*]'))
输出:
http://www.test.ca/
http://b.scorecardresearch.com/p?ns__t=1387392184071&ns__c=ISO-8859-1&c1=3&c3=_es_7948950&c4=56568219&c5=105139691&c6=&c10=1&c11=1016510&c13=728x90&c16=dfa&c2=14397547&ax_iframe=2&ns_ce_mod=vce_st&ns__p=1387391507295&ax_cid=14397547&ax_bl=0&ax_blt=1228&ns_ad_event=show&ns_ad_id=DCF277937840&ns_ad_sz=728x90"
http://cdn.media.ca/a/mediative/sites/test_en.js"
http://pt200233.unica.com/ntpage.gif?js=1&ts=1387392184554.791&lc=http%3A%2F%2Fwww.test.ca%2F%3Fni_title%3D%2Fhome%2Fhomepage&rf=http%3A%2F%2Fwww.test.ca%2F&rs=1680x1050&cd=32&ln=en&tz=GMT%20-05%3A00&jv=1&ck=UnicaID%3DwQVZatfvXZ5-YZ0yaPj&m.pn=homepage&m.mlc=%2Fhome&m.cv_c13=ctest-new&m.cv_c14=en&m.host=www.test.ca&m.page=%2Fhome%2Fhomepage&m.mlc0=home&ets=1387392184559.194&site=test
接下来,我将只检索那些包含“unica”一词的 URL。
我已尝试以下所有方法,但收到 TypeError,
我错过了什么?:
'\n'.join(jsonpath.jsonpath(parsed_input, '$..URLs[?(/unica/)]'))
'\n'.join(jsonpath.jsonpath(parsed_input, '$..URLs[?(@(unica))]'))
'\n'.join(jsonpath.jsonpath(parsed_input, '$..URLs[?(@.(*.unica.*))]'))
'\n'.join(jsonpath.jsonpath(parsed_input, '$.*.URLs[?(unica)]'))
'\n'.join(jsonpath.jsonpath(parsed_input, '$.*.URLs[?:unica]'))
谢谢,
山姆
【问题讨论】:
-
[x for x in '\n'.join(jsonpath.jsonpath(parsed_input, '$..URLs[*]')) if 'unica' in x] -
嘿 Nehal,它打印 [],这里有什么遗漏吗?