【发布时间】:2015-07-28 17:43:02
【问题描述】:
我有一组完整的网址,例如
http://en.wikipedia.org/wiki/Episkopi_Bay
http://en.wikipedia.org/wiki/Monte_Lauro
http://en.wikipedia.org/wiki/Lampedusa
http://en.wikipedia.org/wiki/Himera
http://en.wikipedia.org/wiki/Lago_Cecita
http://en.wikipedia.org/wiki/Aspromonte
我想为这些 URL 找到 wikipedia pageids。我以前使用过 Mediawiki API,但我不知道该怎么做。
我尝试通过获取 lastindexof("/") 的子字符串和最后一个字符,然后查询 API 以获取 pageid,从 URL 中提取页面标题。
http://en.wikipedia.org/wiki/Episkopi_Bay --> Episkopi_Bay
http://en.wikipedia.org/wiki/Monte_Lauro --> Monte_Lauro
http://en.wikipedia.org/wiki/Lampedusa -- > Lampedusa
http://en.wikipedia.org/wiki/Himera --> Himera
http://en.wikipedia.org/wiki/Lago_Cecita --> Lago_Cecita
http://en.wikipedia.org/wiki/Aspromonte --> Aspromonte
但问题是我的一些链接可能是重定向的,因此子字符串可能并不总是页面的标题。
TL;DR:如何从 URL 中找到维基百科页面的 pageid?
【问题讨论】:
标签: mediawiki wikipedia-api mediawiki-api mediawiki-extensions