【发布时间】:2013-12-06 09:22:12
【问题描述】:
在页面MediaWiki::DumpFile 上存在以下代码:
use MediaWiki::DumpFile;
$mw = MediaWiki::DumpFile->new;
$sql = $mw->sql($filename);
$sql = $mw->sql(\*FH);
$pages = $mw->pages($filename);
$pages = $mw->pages(\*FH);
$fastpages = $mw->fastpages($filename);
$fastpages = $mw->fastpages(\*FH);
use MediaWiki::DumpFile::Compat;
$pmwd = Parse::MediaWikiDump->new;
我对 Perl 完全陌生,不知道如何使用 $fastpages 从 XML 转储中保存所有 HTML 页面(或文本,没关系)。你能帮助我吗?什么是*FH?
【问题讨论】:
-
在搜索提取库时,我发现了这个出色的页面:medialab.di.unipi.it/wiki/Wikipedia_Extractor。它可以用来代替有问题的方法。
标签: html xml perl cpan wikitext