【发布时间】:2011-12-10 23:12:30
【问题描述】:
我想制作一个程序来检索一些信息作为 url。 例如,我给出下面的网址,来自 librarything
如何检索“标签”选项卡下的所有单词,例如
Black Library 幻想 Thanquol & Boneripper Thanquol 和 Bone Ripper 战锤?
我正在考虑使用 java,并设计一个数据挖掘包装器,但我不知道如何开始。谁能给我一些建议?
编辑: 你给了我很好的帮助,但我想问点别的。 对于每个标签,当我们按下“数字”按钮时,我们可以看到每个标签被使用了多少次。我怎样才能找回那个号码呢?
【问题讨论】:
-
如果您要使用 HTML,我建议您使用 Python 或 Perl。当我制作与您的示例类似的程序时,我对 Python 有很好的体验,但目前无法真正分享任何内容。有专门为parsing HTML in Python制作的库,也可以查看regex和urllib。
-
@Griffin:这似乎是一个基于 DOM 的解析器,只会导致丑陋的样板代码。此外,使用正则表达式解析 HTML 是普通的 insane.
-
@BalusC 我自己没有使用过 HTML 解析器,使用正则表达式后,我被重定向到 Freenode 上 Python 频道上的那个库。对此似乎众说纷纭,有人说可以,有人说不行。谢谢你的链接,我去看看。
标签: java wrapper data-mining information-retrieval