【问题标题】:HTML content extraction using Diffbot使用 Diffbot 提取 HTML 内容
【发布时间】:2013-05-07 19:33:44
【问题描述】:

谁能帮我我想从http://www.quranexplorer.com/Hadith/English/Index.html提取html数据。我找到了一个完全可以做到http://diffbot.com/dev/docs/ 的服务,他们通过一个简单的 api 支持数据提取,问题是我有大量需要处理的 url。下面的链接http://test.deen-ul-islam.org/html/h.js

我需要创建一个跟随 url 的脚本,然后使用 api 生成 html 数据的 json 格式(该站点的 api 允许批量请求检查网站文档)

请注意,diffbot 每月只允许 10000 个免费请求,因此我需要一种方法来保存进度并能够从我离开的地方继续。

这是我使用 php 创建的示例。

$token = "dfoidjhku";// example token
$url = "http://www.quranexplorer.com/Hadith/English/Hadith/bukhari/001.001.006.html";
$geturl="http://www.diffbot.com/api/article?tags=1&token=".$token."&url=".$url;
$json = file_get_contents($geturl);
$data = json_decode($json, TRUE);
echo $article_title=$data['title'];
echo $article_author=$data['author'];
echo $article_date=$data['date'];
echo nl2br($article_text=$data['text']);
$article_tags=$data['tags'];
foreach($article_tags as $result) {
    echo $result, '<br>';
}

我不介意工具是 javascript 还是 php,我只需要一种方法来获取 json 格式的 html 数据。

【问题讨论】:

    标签: php html json web-scraping diffbot


    【解决方案1】:

    来自 Diffbot 的约翰在这里。注意:不是开发人员,但足够了解编写 hacky 代码来做简单的事情。

    您有一个链接列表 - 应该可以直接遍历这些链接,并为每个链接调用我们。

    这是一个执行此操作的 Python 脚本:https://gist.github.com/johndavi/5545375

    我在 Sublime Text 中使用快速搜索正则表达式从 JS 文件中提取链接。

    要截断它,只需剪掉一些链接,然后运行它。这需要一段时间,因为我没有使用 Batch API。

    如果您需要改进或改变这一点,最好直接寻找更强大的开发人员。 Diffbot 是一个对开发人员友好的工具。

    【讨论】:

    • 您好,感谢您的代码,唯一的问题是我不知道如何使用 python,您可以创建脚本的 php 版本,
    • 嗨,谢谢 - 很抱歉,我只能做到这一点。我确信一些 PHP 指南会很容易地帮助您复制这一点。祝你好运!
    猜你喜欢
    • 1970-01-01
    • 2015-01-04
    • 2012-01-03
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-04-10
    • 1970-01-01
    相关资源
    最近更新 更多