【发布时间】:2023-03-21 13:51:01
【问题描述】:
我正在使用 PHP Simple HTML DOM Parser http://simplehtmldom.sourceforge.net/ 从其他域获取页面标题、元描述和元标记等数据,然后将其插入数据库。
但我在编码方面遇到了一些问题。问题是我没有从那些不是英语的网站获得正确的字符。
下面是代码:
<?php
require 'init.php';
$curl = new curl();
$html = new simple_html_dom();
$page = $_GET['page'];
$curl_output = $curl->getPage($page);
$html->load($curl_output['content']);
$meta_title = $html->find('title', 0)->innertext;
print $meta_title . "<hr />";
// print $html->plaintext . "<hr />";
?>
facebook.compage 的输出
Welcome to Facebook — Log in, sign up or learn more
amazon.cnpage 的输出
亚马逊-网上è´ç‰©å•†åŸŽï¼šè¦ç½‘è´, å°±æ¥Z.cn!
mail.rupage 的输出
Mail.Ru: почта, поиÑк в интернете, новоÑти, игры, развлечениÑ
所以,字符没有被正确编码。
谁能帮我解决这个问题,以便我可以将正确的数据添加到我的数据库中。
【问题讨论】:
-
如果您在浏览器中将“查看”>“编码”下的编码切换为其他内容会怎样?
-
如果我将浏览器编码切换为 UTF-8,它可以工作。
标签: php mysql dom curl simple-html-dom