【问题标题】:utf-8 string getting truncated in MySQL table using Perl/DBI使用 Perl/DBI 在 MySQL 表中截断 utf-8 字符串
【发布时间】:2011-10-28 23:37:43
【问题描述】:

我正在尝试使用 perl/DBI 将 utf-8 字符串写入 MySQL 表。由于某种原因,字符串在第一个非 ascii 字符处被截断。

例如,如果我设置了下表:

CREATE DATABASE testdb DEFAULT CHARSET=utf8;
CREATE TABLE testdb.testtable (textval CHAR(30)) DEFAULT CHARSET=utf8;

然后运行下面的perl代码:

#!/usr/bin/perl
use strict;
use DBI;
my $dbh = DBI->connect('DBI:mysql:host=localhost;database=testdb', 'testuser', 'somepassword', {mysql_enable_utf8 => 1}) or die $DBI::errstr;
$dbh->do('SET NAMES utf8');
$dbh->do("INSERT INTO testtable (textval) VALUES ('the N\xFCrburgring')");

它实际上写的是“N”。 (当它应该写“纽伯格林”时)

查看 MySQL 查询日志,我看到:

271 Query INSERT INTO testtable (textval) VALUES ('the Nürburgring')

所以字符串完好无损地到达数据库服务器。

如果我直接在 MySQL 控制台中输入相同的查询:

INSERT INTO testtable (textval) VALUES ('the Nürburgring');

整个字符串写入正确。知道我做错了什么吗?

【问题讨论】:

  • 如果你把脚本中的\xFC改成ü会写什么?
  • 如果我在 perl 代码中使用文字 ü,它的作用完全相同。

标签: mysql perl utf-8 dbi


【解决方案1】:

你设置了属性mysql_enable_utf8,所以你向接口承诺你会给它一个Perl字符串。但是,这是 Latin1 编码的八位字节缓冲区。

use Devel::Peek qw(Dump);
Dump "the N\xfcrburgring";
#  FLAGS = (POK,READONLY,pPOK)
#  PV = 0x208e4f0 "the N\374rburgring"\0

修复很简单。要么在没有\x 转义的情况下标注文字字符,使用utf8 pragma 告诉Perl 你的源代码是UTF-8 并用你的编辑器以UTF-8 编码保存源代码......

use utf8;
use Devel::Peek qw(Dump);
Dump "the Nürburgring";
#  FLAGS = (POK,READONLY,pPOK,UTF8)
#  PV = 0x20999f0 "the N\303\274rburgring"\0 [UTF8 "the N\x{fc}rburgring"]

... 或将八位字节解码为字符串。大多数时候,您处理的不是文字,而是来自外部的数据,所以learn about the whole topic of encoding 更好。

use Encode qw(decode);
use Devel::Peek qw(Dump);
Dump decode 'Latin1', "the N\xfcrburgring";
#  FLAGS = (TEMP,POK,pPOK,UTF8)
#  PV = 0x208f6b0 "the N\303\274rburgring"\0 [UTF8 "the N\x{fc}rburgring"]

【讨论】:

  • 感谢您的解释。我想我现在明白了。我将插入行更改为$dbh->do(decode('Latin1', "INSERT INTO testtable (textval) VALUES ('the N\xFCrburgring')"));,现在它可以正常工作了。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2013-06-17
  • 1970-01-01
  • 1970-01-01
  • 2020-03-31
  • 2020-11-29
相关资源
最近更新 更多