【问题标题】:How are Structured and Unstructured data distinguished?如何区分结构化和非结构化数据?
【发布时间】:2018-03-18 04:43:51
【问题描述】:

结构化数据和非结构化数据有什么区别? 这种差异如何影响各自的数据挖掘方法?

【问题讨论】:

  • 这个问题很广泛。能举个例子吗?
  • 有一个“结构化学习”的相关概念,它指的是使用“结构化输出空间”进行学习,这是您尝试预测的标签可以分解为子标签的时候。例如,尝试将词性标签分配给句子中的所有单词是结构化的学习任务,因为整个句子的词性分配是一个由单个词的词性标签组成的“巨型标签”

标签: machine-learning statistics


【解决方案1】:

我熟悉的术语是结构化非结构化数据(除了后缀之外与您的Q中的相同)。

我在机器学习中使用这两种类型的数据,但我不知道任何正式的定义;然而,我怀疑几乎所有需要区分这两种数据类型的人都可以毫不费力地区分它们。

结构化数据示例:发送电子邮件的日期/时间;无论是附件,还是电子邮件发件人。非结构化数据:电子邮件正文。

是否有稳定的规则或规则集来区分这两种类型的数据?我认同。首先,如果您可以为数据元素构建一个解析器,那么它就是结构化的。

另一个经验法则是查看数据库中存储数据所需的字段的数据类型。如果它是文本类型——适用于 MySQL、Tintext、Text、Mediumtext 或 Longtext。或者不太可能,VARCHAR(255)--那么该数据可能是未结构化的

这种区别对数据挖掘的主要意义可能在于:结构化数据一旦从文档中提取并解析,就可以用作统计/机器学习模型中的变量。然而,非结构化数据需要进一步解析——也就是说,在你可以将其用于建模之前,你首先必须将其分解为一组结构化数据元素——例如,单词的数量等。

例如,假设您想为一家制作在线 MMORPG 的公司内的服务器组构建一个知识管理 (KM) 系统。您可能会从该组成员之间交换的大量电子邮件开始。

因此,您为此来源创建了一个数据模型,例如,由“发送者”、“接收者”、“发送日期/时间”等字段组成,接收者和发送者是否都是服务器组的员工,是否消息被复制给其他人等。数据库的行是单个电子邮件。

然后您编写一个由一组解析器组成的脚本,以从每封电子邮件中提取每个字段。对于许多字段,这很简单,例如,对于“cc:”字段,您编写一个解析器来扫描电子邮件的该部分并检查它是否为空——如果是,则数据库中的该字段行可能填充“假”(表示没有人被复制),否则为“真”。同样,数据/时间,可能是某种形式,例如:2011 年 3 月 16 日 18:45:39.0319 (UTC)。提取和解析这些数据同样简单;事实上,你的脚本语言几乎肯定有一个模块来做这件事。

但是当您到达电子邮件的正文时,虽然从电子邮件的其余部分中提取并不难,但解析它并不简单。您的数据模型可能包含“NumberOfWords”、“Keywords”等字段,构建解析器来填充这些字段很简单。不过,最有用的信息更难——即,电子邮件对收件人有帮助吗?主题是什么?是否权威?

【讨论】:

  • 有些例子中结构化数据不在文本数据中。
【解决方案2】:

非结构化数据的数据挖掘通常属于“文本挖掘”的范畴。对此有两种不同的看法。一种观点认为,您需要专门的工具来执行自然语言处理 (NLP),因为这是获得语义含义的唯一方法。另一种方法是将非结构化数据转换为词矩阵,然后使用标准统计技术来执行数据挖掘(“词袋”)。在这种情况下,一切都变成了数据,单词的顺序并不重要。

-拉尔夫·温特斯

【讨论】:

    【解决方案3】:

    结构化数据

    结构化数据可以被视为数据的数据库。在结构化数据中,每个特征(字段)都有很好的记录。例如,bank_transaction 数据集或class_attendance 数据集可以被视为结构化数据集。

    ----------------------------------------------------------------------
    |      student_id      |     student_name    |   student_attendance  |
    |----------------------|---------------------|-----------------------|
    |          2123        |         Jo          |           45          |
    |----------------------|---------------------|-----------------------|
    |          2175        |         Mark        |           10          |
    |---------- -----------|---------------------|-----------------------|
    

    非结构化数据

    数据类型 - 例如图像、音频/视频剪辑、文本等 - 被认为计算机难以解释的数据类型称为非结构化数据。在正常情况下,非结构化数据也称为Raw data。计算机很难将此类数据可视化。

    【讨论】:

      猜你喜欢
      • 2015-10-09
      • 1970-01-01
      • 2019-12-10
      • 2011-03-10
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多