【问题标题】:Word2Vec Doesn't Contain Embedding for Number 23Word2Vec 不包含数字 23 的嵌入
【发布时间】:2018-01-24 06:20:12
【问题描述】:

您好,我正在开发带有 Attention 的编码器-解码器模型,该模型可以预测给定事实关系的 WTO 小组报告,以 Text_Inputs 形式给出。

事实关系的例句如下:

sample_sentence = "1995 年 1 月 23 日,美国收到委内瑞拉的请求,要求根据 1994 年关税及贸易总协定(“总协定”)第 XXII:1 条,该协定第 14.1 条举行磋商关于技术性贸易壁垒(“TBT 协议”)和《关于解决争端的规则和程序的谅解》(“DSU”)第 4 条,关于环境保护局于 1993 年 12 月 15 日发布的规则,题为“燃料和燃料添加剂的法规——新配方汽油和常规汽油的标准”(WT/DS2/1)。委内瑞拉和美国之间的磋商于 1995 年 2 月 24 日进行。因为它们没有产生令人满意的解决方案就此事而言,委内瑞拉在 1995 年 3 月 25 日的来文中要求争端解决机构(“DSB”)成立一个小组,根据总协定第 XXIII:2 条和 DSU 第 6 条审查该事项( WT/DS2/2)。1995 年 4 月 10 日,第e DSB 根据委内瑞拉的要求成立了专家组。 1995 年 4 月 28 日,争议各方同意专家组应有标准职权范围(DSU,第 7 条),并同意专家组的组成如下"

我正在尝试使用来自 google 的 Word2Vec 并将每个单词编码为 300dim 单词向量,但是,像数字 23 似乎未包含在 Word2Vec VocaSets 中。

解决这个问题的方法是什么?

1) 使用另一个词嵌入,例如 Glovec?

2) 或者其他任何其他建议?

提前感谢您的帮助

  • 编辑)

我认为要成功完成这项任务,我认为首先我必须在实际训练之前了解当前的 NMT 应用程序是如何处理命名实体识别问题的。

任何暗示性的文献?

【问题讨论】:

    标签: word2vec encoder attention-model


    【解决方案1】:

    Word2Vec 只学习它经常看到的单词。

    也许尝试用文本替换源中的数字,即(“在...的二十分之三”)?

    【讨论】:

    • 我认为要成功完成这项任务,我认为首先我必须在实际训练之前了解当前的 NMT 应用程序如何处理命名实体识别问题。有什么暗示性的文献吗?
    猜你喜欢
    • 1970-01-01
    • 2018-06-09
    • 1970-01-01
    • 1970-01-01
    • 2020-12-26
    • 1970-01-01
    • 2017-01-13
    • 2011-01-27
    • 1970-01-01
    相关资源
    最近更新 更多