【发布时间】:2018-01-24 06:20:12
【问题描述】:
您好,我正在开发带有 Attention 的编码器-解码器模型,该模型可以预测给定事实关系的 WTO 小组报告,以 Text_Inputs 形式给出。
事实关系的例句如下:
sample_sentence = "1995 年 1 月 23 日,美国收到委内瑞拉的请求,要求根据 1994 年关税及贸易总协定(“总协定”)第 XXII:1 条,该协定第 14.1 条举行磋商关于技术性贸易壁垒(“TBT 协议”)和《关于解决争端的规则和程序的谅解》(“DSU”)第 4 条,关于环境保护局于 1993 年 12 月 15 日发布的规则,题为“燃料和燃料添加剂的法规——新配方汽油和常规汽油的标准”(WT/DS2/1)。委内瑞拉和美国之间的磋商于 1995 年 2 月 24 日进行。因为它们没有产生令人满意的解决方案就此事而言,委内瑞拉在 1995 年 3 月 25 日的来文中要求争端解决机构(“DSB”)成立一个小组,根据总协定第 XXIII:2 条和 DSU 第 6 条审查该事项( WT/DS2/2)。1995 年 4 月 10 日,第e DSB 根据委内瑞拉的要求成立了专家组。 1995 年 4 月 28 日,争议各方同意专家组应有标准职权范围(DSU,第 7 条),并同意专家组的组成如下"
我正在尝试使用来自 google 的 Word2Vec 并将每个单词编码为 300dim 单词向量,但是,像数字 23 似乎未包含在 Word2Vec VocaSets 中。
解决这个问题的方法是什么?
1) 使用另一个词嵌入,例如 Glovec?
2) 或者其他任何其他建议?
提前感谢您的帮助
- 编辑)
我认为要成功完成这项任务,我认为首先我必须在实际训练之前了解当前的 NMT 应用程序是如何处理命名实体识别问题的。
任何暗示性的文献?
【问题讨论】:
标签: word2vec encoder attention-model