【问题标题】:Word segmentation using dynamic programming使用动态规划进行分词
【发布时间】:2014-04-07 07:15:25
【问题描述】:

所以首先我对 Python 很陌生,所以如果我做了一些糟糕的事情,我会在这篇文章的开头说声抱歉。我被分配了这个问题:

我们想为以下问题设计一个动态规划解决方案:有一个字符串可能是一个删除所有空格的单词序列,我们想找到一种方法(如果有的话)插入分隔有效英文单词的空格。例如,青年事件可能来自“the you the vent”、“the Youth event”或“they out he vent”。如果输入是eaglehaslande,那么就没有这种方法。您的任务是以两种不同的方式实现动态规划解决方案:

  • 自下而上的迭代版本
  • 递归记忆版本

假设原始单词序列没有其他标点符号(如句点)、大写字母和专有名称 - 所有单词都将在提供给您的字典文件中可用。

所以我有两个主要问题:

  1. 我知道这可以而且应该在 O(N^2) 内完成,我认为我的不是
  2. 查找表并未添加所有看起来可以降低时间复杂度的单词

我想要什么:

  1. 任何类型的输入(更好的方法,您在代码中看到的错误,如何使查找表正常工作,如何使用布尔值表构建有效单词序列)
  2. 关于如何处理递归版本的一些想法,尽管我觉得一旦我能够解决迭代解决方案,我将能够从中设计出递归版本。

一如既往地感谢任何人为此付出的任何时间和努力,我们始终不胜感激。

这是我的尝试:

#dictionary function returns True if word is found in dictionary false otherwise
def dictW(s):
    diction = open("diction10k.txt",'r') 
    for x in diction:
        x = x.strip("\n \r")
        if s == x:
            return True
    return False

def iterativeSplit(s):
    n = len(s)
    i = j = k = 0
    A = [-1] * n
    word = [""] * n
    booly = False
    for i in range(0, n):
        for j in range(0, i+1):
            prefix = s[j:i+1]
            for k in range(0, n):

                if word[k] == prefix:
                    #booly = True
                    A[k] = 1
                    #print "Array below at index k %d and word = %s"%(k,word[k])
                    #print A
            # print prefix, A[i]
            if(((A[i] == -1) or (A[i] == 0))):
                if (dictW(prefix)):
                    A[i] = 1
                    word[i] = prefix
                    #print word[i], i
                else:
                    A[i] = 0
    for i in range(0, n):
        print A[i]

【问题讨论】:

  • 删除 x = x.strip("\n \r") 并将 if s == x 替换为 if s.find(x) != -1 应该可以加快速度。当然,这不会给你完全匹配,例如如果单词是 'hello',就会找到 'hell'。
  • 有趣。这是两个版本的字符串 lukelucklikeslakes 的结果。我的真实 0m15.266s 用户 0m2.858s sys 0m0.031s 你的真实 0m12.906s 用户 0m3.264s sys 0m0.030s
  • 是的。我想直接的字符串比较总是比尝试在另一个字符串中查找字符串序列更快。我假设删除脱衣舞会是有益的。有什么理由需要脱衣舞吗?你能用 10 倍的条目再试一次吗?此外,您可能希望在 for 循环开始之前打开并存储文件中的行,因为您现在重复该操作 ijk 次。

标签: python dynamic-programming text-segmentation


【解决方案1】:

有关如何进行英语分词的另一个真实示例,请查看Python wordsegment modulesource。它有点复杂,因为它使用单词和短语频率表,但它说明了记忆方法。

特别是segment 说明了记忆方法:

def segment(text):
    "Return a list of words that is the best segmenation of `text`."

    memo = dict()

    def search(text, prev='<s>'):
        if text == '':
            return 0.0, []

        def candidates():
            for prefix, suffix in divide(text):
                prefix_score = log10(score(prefix, prev))

                pair = (suffix, prefix)
                if pair not in memo:
                    memo[pair] = search(suffix, prefix)
                suffix_score, suffix_words = memo[pair]

                yield (prefix_score + suffix_score, [prefix] + suffix_words)

        return max(candidates())

    result_score, result_words = search(clean(text))

    return result_words

如果您替换了 score 函数,使其在您的字典中返回“1”,如果不是,则返回“0”,那么您只需列举所有得分为正的候选者作为您的答案。

【讨论】:

    【解决方案2】:

    Here is the solution 在 C++ 中。阅读并理解概念,然后实施。

    这个video对理解DP方法很有帮助。

    我觉得可以提供帮助的另一种方法是Trie 数据结构。这是解决上述问题的更好方法。

    【讨论】:

      猜你喜欢
      • 2012-10-29
      • 1970-01-01
      • 1970-01-01
      • 2010-11-09
      • 2019-04-14
      • 2018-01-21
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多