【问题标题】:Algorithm to calculate how much of text A is in text B?计算文本B中有多少文本A的算法?
【发布时间】:2013-04-27 15:06:18
【问题描述】:

我需要计算一个文本块 (A) 在另一个文本块 (B) 中有多少。像 soundex 这样的简单算法并没有为我提供很好的结果,因为文本 B 在其中包含不/不应该出现在文本 A 中的其他文本,这让我的数字大吃一惊。我需要确保一定比例的AB 内,并忽略对B 的添加。

我首先想到的一个简单算法可能适用于我的情况,将A 拆分为句子,记下句子的总数,然后搜索B 以获取每个句子的实例以提供百分比。虽然这应该可行,但感觉很hacky,而且我敢肯定,比我更聪明的人设计了一种算法,可以根据类似的原理提供更好的计算。

【问题讨论】:

标签: algorithm text language-agnostic text-comparison


【解决方案1】:

Longest Common Subsequence 看起来最适合您的目的。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-08-29
    • 2021-02-10
    • 2011-12-15
    • 2015-12-05
    • 2023-02-21
    相关资源
    最近更新 更多