【发布时间】:2012-11-06 05:00:57
【问题描述】:
基本上 - 我想计算各种术语的“接近度”。 我所说的“接近度”具体指的是它们之间的空格/字符/单词的数量。
例子:
术语 = 字 1 / 字 2 块 = "blah Word1 blah blah blah blah blah Word2 blah" 接近度 = Word1-Word2:5 脚本会看到 2 个术语,找到它们,然后根据它们之间的单词查看距离。
更高级的版本是检查语义结构 - 并确定这些术语是否出现在相同的语义元素、同级或父级等中。 因此,术语的邻近发现可以在同一段落内,或在连续段落中,或在同一“父”(标题)下,但以其他方式分开等。
进一步 - 在以后引入诸如词干/关系/发音之类的东西也可能很有用。
.
我浏览了网络(谷歌,这里,php 论坛,php 脚本站点)。 没有看到类似的东西。 我可以在一些类似(有限)的网站上看到工具——通常是基于 SEO 的工具。 我希望能够将其应用于一般的“文本”......因为我可以将其应用于上传的 word/txt 文件等。
我没有看到任何真实的例子——所以我只能假设编写它是一件小事。
问题是 - 我该怎么做? 我将如何处理单词的变体顺序(Word1+Word2 / Word2+Word1)? 我如何处理识别同一元素/结构内部/外部的接近度?
希望有人能提供一些启示/提出一些建议。
【问题讨论】:
-
-dotNetkow- 修订版足够公平 - 但“word”有点通用,也许标志/标签应该设置为“MSWord”或类似的?那 - 或者开始为标签分配“详细”值,这样人们就不会分配被认为不相关的术语
-
我同意 - 我们有一个对 Word 有意义的“msword”标签。我将编辑两个标签上的“wiki”以澄清。
-
谢谢 - 这可能会让人们感到困惑,因为有很多可能的词可以使用,还有很多定义/实现。