【发布时间】:2011-07-08 08:34:43
【问题描述】:
我有一个用例,我需要在 Java 中以给定网页的格式呈现未格式化的文本。即文本应自动格式化为带有样式、段落、项目符号等的网页。
正如我首先看到的那样,我将不得不分析一段未格式化的文本以找出段落、项目符号、标题等的候选者。我打算使用 Lucene 分析器/标记器来完成这项任务。有其他选择吗?
第二个问题是将格式化的网页转换为某种模板(例如速度模板),其中包含标题、项目符号等各种实体的占位符。
Java中是否有任何文本分析/模板库可以帮助我做到这一点?最好是开源的。
对于在 Java 中以更好的方式完成此类任务还有其他建议吗?
感谢您的帮助。
【问题讨论】:
-
您是否真的需要在每种情况下使用不同的模板,或者您不能只使用一个模板在解析/拆分后作用于表示文本的模型对象? (所以模板会在页面上循环显示它们,每个页面都会在标题、段落等上循环......)。当然,你真正的问题是分裂。
-
我需要用户能够选择一个网页并将其指定为他的模板。那么他所有的输入文本都应该像那个网页一样格式化。
-
网页是由您的应用程序生成的,还是来自其他应用程序?在第一种情况下,您不能对用户选择的页面(使用虚假文本或 Lorem Ipsum)和使用用户提供的内容生成的页面使用相同的模板吗?在第二种情况下,您如何期望知道页面的哪一部分应该对应于用户生成内容的一部分?
-
网页是在应用程序外部生成的。猜测页面的哪一部分对应哪一部分内容是问题的一部分。
-
所以你的问题是“Lorem Ipsum Hello World 所以这家伙进入酒吧”没有任何标记/结构;和一个随机站点的 URL(比如“thetimes.co.uk/tto/news/");你应该可以猜到应该使用“Lorem Ipsum”作为主标题,“Hello world”作为第二个标题,并且“所以这个人输入进入酒吧”作为文章内容(加上你应该摆脱所有的广告,其他内容等......)?这对我来说听起来像是 2 个人工智能难题,除非你有某种上下文可以帮助......一旦你解决了 NLP,任何模板技术都可以;)
标签: java lucene velocity template-engine text-analysis