【问题标题】:XMLParser is eating my whitespaceXMLParser 正在吃掉我的空白
【发布时间】:2012-05-30 03:54:16
【问题描述】:

我正在解析的 wiki 页面中丢失了大量空白,我认为这是因为解析器。我的 Groovy 脚本中有这个:

@Grab(group='org.ccil.cowan.tagsoup', module='tagsoup', version='1.2' )
def slurper = new XmlSlurper(new org.ccil.cowan.tagsoup.Parser())
slurper.keepWhitespace = true
inputStream.withStream{ doc = slurper.parse(it) 
println "originalContent = " + doc.'**'.find{ it.@id == 'editpageform' }.'**'.find { it.@name=='originalContent'}.@value
}

inputStream 是从一个 URL GET 请求初始化的,用于编辑一个 confluence wiki 页面。 稍后在我执行此操作的 withInputStream 块中:

println "originalContent = " + doc.'**'.find{ it.@id == 'editpageform' }.'**'.find { it.@name=='originalContent'}.@value

我注意到页面的所有原始内容都被删除了换行符。我最初认为这是服务器端的事情,但是当我在浏览器中创建相同的请求并查看源代码时,我可以在“originalContent”隐藏参数中看到换行符。有没有一种简单的方法可以禁用空白规范化并保留该字段的内容?以上是针对内部 Confluence wiki 页面运行的,但在编辑任意 wiki 页面时很可能会被修改。

以上更新 我添加了对“slurped.keepWhitespace = true”的调用以尝试保留空格,但这仍然不起作用。我认为这种方法适用于元素而不是属性?有没有办法轻松调整底层 Java XMLParser 上的标志?属性值中的空格是否有特定的设置?

【问题讨论】:

  • 当你让你的解析器保持饥饿时会发生这种情况;-)(对不起,我无法抗拒)
  • 所以如果你说 whitespache,你的意思是只有换行符?如果你说换行部分没有被删除,它们只会被转换? Afaik XML 只有换行符的换行符。
  • 我相信这个in the Groovy JIRA有问题
  • 谢谢!我检查了 Jira,确实存在一些关于应该修剪哪些空白以及默认应该是什么的困惑。不幸的是,我正在寻找一个简单的方法来解决我的问题,比如“slurper.keepWhitespace = true”,但即使这样对我也不起作用。 (我试图在属性值中保留空格。)
  • @blackdrag by whitespace 我的意思是换行符。我玩得更多了,看来 Confluence 可能无法转换我在 Groovy 中发布的换行符。

标签: java xml groovy xml-parsing


【解决方案1】:

我首先尝试用我自己的一些融合页面来重现这个,但是输入节点中没有 value 属性和文本内容,所以我创建了自己的测试 html。

现在,我认为 tagoup 解析器也需要配置为保留空格,仅在 slurper 上设置此设置无济于事,因为默认设置是忽略空格。

所以我已经这样做了,顺便说一句,tagsoup feature ignorable-whitespace 已记录在案。 (搜索页面上的空白)

无论如何,它不起作用。从示例中可以看出,属性中的空格被保留,尽管设置了额外的功能,但保留文本空格似乎不起作用。也许这是 tagoup 或 xml slurper 中的错误?

我建议你也仔细看看你的 html,真的存在 value 属性吗?

@Grab(group='org.ccil.cowan.tagsoup', module='tagsoup', version='1.2' )

String html = """\
<html><head><title>test</title></head><body>
<p>
    <form id="editpageform">
        <p>
            <input name="originalContent" value="         ">         

            </input>
        </p>
    </form>
</p>
</body></html>
"""
def inputStream = new ByteArrayInputStream(html.getBytes())

def parser = new org.ccil.cowan.tagsoup.Parser()
parser.setFeature("http://www.ccil.org/~cowan/tagsoup/features/ignorable-whitespace", true)

def slurper = new XmlSlurper(parser)
slurper.keepWhitespace = true

inputStream.withStream{ doc = slurper.parse(it) 
    def parse = { doc.'**'.find{ it.@id == 'editpageform' }.'**'.find { it.@name=='originalContent'} }
    println "originalContent (name)  = '${parse().@name}'"
    println "originalContent (value) = '${parse().@value}'"
    println "originalContent (text)  = '${parse().text()}'"
}

【讨论】:

  • 感谢您详细说明。为了更好地突出我的问题,我在其中包含了您脚本的修改版本。
  • 你是对的。我用谷歌搜索了一些,似乎这根本行不通。虽然属性中允许换行,但它们被规范化了。但这里概述了一个解决方法:stackoverflow.com/questions/2746876/…
【解决方案2】:

似乎换行符没有保留在 value 属性中。见下文:

@Grab(group='org.ccil.cowan.tagsoup', module='tagsoup', version='1.2' )

String html = """\
<html><head><title>test</title></head><body>
<p>
    <form id="editpageform">
        <p>
            <input name="originalContent" value=" 



                    ">         

            </input>
        </p>
    </form>
</p>
</body></html>
"""
def inputStream = new ByteArrayInputStream(html.getBytes())

def parser = new org.ccil.cowan.tagsoup.Parser()
parser.setFeature("http://www.ccil.org/~cowan/tagsoup/features/ignorable-whitespace", true)

def slurper = new XmlSlurper(parser)
slurper.keepWhitespace = true

inputStream.withStream{ doc = slurper.parse(it) 
    def parse = { doc.'**'.find{ it.@id == 'editpageform' }.'**'.find { it.@name=='originalContent'} }
    println "originalContent (name)  = '${parse().@name}'"
    println "originalContent (value) = '${parse().@value}'"
    println "originalContent (text)  = '${parse().text()}'"
    assert parse().@value.toString().contains('\n') : "Should contain a newline"
}

【讨论】:

    猜你喜欢
    • 2020-11-08
    • 2011-04-22
    • 1970-01-01
    • 2011-02-28
    • 2016-08-27
    • 2015-05-05
    • 2017-09-25
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多