【发布时间】:2014-10-22 07:32:51
【问题描述】:
我试图从像这样的大字符串中提取少量信息
[[["좋은","good","joh-eun",""]],[["adjective",[["좋은",["good","nice","pretty","admirable","canny","tenacious"],,0.38553435]],"good",4],["adverb",["훌륭하게",["wonderfully","good","nicely","beautifully","fine","finely"],,0.00029145498],"good",4]]]
我想像这样提取字符串
좋은 - good
좋은 - good,nice,pretty,admirable,canny,tenacious (basically adjectives)
훌륭하게 - wonderfully,good,nicely,beautifully,fine,finely (adverbs)
请帮助我尝试使用 sed 和管道进行切割
cut --delimiter='"' -f 1-2 and then use sed 's/\[\[\[\"//'
这给了我第一个韩语 좋은 结果,我无法扩展它以获得所需的结果! 如果有其他更好的方法可以实现这一点,请提出建议。 提前致谢。
【问题讨论】:
-
这个例子是你真正的输入吗? [] 的格式似乎不连贯......
-
你能更准确地区分你想要“提取”的内容和想要丢弃的内容吗? (计算机(或我们)不能用“基本上”做任何事情)。如果你不能 - 如果你想包含所有副词和/或形容词,那么我们需要考虑基于字典的解决方案
-
@Tensibai - 它的实际输入的简短版本..我猜错过了括号,一旦我可以访问计算机就会编辑(现在在手机上)
-
@drewmoore - 我想从该特定输入中取出动词、名词等及其韩语单词。
-
我的错,一旦格式化梨是正确的,我一开始确实错过了一部分。我是否正确地认为形容词和反词并不总是如此,它们是可选的? (不知道如何用正则表达式处理它,但@avinash-raj 是我所知道的最好的正则表达式编写器;)如果它可以处理,他可以编写它;)