【发布时间】:2023-03-06 05:36:01
【问题描述】:
我正在尝试解析 YouTube 对歌曲的描述以编译成 .csv
目前我可以隔离时间码,但尝试隔离歌曲和艺术家被证明更棘手。
首先,我抓住了白色空间
# catches whitespace
pattern = re.compile(r'\s+')
其次,时间码(让字符串更容易处理)
# catches timecodes
pattern1 = re.compile(r'[\d\.-]+:[\d.-]+:[\d\.-]+')
然后我删除并删除。
然后我尝试捕获 \n 之间的所有字符串,因为这就是曲目列表的格式
songBeforeDash = re.search(r'^([\\n][a-zA-Z0-9]*-[a-zA-Z0-9]*[\\n]*)+$', description)
格式如下\n[string]-[string]\n
使用这个 excellent visualiser ,我已经能够对其进行调整,以便捕获第一个结果,但是任何后续结果都不匹配。 这是在第一个结果上停下来而不追赶其他结果的情况吗?
这是我试图捕捉的样本
\nmiddleschoolxAso-Cypress\nShopan-Woodnot\nchromonicci-Memories.\nYasper-MoveTogether\nFenickxDelayde-Longwayhome\nauv-Rockaway5pm\nsadtoi-Aires\nGMillsxKyleMcEvoy-Haze\nRuckP-CoffeeBreak\n
【问题讨论】:
-
部分示例字符串不以\n开头和结尾
-
抱歉!工作妨碍了我,我忘了回来查看。接受了最合适的答案。谢谢大家的帮助,我的程序已经取得了进展,能够解析我需要的内容:)