【发布时间】:2015-06-04 10:41:48
【问题描述】:
我正在处理python scanner library 并遇到了编码。我想,词法扫描器永远不会遇到“关键”字符的问题,因为它们总是出现在带引号的字符串中。 IE。在 unicode 中,额外字符的格式为
0x00000000 - 0x0000007F:
0xxxxxxx
0x00000080 - 0x000007FF:
110xxxxx 10xxxxxx
0x00000800 - 0x0000FFFF:
1110xxxx 10xxxxxx 10xxxxxx
0x00010000 - 0x001FFFFF:
11110xxx 10xxxxxx 10xxxxxx 10xxxxxx
0x00200000 - 0x03FFFFFF:
111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx
0x04000000 - 0x7FFFFFFF:
1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx
,因此代码始终高于 x80:它们不会与 ' 和 " 混合使用。 我不必关心编码。我说的对吗?
参考资料: https://www.python.org/dev/peps/pep-0263/ https://docs.python.org/2/tutorial/interpreter.html#source-code-encoding
【问题讨论】:
标签: python compiler-construction grammar lexical-analysis