fix parsing of octal characters in Python regexps (PY-2906)

This commit is contained in:
Dmitry Jemerov
2011-02-21 18:33:00 +01:00
parent bf77b2f216
commit de3f634507
4 changed files with 130 additions and 113 deletions
@@ -21,8 +21,9 @@ public class RegExpLexer extends FlexAdapter {
private static final int COMMENT_MODE = 1 << 14;
public RegExpLexer(boolean xmlSchemaMode, boolean allowDanglingMetacharacters, boolean allowRBracketInCharacterClass) {
super(new _RegExLexer(xmlSchemaMode, allowDanglingMetacharacters, allowRBracketInCharacterClass));
public RegExpLexer(boolean xmlSchemaMode, boolean allowDanglingMetacharacters, boolean allowRBracketInCharacterClass,
boolean allowOctalNoLeadingZero) {
super(new _RegExLexer(xmlSchemaMode, allowDanglingMetacharacters, allowRBracketInCharacterClass, allowOctalNoLeadingZero));
}
public void start(CharSequence buffer, int startOffset, int endOffset, int initialState) {
@@ -36,7 +36,7 @@ public class RegExpParserDefinition implements ParserDefinition {
@NotNull
public Lexer createLexer(Project project) {
return new RegExpLexer(false, false, true);
return new RegExpLexer(false, false, true, false);
}
public PsiParser createParser(Project project) {
@@ -1,4 +1,4 @@
/* The following code was generated by JFlex 1.4.3 on 21.02.11 18:10 */
/* The following code was generated by JFlex 1.4.3 on 21.02.11 18:30 */
/* It's an automatically generated code. Do not modify it. */
package org.intellij.lang.regexp;
@@ -14,7 +14,7 @@ import com.intellij.psi.StringEscapesTokenTypes;
/**
* This class is a scanner generated by
* <a href="http://www.jflex.de/">JFlex</a> 1.4.3
* on 21.02.11 18:10 from the specification file
* on 21.02.11 18:30 from the specification file
* <tt>C:/JetBrains/IDEA/tools/lexer/../../community/RegExpSupport/src/org/intellij/lang/regexp/regexp-lexer.flex</tt>
*/
class _RegExLexer implements FlexLexer {
@@ -137,13 +137,14 @@ class _RegExLexer implements FlexLexer {
"\1\11\1\35\1\36\1\35\1\37\1\40\1\1\1\41"+
"\1\42\1\2\1\43\1\44\1\45\1\46\1\47\1\50"+
"\1\51\1\52\1\53\1\54\1\55\1\56\2\57\1\60"+
"\1\11\1\61\1\62\1\63\1\64\1\65\1\66\1\0"+
"\1\67\1\70\1\71\1\72\1\0\1\73\1\74\1\75"+
"\2\62\2\63\1\76\1\77\1\100\1\101\1\0\1\74"+
"\1\62\1\102\2\63\1\103\1\74\3\63\1\104";
"\1\11\1\61\1\62\1\63\1\50\1\64\1\65\1\66"+
"\1\0\1\67\1\70\1\71\1\72\1\0\1\73\1\74"+
"\1\75\2\62\2\63\1\50\1\76\1\77\1\100\1\101"+
"\1\0\1\74\1\62\1\102\2\63\1\103\1\104\1\74"+
"\3\63\1\105";
private static int [] zzUnpackAction() {
int [] result = new int[103];
int [] result = new int[106];
int offset = 0;
offset = zzUnpackAction(ZZ_ACTION_PACKED_0, offset, result);
return result;
@@ -176,14 +177,15 @@ class _RegExLexer implements FlexLexer {
"\0\u03fc\0\u02fd\0\u042f\0\u0297\0\u0297\0\u02fd\0\u0297\0\u0297"+
"\0\u0462\0\u0495\0\u0297\0\u0297\0\u0297\0\u0297\0\u04c8\0\u0297"+
"\0\u0297\0\u04fb\0\u052e\0\u0297\0\u0297\0\u0297\0\u0297\0\u0297"+
"\0\u0297\0\u0561\0\u0297\0\u0297\0\u0297\0\u0594\0\u05c7\0\u0297"+
"\0\u0297\0\u0297\0\u05fa\0\u0297\0\u0297\0\u0297\0\u062d\0\u0660"+
"\0\u0297\0\u0693\0\u0297\0\u06c6\0\u06f9\0\u072c\0\u075f\0\u0297"+
"\0\u0297\0\u0297\0\u0297\0\u0792\0\u07c5\0\u0297\0\u0297\0\u07f8"+
"\0\u082b\0\u0297\0\u0297\0\u085e\0\u0891\0\u0297\0\u0297";
"\0\u0297\0\u0561\0\u0297\0\u0297\0\u0297\0\u0594\0\u05c7\0\u05fa"+
"\0\u0297\0\u0297\0\u0297\0\u062d\0\u0297\0\u0297\0\u0297\0\u0660"+
"\0\u0693\0\u0297\0\u06c6\0\u0297\0\u06f9\0\u072c\0\u075f\0\u0792"+
"\0\u07c5\0\u0297\0\u0297\0\u0297\0\u0297\0\u07f8\0\u082b\0\u0297"+
"\0\u0297\0\u085e\0\u0891\0\u04fb\0\u0297\0\u0297\0\u08c4\0\u08f7"+
"\0\u0297\0\u0297";
private static int [] zzUnpackRowMap() {
int [] result = new int[103];
int [] result = new int[106];
int offset = 0;
offset = zzUnpackRowMap(ZZ_ROWMAP_PACKED_0, offset, result);
return result;
@@ -225,33 +227,35 @@ class _RegExLexer implements FlexLexer {
"\101\0\1\67\55\0\1\70\51\0\1\71\1\72\1\73"+
"\4\74\1\71\1\74\1\71\1\74\1\75\6\74\2\76"+
"\2\77\2\100\1\101\1\102\1\101\2\103\1\104\1\105"+
"\1\104\1\106\1\107\1\72\1\74\1\104\1\75\4\71"+
"\1\75\7\71\1\75\37\0\1\110\24\0\2\41\37\0"+
"\1\104\1\106\1\107\1\110\1\74\1\104\1\75\4\71"+
"\1\75\7\71\1\75\37\0\1\111\24\0\2\41\37\0"+
"\1\41\4\0\1\41\14\0\2\43\17\0\21\43\1\0"+
"\1\43\1\0\2\43\64\0\1\111\11\0\1\71\1\72"+
"\1\43\1\0\2\43\64\0\1\112\11\0\1\71\1\72"+
"\1\73\4\74\1\71\1\74\1\16\1\74\1\75\6\74"+
"\2\76\2\77\2\100\1\101\1\102\1\101\2\103\1\104"+
"\1\105\1\104\1\106\1\107\1\72\1\74\1\104\1\75"+
"\1\105\1\104\1\106\1\107\1\110\1\74\1\104\1\75"+
"\4\71\1\75\7\71\1\75\22\0\20\61\2\0\1\61"+
"\40\0\20\62\2\0\1\62\22\0\1\112\27\0\1\113"+
"\16\0\2\114\1\115\1\116\1\117\1\120\1\121\2\0"+
"\2\72\37\0\1\72\22\0\1\122\37\0\1\122\20\0"+
"\63\123\1\124\2\125\20\124\2\125\2\124\3\125\3\124"+
"\1\125\1\124\1\125\2\124\1\125\20\124\1\126\2\127"+
"\20\126\2\127\2\126\3\127\3\126\1\127\1\126\1\127"+
"\2\126\1\127\20\126\55\0\1\130\1\0\1\131\60\0"+
"\1\132\1\133\4\0\5\134\1\0\55\134\2\0\1\135"+
"\37\0\1\135\20\0\64\136\2\137\20\136\2\137\2\136"+
"\3\137\3\136\1\137\1\136\1\137\2\136\1\137\20\136"+
"\40\0\20\62\2\0\1\62\22\0\1\113\27\0\1\114"+
"\16\0\2\115\1\116\1\117\1\120\1\121\1\122\2\0"+
"\2\72\37\0\1\72\22\0\1\123\37\0\1\123\20\0"+
"\63\124\1\125\2\126\20\125\2\126\2\125\3\126\3\125"+
"\1\126\1\125\1\126\2\125\1\126\20\125\1\127\2\130"+
"\20\127\2\130\2\127\3\130\3\127\1\130\1\127\1\130"+
"\2\127\1\130\20\127\1\0\1\72\1\131\37\0\1\131"+
"\75\0\1\132\1\0\1\133\60\0\1\134\1\135\4\0"+
"\5\136\1\0\55\136\2\0\1\137\37\0\1\137\20\0"+
"\64\140\2\141\20\140\2\141\2\140\3\141\3\140\1\141"+
"\1\140\1\141\2\140\1\141\20\140\5\134\1\142\55\134"+
"\2\0\1\143\37\0\1\143\20\0\64\144\2\145\20\144"+
"\2\145\2\144\3\145\3\144\1\145\1\144\1\145\2\144"+
"\1\145\20\144\64\146\2\147\20\146\2\147\2\146\3\147"+
"\3\146\1\147\1\146\1\147\2\146\1\147\20\146";
"\1\140\1\141\2\140\1\141\20\140\64\142\2\143\20\142"+
"\2\143\2\142\3\143\3\142\1\143\1\142\1\143\2\142"+
"\1\143\20\142\1\0\1\72\1\144\37\0\1\144\20\0"+
"\5\136\1\145\55\136\2\0\1\146\37\0\1\146\20\0"+
"\64\147\2\150\20\147\2\150\2\147\3\150\3\147\1\150"+
"\1\147\1\150\2\147\1\150\20\147\64\151\2\152\20\151"+
"\2\152\2\151\3\152\3\151\1\152\1\151\1\152\2\151"+
"\1\152\20\151";
private static int [] zzUnpackTrans() {
int [] result = new int[2244];
int [] result = new int[2346];
int offset = 0;
offset = zzUnpackTrans(ZZ_TRANS_PACKED_0, offset, result);
return result;
@@ -295,12 +299,12 @@ class _RegExLexer implements FlexLexer {
"\7\0\2\1\4\0\2\11\1\1\2\11\2\1\12\11"+
"\1\1\1\11\1\1\1\11\1\1\5\11\3\1\2\11"+
"\1\1\2\11\2\1\4\11\1\1\2\11\2\1\6\11"+
"\1\1\3\11\2\1\3\11\1\0\3\11\1\1\1\0"+
"\1\11\1\1\1\11\4\1\4\11\1\0\1\1\2\11"+
"\2\1\2\11\2\1\2\11";
"\1\1\3\11\3\1\3\11\1\0\3\11\1\1\1\0"+
"\1\11\1\1\1\11\5\1\4\11\1\0\1\1\2\11"+
"\3\1\2\11\2\1\2\11";
private static int [] zzUnpackAttribute() {
int [] result = new int[103];
int [] result = new int[106];
int offset = 0;
offset = zzUnpackAttribute(ZZ_ATTRIBUTE_PACKED_0, offset, result);
return result;
@@ -368,12 +372,14 @@ class _RegExLexer implements FlexLexer {
private boolean allowDanglingMetacharacters;
private boolean allowRBracketInCharacterClass;
private boolean allowOctalNoLeadingZero;
_RegExLexer(boolean xmlSchemaMode, boolean allowDanglingMetacharacters, boolean allowRBracketInCharacterClass) {
_RegExLexer(boolean xmlSchemaMode, boolean allowDanglingMetacharacters, boolean allowRBracketInCharacterClass, boolean allowOctalNoLeadingZero) {
this((java.io.Reader)null);
this.xmlSchemaMode = xmlSchemaMode;
this.allowDanglingMetacharacters = allowDanglingMetacharacters;
this.allowRBracketInCharacterClass = allowRBracketInCharacterClass;
this.allowOctalNoLeadingZero = allowOctalNoLeadingZero;
}
private void yypushstate(int state) {
@@ -646,19 +652,19 @@ class _RegExLexer implements FlexLexer {
case 7:
{ if (yystate() != CLASS2) yypushstate(EMBRACED); return RegExpTT.LBRACE;
}
case 69: break;
case 70: break;
case 6:
{ return RegExpTT.GROUP_END;
}
case 70: break;
case 71: break;
case 14:
{ return RegExpTT.STAR;
}
case 71: break;
case 72: break;
case 42:
{ return RegExpTT.ESC_CHARACTER;
}
case 72: break;
case 73: break;
case 38:
// lookahead expression with fixed base length
zzMarkedPos = zzStartRead + 1;
@@ -670,15 +676,15 @@ class _RegExLexer implements FlexLexer {
}
return RegExpTT.CLASS_BEGIN;
}
case 73: break;
case 74: break;
case 28:
{ return commentMode ? com.intellij.psi.TokenType.WHITE_SPACE : RegExpTT.ESC_CHARACTER;
}
case 74: break;
case 75: break;
case 43:
{ return commentMode ? RegExpTT.CHARACTER : RegExpTT.REDUNDANT_ESCAPE;
}
case 75: break;
case 76: break;
case 8:
{ if (allowRBracketInCharacterClass) {
yypushstate(CLASS2);
@@ -688,219 +694,224 @@ class _RegExLexer implements FlexLexer {
}
return RegExpTT.CLASS_BEGIN;
}
case 76: break;
case 77: break;
case 39:
{ return RegExpTT.REDUNDANT_ESCAPE;
}
case 77: break;
case 78: break;
case 24:
{ return RegExpTT.COMMA;
}
case 78: break;
case 79: break;
case 58:
{ yybegin(NAMED_GROUP); return RegExpTT.RUBY_NAMED_GROUP;
}
case 79: break;
case 80: break;
case 64:
{ return RegExpTT.POS_LOOKBEHIND;
}
case 80: break;
case 81: break;
case 41:
{ return RegExpTT.BAD_OCT_VALUE;
}
case 81: break;
case 82: break;
case 10:
{ return commentMode ? com.intellij.psi.TokenType.WHITE_SPACE : RegExpTT.CTRL_CHARACTER;
}
case 82: break;
case 83: break;
case 30:
{ yypopstate(); yypushstate(EMBRACED); return RegExpTT.LBRACE;
}
case 83: break;
case 84: break;
case 51:
{ return StringEscapesTokenTypes.INVALID_UNICODE_ESCAPE_TOKEN;
}
case 84: break;
case 85: break;
case 65:
{ return RegExpTT.NEG_LOOKBEHIND;
}
case 85: break;
case 68:
case 86: break;
case 69:
{ return RegExpTT.UNICODE_CHAR;
}
case 86: break;
case 87: break;
case 61:
{ if (xmlSchemaMode) { yypushback(1); return RegExpTT.CHAR_CLASS; } else return RegExpTT.CTRL;
}
case 87: break;
case 88: break;
case 37:
{ yybegin(OPTIONS); return RegExpTT.SET_OPTIONS;
}
case 88: break;
case 89: break;
case 12:
{ return RegExpTT.DOLLAR;
}
case 89: break;
case 90: break;
case 52:
{ yypopstate(); return RegExpTT.QUOTE_END;
}
case 90: break;
case 91: break;
case 56:
{ return RegExpTT.POS_LOOKAHEAD;
}
case 91: break;
case 92: break;
case 22:
{ yypopstate(); return RegExpTT.RBRACE;
}
case 92: break;
case 93: break;
case 3:
{ return RegExpTT.CHARACTER;
}
case 93: break;
case 94: break;
case 57:
{ return RegExpTT.NEG_LOOKAHEAD;
}
case 94: break;
case 95: break;
case 67:
{ if (allowOctalNoLeadingZero) return RegExpTT.OCT_CHAR;
return yystate() != CLASS2 ? RegExpTT.BACKREF : RegExpTT.ESC_CHARACTER;
}
case 96: break;
case 44:
{ return RegExpTT.ESC_CTRL_CHARACTER;
}
case 95: break;
case 97: break;
case 23:
{ return RegExpTT.NAME;
}
case 96: break;
case 98: break;
case 53:
{ return RegExpTT.ANDAND;
}
case 97: break;
case 99: break;
case 13:
{ return RegExpTT.QUEST;
}
case 98: break;
case 100: break;
case 46:
{ return RegExpTT.CHAR_CLASS;
}
case 99: break;
case 101: break;
case 17:
{ return RegExpTT.MINUS;
}
case 100: break;
case 67:
case 102: break;
case 68:
{ return RegExpTT.COMMENT;
}
case 101: break;
case 103: break;
case 40:
{ return yystate() != CLASS2 ? RegExpTT.BACKREF : RegExpTT.ESC_CHARACTER;
}
case 102: break;
case 104: break;
case 16:
{ return RegExpTT.UNION;
}
case 103: break;
case 105: break;
case 47:
{ if (xmlSchemaMode) return RegExpTT.CHAR_CLASS; else return StringEscapesTokenTypes.INVALID_CHARACTER_ESCAPE_TOKEN;
}
case 104: break;
case 106: break;
case 60:
{ return RegExpTT.OCT_CHAR;
}
case 105: break;
case 107: break;
case 4:
{ return RegExpTT.DOT;
}
case 106: break;
case 108: break;
case 32:
{ yybegin(YYINITIAL); return RegExpTT.GROUP_END;
}
case 107: break;
case 109: break;
case 21:
{ return RegExpTT.NUMBER;
}
case 108: break;
case 110: break;
case 35:
{ yybegin(YYINITIAL); return RegExpTT.GT;
}
case 109: break;
case 111: break;
case 59:
{ yybegin(QUOTED_NAMED_GROUP); return RegExpTT.RUBY_QUOTED_NAMED_GROUP;
}
case 110: break;
case 112: break;
case 54:
{ yybegin(PY_COND_REF); return RegExpTT.PYTHON_COND_REF;
}
case 111: break;
case 113: break;
case 48:
{ yypushstate(PROP); return RegExpTT.PROPERTY;
}
case 112: break;
case 114: break;
case 18:
{ return commentMode ? com.intellij.psi.TokenType.WHITE_SPACE : RegExpTT.CHARACTER;
}
case 113: break;
case 115: break;
case 33:
{ handleOptions(); return RegExpTT.OPTIONS_OFF;
}
case 114: break;
case 116: break;
case 34:
{ yybegin(YYINITIAL); return RegExpTT.COLON;
}
case 115: break;
case 117: break;
case 25:
{ assert false : yytext();
}
case 116: break;
case 118: break;
case 62:
{ yybegin(PY_NAMED_GROUP_REF); return RegExpTT.PYTHON_NAMED_GROUP_REF;
}
case 117: break;
case 119: break;
case 27:
{ yypopstate(); return RegExpTT.CLASS_END;
}
case 118: break;
case 120: break;
case 11:
{ return RegExpTT.CARET;
}
case 119: break;
case 121: break;
case 1:
{ handleOptions(); return RegExpTT.OPTIONS_ON;
}
case 120: break;
case 122: break;
case 29:
{ yypopstate(); yypushback(1);
}
case 121: break;
case 123: break;
case 45:
{ return yystate() != CLASS2 ? RegExpTT.BOUNDARY : RegExpTT.ESC_CHARACTER;
}
case 122: break;
case 124: break;
case 63:
{ yybegin(NAMED_GROUP); return RegExpTT.PYTHON_NAMED_GROUP;
}
case 123: break;
case 125: break;
case 19:
{ if (commentMode) { yypushstate(COMMENT); return RegExpTT.COMMENT; } else return RegExpTT.CHARACTER;
}
case 124: break;
case 126: break;
case 66:
{ return RegExpTT.HEX_CHAR;
}
case 125: break;
case 127: break;
case 5:
{ return RegExpTT.GROUP_BEGIN;
}
case 126: break;
case 128: break;
case 55:
{ return RegExpTT.NON_CAPT_GROUP;
}
case 127: break;
case 129: break;
case 9:
{ return StringEscapesTokenTypes.INVALID_CHARACTER_ESCAPE_TOKEN;
}
case 128: break;
case 130: break;
case 36:
{ yybegin(YYINITIAL); return RegExpTT.QUOTE;
}
case 129: break;
case 131: break;
case 20:
{ if (allowDanglingMetacharacters) {
yypopstate(); yypushback(1);
@@ -908,31 +919,31 @@ class _RegExLexer implements FlexLexer {
return RegExpTT.BAD_CHARACTER;
}
}
case 130: break;
case 132: break;
case 50:
{ return RegExpTT.BAD_HEX_VALUE;
}
case 131: break;
case 133: break;
case 2:
{ yypopstate(); return RegExpTT.COMMENT;
}
case 132: break;
case 134: break;
case 49:
{ yypushstate(QUOTED); return RegExpTT.QUOTE_BEGIN;
}
case 133: break;
case 135: break;
case 26:
{ yybegin(CLASS2); return RegExpTT.CHARACTER;
}
case 134: break;
case 136: break;
case 15:
{ return RegExpTT.PLUS;
}
case 135: break;
case 137: break;
case 31:
{ yybegin(YYINITIAL); return RegExpTT.BAD_CHARACTER;
}
case 136: break;
case 138: break;
default:
if (zzInput == YYEOF && zzStartRead == zzCurrentPos) {
zzAtEOF = true;
@@ -28,12 +28,14 @@ import com.intellij.psi.StringEscapesTokenTypes;
private boolean allowDanglingMetacharacters;
private boolean allowRBracketInCharacterClass;
private boolean allowOctalNoLeadingZero;
_RegExLexer(boolean xmlSchemaMode, boolean allowDanglingMetacharacters, boolean allowRBracketInCharacterClass) {
_RegExLexer(boolean xmlSchemaMode, boolean allowDanglingMetacharacters, boolean allowRBracketInCharacterClass, boolean allowOctalNoLeadingZero) {
this((java.io.Reader)null);
this.xmlSchemaMode = xmlSchemaMode;
this.allowDanglingMetacharacters = allowDanglingMetacharacters;
this.allowRBracketInCharacterClass = allowRBracketInCharacterClass;
this.allowOctalNoLeadingZero = allowOctalNoLeadingZero;
}
private void yypushstate(int state) {
@@ -136,7 +138,10 @@ HEX_CHAR=[0-9a-fA-F]
So, for 100% compatibility, backrefs > 9 should be resolved by the parser, but
I'm not sure if it's worth the effort - at least not atm.
*/
{ESCAPE} [0-7]{3} { if (allowOctalNoLeadingZero) return RegExpTT.OCT_CHAR;
return yystate() != CLASS2 ? RegExpTT.BACKREF : RegExpTT.ESC_CHARACTER;
}
{ESCAPE} {DIGITS} { return yystate() != CLASS2 ? RegExpTT.BACKREF : RegExpTT.ESC_CHARACTER; }
{ESCAPE} "-" { return RegExpTT.ESC_CHARACTER; }