Question

对于我的词法分析器（tokenizer），所有ASCII 7-bit字符（0x00至0x7F）都有特定的标记。作为SWI-Prolog supports Unicode，字符代码从0x0000到0xFFFF。

在我的词法分析器中，由于有许多字符无法映射到特定标记，因此存在未知标记（tokUnknown）。

为确保代码在0到127（0x00到0x7F）之间的所有字符都没有tokUnknown，需要测试用例。

测试用例需要一个简单的词法分析器才能将字符转换为令牌。

tokenizer_unknown(Token) -->
    (
        white_space_char(W), !, white_space(W, S),
        { Token = tokWhitespace(S) }
    ;
        [S],
        { special_character(S,Token) }
    ;
        digit(D), !, number(D, N),
        { Token = tokNumber(N) }
    ;
        letter(L), !, word(L, W),
        { Token = tokWord(W) }
    ;
        [_],
        { Token = tokUnknown }
    ), !.

这是代码为0的字符的测试用例。

:- begin_tests(unknown).

test(001) :-
    Code = 0,
    char_code(Char,Code),
    Chars = [Char],
    phrase(tokenizer_unknown(Token),Chars,Rest),
    assertion(Rest == []),
    assertion(Token \== tokUnknown).

:- end_tests(unknown).

以这种方式进行笔试需要128种不同的测试来检查tokUnknown。

SWI-Prolog单元测试库plunit具有用于生成数据的选项forall。

根据文档，测试应如下所示：

test(002, [forall(???)]) :-
    char_code(Char,Code),
    Chars = [Char],
    phrase(tokenizer_unknown(Token),Chars,Rest),
    assertion(Rest == []),
    assertion(Token \== tokUnknown).

是否可以使用forall选项编写一个测试用例，而不是该测试系列的128个单独的用例？

您可以使用forall给出测试用例的工作版本吗？

跟进

forall的模板为forall(:Generator)。

当我第一次看到这个时，我完全感到困惑，几乎走开了，去写大量的测试，但是坚持知道这对于进行参数化测试是多么有价值和容易，例如JUnit 5 或NUnit 3。然后，可以将参数化测试用于fuzzing，并可以增强模糊测试以生成counter examples，例如QuickCheck，FsCheck

示例1

在硬编码测试中

test(001) :-
    Code = 0,
    char_code(Char,Code),
    Chars = [Char],
    phrase(tokenizer_unknown(Token),Chars,Rest),
    assertion(Rest == []),
    assertion(Token \== tokUnknown).

我想为每个测试更改Code变量。我也知道Code的限制，即0到127。

因此对于这个简单的生成器，所需要的只是一个谓词，该谓词在被调用时生成从0到127的值，并将它们作为变量返回，例如Code。

between/3满足了要求，例如

?- between(0,3,Code).
Code = 0 ;
Code = 1 ;
Code = 2 ;
Code = 3.

通过查看答案可以看出，只需将谓词赋予forall，例如

forall(between(0, 127, Code))

示例2

此测试是为了检查所有单独的whitespace字符或ASCII 7位字符的空白字符序列是否返回为tokWhitespace，并且空白字符是令牌的字符串值。

带有空格标记的习惯是不要在标记中包含字符，而是将它们包括在其中，因为如果需要，可以更轻松地删除它们，然后想知道OP为什么不这样做。因为这是为了学习，所以将它们包括在内。

硬编码测试

:- begin_tests(white_space).

test(001) :-
    String = "\t",
    string_codes(String,Codes),
    phrase(whitespace(Tokens),Codes,Rest),
    assertion(Tokens == tokWhitespace("\t")),
    assertion(Rest == []).

test(011) :-
    String = "\t\r",
    string_codes(String,Codes),
    phrase(whitespace(Tokens),Codes,Rest),
    assertion(Tokens == tokWhitespace("\t\r")),
    assertion(Rest == []).

test(043) :-
    String = "\s\s\s",
    string_codes(String,Codes),
    phrase(whitespace(Tokens),Codes,Rest),
    assertion(Tokens == tokWhitespace("\s\s\s")),
    assertion(Rest == []).

:- end_tests(white_space).

在此示例中，变量为String，例如"\t"和令牌tokWhitespace中的值，例如"\t"。

单个空格字符为：

?- code_type(Char,space).
Char = 9 ;        % tokHorizontalTab   \t
Char = 10 ;       % tokLineFeed        \n
Char = 11 ;       % tokVerticalTab     \v
Char = 12 ;       % tokFormFeed        \f
Char = 13 ;       % tokCarriageReturn  \r
Char = 32 ;       % tokSpace           \s
Char = 160 ;      % Yes, there are space characters defined beyond 7-bit ASCII. See: https://en.wikipedia.org/wiki/Whitespace_character#Unicode
Char = 5760 ; 
...

从数十年的词法分析/标记化测试编写中学到的一个教训是，每个字符都需要进行测试。同样，测试不应以与lexer / tokenizer中的检查相同的方式生成值。在这种情况下，测试不应依赖于code_type/2，因为它是在词法分析器/令牌生成器中使用的，并且如果code_type/2用于某些如何获得错误的测试，则测试将无法检测到它。因此，测试用例将通过不同的方式获取字符，在此示例中，它们将来自列表。

从数十年的递归代码测试中学到的第二个教训是，该测试需要至少测试三个级别的深度。在此示例中，空白字符测试将测试最多三个字符的序列。

第三课是将函数组合与组合，置换，类型构造函数和类型析构函数等函数一起使用，减少了编写测试数据生成器的combinatorial explosion；相反，它们有助于测试用例的组合爆炸。要在Prolog中做到这一点，需要将功能概念转化为Prolog谓词。

基于这些课程，需要一些辅助谓词。

comb(0,_,[]).
comb(N,[X|T],[X|Comb]) :-
    N>0,
    N1 is N-1,
    comb(N1,T,Comb).
comb(N,[_|T],Comb) :-
    N>0,
    comb(N,T,Comb).

variation_string(N,L,String) :-
    between(1,N,N0),
    comb(N0,L,L1),
    permutation(L1,L2),
    string_chars(String,L2).

variation_number(N,L,String,Number) :-
    between(1,N,N0),
    comb(N0,L,L1),
    permutation(L1,L2),
    string_chars(String,L2),
    number_chars(Number,L2).

用法示例：

?- variation_string(3,['\t','\r','\n'],String).
String = "\t" ;
String = "\r" ;
String = "\n" ;
String = "\t\r" ;
String = "\r\t" ;
String = "\t\n" ;
String = "\n\t" ;
String = "\r\n" ;
String = "\n\r" ;
String = "\t\r\n" ;
String = "\t\n\r" ;
String = "\r\t\n" ;
String = "\r\n\t" ;
String = "\n\t\r" ;
String = "\n\r\t" ;
false.

为了简化对forall的阅读，创建了一个辅助谓词。

generator_ascii_7bit_char_type_white(R) :-
    variation_string(3,['\t','\n','\v','\f','\r','\s'],R).

现在在测试中只需将生成器与forall一起使用。

:- begin_tests(white_space).

test(000, [forall(generator_ascii_7bit_char_type_white(String))]) :-
    string_codes(String,Codes),
    phrase(whitespace(Tokens),Codes,Rest),
    assertion(Tokens == tokWhitespace(String)),
    assertion(Rest == []).

:- end_tests(white_space).

只需很少的代码，所有这些测试就可以创建并运行（每个点代表一个单独的测试用例）。

% PL-Unit: white_space ............................................................................................................................................................ done

示例3

此示例test a non-deterministic predicate因此需要使用findall。该谓词也有两个输入参数和两个输出参数。

findall / 3的签名是

findall(+Template, :Goal, -Bag)

要将两个值与finall/3一起使用，Template不是元组，例如(A,B)，但有一个列表，例如[A,B]，而Bag是列表的列表，例如[["1",1],["2",2]]，其中列表中的每个项目都是结果，而内部列表中的项目是相应的Template参数的值。

此示例测试variation_number/4

:- begin_tests(variation_number_4).

variation_number_4(0,[],[]).
variation_number_4(1,[],[]).
variation_number_4(2,[],[]).
variation_number_4(3,[],[]).
variation_number_4(0,['1'],[]).
variation_number_4(1,['1'],[["1",1]]).
variation_number_4(2,['1'],[["1",1]]).
variation_number_4(3,['1'],[["1",1]]).
variation_number_4(0,['1','2'],[]).
variation_number_4(1,['1','2'],[["1",1],["2",2]]).
variation_number_4(2,['1','2'],[["1",1],["2",2],["12",12],["21",21]]).
variation_number_4(3,['1','2'],[["1",1],["2",2],["12",12],["21",21]]).
variation_number_4(0,['1','2','3'],[]).
variation_number_4(1,['1','2','3'],[["1",1],["2",2],["3",3]]).
variation_number_4(2,['1','2','3'],[["1",1],["2",2],["3",3],["12",12],["21",21],["13",13],["31",31],["23",23],["32",32]]).
variation_number_4(3,['1','2','3'],[["1",1],["2",2],["3",3],["12",12],["21",21],["13",13],["31",31],["23",23],["32",32],["123",123],["132",132],["213",213],["231",231],["312",312],["321",321]]).
variation_number_4(0,['1','2','3','4'],[]).
variation_number_4(1,['1','2','3','4'],[["1",1],["2",2],["3",3],["4",4]]).
variation_number_4(2,['1','2','3','4'],[["1",1],["2",2],["3",3],["4",4],["12",12],["21",21],["13",13],["31",31],["14",14],["41",41],["23",23],["32",32],["24",24],["42",42],["34",34],["43",43]]).
variation_number_4(3,['1','2','3','4'],[["1",1],["2",2],["3",3],["4",4],["12",12],["21",21],["13",13],["31",31],["14",14],["41",41],["23",23],["32",32],["24",24],["42",42],["34",34],["43",43],["123",123],["132",132],["213",213],["231",231],["312",312],["321",321],["124",124],["142",142],["214",214],["241",241],["412",412],["421",421],["134",134],["143",143],["314",314],["341",341],["413",413],["431",431],["234",234],["243",243],["324",324],["342",342],["423",423],["432",432]]).

test(000, forall(variation_number_4(Len,L,R0s))) :-
    findall([R,N],variation_number(Len,L,R,N),Rs),
    assertion(Rs == R0s).

:- end_tests(variation_number_4).

Answer 1

请注意，这些断言是不正确的。他们应该是：

...
assertion(Rest == []),
assertion(Token \== tokUnknown).

否则，测试将不会检测到返回Rest或Token未绑定的错误。

关于您对forall/1选项的问题，我希望以下方法可以工作（不过，尚未尝试）：

test(002, [forall(between(0, 127, Code))]) :-
    char_code(Char, Code),
    phrase(tokenizer_unknown(Token), [Char], Rest),
    assertion(Rest == []),
    assertion(Token \== tokUnknown).

SWI-Prolog-单元测试库plunit-怎么使用forall选项？

1 个答案: