Add char tokenizer config.

#2
Files changed (1) hide show
  1. tokenizer_config.json +73 -0
tokenizer_config.json ADDED
@@ -0,0 +1,73 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "CharTokenizer",
3
+ "model_type": "charlm",
4
+ "vocab_size": 65,
5
+ "chars": [
6
+ "\n",
7
+ " ",
8
+ "!",
9
+ "$",
10
+ "&",
11
+ "'",
12
+ ",",
13
+ "-",
14
+ ".",
15
+ "3",
16
+ ":",
17
+ ";",
18
+ "?",
19
+ "A",
20
+ "B",
21
+ "C",
22
+ "D",
23
+ "E",
24
+ "F",
25
+ "G",
26
+ "H",
27
+ "I",
28
+ "J",
29
+ "K",
30
+ "L",
31
+ "M",
32
+ "N",
33
+ "O",
34
+ "P",
35
+ "Q",
36
+ "R",
37
+ "S",
38
+ "T",
39
+ "U",
40
+ "V",
41
+ "W",
42
+ "X",
43
+ "Y",
44
+ "Z",
45
+ "a",
46
+ "b",
47
+ "c",
48
+ "d",
49
+ "e",
50
+ "f",
51
+ "g",
52
+ "h",
53
+ "i",
54
+ "j",
55
+ "k",
56
+ "l",
57
+ "m",
58
+ "n",
59
+ "o",
60
+ "p",
61
+ "q",
62
+ "r",
63
+ "s",
64
+ "t",
65
+ "u",
66
+ "v",
67
+ "w",
68
+ "x",
69
+ "y",
70
+ "z"
71
+ ],
72
+ "unk_token": "<unk>"
73
+ }