afvanluenen commited on
Commit
f485345
·
verified ·
1 Parent(s): 31540ef

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +25 -25
README.md CHANGED
@@ -32,23 +32,23 @@ nor has it been tested on other downstream tasks.
32
  TODO: get model architecture like on the model card of the previous model
33
 
34
  Full architecture:
35
- `[
36
- {
37
- "idx": 0,
38
- "name": "0",
39
- "path": "0_ASMTransformerModule",
40
- "type": "asmtransformers.models.asmsentencebert.ASMTransformerModule"
41
- },
42
- {
43
- "idx": 1,
44
- "name": "1",
45
- "path": "1_Pooling",
46
- "type": "sentence_transformers.sentence_transformer.modules.pooling.Pooling"
47
- }
48
- ]`
49
 
50
  Parameters used:
51
- `{
52
  "architectures": [
53
  "BertForMaskedLM"
54
  ],
@@ -71,18 +71,18 @@ Parameters used:
71
  "type_vocab_size": 2,
72
  "use_cache": true,
73
  "vocab_size": 6161
74
- }`
75
 
76
  Preraining parameters used:
77
- `{
78
- "epochs"=19,
79
- "eval_steps"=10000,
80
- "batch_size"=512,
81
- "gradient_accumulation_steps"=1,
82
- "mlm_prob"=0.4,
83
- "bf16"=True,
84
- "tf32"=True
85
- }`
86
 
87
  Note that during pretraining, the --mlm-prob parameter has been set to 0.4, in accordance to [paper](INSERT LINK)
88
 
 
32
  TODO: get model architecture like on the model card of the previous model
33
 
34
  Full architecture:
35
+ [
36
+ {
37
+ "idx": 0,
38
+ "name": "0",
39
+ "path": "0_ASMTransformerModule",
40
+ "type": "asmtransformers.models.asmsentencebert.ASMTransformerModule"
41
+ },
42
+ {
43
+ "idx": 1,
44
+ "name": "1",
45
+ "path": "1_Pooling",
46
+ "type": "sentence_transformers.sentence_transformer.modules.pooling.Pooling"
47
+ }
48
+ ]
49
 
50
  Parameters used:
51
+ {
52
  "architectures": [
53
  "BertForMaskedLM"
54
  ],
 
71
  "type_vocab_size": 2,
72
  "use_cache": true,
73
  "vocab_size": 6161
74
+ }
75
 
76
  Preraining parameters used:
77
+ {
78
+ "epochs"=19,
79
+ "eval_steps"=10000,
80
+ "batch_size"=512,
81
+ "gradient_accumulation_steps"=1,
82
+ "mlm_prob"=0.4,
83
+ "bf16"=True,
84
+ "tf32"=True
85
+ }
86
 
87
  Note that during pretraining, the --mlm-prob parameter has been set to 0.4, in accordance to [paper](INSERT LINK)
88