ChiefTheLord commited on
Commit
cd2e4f3
·
verified ·
1 Parent(s): b6e6dc1

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -106,3 +106,4 @@ checkpoints-v1.0e-discrete-condition/checkpoint-15360/eval_state.json filter=lfs
106
  checkpoints-v1.0e-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
107
  checkpoints-v1.0f-discrete-condition/checkpoint-15360/eval_state.json filter=lfs diff=lfs merge=lfs -text
108
  checkpoints-v1.0f-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
 
 
106
  checkpoints-v1.0e-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
107
  checkpoints-v1.0f-discrete-condition/checkpoint-15360/eval_state.json filter=lfs diff=lfs merge=lfs -text
108
  checkpoints-v1.0f-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
109
+ checkpoints-v2.0a-discrete-condition/checkpoint-4096/eval_state.json filter=lfs diff=lfs merge=lfs -text
checkpoints-v2.0a-discrete-condition/checkpoint-4096/eval_state.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:845d2e71903e48abd1666670aa6d6398235be8ff153f75093e1b45e4ed7c8600
3
+ size 46081776
checkpoints-v2.0a-discrete-condition/checkpoint-4096/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:39a3c2becf5813595af681ff92d079acfe70c654158ec604cdf784c18d531dde
3
+ size 15210032
checkpoints-v2.0a-discrete-condition/checkpoint-4096/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f49965c5d19f553ddded7715f5bbb968308301248d4c1f01b6f30f1c63c93fdf
3
+ size 13675339
checkpoints-v2.0a-discrete-condition/checkpoint-4096/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f04c8bb33e8e4266c246f4329da29d6f1414224fc8a213228730fe476d54b784
3
+ size 14645
checkpoints-v2.0a-discrete-condition/checkpoint-4096/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:90078bef0ff08e77712ec862bc2a11b4989d3477480b20822129904ef078a3a3
3
+ size 1383
checkpoints-v2.0a-discrete-condition/checkpoint-4096/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3a96292f7ed2848651a48ddc440ca758838d3d5eb28c3ec2cae1ccbbb1dc4b1c
3
+ size 1465
checkpoints-v2.0a-discrete-condition/checkpoint-4096/trainer_state.json ADDED
@@ -0,0 +1,238 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.18918294766985358,
6
+ "eval_steps": 1024,
7
+ "global_step": 4096,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011823934229365849,
14
+ "grad_norm": 0.3142397999763489,
15
+ "learning_rate": 0.000498046875,
16
+ "loss": 2.5664353370666504,
17
+ "step": 256
18
+ },
19
+ {
20
+ "epoch": 0.023647868458731697,
21
+ "grad_norm": 0.7134925127029419,
22
+ "learning_rate": 0.000998046875,
23
+ "loss": 1.9098931550979614,
24
+ "step": 512
25
+ },
26
+ {
27
+ "epoch": 0.03547180268809755,
28
+ "grad_norm": 1.1968424320220947,
29
+ "learning_rate": 0.000999640996023194,
30
+ "loss": 1.6245745420455933,
31
+ "step": 768
32
+ },
33
+ {
34
+ "epoch": 0.047295736917463395,
35
+ "grad_norm": 0.9976363182067871,
36
+ "learning_rate": 0.0009985588674043958,
37
+ "loss": 1.4784010648727417,
38
+ "step": 1024
39
+ },
40
+ {
41
+ "epoch": 0.047295736917463395,
42
+ "eval_bleu": 0.0011133109477885134,
43
+ "eval_cos0_loss": 0.35662247560339977,
44
+ "eval_cos_loss": 0.3775373704765485,
45
+ "eval_loss": 1.4111966779242913,
46
+ "eval_mse0_loss": 1.4443081268981166,
47
+ "eval_mse_loss": 1.3780852248679558,
48
+ "step": 1024
49
+ },
50
+ {
51
+ "epoch": 0.047295736917463395,
52
+ "eval_bleu": 0.0011133109477885134,
53
+ "eval_cos0_loss": 0.35662247560339977,
54
+ "eval_cos_loss": 0.3775373704765485,
55
+ "eval_loss": 1.4111966779242913,
56
+ "eval_mse0_loss": 1.4443081268981166,
57
+ "eval_mse_loss": 1.3780852248679558,
58
+ "eval_runtime": 559.8994,
59
+ "eval_samples_per_second": 49.996,
60
+ "eval_steps_per_second": 0.782,
61
+ "step": 1024
62
+ },
63
+ {
64
+ "epoch": 0.05911967114682925,
65
+ "grad_norm": 0.9691009521484375,
66
+ "learning_rate": 0.0009967551747861387,
67
+ "loss": 1.3725448846817017,
68
+ "step": 1280
69
+ },
70
+ {
71
+ "epoch": 0.0709436053761951,
72
+ "grad_norm": 1.2567791938781738,
73
+ "learning_rate": 0.000994232528651847,
74
+ "loss": 1.3024182319641113,
75
+ "step": 1536
76
+ },
77
+ {
78
+ "epoch": 0.08276753960556095,
79
+ "grad_norm": 0.9418615698814392,
80
+ "learning_rate": 0.0009909945800260092,
81
+ "loss": 1.2219008207321167,
82
+ "step": 1792
83
+ },
84
+ {
85
+ "epoch": 0.09459147383492679,
86
+ "grad_norm": 1.0366237163543701,
87
+ "learning_rate": 0.0009870460151900522,
88
+ "loss": 1.166050672531128,
89
+ "step": 2048
90
+ },
91
+ {
92
+ "epoch": 0.09459147383492679,
93
+ "eval_bleu": 0.007989488547135068,
94
+ "eval_cos0_loss": 0.2812547723860501,
95
+ "eval_cos_loss": 0.33213963383408984,
96
+ "eval_loss": 1.1427442649183752,
97
+ "eval_mse0_loss": 1.098496745166169,
98
+ "eval_mse_loss": 1.1869917854870835,
99
+ "step": 2048
100
+ },
101
+ {
102
+ "epoch": 0.09459147383492679,
103
+ "eval_bleu": 0.007989488547135068,
104
+ "eval_cos0_loss": 0.2812547723860501,
105
+ "eval_cos_loss": 0.33213963383408984,
106
+ "eval_loss": 1.1427442649183752,
107
+ "eval_mse0_loss": 1.098496745166169,
108
+ "eval_mse_loss": 1.1869917854870835,
109
+ "eval_runtime": 556.0835,
110
+ "eval_samples_per_second": 50.34,
111
+ "eval_steps_per_second": 0.788,
112
+ "step": 2048
113
+ },
114
+ {
115
+ "epoch": 0.10641540806429264,
116
+ "grad_norm": 1.2856756448745728,
117
+ "learning_rate": 0.0009823925488998885,
118
+ "loss": 1.1258903741836548,
119
+ "step": 2304
120
+ },
121
+ {
122
+ "epoch": 0.1182393422936585,
123
+ "grad_norm": 1.1996031999588013,
124
+ "learning_rate": 0.0009770409161149525,
125
+ "loss": 1.0752795934677124,
126
+ "step": 2560
127
+ },
128
+ {
129
+ "epoch": 0.13006327652302435,
130
+ "grad_norm": 1.0043145418167114,
131
+ "learning_rate": 0.0009709988622506973,
132
+ "loss": 1.034059762954712,
133
+ "step": 2816
134
+ },
135
+ {
136
+ "epoch": 0.1418872107523902,
137
+ "grad_norm": 1.327103853225708,
138
+ "learning_rate": 0.000964275131968659,
139
+ "loss": 0.9963141083717346,
140
+ "step": 3072
141
+ },
142
+ {
143
+ "epoch": 0.1418872107523902,
144
+ "eval_bleu": 0.024982546797062154,
145
+ "eval_cos0_loss": 0.23017472596881597,
146
+ "eval_cos_loss": 0.3040819166729984,
147
+ "eval_loss": 0.9821336078861532,
148
+ "eval_mse0_loss": 0.8859744953782591,
149
+ "eval_mse_loss": 1.0782927214827167,
150
+ "step": 3072
151
+ },
152
+ {
153
+ "epoch": 0.1418872107523902,
154
+ "eval_bleu": 0.024982546797062154,
155
+ "eval_cos0_loss": 0.23017472596881597,
156
+ "eval_cos_loss": 0.3040819166729984,
157
+ "eval_loss": 0.9821336078861532,
158
+ "eval_mse0_loss": 0.8859744953782591,
159
+ "eval_mse_loss": 1.0782927214827167,
160
+ "eval_runtime": 554.8091,
161
+ "eval_samples_per_second": 50.455,
162
+ "eval_steps_per_second": 0.789,
163
+ "step": 3072
164
+ },
165
+ {
166
+ "epoch": 0.15371114498175603,
167
+ "grad_norm": 1.20012366771698,
168
+ "learning_rate": 0.0009568794565203123,
169
+ "loss": 0.9632707238197327,
170
+ "step": 3328
171
+ },
172
+ {
173
+ "epoch": 0.1655350792111219,
174
+ "grad_norm": 1.1331790685653687,
175
+ "learning_rate": 0.0009488225396630347,
176
+ "loss": 0.9331204891204834,
177
+ "step": 3584
178
+ },
179
+ {
180
+ "epoch": 0.17735901344048774,
181
+ "grad_norm": 1.2750242948532104,
182
+ "learning_rate": 0.0009401160421685646,
183
+ "loss": 0.9070082306861877,
184
+ "step": 3840
185
+ },
186
+ {
187
+ "epoch": 0.18918294766985358,
188
+ "grad_norm": 1.2876979112625122,
189
+ "learning_rate": 0.0009307725649463714,
190
+ "loss": 0.885317325592041,
191
+ "step": 4096
192
+ },
193
+ {
194
+ "epoch": 0.18918294766985358,
195
+ "eval_bleu": 0.06063932312714804,
196
+ "eval_cos0_loss": 0.20171181510572564,
197
+ "eval_cos_loss": 0.28187595001638754,
198
+ "eval_loss": 0.8752339045478873,
199
+ "eval_mse0_loss": 0.7643582605880145,
200
+ "eval_mse_loss": 0.9861095474190908,
201
+ "step": 4096
202
+ },
203
+ {
204
+ "epoch": 0.18918294766985358,
205
+ "eval_bleu": 0.06063932312714804,
206
+ "eval_cos0_loss": 0.20171181510572564,
207
+ "eval_cos_loss": 0.28187595001638754,
208
+ "eval_loss": 0.8752339045478873,
209
+ "eval_mse0_loss": 0.7643582605880145,
210
+ "eval_mse_loss": 0.9861095474190908,
211
+ "eval_runtime": 557.2308,
212
+ "eval_samples_per_second": 50.236,
213
+ "eval_steps_per_second": 0.786,
214
+ "step": 4096
215
+ }
216
+ ],
217
+ "logging_steps": 256,
218
+ "max_steps": 21651,
219
+ "num_input_tokens_seen": 0,
220
+ "num_train_epochs": 1,
221
+ "save_steps": 1024,
222
+ "stateful_callbacks": {
223
+ "TrainerControl": {
224
+ "args": {
225
+ "should_epoch_stop": false,
226
+ "should_evaluate": false,
227
+ "should_log": false,
228
+ "should_save": true,
229
+ "should_training_stop": false
230
+ },
231
+ "attributes": {}
232
+ }
233
+ },
234
+ "total_flos": 0.0,
235
+ "train_batch_size": 64,
236
+ "trial_name": null,
237
+ "trial_params": null
238
+ }
checkpoints-v2.0a-discrete-condition/checkpoint-4096/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f63a8a711fb280c6320e95476c532b75c862f31d6a218a0d05079e32411a5ae1
3
+ size 5201