ChiefTheLord commited on
Commit
93b4521
·
verified ·
1 Parent(s): 104f716

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -95,3 +95,4 @@ checkpoints-v4.0-discrete/checkpoint-20480-2/eval_state.json filter=lfs diff=lfs
95
  checkpoints-v6.0-discrete/checkpoint-21504/eval_state.json filter=lfs diff=lfs merge=lfs -text
96
  checkpoints-v1.0a-discrete-condition/checkpoint-14336/eval_state.json filter=lfs diff=lfs merge=lfs -text
97
  checkpoints-v1.0a-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
 
 
95
  checkpoints-v6.0-discrete/checkpoint-21504/eval_state.json filter=lfs diff=lfs merge=lfs -text
96
  checkpoints-v1.0a-discrete-condition/checkpoint-14336/eval_state.json filter=lfs diff=lfs merge=lfs -text
97
  checkpoints-v1.0a-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
98
+ checkpoints-v1.0b-discrete-condition/checkpoint-11264/eval_state.json filter=lfs diff=lfs merge=lfs -text
checkpoints-v1.0b-discrete-condition/checkpoint-11264/eval_state.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1b952fb4f279cfe936331993857d8ef26245a9b4d3611e3159625a8bd93fb15a
3
+ size 42817288
checkpoints-v1.0b-discrete-condition/checkpoint-11264/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5ee950a5d7955b10959948211bbadfea2d0b29e2910f39995dfb85c311961c59
3
+ size 15210032
checkpoints-v1.0b-discrete-condition/checkpoint-11264/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3a9bf1e185124ccefa437d5ac3cd14e6248296761a84b8c09ea27a6169301d16
3
+ size 13675339
checkpoints-v1.0b-discrete-condition/checkpoint-11264/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e733f914ad4b0621888d4f1de3f18cc2415364d8f05d4845655af2cac85cb715
3
+ size 14645
checkpoints-v1.0b-discrete-condition/checkpoint-11264/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fa294ad48ff2fd881d808329ecea8657a7b3b5ac9a0c062d03df25d5e0c68267
3
+ size 1383
checkpoints-v1.0b-discrete-condition/checkpoint-11264/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:93a66f41114ac55ff6e3adfa36103cb9f7c62dc2fc1fc12a1a0c64b3df604276
3
+ size 1465
checkpoints-v1.0b-discrete-condition/checkpoint-11264/trainer_state.json ADDED
@@ -0,0 +1,760 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.5202531060920974,
6
+ "eval_steps": 512,
7
+ "global_step": 11264,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011823934229365849,
14
+ "grad_norm": 0.0374470092356205,
15
+ "learning_rate": 0.000498046875,
16
+ "loss": 1.7392830848693848,
17
+ "step": 256
18
+ },
19
+ {
20
+ "epoch": 0.023647868458731697,
21
+ "grad_norm": 0.6093892455101013,
22
+ "learning_rate": 0.000998046875,
23
+ "loss": 1.598156213760376,
24
+ "step": 512
25
+ },
26
+ {
27
+ "epoch": 0.023647868458731697,
28
+ "eval_bleu": 0.0,
29
+ "eval_cos_loss": 0.7696732297607752,
30
+ "eval_loss": 1.4412390649590863,
31
+ "eval_mse_loss": 1.4412390649590863,
32
+ "step": 512
33
+ },
34
+ {
35
+ "epoch": 0.023647868458731697,
36
+ "eval_bleu": 0.0,
37
+ "eval_cos_loss": 0.7696732297607752,
38
+ "eval_loss": 1.4412390649590863,
39
+ "eval_mse_loss": 1.4412390649590863,
40
+ "eval_runtime": 159.5986,
41
+ "eval_samples_per_second": 175.396,
42
+ "eval_steps_per_second": 2.744,
43
+ "step": 512
44
+ },
45
+ {
46
+ "epoch": 0.03547180268809755,
47
+ "grad_norm": 0.6309738159179688,
48
+ "learning_rate": 0.000999640996023194,
49
+ "loss": 1.3486289978027344,
50
+ "step": 768
51
+ },
52
+ {
53
+ "epoch": 0.047295736917463395,
54
+ "grad_norm": 0.9618902802467346,
55
+ "learning_rate": 0.0009985588674043958,
56
+ "loss": 1.2263447046279907,
57
+ "step": 1024
58
+ },
59
+ {
60
+ "epoch": 0.047295736917463395,
61
+ "eval_bleu": 0.002616386000515621,
62
+ "eval_cos_loss": 0.6618151305473015,
63
+ "eval_loss": 1.1486175982919458,
64
+ "eval_mse_loss": 1.1486175982919458,
65
+ "step": 1024
66
+ },
67
+ {
68
+ "epoch": 0.047295736917463395,
69
+ "eval_bleu": 0.002616386000515621,
70
+ "eval_cos_loss": 0.6618151305473015,
71
+ "eval_loss": 1.1486175982919458,
72
+ "eval_mse_loss": 1.1486175982919458,
73
+ "eval_runtime": 155.4374,
74
+ "eval_samples_per_second": 180.092,
75
+ "eval_steps_per_second": 2.818,
76
+ "step": 1024
77
+ },
78
+ {
79
+ "epoch": 0.05911967114682925,
80
+ "grad_norm": 0.807138204574585,
81
+ "learning_rate": 0.0009967551747861387,
82
+ "loss": 1.0810199975967407,
83
+ "step": 1280
84
+ },
85
+ {
86
+ "epoch": 0.0709436053761951,
87
+ "grad_norm": 0.7746097445487976,
88
+ "learning_rate": 0.000994232528651847,
89
+ "loss": 0.9834531545639038,
90
+ "step": 1536
91
+ },
92
+ {
93
+ "epoch": 0.0709436053761951,
94
+ "eval_bleu": 0.012529858522811724,
95
+ "eval_cos_loss": 0.5913034896600192,
96
+ "eval_loss": 0.9445572563502342,
97
+ "eval_mse_loss": 0.9445572563502342,
98
+ "step": 1536
99
+ },
100
+ {
101
+ "epoch": 0.0709436053761951,
102
+ "eval_bleu": 0.012529858522811724,
103
+ "eval_cos_loss": 0.5913034896600192,
104
+ "eval_loss": 0.9445572563502342,
105
+ "eval_mse_loss": 0.9445572563502342,
106
+ "eval_runtime": 157.248,
107
+ "eval_samples_per_second": 178.018,
108
+ "eval_steps_per_second": 2.785,
109
+ "step": 1536
110
+ },
111
+ {
112
+ "epoch": 0.08276753960556095,
113
+ "grad_norm": 0.7339635491371155,
114
+ "learning_rate": 0.0009909945800260092,
115
+ "loss": 0.929780900478363,
116
+ "step": 1792
117
+ },
118
+ {
119
+ "epoch": 0.09459147383492679,
120
+ "grad_norm": 0.6405588388442993,
121
+ "learning_rate": 0.0009870460151900522,
122
+ "loss": 0.8905904293060303,
123
+ "step": 2048
124
+ },
125
+ {
126
+ "epoch": 0.09459147383492679,
127
+ "eval_bleu": 0.024984530015966948,
128
+ "eval_cos_loss": 0.5550511261643885,
129
+ "eval_loss": 0.8596870847488647,
130
+ "eval_mse_loss": 0.8596870847488647,
131
+ "step": 2048
132
+ },
133
+ {
134
+ "epoch": 0.09459147383492679,
135
+ "eval_bleu": 0.024984530015966948,
136
+ "eval_cos_loss": 0.5550511261643885,
137
+ "eval_loss": 0.8596870847488647,
138
+ "eval_mse_loss": 0.8596870847488647,
139
+ "eval_runtime": 158.1254,
140
+ "eval_samples_per_second": 177.03,
141
+ "eval_steps_per_second": 2.77,
142
+ "step": 2048
143
+ },
144
+ {
145
+ "epoch": 0.10641540806429264,
146
+ "grad_norm": 0.44440358877182007,
147
+ "learning_rate": 0.0009823925488998885,
148
+ "loss": 0.8383368253707886,
149
+ "step": 2304
150
+ },
151
+ {
152
+ "epoch": 0.1182393422936585,
153
+ "grad_norm": 0.5447011590003967,
154
+ "learning_rate": 0.0009770409161149525,
155
+ "loss": 0.8073748350143433,
156
+ "step": 2560
157
+ },
158
+ {
159
+ "epoch": 0.1182393422936585,
160
+ "eval_bleu": 0.047084110969286816,
161
+ "eval_cos_loss": 0.5225583875560325,
162
+ "eval_loss": 0.790363206983157,
163
+ "eval_mse_loss": 0.790363206983157,
164
+ "step": 2560
165
+ },
166
+ {
167
+ "epoch": 0.1182393422936585,
168
+ "eval_bleu": 0.047084110969286816,
169
+ "eval_cos_loss": 0.5225583875560325,
170
+ "eval_loss": 0.790363206983157,
171
+ "eval_mse_loss": 0.790363206983157,
172
+ "eval_runtime": 159.2451,
173
+ "eval_samples_per_second": 175.786,
174
+ "eval_steps_per_second": 2.75,
175
+ "step": 2560
176
+ },
177
+ {
178
+ "epoch": 0.13006327652302435,
179
+ "grad_norm": 0.7619520425796509,
180
+ "learning_rate": 0.0009709988622506973,
181
+ "loss": 0.7779935598373413,
182
+ "step": 2816
183
+ },
184
+ {
185
+ "epoch": 0.1418872107523902,
186
+ "grad_norm": 0.7269508242607117,
187
+ "learning_rate": 0.000964275131968659,
188
+ "loss": 0.7515906691551208,
189
+ "step": 3072
190
+ },
191
+ {
192
+ "epoch": 0.1418872107523902,
193
+ "eval_bleu": 0.06069124069154519,
194
+ "eval_cos_loss": 0.49749508357211336,
195
+ "eval_loss": 0.7418757852626173,
196
+ "eval_mse_loss": 0.7418757852626173,
197
+ "step": 3072
198
+ },
199
+ {
200
+ "epoch": 0.1418872107523902,
201
+ "eval_bleu": 0.06069124069154519,
202
+ "eval_cos_loss": 0.49749508357211336,
203
+ "eval_loss": 0.7418757852626173,
204
+ "eval_mse_loss": 0.7418757852626173,
205
+ "eval_runtime": 159.5995,
206
+ "eval_samples_per_second": 175.395,
207
+ "eval_steps_per_second": 2.744,
208
+ "step": 3072
209
+ },
210
+ {
211
+ "epoch": 0.15371114498175603,
212
+ "grad_norm": 0.526964008808136,
213
+ "learning_rate": 0.0009568794565203123,
214
+ "loss": 0.7329623103141785,
215
+ "step": 3328
216
+ },
217
+ {
218
+ "epoch": 0.1655350792111219,
219
+ "grad_norm": 0.6683301329612732,
220
+ "learning_rate": 0.0009488225396630347,
221
+ "loss": 0.7124975323677063,
222
+ "step": 3584
223
+ },
224
+ {
225
+ "epoch": 0.1655350792111219,
226
+ "eval_bleu": 0.07747562521735782,
227
+ "eval_cos_loss": 0.4767472299674875,
228
+ "eval_loss": 0.7043111967986033,
229
+ "eval_mse_loss": 0.7043111967986033,
230
+ "step": 3584
231
+ },
232
+ {
233
+ "epoch": 0.1655350792111219,
234
+ "eval_bleu": 0.07747562521735782,
235
+ "eval_cos_loss": 0.4767472299674875,
236
+ "eval_loss": 0.7043111967986033,
237
+ "eval_mse_loss": 0.7043111967986033,
238
+ "eval_runtime": 162.4192,
239
+ "eval_samples_per_second": 172.35,
240
+ "eval_steps_per_second": 2.697,
241
+ "step": 3584
242
+ },
243
+ {
244
+ "epoch": 0.17735901344048774,
245
+ "grad_norm": 0.6260165572166443,
246
+ "learning_rate": 0.0009401160421685646,
247
+ "loss": 0.6971993446350098,
248
+ "step": 3840
249
+ },
250
+ {
251
+ "epoch": 0.18918294766985358,
252
+ "grad_norm": 0.7788051962852478,
253
+ "learning_rate": 0.0009307725649463714,
254
+ "loss": 0.6853694319725037,
255
+ "step": 4096
256
+ },
257
+ {
258
+ "epoch": 0.18918294766985358,
259
+ "eval_bleu": 0.0886926891607534,
260
+ "eval_cos_loss": 0.46421769383835465,
261
+ "eval_loss": 0.6790926791217229,
262
+ "eval_mse_loss": 0.6790926791217229,
263
+ "step": 4096
264
+ },
265
+ {
266
+ "epoch": 0.18918294766985358,
267
+ "eval_bleu": 0.0886926891607534,
268
+ "eval_cos_loss": 0.46421769383835465,
269
+ "eval_loss": 0.6790926791217229,
270
+ "eval_mse_loss": 0.6790926791217229,
271
+ "eval_runtime": 161.9861,
272
+ "eval_samples_per_second": 172.811,
273
+ "eval_steps_per_second": 2.704,
274
+ "step": 4096
275
+ },
276
+ {
277
+ "epoch": 0.20100688189921945,
278
+ "grad_norm": 0.5158849358558655,
279
+ "learning_rate": 0.0009208056308063659,
280
+ "loss": 0.6696363687515259,
281
+ "step": 4352
282
+ },
283
+ {
284
+ "epoch": 0.2128308161285853,
285
+ "grad_norm": 0.5475754141807556,
286
+ "learning_rate": 0.0009102296648873445,
287
+ "loss": 0.6564373970031738,
288
+ "step": 4608
289
+ },
290
+ {
291
+ "epoch": 0.2128308161285853,
292
+ "eval_bleu": 0.10135086888192472,
293
+ "eval_cos_loss": 0.45056082961493976,
294
+ "eval_loss": 0.6526828235415019,
295
+ "eval_mse_loss": 0.6526828235415019,
296
+ "step": 4608
297
+ },
298
+ {
299
+ "epoch": 0.2128308161285853,
300
+ "eval_bleu": 0.10135086888192472,
301
+ "eval_cos_loss": 0.45056082961493976,
302
+ "eval_loss": 0.6526828235415019,
303
+ "eval_mse_loss": 0.6526828235415019,
304
+ "eval_runtime": 160.4944,
305
+ "eval_samples_per_second": 174.417,
306
+ "eval_steps_per_second": 2.729,
307
+ "step": 4608
308
+ },
309
+ {
310
+ "epoch": 0.22465475035795113,
311
+ "grad_norm": 0.4408429265022278,
312
+ "learning_rate": 0.0008990599737794927,
313
+ "loss": 0.6503246426582336,
314
+ "step": 4864
315
+ },
316
+ {
317
+ "epoch": 0.236478684587317,
318
+ "grad_norm": 0.5507891774177551,
319
+ "learning_rate": 0.0008873127233711644,
320
+ "loss": 0.6398327946662903,
321
+ "step": 5120
322
+ },
323
+ {
324
+ "epoch": 0.236478684587317,
325
+ "eval_bleu": 0.11090334235828597,
326
+ "eval_cos_loss": 0.43968688012802437,
327
+ "eval_loss": 0.6368203232549641,
328
+ "eval_mse_loss": 0.6368203232549641,
329
+ "step": 5120
330
+ },
331
+ {
332
+ "epoch": 0.236478684587317,
333
+ "eval_bleu": 0.11090334235828597,
334
+ "eval_cos_loss": 0.43968688012802437,
335
+ "eval_loss": 0.6368203232549641,
336
+ "eval_mse_loss": 0.6368203232549641,
337
+ "eval_runtime": 163.0003,
338
+ "eval_samples_per_second": 171.736,
339
+ "eval_steps_per_second": 2.687,
340
+ "step": 5120
341
+ },
342
+ {
343
+ "epoch": 0.24830261881668284,
344
+ "grad_norm": 0.5450671911239624,
345
+ "learning_rate": 0.0008750049154520011,
346
+ "loss": 0.6276033520698547,
347
+ "step": 5376
348
+ },
349
+ {
350
+ "epoch": 0.2601265530460487,
351
+ "grad_norm": 0.4864253103733063,
352
+ "learning_rate": 0.0008621543631062487,
353
+ "loss": 0.6176455616950989,
354
+ "step": 5632
355
+ },
356
+ {
357
+ "epoch": 0.2601265530460487,
358
+ "eval_bleu": 0.13157973832317418,
359
+ "eval_cos_loss": 0.42597596265681803,
360
+ "eval_loss": 0.6125754146543267,
361
+ "eval_mse_loss": 0.6125754146543267,
362
+ "step": 5632
363
+ },
364
+ {
365
+ "epoch": 0.2601265530460487,
366
+ "eval_bleu": 0.13157973832317418,
367
+ "eval_cos_loss": 0.42597596265681803,
368
+ "eval_loss": 0.6125754146543267,
369
+ "eval_mse_loss": 0.6125754146543267,
370
+ "eval_runtime": 164.2634,
371
+ "eval_samples_per_second": 170.415,
372
+ "eval_steps_per_second": 2.666,
373
+ "step": 5632
374
+ },
375
+ {
376
+ "epoch": 0.27195048727541454,
377
+ "grad_norm": 0.43313494324684143,
378
+ "learning_rate": 0.0008487796649318904,
379
+ "loss": 0.6093599796295166,
380
+ "step": 5888
381
+ },
382
+ {
383
+ "epoch": 0.2837744215047804,
384
+ "grad_norm": 0.7482439279556274,
385
+ "learning_rate": 0.0008349001781229053,
386
+ "loss": 0.6033267974853516,
387
+ "step": 6144
388
+ },
389
+ {
390
+ "epoch": 0.2837744215047804,
391
+ "eval_bleu": 0.14631271028993093,
392
+ "eval_cos_loss": 0.41583949184581026,
393
+ "eval_loss": 0.5962636355123564,
394
+ "eval_mse_loss": 0.5962636355123564,
395
+ "step": 6144
396
+ },
397
+ {
398
+ "epoch": 0.2837744215047804,
399
+ "eval_bleu": 0.14631271028993093,
400
+ "eval_cos_loss": 0.41583949184581026,
401
+ "eval_loss": 0.5962636355123564,
402
+ "eval_mse_loss": 0.5962636355123564,
403
+ "eval_runtime": 162.422,
404
+ "eval_samples_per_second": 172.347,
405
+ "eval_steps_per_second": 2.697,
406
+ "step": 6144
407
+ },
408
+ {
409
+ "epoch": 0.2955983557341462,
410
+ "grad_norm": 0.6504518985748291,
411
+ "learning_rate": 0.0008205359904536107,
412
+ "loss": 0.5911573171615601,
413
+ "step": 6400
414
+ },
415
+ {
416
+ "epoch": 0.30742228996351206,
417
+ "grad_norm": 0.5136239528656006,
418
+ "learning_rate": 0.0008057078912056363,
419
+ "loss": 0.5828324556350708,
420
+ "step": 6656
421
+ },
422
+ {
423
+ "epoch": 0.30742228996351206,
424
+ "eval_bleu": 0.15939404724680464,
425
+ "eval_cos_loss": 0.4056242143726784,
426
+ "eval_loss": 0.5786329095494257,
427
+ "eval_mse_loss": 0.5786329095494257,
428
+ "step": 6656
429
+ },
430
+ {
431
+ "epoch": 0.30742228996351206,
432
+ "eval_bleu": 0.15939404724680464,
433
+ "eval_cos_loss": 0.4056242143726784,
434
+ "eval_loss": 0.5786329095494257,
435
+ "eval_mse_loss": 0.5786329095494257,
436
+ "eval_runtime": 163.4349,
437
+ "eval_samples_per_second": 171.279,
438
+ "eval_steps_per_second": 2.68,
439
+ "step": 6656
440
+ },
441
+ {
442
+ "epoch": 0.3192462241928779,
443
+ "grad_norm": 0.49864041805267334,
444
+ "learning_rate": 0.0007904373410796086,
445
+ "loss": 0.5757267475128174,
446
+ "step": 6912
447
+ },
448
+ {
449
+ "epoch": 0.3310701584222438,
450
+ "grad_norm": 0.5295012593269348,
451
+ "learning_rate": 0.0007747464411350876,
452
+ "loss": 0.567646324634552,
453
+ "step": 7168
454
+ },
455
+ {
456
+ "epoch": 0.3310701584222438,
457
+ "eval_bleu": 0.1685069007169743,
458
+ "eval_cos_loss": 0.39840105094321787,
459
+ "eval_loss": 0.5660831006966769,
460
+ "eval_mse_loss": 0.5660831006966769,
461
+ "step": 7168
462
+ },
463
+ {
464
+ "epoch": 0.3310701584222438,
465
+ "eval_bleu": 0.1685069007169743,
466
+ "eval_cos_loss": 0.39840105094321787,
467
+ "eval_loss": 0.5660831006966769,
468
+ "eval_mse_loss": 0.5660831006966769,
469
+ "eval_runtime": 162.053,
470
+ "eval_samples_per_second": 172.74,
471
+ "eval_steps_per_second": 2.703,
472
+ "step": 7168
473
+ },
474
+ {
475
+ "epoch": 0.34289409265160964,
476
+ "grad_norm": 0.48798659443855286,
477
+ "learning_rate": 0.000758657900803716,
478
+ "loss": 0.5626987814903259,
479
+ "step": 7424
480
+ },
481
+ {
482
+ "epoch": 0.3547180268809755,
483
+ "grad_norm": 0.4305446445941925,
484
+ "learning_rate": 0.000742195005021869,
485
+ "loss": 0.557548463344574,
486
+ "step": 7680
487
+ },
488
+ {
489
+ "epoch": 0.3547180268809755,
490
+ "eval_bleu": 0.17911785989508686,
491
+ "eval_cos_loss": 0.3920303521907493,
492
+ "eval_loss": 0.553923270269616,
493
+ "eval_mse_loss": 0.553923270269616,
494
+ "step": 7680
495
+ },
496
+ {
497
+ "epoch": 0.3547180268809755,
498
+ "eval_bleu": 0.17911785989508686,
499
+ "eval_cos_loss": 0.3920303521907493,
500
+ "eval_loss": 0.553923270269616,
501
+ "eval_mse_loss": 0.553923270269616,
502
+ "eval_runtime": 163.5661,
503
+ "eval_samples_per_second": 171.142,
504
+ "eval_steps_per_second": 2.678,
505
+ "step": 7680
506
+ },
507
+ {
508
+ "epoch": 0.3665419611103413,
509
+ "grad_norm": 0.4493429958820343,
510
+ "learning_rate": 0.0007253815805303786,
511
+ "loss": 0.552599310874939,
512
+ "step": 7936
513
+ },
514
+ {
515
+ "epoch": 0.37836589533970716,
516
+ "grad_norm": 0.42025429010391235,
517
+ "learning_rate": 0.0007082419613901028,
518
+ "loss": 0.5472441911697388,
519
+ "step": 8192
520
+ },
521
+ {
522
+ "epoch": 0.37836589533970716,
523
+ "eval_bleu": 0.18641399326852548,
524
+ "eval_cos_loss": 0.3872319327233589,
525
+ "eval_loss": 0.54537038974566,
526
+ "eval_mse_loss": 0.54537038974566,
527
+ "step": 8192
528
+ },
529
+ {
530
+ "epoch": 0.37836589533970716,
531
+ "eval_bleu": 0.18641399326852548,
532
+ "eval_cos_loss": 0.3872319327233589,
533
+ "eval_loss": 0.54537038974566,
534
+ "eval_mse_loss": 0.54537038974566,
535
+ "eval_runtime": 161.9209,
536
+ "eval_samples_per_second": 172.881,
537
+ "eval_steps_per_second": 2.705,
538
+ "step": 8192
539
+ },
540
+ {
541
+ "epoch": 0.390189829569073,
542
+ "grad_norm": 0.5434500575065613,
543
+ "learning_rate": 0.0006908009537632514,
544
+ "loss": 0.545592725276947,
545
+ "step": 8448
546
+ },
547
+ {
548
+ "epoch": 0.4020137637984389,
549
+ "grad_norm": 0.4888971447944641,
550
+ "learning_rate": 0.0006730838000114403,
551
+ "loss": 0.54087895154953,
552
+ "step": 8704
553
+ },
554
+ {
555
+ "epoch": 0.4020137637984389,
556
+ "eval_bleu": 0.196455213608019,
557
+ "eval_cos_loss": 0.3822596245976888,
558
+ "eval_loss": 0.5381640580963326,
559
+ "eval_mse_loss": 0.5381640580963326,
560
+ "step": 8704
561
+ },
562
+ {
563
+ "epoch": 0.4020137637984389,
564
+ "eval_bleu": 0.196455213608019,
565
+ "eval_cos_loss": 0.3822596245976888,
566
+ "eval_loss": 0.5381640580963326,
567
+ "eval_mse_loss": 0.5381640580963326,
568
+ "eval_runtime": 161.8948,
569
+ "eval_samples_per_second": 172.909,
570
+ "eval_steps_per_second": 2.705,
571
+ "step": 8704
572
+ },
573
+ {
574
+ "epoch": 0.41383769802780473,
575
+ "grad_norm": 0.47220879793167114,
576
+ "learning_rate": 0.0006551161421624341,
577
+ "loss": 0.5345809459686279,
578
+ "step": 8960
579
+ },
580
+ {
581
+ "epoch": 0.4256616322571706,
582
+ "grad_norm": 0.33014801144599915,
583
+ "learning_rate": 0.0006369239847984517,
584
+ "loss": 0.5279064774513245,
585
+ "step": 9216
586
+ },
587
+ {
588
+ "epoch": 0.4256616322571706,
589
+ "eval_bleu": 0.20667946656569708,
590
+ "eval_cos_loss": 0.3749828126332531,
591
+ "eval_loss": 0.5253440598238549,
592
+ "eval_mse_loss": 0.5253440598238549,
593
+ "step": 9216
594
+ },
595
+ {
596
+ "epoch": 0.4256616322571706,
597
+ "eval_bleu": 0.20667946656569708,
598
+ "eval_cos_loss": 0.3749828126332531,
599
+ "eval_loss": 0.5253440598238549,
600
+ "eval_mse_loss": 0.5253440598238549,
601
+ "eval_runtime": 160.6156,
602
+ "eval_samples_per_second": 174.286,
603
+ "eval_steps_per_second": 2.727,
604
+ "step": 9216
605
+ },
606
+ {
607
+ "epoch": 0.4374855664865364,
608
+ "grad_norm": 0.39421921968460083,
609
+ "learning_rate": 0.0006185336574197479,
610
+ "loss": 0.523585319519043,
611
+ "step": 9472
612
+ },
613
+ {
614
+ "epoch": 0.44930950071590225,
615
+ "grad_norm": 0.39712467789649963,
616
+ "learning_rate": 0.0005999717763379407,
617
+ "loss": 0.5216853618621826,
618
+ "step": 9728
619
+ },
620
+ {
621
+ "epoch": 0.44930950071590225,
622
+ "eval_bleu": 0.21239179754170903,
623
+ "eval_cos_loss": 0.37135064908086435,
624
+ "eval_loss": 0.5193090603504007,
625
+ "eval_mse_loss": 0.5193090603504007,
626
+ "step": 9728
627
+ },
628
+ {
629
+ "epoch": 0.44930950071590225,
630
+ "eval_bleu": 0.21239179754170903,
631
+ "eval_cos_loss": 0.37135064908086435,
632
+ "eval_loss": 0.5193090603504007,
633
+ "eval_mse_loss": 0.5193090603504007,
634
+ "eval_runtime": 162.2466,
635
+ "eval_samples_per_second": 172.534,
636
+ "eval_steps_per_second": 2.7,
637
+ "step": 9728
638
+ },
639
+ {
640
+ "epoch": 0.4611334349452681,
641
+ "grad_norm": 0.4306870102882385,
642
+ "learning_rate": 0.0005812652061542363,
643
+ "loss": 0.5166722536087036,
644
+ "step": 9984
645
+ },
646
+ {
647
+ "epoch": 0.472957369174634,
648
+ "grad_norm": 0.33111369609832764,
649
+ "learning_rate": 0.0005624410208783071,
650
+ "loss": 0.5125476121902466,
651
+ "step": 10240
652
+ },
653
+ {
654
+ "epoch": 0.472957369174634,
655
+ "eval_bleu": 0.22053615881947866,
656
+ "eval_cos_loss": 0.3653238587183495,
657
+ "eval_loss": 0.5105652859494022,
658
+ "eval_mse_loss": 0.5105652859494022,
659
+ "step": 10240
660
+ },
661
+ {
662
+ "epoch": 0.472957369174634,
663
+ "eval_bleu": 0.22053615881947866,
664
+ "eval_cos_loss": 0.3653238587183495,
665
+ "eval_loss": 0.5105652859494022,
666
+ "eval_mse_loss": 0.5105652859494022,
667
+ "eval_runtime": 161.4968,
668
+ "eval_samples_per_second": 173.335,
669
+ "eval_steps_per_second": 2.712,
670
+ "step": 10240
671
+ },
672
+ {
673
+ "epoch": 0.48478130340399983,
674
+ "grad_norm": 0.4274887442588806,
675
+ "learning_rate": 0.0005435264647440881,
676
+ "loss": 0.5081963539123535,
677
+ "step": 10496
678
+ },
679
+ {
680
+ "epoch": 0.49660523763336567,
681
+ "grad_norm": 0.39072319865226746,
682
+ "learning_rate": 0.000524548912779213,
683
+ "loss": 0.503269374370575,
684
+ "step": 10752
685
+ },
686
+ {
687
+ "epoch": 0.49660523763336567,
688
+ "eval_bleu": 0.22996295812492562,
689
+ "eval_cos_loss": 0.3602397588153952,
690
+ "eval_loss": 0.5025479411153488,
691
+ "eval_mse_loss": 0.5025479411153488,
692
+ "step": 10752
693
+ },
694
+ {
695
+ "epoch": 0.49660523763336567,
696
+ "eval_bleu": 0.22996295812492562,
697
+ "eval_cos_loss": 0.3602397588153952,
698
+ "eval_loss": 0.5025479411153488,
699
+ "eval_mse_loss": 0.5025479411153488,
700
+ "eval_runtime": 161.7807,
701
+ "eval_samples_per_second": 173.031,
702
+ "eval_steps_per_second": 2.707,
703
+ "step": 10752
704
+ },
705
+ {
706
+ "epoch": 0.5084291718627315,
707
+ "grad_norm": 0.4057266414165497,
708
+ "learning_rate": 0.0005055358311851499,
709
+ "loss": 0.5023725032806396,
710
+ "step": 11008
711
+ },
712
+ {
713
+ "epoch": 0.5202531060920974,
714
+ "grad_norm": 0.4108782708644867,
715
+ "learning_rate": 0.0004865147375853812,
716
+ "loss": 0.49648576974868774,
717
+ "step": 11264
718
+ },
719
+ {
720
+ "epoch": 0.5202531060920974,
721
+ "eval_bleu": 0.2398296736572509,
722
+ "eval_cos_loss": 0.3552770841883742,
723
+ "eval_loss": 0.49366489923707974,
724
+ "eval_mse_loss": 0.49366489923707974,
725
+ "step": 11264
726
+ },
727
+ {
728
+ "epoch": 0.5202531060920974,
729
+ "eval_bleu": 0.2398296736572509,
730
+ "eval_cos_loss": 0.3552770841883742,
731
+ "eval_loss": 0.49366489923707974,
732
+ "eval_mse_loss": 0.49366489923707974,
733
+ "eval_runtime": 161.5263,
734
+ "eval_samples_per_second": 173.303,
735
+ "eval_steps_per_second": 2.712,
736
+ "step": 11264
737
+ }
738
+ ],
739
+ "logging_steps": 256,
740
+ "max_steps": 21651,
741
+ "num_input_tokens_seen": 0,
742
+ "num_train_epochs": 1,
743
+ "save_steps": 512,
744
+ "stateful_callbacks": {
745
+ "TrainerControl": {
746
+ "args": {
747
+ "should_epoch_stop": false,
748
+ "should_evaluate": false,
749
+ "should_log": false,
750
+ "should_save": true,
751
+ "should_training_stop": false
752
+ },
753
+ "attributes": {}
754
+ }
755
+ },
756
+ "total_flos": 0.0,
757
+ "train_batch_size": 64,
758
+ "trial_name": null,
759
+ "trial_params": null
760
+ }
checkpoints-v1.0b-discrete-condition/checkpoint-11264/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ecd56bbefa515c916b0791362892dd6ccc687a6e1607fb7282c4a8421aff5927
3
+ size 5201