ChiefTheLord commited on
Commit
9034ecf
·
verified ·
1 Parent(s): 41debad

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -108,3 +108,4 @@ checkpoints-v1.0f-discrete-condition/checkpoint-15360/eval_state.json filter=lfs
108
  checkpoints-v1.0f-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
109
  checkpoints-v2.0a-discrete-condition/checkpoint-4096/eval_state.json filter=lfs diff=lfs merge=lfs -text
110
  checkpoints-v2.0a-discrete-condition/checkpoint-17408/eval_state.json filter=lfs diff=lfs merge=lfs -text
 
 
108
  checkpoints-v1.0f-discrete-condition/checkpoint-21651/eval_state.json filter=lfs diff=lfs merge=lfs -text
109
  checkpoints-v2.0a-discrete-condition/checkpoint-4096/eval_state.json filter=lfs diff=lfs merge=lfs -text
110
  checkpoints-v2.0a-discrete-condition/checkpoint-17408/eval_state.json filter=lfs diff=lfs merge=lfs -text
111
+ checkpoints-v2.0a-discrete-condition/checkpoint-20480/eval_state.json filter=lfs diff=lfs merge=lfs -text
checkpoints-v2.0a-discrete-condition/checkpoint-20480/eval_state.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:87764c39e59b18223bd5836da3afadcf653921951508d0a46f58a6b806965573
3
+ size 43946523
checkpoints-v2.0a-discrete-condition/checkpoint-20480/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e48498afc293216b64cd892481f29f2f6dc3ef7c03f2ddfa73a2963acad867da
3
+ size 15210032
checkpoints-v2.0a-discrete-condition/checkpoint-20480/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:64340172d7ac31f86fee71238ad4ba474854f56dd72d83008b3a43d8fe0c3221
3
+ size 13675339
checkpoints-v2.0a-discrete-condition/checkpoint-20480/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:75f98efdb41ecaf490c8933e7f3828c49e011a3d6c5a11eb00d3650064937597
3
+ size 14645
checkpoints-v2.0a-discrete-condition/checkpoint-20480/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9f14e5d566925eca6437d621595219dc14f71ac82724e510a163ca18bf7ed72c
3
+ size 1383
checkpoints-v2.0a-discrete-condition/checkpoint-20480/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:205d765e13e1be2966644dd0f0eaaf87a8a81b7f8860b6a9dc2ebf25b30616e3
3
+ size 1465
checkpoints-v2.0a-discrete-condition/checkpoint-20480/trainer_state.json ADDED
@@ -0,0 +1,1054 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.945914738349268,
6
+ "eval_steps": 1024,
7
+ "global_step": 20480,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011823934229365849,
14
+ "grad_norm": 0.3142397999763489,
15
+ "learning_rate": 0.000498046875,
16
+ "loss": 2.5664353370666504,
17
+ "step": 256
18
+ },
19
+ {
20
+ "epoch": 0.023647868458731697,
21
+ "grad_norm": 0.7134925127029419,
22
+ "learning_rate": 0.000998046875,
23
+ "loss": 1.9098931550979614,
24
+ "step": 512
25
+ },
26
+ {
27
+ "epoch": 0.03547180268809755,
28
+ "grad_norm": 1.1968424320220947,
29
+ "learning_rate": 0.000999640996023194,
30
+ "loss": 1.6245745420455933,
31
+ "step": 768
32
+ },
33
+ {
34
+ "epoch": 0.047295736917463395,
35
+ "grad_norm": 0.9976363182067871,
36
+ "learning_rate": 0.0009985588674043958,
37
+ "loss": 1.4784010648727417,
38
+ "step": 1024
39
+ },
40
+ {
41
+ "epoch": 0.047295736917463395,
42
+ "eval_bleu": 0.0011133109477885134,
43
+ "eval_cos0_loss": 0.35662247560339977,
44
+ "eval_cos_loss": 0.3775373704765485,
45
+ "eval_loss": 1.4111966779242913,
46
+ "eval_mse0_loss": 1.4443081268981166,
47
+ "eval_mse_loss": 1.3780852248679558,
48
+ "step": 1024
49
+ },
50
+ {
51
+ "epoch": 0.047295736917463395,
52
+ "eval_bleu": 0.0011133109477885134,
53
+ "eval_cos0_loss": 0.35662247560339977,
54
+ "eval_cos_loss": 0.3775373704765485,
55
+ "eval_loss": 1.4111966779242913,
56
+ "eval_mse0_loss": 1.4443081268981166,
57
+ "eval_mse_loss": 1.3780852248679558,
58
+ "eval_runtime": 559.8994,
59
+ "eval_samples_per_second": 49.996,
60
+ "eval_steps_per_second": 0.782,
61
+ "step": 1024
62
+ },
63
+ {
64
+ "epoch": 0.05911967114682925,
65
+ "grad_norm": 0.9691009521484375,
66
+ "learning_rate": 0.0009967551747861387,
67
+ "loss": 1.3725448846817017,
68
+ "step": 1280
69
+ },
70
+ {
71
+ "epoch": 0.0709436053761951,
72
+ "grad_norm": 1.2567791938781738,
73
+ "learning_rate": 0.000994232528651847,
74
+ "loss": 1.3024182319641113,
75
+ "step": 1536
76
+ },
77
+ {
78
+ "epoch": 0.08276753960556095,
79
+ "grad_norm": 0.9418615698814392,
80
+ "learning_rate": 0.0009909945800260092,
81
+ "loss": 1.2219008207321167,
82
+ "step": 1792
83
+ },
84
+ {
85
+ "epoch": 0.09459147383492679,
86
+ "grad_norm": 1.0366237163543701,
87
+ "learning_rate": 0.0009870460151900522,
88
+ "loss": 1.166050672531128,
89
+ "step": 2048
90
+ },
91
+ {
92
+ "epoch": 0.09459147383492679,
93
+ "eval_bleu": 0.007989488547135068,
94
+ "eval_cos0_loss": 0.2812547723860501,
95
+ "eval_cos_loss": 0.33213963383408984,
96
+ "eval_loss": 1.1427442649183752,
97
+ "eval_mse0_loss": 1.098496745166169,
98
+ "eval_mse_loss": 1.1869917854870835,
99
+ "step": 2048
100
+ },
101
+ {
102
+ "epoch": 0.09459147383492679,
103
+ "eval_bleu": 0.007989488547135068,
104
+ "eval_cos0_loss": 0.2812547723860501,
105
+ "eval_cos_loss": 0.33213963383408984,
106
+ "eval_loss": 1.1427442649183752,
107
+ "eval_mse0_loss": 1.098496745166169,
108
+ "eval_mse_loss": 1.1869917854870835,
109
+ "eval_runtime": 556.0835,
110
+ "eval_samples_per_second": 50.34,
111
+ "eval_steps_per_second": 0.788,
112
+ "step": 2048
113
+ },
114
+ {
115
+ "epoch": 0.10641540806429264,
116
+ "grad_norm": 1.2856756448745728,
117
+ "learning_rate": 0.0009823925488998885,
118
+ "loss": 1.1258903741836548,
119
+ "step": 2304
120
+ },
121
+ {
122
+ "epoch": 0.1182393422936585,
123
+ "grad_norm": 1.1996031999588013,
124
+ "learning_rate": 0.0009770409161149525,
125
+ "loss": 1.0752795934677124,
126
+ "step": 2560
127
+ },
128
+ {
129
+ "epoch": 0.13006327652302435,
130
+ "grad_norm": 1.0043145418167114,
131
+ "learning_rate": 0.0009709988622506973,
132
+ "loss": 1.034059762954712,
133
+ "step": 2816
134
+ },
135
+ {
136
+ "epoch": 0.1418872107523902,
137
+ "grad_norm": 1.327103853225708,
138
+ "learning_rate": 0.000964275131968659,
139
+ "loss": 0.9963141083717346,
140
+ "step": 3072
141
+ },
142
+ {
143
+ "epoch": 0.1418872107523902,
144
+ "eval_bleu": 0.024982546797062154,
145
+ "eval_cos0_loss": 0.23017472596881597,
146
+ "eval_cos_loss": 0.3040819166729984,
147
+ "eval_loss": 0.9821336078861532,
148
+ "eval_mse0_loss": 0.8859744953782591,
149
+ "eval_mse_loss": 1.0782927214827167,
150
+ "step": 3072
151
+ },
152
+ {
153
+ "epoch": 0.1418872107523902,
154
+ "eval_bleu": 0.024982546797062154,
155
+ "eval_cos0_loss": 0.23017472596881597,
156
+ "eval_cos_loss": 0.3040819166729984,
157
+ "eval_loss": 0.9821336078861532,
158
+ "eval_mse0_loss": 0.8859744953782591,
159
+ "eval_mse_loss": 1.0782927214827167,
160
+ "eval_runtime": 554.8091,
161
+ "eval_samples_per_second": 50.455,
162
+ "eval_steps_per_second": 0.789,
163
+ "step": 3072
164
+ },
165
+ {
166
+ "epoch": 0.15371114498175603,
167
+ "grad_norm": 1.20012366771698,
168
+ "learning_rate": 0.0009568794565203123,
169
+ "loss": 0.9632707238197327,
170
+ "step": 3328
171
+ },
172
+ {
173
+ "epoch": 0.1655350792111219,
174
+ "grad_norm": 1.1331790685653687,
175
+ "learning_rate": 0.0009488225396630347,
176
+ "loss": 0.9331204891204834,
177
+ "step": 3584
178
+ },
179
+ {
180
+ "epoch": 0.17735901344048774,
181
+ "grad_norm": 1.2750242948532104,
182
+ "learning_rate": 0.0009401160421685646,
183
+ "loss": 0.9070082306861877,
184
+ "step": 3840
185
+ },
186
+ {
187
+ "epoch": 0.18918294766985358,
188
+ "grad_norm": 1.2876979112625122,
189
+ "learning_rate": 0.0009307725649463714,
190
+ "loss": 0.885317325592041,
191
+ "step": 4096
192
+ },
193
+ {
194
+ "epoch": 0.18918294766985358,
195
+ "eval_bleu": 0.06063932312714804,
196
+ "eval_cos0_loss": 0.20171181510572564,
197
+ "eval_cos_loss": 0.28187595001638754,
198
+ "eval_loss": 0.8752339045478873,
199
+ "eval_mse0_loss": 0.7643582605880145,
200
+ "eval_mse_loss": 0.9861095474190908,
201
+ "step": 4096
202
+ },
203
+ {
204
+ "epoch": 0.18918294766985358,
205
+ "eval_bleu": 0.06063932312714804,
206
+ "eval_cos0_loss": 0.20171181510572564,
207
+ "eval_cos_loss": 0.28187595001638754,
208
+ "eval_loss": 0.8752339045478873,
209
+ "eval_mse0_loss": 0.7643582605880145,
210
+ "eval_mse_loss": 0.9861095474190908,
211
+ "eval_runtime": 557.2308,
212
+ "eval_samples_per_second": 50.236,
213
+ "eval_steps_per_second": 0.786,
214
+ "step": 4096
215
+ },
216
+ {
217
+ "epoch": 0.20100688189921945,
218
+ "grad_norm": 1.1240010261535645,
219
+ "learning_rate": 0.0009208056308063659,
220
+ "loss": 0.8680519461631775,
221
+ "step": 4352
222
+ },
223
+ {
224
+ "epoch": 0.2128308161285853,
225
+ "grad_norm": 1.2636797428131104,
226
+ "learning_rate": 0.0009102296648873445,
227
+ "loss": 0.8495728969573975,
228
+ "step": 4608
229
+ },
230
+ {
231
+ "epoch": 0.22465475035795113,
232
+ "grad_norm": 1.360592007637024,
233
+ "learning_rate": 0.0008990599737794927,
234
+ "loss": 0.8332192301750183,
235
+ "step": 4864
236
+ },
237
+ {
238
+ "epoch": 0.236478684587317,
239
+ "grad_norm": 1.234397292137146,
240
+ "learning_rate": 0.0008873127233711644,
241
+ "loss": 0.8192408084869385,
242
+ "step": 5120
243
+ },
244
+ {
245
+ "epoch": 0.236478684587317,
246
+ "eval_bleu": 0.10255567816097404,
247
+ "eval_cos0_loss": 0.18466767206039603,
248
+ "eval_cos_loss": 0.26551847068006046,
249
+ "eval_loss": 0.8101615647202758,
250
+ "eval_mse0_loss": 0.6974468048849062,
251
+ "eval_mse_loss": 0.9228763238752269,
252
+ "step": 5120
253
+ },
254
+ {
255
+ "epoch": 0.236478684587317,
256
+ "eval_bleu": 0.10255567816097404,
257
+ "eval_cos0_loss": 0.18466767206039603,
258
+ "eval_cos_loss": 0.26551847068006046,
259
+ "eval_loss": 0.8101615647202758,
260
+ "eval_mse0_loss": 0.6974468048849062,
261
+ "eval_mse_loss": 0.9228763238752269,
262
+ "eval_runtime": 583.7558,
263
+ "eval_samples_per_second": 47.953,
264
+ "eval_steps_per_second": 0.75,
265
+ "step": 5120
266
+ },
267
+ {
268
+ "epoch": 0.24830261881668284,
269
+ "grad_norm": 1.173608422279358,
270
+ "learning_rate": 0.0008750049154520011,
271
+ "loss": 0.8069764375686646,
272
+ "step": 5376
273
+ },
274
+ {
275
+ "epoch": 0.2601265530460487,
276
+ "grad_norm": 1.8336809873580933,
277
+ "learning_rate": 0.0008621543631062487,
278
+ "loss": 0.795956015586853,
279
+ "step": 5632
280
+ },
281
+ {
282
+ "epoch": 0.27195048727541454,
283
+ "grad_norm": 1.5927679538726807,
284
+ "learning_rate": 0.0008487796649318904,
285
+ "loss": 0.7861471176147461,
286
+ "step": 5888
287
+ },
288
+ {
289
+ "epoch": 0.2837744215047804,
290
+ "grad_norm": 1.0291717052459717,
291
+ "learning_rate": 0.0008349001781229053,
292
+ "loss": 0.7804827094078064,
293
+ "step": 6144
294
+ },
295
+ {
296
+ "epoch": 0.2837744215047804,
297
+ "eval_bleu": 0.13127766845735372,
298
+ "eval_cos0_loss": 0.17457472553400144,
299
+ "eval_cos_loss": 0.25580114595694087,
300
+ "eval_loss": 0.7713260930967113,
301
+ "eval_mse0_loss": 0.6574085895057138,
302
+ "eval_mse_loss": 0.8852435932856172,
303
+ "step": 6144
304
+ },
305
+ {
306
+ "epoch": 0.2837744215047804,
307
+ "eval_bleu": 0.13127766845735372,
308
+ "eval_cos0_loss": 0.17457472553400144,
309
+ "eval_cos_loss": 0.25580114595694087,
310
+ "eval_loss": 0.7713260930967113,
311
+ "eval_mse0_loss": 0.6574085895057138,
312
+ "eval_mse_loss": 0.8852435932856172,
313
+ "eval_runtime": 577.0134,
314
+ "eval_samples_per_second": 48.514,
315
+ "eval_steps_per_second": 0.759,
316
+ "step": 6144
317
+ },
318
+ {
319
+ "epoch": 0.2955983557341462,
320
+ "grad_norm": 1.3018436431884766,
321
+ "learning_rate": 0.0008205359904536107,
322
+ "loss": 0.7684663534164429,
323
+ "step": 6400
324
+ },
325
+ {
326
+ "epoch": 0.30742228996351206,
327
+ "grad_norm": 1.0704524517059326,
328
+ "learning_rate": 0.0008057078912056363,
329
+ "loss": 0.7616295218467712,
330
+ "step": 6656
331
+ },
332
+ {
333
+ "epoch": 0.3192462241928779,
334
+ "grad_norm": 1.6023725271224976,
335
+ "learning_rate": 0.0007904373410796086,
336
+ "loss": 0.7544670701026917,
337
+ "step": 6912
338
+ },
339
+ {
340
+ "epoch": 0.3310701584222438,
341
+ "grad_norm": 1.219114065170288,
342
+ "learning_rate": 0.0007747464411350876,
343
+ "loss": 0.7457343339920044,
344
+ "step": 7168
345
+ },
346
+ {
347
+ "epoch": 0.3310701584222438,
348
+ "eval_bleu": 0.15246682650512422,
349
+ "eval_cos0_loss": 0.1674851971810267,
350
+ "eval_cos_loss": 0.2466294202766462,
351
+ "eval_loss": 0.7406182776303052,
352
+ "eval_mse0_loss": 0.6302642956988452,
353
+ "eval_mse_loss": 0.8509722592895979,
354
+ "step": 7168
355
+ },
356
+ {
357
+ "epoch": 0.3310701584222438,
358
+ "eval_bleu": 0.15246682650512422,
359
+ "eval_cos0_loss": 0.1674851971810267,
360
+ "eval_cos_loss": 0.2466294202766462,
361
+ "eval_loss": 0.7406182776303052,
362
+ "eval_mse0_loss": 0.6302642956988452,
363
+ "eval_mse_loss": 0.8509722592895979,
364
+ "eval_runtime": 578.8909,
365
+ "eval_samples_per_second": 48.356,
366
+ "eval_steps_per_second": 0.757,
367
+ "step": 7168
368
+ },
369
+ {
370
+ "epoch": 0.34289409265160964,
371
+ "grad_norm": 1.460205078125,
372
+ "learning_rate": 0.000758657900803716,
373
+ "loss": 0.738666832447052,
374
+ "step": 7424
375
+ },
376
+ {
377
+ "epoch": 0.3547180268809755,
378
+ "grad_norm": 1.2112350463867188,
379
+ "learning_rate": 0.000742195005021869,
380
+ "loss": 0.7338549494743347,
381
+ "step": 7680
382
+ },
383
+ {
384
+ "epoch": 0.3665419611103413,
385
+ "grad_norm": 1.5046770572662354,
386
+ "learning_rate": 0.0007253815805303786,
387
+ "loss": 0.7262668609619141,
388
+ "step": 7936
389
+ },
390
+ {
391
+ "epoch": 0.37836589533970716,
392
+ "grad_norm": 1.2543824911117554,
393
+ "learning_rate": 0.0007082419613901028,
394
+ "loss": 0.7201228141784668,
395
+ "step": 8192
396
+ },
397
+ {
398
+ "epoch": 0.37836589533970716,
399
+ "eval_bleu": 0.1775889548156276,
400
+ "eval_cos0_loss": 0.1623513085520975,
401
+ "eval_cos_loss": 0.2395647324315489,
402
+ "eval_loss": 0.7153391051510153,
403
+ "eval_mse0_loss": 0.6087808826742651,
404
+ "eval_mse_loss": 0.8218973299411878,
405
+ "step": 8192
406
+ },
407
+ {
408
+ "epoch": 0.37836589533970716,
409
+ "eval_bleu": 0.1775889548156276,
410
+ "eval_cos0_loss": 0.1623513085520975,
411
+ "eval_cos_loss": 0.2395647324315489,
412
+ "eval_loss": 0.7153391051510153,
413
+ "eval_mse0_loss": 0.6087808826742651,
414
+ "eval_mse_loss": 0.8218973299411878,
415
+ "eval_runtime": 580.0403,
416
+ "eval_samples_per_second": 48.26,
417
+ "eval_steps_per_second": 0.755,
418
+ "step": 8192
419
+ },
420
+ {
421
+ "epoch": 0.390189829569073,
422
+ "grad_norm": 1.4440797567367554,
423
+ "learning_rate": 0.0006908009537632514,
424
+ "loss": 0.7171863317489624,
425
+ "step": 8448
426
+ },
427
+ {
428
+ "epoch": 0.4020137637984389,
429
+ "grad_norm": 1.0524756908416748,
430
+ "learning_rate": 0.0006730838000114403,
431
+ "loss": 0.711561918258667,
432
+ "step": 8704
433
+ },
434
+ {
435
+ "epoch": 0.41383769802780473,
436
+ "grad_norm": 1.1838279962539673,
437
+ "learning_rate": 0.0006551161421624341,
438
+ "loss": 0.7070404291152954,
439
+ "step": 8960
440
+ },
441
+ {
442
+ "epoch": 0.4256616322571706,
443
+ "grad_norm": 1.4732449054718018,
444
+ "learning_rate": 0.0006369239847984517,
445
+ "loss": 0.7004984021186829,
446
+ "step": 9216
447
+ },
448
+ {
449
+ "epoch": 0.4256616322571706,
450
+ "eval_bleu": 0.19457770659123766,
451
+ "eval_cos0_loss": 0.15885940721454142,
452
+ "eval_cos_loss": 0.23402096242665155,
453
+ "eval_loss": 0.6976124562629281,
454
+ "eval_mse0_loss": 0.5943438904742672,
455
+ "eval_mse_loss": 0.8008810213711708,
456
+ "step": 9216
457
+ },
458
+ {
459
+ "epoch": 0.4256616322571706,
460
+ "eval_bleu": 0.19457770659123766,
461
+ "eval_cos0_loss": 0.15885940721454142,
462
+ "eval_cos_loss": 0.23402096242665155,
463
+ "eval_loss": 0.6976124562629281,
464
+ "eval_mse0_loss": 0.5943438904742672,
465
+ "eval_mse_loss": 0.8008810213711708,
466
+ "eval_runtime": 580.0865,
467
+ "eval_samples_per_second": 48.257,
468
+ "eval_steps_per_second": 0.755,
469
+ "step": 9216
470
+ },
471
+ {
472
+ "epoch": 0.4374855664865364,
473
+ "grad_norm": 1.0538158416748047,
474
+ "learning_rate": 0.0006185336574197479,
475
+ "loss": 0.6956149339675903,
476
+ "step": 9472
477
+ },
478
+ {
479
+ "epoch": 0.44930950071590225,
480
+ "grad_norm": 0.8222823143005371,
481
+ "learning_rate": 0.0005999717763379407,
482
+ "loss": 0.6951084733009338,
483
+ "step": 9728
484
+ },
485
+ {
486
+ "epoch": 0.4611334349452681,
487
+ "grad_norm": 1.5588804483413696,
488
+ "learning_rate": 0.0005812652061542363,
489
+ "loss": 0.690363883972168,
490
+ "step": 9984
491
+ },
492
+ {
493
+ "epoch": 0.472957369174634,
494
+ "grad_norm": 1.845235824584961,
495
+ "learning_rate": 0.0005624410208783071,
496
+ "loss": 0.6868069767951965,
497
+ "step": 10240
498
+ },
499
+ {
500
+ "epoch": 0.472957369174634,
501
+ "eval_bleu": 0.20304036498439118,
502
+ "eval_cos0_loss": 0.15687455172272033,
503
+ "eval_cos_loss": 0.23101301504868896,
504
+ "eval_loss": 0.6880998141961555,
505
+ "eval_mse0_loss": 0.5864529236810937,
506
+ "eval_mse_loss": 0.7897467010369584,
507
+ "step": 10240
508
+ },
509
+ {
510
+ "epoch": 0.472957369174634,
511
+ "eval_bleu": 0.20304036498439118,
512
+ "eval_cos0_loss": 0.15687455172272033,
513
+ "eval_cos_loss": 0.23101301504868896,
514
+ "eval_loss": 0.6880998141961555,
515
+ "eval_mse0_loss": 0.5864529236810937,
516
+ "eval_mse_loss": 0.7897467010369584,
517
+ "eval_runtime": 581.3751,
518
+ "eval_samples_per_second": 48.15,
519
+ "eval_steps_per_second": 0.753,
520
+ "step": 10240
521
+ },
522
+ {
523
+ "epoch": 0.48478130340399983,
524
+ "grad_norm": 0.9795528650283813,
525
+ "learning_rate": 0.0005435264647440881,
526
+ "loss": 0.6827271580696106,
527
+ "step": 10496
528
+ },
529
+ {
530
+ "epoch": 0.49660523763336567,
531
+ "grad_norm": 1.3697625398635864,
532
+ "learning_rate": 0.000524548912779213,
533
+ "loss": 0.6798324584960938,
534
+ "step": 10752
535
+ },
536
+ {
537
+ "epoch": 0.5084291718627315,
538
+ "grad_norm": 1.4568535089492798,
539
+ "learning_rate": 0.0005055358311851499,
540
+ "loss": 0.6787227392196655,
541
+ "step": 11008
542
+ },
543
+ {
544
+ "epoch": 0.5202531060920974,
545
+ "grad_norm": 1.4903242588043213,
546
+ "learning_rate": 0.0004865147375853812,
547
+ "loss": 0.674541711807251,
548
+ "step": 11264
549
+ },
550
+ {
551
+ "epoch": 0.5202531060920974,
552
+ "eval_bleu": 0.21345580311184512,
553
+ "eval_cos0_loss": 0.15367668176486612,
554
+ "eval_cos_loss": 0.2262359024386972,
555
+ "eval_loss": 0.6721561401402025,
556
+ "eval_mse0_loss": 0.5740672428858334,
557
+ "eval_mse_loss": 0.7702450397079939,
558
+ "step": 11264
559
+ },
560
+ {
561
+ "epoch": 0.5202531060920974,
562
+ "eval_bleu": 0.21345580311184512,
563
+ "eval_cos0_loss": 0.15367668176486612,
564
+ "eval_cos_loss": 0.2262359024386972,
565
+ "eval_loss": 0.6721561401402025,
566
+ "eval_mse0_loss": 0.5740672428858334,
567
+ "eval_mse_loss": 0.7702450397079939,
568
+ "eval_runtime": 582.4756,
569
+ "eval_samples_per_second": 48.059,
570
+ "eval_steps_per_second": 0.752,
571
+ "step": 11264
572
+ },
573
+ {
574
+ "epoch": 0.5320770403214632,
575
+ "grad_norm": 0.9498454332351685,
576
+ "learning_rate": 0.0004675131611991607,
577
+ "loss": 0.6699618101119995,
578
+ "step": 11520
579
+ },
580
+ {
581
+ "epoch": 0.5439009745508291,
582
+ "grad_norm": 1.4717437028884888,
583
+ "learning_rate": 0.0004485586029984899,
584
+ "loss": 0.6672994494438171,
585
+ "step": 11776
586
+ },
587
+ {
588
+ "epoch": 0.5557249087801949,
589
+ "grad_norm": 0.8287393450737,
590
+ "learning_rate": 0.00042967849590597266,
591
+ "loss": 0.6647874712944031,
592
+ "step": 12032
593
+ },
594
+ {
595
+ "epoch": 0.5675488430095608,
596
+ "grad_norm": 1.1512218713760376,
597
+ "learning_rate": 0.0004109001650911621,
598
+ "loss": 0.6636562347412109,
599
+ "step": 12288
600
+ },
601
+ {
602
+ "epoch": 0.5675488430095608,
603
+ "eval_bleu": 0.21659165416113416,
604
+ "eval_cos0_loss": 0.15134912535344083,
605
+ "eval_cos_loss": 0.22285634510593327,
606
+ "eval_loss": 0.6604986801811549,
607
+ "eval_mse0_loss": 0.5644185297429289,
608
+ "eval_mse_loss": 0.7565788306874227,
609
+ "step": 12288
610
+ },
611
+ {
612
+ "epoch": 0.5675488430095608,
613
+ "eval_bleu": 0.21659165416113416,
614
+ "eval_cos0_loss": 0.15134912535344083,
615
+ "eval_cos_loss": 0.22285634510593327,
616
+ "eval_loss": 0.6604986801811549,
617
+ "eval_mse0_loss": 0.5644185297429289,
618
+ "eval_mse_loss": 0.7565788306874227,
619
+ "eval_runtime": 582.4315,
620
+ "eval_samples_per_second": 48.062,
621
+ "eval_steps_per_second": 0.752,
622
+ "step": 12288
623
+ },
624
+ {
625
+ "epoch": 0.5793727772389267,
626
+ "grad_norm": 1.056576132774353,
627
+ "learning_rate": 0.0003922507884228551,
628
+ "loss": 0.6617808938026428,
629
+ "step": 12544
630
+ },
631
+ {
632
+ "epoch": 0.5911967114682924,
633
+ "grad_norm": 0.8154197335243225,
634
+ "learning_rate": 0.00037375735713457723,
635
+ "loss": 0.6574999690055847,
636
+ "step": 12800
637
+ },
638
+ {
639
+ "epoch": 0.6030206456976583,
640
+ "grad_norm": 0.845640242099762,
641
+ "learning_rate": 0.00035544663676018276,
642
+ "loss": 0.6567996740341187,
643
+ "step": 13056
644
+ },
645
+ {
646
+ "epoch": 0.6148445799270241,
647
+ "grad_norm": 0.8343638777732849,
648
+ "learning_rate": 0.00033734512839611255,
649
+ "loss": 0.6537163257598877,
650
+ "step": 13312
651
+ },
652
+ {
653
+ "epoch": 0.6148445799270241,
654
+ "eval_bleu": 0.218972891768312,
655
+ "eval_cos0_loss": 0.14968309493641876,
656
+ "eval_cos_loss": 0.21990781321645328,
657
+ "eval_loss": 0.6513756312191759,
658
+ "eval_mse0_loss": 0.5580470727322853,
659
+ "eval_mse_loss": 0.7447041914071122,
660
+ "step": 13312
661
+ },
662
+ {
663
+ "epoch": 0.6148445799270241,
664
+ "eval_bleu": 0.218972891768312,
665
+ "eval_cos0_loss": 0.14968309493641876,
666
+ "eval_cos_loss": 0.21990781321645328,
667
+ "eval_loss": 0.6513756312191759,
668
+ "eval_mse0_loss": 0.5580470727322853,
669
+ "eval_mse_loss": 0.7447041914071122,
670
+ "eval_runtime": 583.7719,
671
+ "eval_samples_per_second": 47.952,
672
+ "eval_steps_per_second": 0.75,
673
+ "step": 13312
674
+ },
675
+ {
676
+ "epoch": 0.62666851415639,
677
+ "grad_norm": 0.6949180960655212,
678
+ "learning_rate": 0.0003194790303463687,
679
+ "loss": 0.6500473022460938,
680
+ "step": 13568
681
+ },
682
+ {
683
+ "epoch": 0.6384924483857558,
684
+ "grad_norm": 0.8861774802207947,
685
+ "learning_rate": 0.00030187420020572406,
686
+ "loss": 0.6494355201721191,
687
+ "step": 13824
688
+ },
689
+ {
690
+ "epoch": 0.6503163826151217,
691
+ "grad_norm": 0.6850175857543945,
692
+ "learning_rate": 0.00028455611743603626,
693
+ "loss": 0.6460621953010559,
694
+ "step": 14080
695
+ },
696
+ {
697
+ "epoch": 0.6621403168444876,
698
+ "grad_norm": 0.9398530721664429,
699
+ "learning_rate": 0.0002675498464898373,
700
+ "loss": 0.6458674669265747,
701
+ "step": 14336
702
+ },
703
+ {
704
+ "epoch": 0.6621403168444876,
705
+ "eval_bleu": 0.22438629765015805,
706
+ "eval_cos0_loss": 0.14854568869011586,
707
+ "eval_cos_loss": 0.2177855370387639,
708
+ "eval_loss": 0.645270940239571,
709
+ "eval_mse0_loss": 0.5533656060831732,
710
+ "eval_mse_loss": 0.7371762782743533,
711
+ "step": 14336
712
+ },
713
+ {
714
+ "epoch": 0.6621403168444876,
715
+ "eval_bleu": 0.22438629765015805,
716
+ "eval_cos0_loss": 0.14854568869011586,
717
+ "eval_cos_loss": 0.2177855370387639,
718
+ "eval_loss": 0.645270940239571,
719
+ "eval_mse0_loss": 0.5533656060831732,
720
+ "eval_mse_loss": 0.7371762782743533,
721
+ "eval_runtime": 582.2288,
722
+ "eval_samples_per_second": 48.079,
723
+ "eval_steps_per_second": 0.752,
724
+ "step": 14336
725
+ },
726
+ {
727
+ "epoch": 0.6739642510738534,
728
+ "grad_norm": 0.9482390880584717,
729
+ "learning_rate": 0.0002508800005345623,
730
+ "loss": 0.6461783647537231,
731
+ "step": 14592
732
+ },
733
+ {
734
+ "epoch": 0.6857881853032193,
735
+ "grad_norm": 1.0454894304275513,
736
+ "learning_rate": 0.00023457070582992562,
737
+ "loss": 0.6453952789306641,
738
+ "step": 14848
739
+ },
740
+ {
741
+ "epoch": 0.6976121195325851,
742
+ "grad_norm": 0.8868135213851929,
743
+ "learning_rate": 0.00021864556680999692,
744
+ "loss": 0.6412617564201355,
745
+ "step": 15104
746
+ },
747
+ {
748
+ "epoch": 0.709436053761951,
749
+ "grad_norm": 0.7072922587394714,
750
+ "learning_rate": 0.0002031276319205152,
751
+ "loss": 0.6395705938339233,
752
+ "step": 15360
753
+ },
754
+ {
755
+ "epoch": 0.709436053761951,
756
+ "eval_bleu": 0.231364164368311,
757
+ "eval_cos0_loss": 0.1473281739032976,
758
+ "eval_cos_loss": 0.21577285199540935,
759
+ "eval_loss": 0.6386176923366442,
760
+ "eval_mse0_loss": 0.5485206785947765,
761
+ "eval_mse_loss": 0.7287147069630557,
762
+ "step": 15360
763
+ },
764
+ {
765
+ "epoch": 0.709436053761951,
766
+ "eval_bleu": 0.231364164368311,
767
+ "eval_cos0_loss": 0.1473281739032976,
768
+ "eval_cos_loss": 0.21577285199540935,
769
+ "eval_loss": 0.6386176923366442,
770
+ "eval_mse0_loss": 0.5485206785947765,
771
+ "eval_mse_loss": 0.7287147069630557,
772
+ "eval_runtime": 580.8567,
773
+ "eval_samples_per_second": 48.193,
774
+ "eval_steps_per_second": 0.754,
775
+ "step": 15360
776
+ },
777
+ {
778
+ "epoch": 0.7212599879913169,
779
+ "grad_norm": 0.8857424855232239,
780
+ "learning_rate": 0.00018803936026088542,
781
+ "loss": 0.6385395526885986,
782
+ "step": 15616
783
+ },
784
+ {
785
+ "epoch": 0.7330839222206826,
786
+ "grad_norm": 0.77009516954422,
787
+ "learning_rate": 0.00017340258907913464,
788
+ "loss": 0.6373556852340698,
789
+ "step": 15872
790
+ },
791
+ {
792
+ "epoch": 0.7449078564500485,
793
+ "grad_norm": 0.7372632622718811,
794
+ "learning_rate": 0.0001592385021668743,
795
+ "loss": 0.6355336308479309,
796
+ "step": 16128
797
+ },
798
+ {
799
+ "epoch": 0.7567317906794143,
800
+ "grad_norm": 0.6727356314659119,
801
+ "learning_rate": 0.0001455675992000087,
802
+ "loss": 0.6361183524131775,
803
+ "step": 16384
804
+ },
805
+ {
806
+ "epoch": 0.7567317906794143,
807
+ "eval_bleu": 0.2332805772143465,
808
+ "eval_cos0_loss": 0.14650672378197108,
809
+ "eval_cos_loss": 0.21429855985456406,
810
+ "eval_loss": 0.6337339371851046,
811
+ "eval_mse0_loss": 0.5449576931729164,
812
+ "eval_mse_loss": 0.722510180652958,
813
+ "step": 16384
814
+ },
815
+ {
816
+ "epoch": 0.7567317906794143,
817
+ "eval_bleu": 0.2332805772143465,
818
+ "eval_cos0_loss": 0.14650672378197108,
819
+ "eval_cos_loss": 0.21429855985456406,
820
+ "eval_loss": 0.6337339371851046,
821
+ "eval_mse0_loss": 0.5449576931729164,
822
+ "eval_mse_loss": 0.722510180652958,
823
+ "eval_runtime": 580.5549,
824
+ "eval_samples_per_second": 48.218,
825
+ "eval_steps_per_second": 0.754,
826
+ "step": 16384
827
+ },
828
+ {
829
+ "epoch": 0.7685557249087802,
830
+ "grad_norm": 0.942642092704773,
831
+ "learning_rate": 0.000132409666069565,
832
+ "loss": 0.6327448487281799,
833
+ "step": 16640
834
+ },
835
+ {
836
+ "epoch": 0.780379659138146,
837
+ "grad_norm": 0.7642722725868225,
838
+ "learning_rate": 0.0001197837462455823,
839
+ "loss": 0.6318186521530151,
840
+ "step": 16896
841
+ },
842
+ {
843
+ "epoch": 0.7922035933675119,
844
+ "grad_norm": 0.710328996181488,
845
+ "learning_rate": 0.00010770811321550749,
846
+ "loss": 0.6301425099372864,
847
+ "step": 17152
848
+ },
849
+ {
850
+ "epoch": 0.8040275275968778,
851
+ "grad_norm": 0.8062455654144287,
852
+ "learning_rate": 9.620024403698591e-05,
853
+ "loss": 0.6309673190116882,
854
+ "step": 17408
855
+ },
856
+ {
857
+ "epoch": 0.8040275275968778,
858
+ "eval_bleu": 0.2361557993657376,
859
+ "eval_cos0_loss": 0.14597250963454922,
860
+ "eval_cos_loss": 0.2134290040900174,
861
+ "eval_loss": 0.6308878854801666,
862
+ "eval_mse0_loss": 0.5427405227264858,
863
+ "eval_mse_loss": 0.7190352452400068,
864
+ "step": 17408
865
+ },
866
+ {
867
+ "epoch": 0.8040275275968778,
868
+ "eval_bleu": 0.2361557993657376,
869
+ "eval_cos0_loss": 0.14597250963454922,
870
+ "eval_cos_loss": 0.2134290040900174,
871
+ "eval_loss": 0.6308878854801666,
872
+ "eval_mse0_loss": 0.5427405227264858,
873
+ "eval_mse_loss": 0.7190352452400068,
874
+ "eval_runtime": 582.2393,
875
+ "eval_samples_per_second": 48.078,
876
+ "eval_steps_per_second": 0.752,
877
+ "step": 17408
878
+ },
879
+ {
880
+ "epoch": 0.8158514618262436,
881
+ "grad_norm": 0.713231086730957,
882
+ "learning_rate": 8.527679404332429e-05,
883
+ "loss": 0.6295254826545715,
884
+ "step": 17664
885
+ },
886
+ {
887
+ "epoch": 0.8276753960556095,
888
+ "grad_norm": 0.7920427918434143,
889
+ "learning_rate": 7.495357273823544e-05,
890
+ "loss": 0.6305422186851501,
891
+ "step": 17920
892
+ },
893
+ {
894
+ "epoch": 0.8394993302849753,
895
+ "grad_norm": 0.6485353708267212,
896
+ "learning_rate": 6.524552091475183e-05,
897
+ "loss": 0.6298679113388062,
898
+ "step": 18176
899
+ },
900
+ {
901
+ "epoch": 0.8513232645143411,
902
+ "grad_norm": 1.203540325164795,
903
+ "learning_rate": 5.6166689031422024e-05,
904
+ "loss": 0.6278858184814453,
905
+ "step": 18432
906
+ },
907
+ {
908
+ "epoch": 0.8513232645143411,
909
+ "eval_bleu": 0.23643256145383365,
910
+ "eval_cos0_loss": 0.14557101495870173,
911
+ "eval_cos_loss": 0.21256517758380333,
912
+ "eval_loss": 0.6282455677583337,
913
+ "eval_mse0_loss": 0.5412607261034996,
914
+ "eval_mse_loss": 0.7152304056028252,
915
+ "step": 18432
916
+ },
917
+ {
918
+ "epoch": 0.8513232645143411,
919
+ "eval_bleu": 0.23643256145383365,
920
+ "eval_cos0_loss": 0.14557101495870173,
921
+ "eval_cos_loss": 0.21256517758380333,
922
+ "eval_loss": 0.6282455677583337,
923
+ "eval_mse0_loss": 0.5412607261034996,
924
+ "eval_mse_loss": 0.7152304056028252,
925
+ "eval_runtime": 571.9312,
926
+ "eval_samples_per_second": 48.945,
927
+ "eval_steps_per_second": 0.766,
928
+ "step": 18432
929
+ },
930
+ {
931
+ "epoch": 0.8631471987437069,
932
+ "grad_norm": 0.6927746534347534,
933
+ "learning_rate": 4.773021687709067e-05,
934
+ "loss": 0.6284635663032532,
935
+ "step": 18688
936
+ },
937
+ {
938
+ "epoch": 0.8749711329730728,
939
+ "grad_norm": 0.5226298570632935,
940
+ "learning_rate": 3.994831455368719e-05,
941
+ "loss": 0.6253275871276855,
942
+ "step": 18944
943
+ },
944
+ {
945
+ "epoch": 0.8867950672024387,
946
+ "grad_norm": 0.5533818006515503,
947
+ "learning_rate": 3.283224480455282e-05,
948
+ "loss": 0.6275526881217957,
949
+ "step": 19200
950
+ },
951
+ {
952
+ "epoch": 0.8986190014318045,
953
+ "grad_norm": 0.6016846299171448,
954
+ "learning_rate": 2.639230671387627e-05,
955
+ "loss": 0.6251530051231384,
956
+ "step": 19456
957
+ },
958
+ {
959
+ "epoch": 0.8986190014318045,
960
+ "eval_bleu": 0.23761663065850158,
961
+ "eval_cos0_loss": 0.1453678863437753,
962
+ "eval_cos_loss": 0.21196116486640826,
963
+ "eval_loss": 0.6269270310935364,
964
+ "eval_mse0_loss": 0.5403517224745119,
965
+ "eval_mse_loss": 0.7135023375352224,
966
+ "step": 19456
967
+ },
968
+ {
969
+ "epoch": 0.8986190014318045,
970
+ "eval_bleu": 0.23761663065850158,
971
+ "eval_cos0_loss": 0.1453678863437753,
972
+ "eval_cos_loss": 0.21196116486640826,
973
+ "eval_loss": 0.6269270310935364,
974
+ "eval_mse0_loss": 0.5403517224745119,
975
+ "eval_mse_loss": 0.7135023375352224,
976
+ "eval_runtime": 567.2599,
977
+ "eval_samples_per_second": 49.348,
978
+ "eval_steps_per_second": 0.772,
979
+ "step": 19456
980
+ },
981
+ {
982
+ "epoch": 0.9104429356611704,
983
+ "grad_norm": 0.5271164774894714,
984
+ "learning_rate": 2.063782080083576e-05,
985
+ "loss": 0.6254515051841736,
986
+ "step": 19712
987
+ },
988
+ {
989
+ "epoch": 0.9222668698905362,
990
+ "grad_norm": 0.4297989010810852,
991
+ "learning_rate": 1.557711553001523e-05,
992
+ "loss": 0.626134991645813,
993
+ "step": 19968
994
+ },
995
+ {
996
+ "epoch": 0.9340908041199021,
997
+ "grad_norm": 0.49735113978385925,
998
+ "learning_rate": 1.1217515257622269e-05,
999
+ "loss": 0.6252702474594116,
1000
+ "step": 20224
1001
+ },
1002
+ {
1003
+ "epoch": 0.945914738349268,
1004
+ "grad_norm": 0.5583053231239319,
1005
+ "learning_rate": 7.565329630950746e-06,
1006
+ "loss": 0.6264917850494385,
1007
+ "step": 20480
1008
+ },
1009
+ {
1010
+ "epoch": 0.945914738349268,
1011
+ "eval_bleu": 0.23882465013214838,
1012
+ "eval_cos0_loss": 0.14522393313172746,
1013
+ "eval_cos_loss": 0.21180957511543683,
1014
+ "eval_loss": 0.6258120900147581,
1015
+ "eval_mse0_loss": 0.5397725887086293,
1016
+ "eval_mse_loss": 0.7118515941106021,
1017
+ "step": 20480
1018
+ },
1019
+ {
1020
+ "epoch": 0.945914738349268,
1021
+ "eval_bleu": 0.23882465013214838,
1022
+ "eval_cos0_loss": 0.14522393313172746,
1023
+ "eval_cos_loss": 0.21180957511543683,
1024
+ "eval_loss": 0.6258120900147581,
1025
+ "eval_mse0_loss": 0.5397725887086293,
1026
+ "eval_mse_loss": 0.7118515941106021,
1027
+ "eval_runtime": 577.0806,
1028
+ "eval_samples_per_second": 48.508,
1029
+ "eval_steps_per_second": 0.759,
1030
+ "step": 20480
1031
+ }
1032
+ ],
1033
+ "logging_steps": 256,
1034
+ "max_steps": 21651,
1035
+ "num_input_tokens_seen": 0,
1036
+ "num_train_epochs": 1,
1037
+ "save_steps": 1024,
1038
+ "stateful_callbacks": {
1039
+ "TrainerControl": {
1040
+ "args": {
1041
+ "should_epoch_stop": false,
1042
+ "should_evaluate": false,
1043
+ "should_log": false,
1044
+ "should_save": true,
1045
+ "should_training_stop": false
1046
+ },
1047
+ "attributes": {}
1048
+ }
1049
+ },
1050
+ "total_flos": 0.0,
1051
+ "train_batch_size": 64,
1052
+ "trial_name": null,
1053
+ "trial_params": null
1054
+ }
checkpoints-v2.0a-discrete-condition/checkpoint-20480/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f63a8a711fb280c6320e95476c532b75c862f31d6a218a0d05079e32411a5ae1
3
+ size 5201