Update training logs at step 800
Browse files- training_logs.jsonl +17 -0
training_logs.jsonl
CHANGED
|
@@ -16,3 +16,20 @@
|
|
| 16 |
{"step": 375, "epoch": 0.30339805825242716, "time": "2026-06-26 20:19:24", "logs": {"loss": 0.3013817977905273, "grad_norm": 0.42674902081489563, "learning_rate": 1.5141700404858302e-05, "epoch": 0.30339805825242716}}
|
| 17 |
{"step": 400, "epoch": 0.32362459546925565, "time": "2026-06-26 20:19:46", "logs": {"loss": 0.22500619888305665, "grad_norm": 0.6443495750427246, "learning_rate": 1.6153846153846154e-05, "epoch": 0.32362459546925565}}
|
| 18 |
{"step": 400, "epoch": 0.32362459546925565, "time": "2026-06-26 20:20:21", "logs": {"eval_loss": 0.16199301183223724, "eval_accuracy": 0.9560384032339565, "eval_precision": 0.9539936102236422, "eval_recall": 0.9900530503978779, "eval_f1": 0.9716889033517735, "eval_runtime": 34.745, "eval_samples_per_second": 56.958, "eval_steps_per_second": 3.569, "epoch": 0.32362459546925565}}
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 16 |
{"step": 375, "epoch": 0.30339805825242716, "time": "2026-06-26 20:19:24", "logs": {"loss": 0.3013817977905273, "grad_norm": 0.42674902081489563, "learning_rate": 1.5141700404858302e-05, "epoch": 0.30339805825242716}}
|
| 17 |
{"step": 400, "epoch": 0.32362459546925565, "time": "2026-06-26 20:19:46", "logs": {"loss": 0.22500619888305665, "grad_norm": 0.6443495750427246, "learning_rate": 1.6153846153846154e-05, "epoch": 0.32362459546925565}}
|
| 18 |
{"step": 400, "epoch": 0.32362459546925565, "time": "2026-06-26 20:20:21", "logs": {"eval_loss": 0.16199301183223724, "eval_accuracy": 0.9560384032339565, "eval_precision": 0.9539936102236422, "eval_recall": 0.9900530503978779, "eval_f1": 0.9716889033517735, "eval_runtime": 34.745, "eval_samples_per_second": 56.958, "eval_steps_per_second": 3.569, "epoch": 0.32362459546925565}}
|
| 19 |
+
{"step": 425, "epoch": 0.34385113268608414, "time": "2026-06-26 20:21:03", "logs": {"loss": 0.23191883087158202, "grad_norm": 12.952281951904297, "learning_rate": 1.716599190283401e-05, "epoch": 0.34385113268608414}}
|
| 20 |
+
{"step": 450, "epoch": 0.3640776699029126, "time": "2026-06-26 20:21:27", "logs": {"loss": 0.26200836181640624, "grad_norm": 19.496694564819336, "learning_rate": 1.8178137651821864e-05, "epoch": 0.3640776699029126}}
|
| 21 |
+
{"step": 475, "epoch": 0.3843042071197411, "time": "2026-06-26 20:21:49", "logs": {"loss": 0.164515438079834, "grad_norm": 2.9963057041168213, "learning_rate": 1.9190283400809718e-05, "epoch": 0.3843042071197411}}
|
| 22 |
+
{"step": 500, "epoch": 0.4045307443365696, "time": "2026-06-26 20:22:11", "logs": {"loss": 0.2513391304016113, "grad_norm": 0.2180398553609848, "learning_rate": 1.999993769982229e-05, "epoch": 0.4045307443365696}}
|
| 23 |
+
{"step": 525, "epoch": 0.42475728155339804, "time": "2026-06-26 20:22:34", "logs": {"loss": 0.30474105834960935, "grad_norm": 15.512799263000488, "learning_rate": 1.9997757275108847e-05, "epoch": 0.42475728155339804}}
|
| 24 |
+
{"step": 550, "epoch": 0.4449838187702265, "time": "2026-06-26 20:22:57", "logs": {"loss": 0.214493408203125, "grad_norm": 23.762832641601562, "learning_rate": 1.9992462617728763e-05, "epoch": 0.4449838187702265}}
|
| 25 |
+
{"step": 575, "epoch": 0.465210355987055, "time": "2026-06-26 20:23:20", "logs": {"loss": 0.23740652084350586, "grad_norm": 0.5767886638641357, "learning_rate": 1.9984055376931414e-05, "epoch": 0.465210355987055}}
|
| 26 |
+
{"step": 600, "epoch": 0.4854368932038835, "time": "2026-06-26 20:23:43", "logs": {"loss": 0.2517130470275879, "grad_norm": 3.6927132606506348, "learning_rate": 1.9972538171514525e-05, "epoch": 0.4854368932038835}}
|
| 27 |
+
{"step": 625, "epoch": 0.5056634304207119, "time": "2026-06-26 20:24:05", "logs": {"loss": 0.21869991302490235, "grad_norm": 2.146721363067627, "learning_rate": 1.9957914589008405e-05, "epoch": 0.5056634304207119}}
|
| 28 |
+
{"step": 650, "epoch": 0.5258899676375405, "time": "2026-06-26 20:24:28", "logs": {"loss": 0.2582887077331543, "grad_norm": 9.424388885498047, "learning_rate": 1.9940189184558487e-05, "epoch": 0.5258899676375405}}
|
| 29 |
+
{"step": 675, "epoch": 0.5461165048543689, "time": "2026-06-26 20:24:51", "logs": {"loss": 0.2324064254760742, "grad_norm": 4.679764747619629, "learning_rate": 1.9919367479506413e-05, "epoch": 0.5461165048543689}}
|
| 30 |
+
{"step": 700, "epoch": 0.5663430420711975, "time": "2026-06-26 20:25:14", "logs": {"loss": 0.23698102951049804, "grad_norm": 3.0119147300720215, "learning_rate": 1.989545595967018e-05, "epoch": 0.5663430420711975}}
|
| 31 |
+
{"step": 725, "epoch": 0.5865695792880259, "time": "2026-06-26 20:25:37", "logs": {"loss": 0.23535886764526368, "grad_norm": 10.184627532958984, "learning_rate": 1.986846207332384e-05, "epoch": 0.5865695792880259}}
|
| 32 |
+
{"step": 750, "epoch": 0.6067961165048543, "time": "2026-06-26 20:26:00", "logs": {"loss": 0.13176690101623534, "grad_norm": 51.39314651489258, "learning_rate": 1.9838394228877443e-05, "epoch": 0.6067961165048543}}
|
| 33 |
+
{"step": 775, "epoch": 0.6270226537216829, "time": "2026-06-26 20:26:22", "logs": {"loss": 0.2888069725036621, "grad_norm": 18.441652297973633, "learning_rate": 1.980526179225785e-05, "epoch": 0.6270226537216829}}
|
| 34 |
+
{"step": 800, "epoch": 0.6472491909385113, "time": "2026-06-26 20:26:45", "logs": {"loss": 0.29139081954956053, "grad_norm": 0.9691627621650696, "learning_rate": 1.97690750839913e-05, "epoch": 0.6472491909385113}}
|
| 35 |
+
{"step": 800, "epoch": 0.6472491909385113, "time": "2026-06-26 20:27:20", "logs": {"eval_loss": 0.14249353110790253, "eval_accuracy": 0.965133906013138, "eval_precision": 0.967511371020143, "eval_recall": 0.9874005305039788, "eval_f1": 0.9773547751887102, "eval_runtime": 34.6417, "eval_samples_per_second": 57.128, "eval_steps_per_second": 3.58, "epoch": 0.6472491909385113}}
|