{ "best_global_step": 1980, "best_metric": 0.7248677248677249, "best_model_checkpoint": "sentiment-model/model_v2\\checkpoint-1980", "epoch": 4.0, "eval_steps": 250, "global_step": 1980, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.10114632501685772, "grad_norm": 1.0693855285644531, "learning_rate": 0.02, "loss": 0.9859145355224609, "step": 50 }, { "epoch": 0.20229265003371544, "grad_norm": 0.6242259740829468, "learning_rate": 0.02, "loss": 0.8014328765869141, "step": 100 }, { "epoch": 0.30343897505057316, "grad_norm": 0.5784542560577393, "learning_rate": 0.02, "loss": 0.7533317565917969, "step": 150 }, { "epoch": 0.4045853000674309, "grad_norm": 0.44530612230300903, "learning_rate": 0.02, "loss": 0.7336380767822266, "step": 200 }, { "epoch": 0.5057316250842886, "grad_norm": 0.4625791013240814, "learning_rate": 0.02, "loss": 0.7139082336425782, "step": 250 }, { "epoch": 0.5057316250842886, "eval_accuracy": 0.671957671957672, "eval_f1_macro": 0.6568898505429338, "eval_f1_weighted": 0.6704089764553762, "eval_loss": 0.7160658836364746, "eval_runtime": 0.5115, "eval_samples_per_second": 369.534, "eval_steps_per_second": 3.91, "step": 250 }, { "epoch": 0.6068779501011463, "grad_norm": 0.4543777406215668, "learning_rate": 0.02, "loss": 0.707908935546875, "step": 300 }, { "epoch": 0.708024275118004, "grad_norm": 0.3702331781387329, "learning_rate": 0.02, "loss": 0.6974618530273438, "step": 350 }, { "epoch": 0.8091706001348618, "grad_norm": 0.359216570854187, "learning_rate": 0.02, "loss": 0.6783417510986328, "step": 400 }, { "epoch": 0.9103169251517195, "grad_norm": 0.5427055358886719, "learning_rate": 0.02, "loss": 0.6694049072265625, "step": 450 }, { "epoch": 1.0101146325016859, "grad_norm": 0.4603957235813141, "learning_rate": 0.02, "loss": 0.6679498291015625, "step": 500 }, { "epoch": 1.0101146325016859, "eval_accuracy": 0.6137566137566137, "eval_f1_macro": 0.6017957351290685, "eval_f1_weighted": 0.6163611422870683, "eval_loss": 0.7431102991104126, "eval_runtime": 0.4311, "eval_samples_per_second": 438.451, "eval_steps_per_second": 4.64, "step": 500 }, { "epoch": 1.1112609575185435, "grad_norm": 0.41513311862945557, "learning_rate": 0.02, "loss": 0.6447215270996094, "step": 550 }, { "epoch": 1.2124072825354013, "grad_norm": 0.5227681398391724, "learning_rate": 0.02, "loss": 0.6510934448242187, "step": 600 }, { "epoch": 1.313553607552259, "grad_norm": 0.45083895325660706, "learning_rate": 0.02, "loss": 0.6367919540405274, "step": 650 }, { "epoch": 1.4146999325691167, "grad_norm": 0.38931724429130554, "learning_rate": 0.02, "loss": 0.6353715133666992, "step": 700 }, { "epoch": 1.5158462575859744, "grad_norm": 0.5749202966690063, "learning_rate": 0.02, "loss": 0.6385128402709961, "step": 750 }, { "epoch": 1.5158462575859744, "eval_accuracy": 0.6825396825396826, "eval_f1_macro": 0.6571172796152046, "eval_f1_weighted": 0.6804525824646179, "eval_loss": 0.6635375618934631, "eval_runtime": 0.5071, "eval_samples_per_second": 372.683, "eval_steps_per_second": 3.944, "step": 750 }, { "epoch": 1.616992582602832, "grad_norm": 0.45581257343292236, "learning_rate": 0.02, "loss": 0.625518913269043, "step": 800 }, { "epoch": 1.7181389076196898, "grad_norm": 0.3377571702003479, "learning_rate": 0.02, "loss": 0.6252500915527344, "step": 850 }, { "epoch": 1.8192852326365476, "grad_norm": 0.5641970038414001, "learning_rate": 0.02, "loss": 0.6137918853759765, "step": 900 }, { "epoch": 1.9204315576534052, "grad_norm": 0.38811010122299194, "learning_rate": 0.02, "loss": 0.6167445373535156, "step": 950 }, { "epoch": 2.0202292650033717, "grad_norm": 0.4042782783508301, "learning_rate": 0.02, "loss": 0.6058655548095703, "step": 1000 }, { "epoch": 2.0202292650033717, "eval_accuracy": 0.6666666666666666, "eval_f1_macro": 0.6448093451550602, "eval_f1_weighted": 0.667169150765329, "eval_loss": 0.6820808053016663, "eval_runtime": 0.4736, "eval_samples_per_second": 399.042, "eval_steps_per_second": 4.223, "step": 1000 }, { "epoch": 2.121375590020229, "grad_norm": 0.6726216077804565, "learning_rate": 0.02, "loss": 0.5750845718383789, "step": 1050 }, { "epoch": 2.222521915037087, "grad_norm": 0.43511903285980225, "learning_rate": 0.02, "loss": 0.5747246170043945, "step": 1100 }, { "epoch": 2.323668240053945, "grad_norm": 0.4764536917209625, "learning_rate": 0.02, "loss": 0.5774239730834961, "step": 1150 }, { "epoch": 2.4248145650708026, "grad_norm": 0.3557627499103546, "learning_rate": 0.02, "loss": 0.5817196655273438, "step": 1200 }, { "epoch": 2.52596089008766, "grad_norm": 0.4189053773880005, "learning_rate": 0.02, "loss": 0.58625732421875, "step": 1250 }, { "epoch": 2.52596089008766, "eval_accuracy": 0.6666666666666666, "eval_f1_macro": 0.642448966034101, "eval_f1_weighted": 0.6673650887236832, "eval_loss": 0.6505153179168701, "eval_runtime": 0.5733, "eval_samples_per_second": 329.696, "eval_steps_per_second": 3.489, "step": 1250 }, { "epoch": 2.627107215104518, "grad_norm": 0.43322718143463135, "learning_rate": 0.02, "loss": 0.5713236999511718, "step": 1300 }, { "epoch": 2.7282535401213757, "grad_norm": 0.539417564868927, "learning_rate": 0.02, "loss": 0.5782129287719726, "step": 1350 }, { "epoch": 2.8293998651382335, "grad_norm": 0.5032817721366882, "learning_rate": 0.02, "loss": 0.5660055160522461, "step": 1400 }, { "epoch": 2.930546190155091, "grad_norm": 0.5244382619857788, "learning_rate": 0.02, "loss": 0.5648572158813476, "step": 1450 }, { "epoch": 3.030343897505057, "grad_norm": 0.443816602230072, "learning_rate": 0.02, "loss": 0.5666342926025391, "step": 1500 }, { "epoch": 3.030343897505057, "eval_accuracy": 0.7142857142857143, "eval_f1_macro": 0.701973951973952, "eval_f1_weighted": 0.7131567726805821, "eval_loss": 0.6522725224494934, "eval_runtime": 0.4984, "eval_samples_per_second": 379.246, "eval_steps_per_second": 4.013, "step": 1500 }, { "epoch": 3.131490222521915, "grad_norm": 0.3713579773902893, "learning_rate": 0.02, "loss": 0.5389602661132813, "step": 1550 }, { "epoch": 3.232636547538773, "grad_norm": 0.44091686606407166, "learning_rate": 0.019929278846732883, "loss": 0.5371050262451171, "step": 1600 }, { "epoch": 3.3337828725556307, "grad_norm": 0.4661828577518463, "learning_rate": 0.01869964766980079, "loss": 0.5366607666015625, "step": 1650 }, { "epoch": 3.434929197572488, "grad_norm": 0.42961224913597107, "learning_rate": 0.016119035924142468, "loss": 0.5338973236083985, "step": 1700 }, { "epoch": 3.536075522589346, "grad_norm": 0.4576632082462311, "learning_rate": 0.012588190451025208, "loss": 0.5357645797729492, "step": 1750 }, { "epoch": 3.536075522589346, "eval_accuracy": 0.7037037037037037, "eval_f1_macro": 0.6804698569404452, "eval_f1_weighted": 0.7027801537605459, "eval_loss": 0.6928421854972839, "eval_runtime": 0.5153, "eval_samples_per_second": 366.775, "eval_steps_per_second": 3.881, "step": 1750 }, { "epoch": 3.6372218476062037, "grad_norm": 0.4636659026145935, "learning_rate": 0.008655421228784682, "loss": 0.5186992263793946, "step": 1800 }, { "epoch": 3.738368172623061, "grad_norm": 0.38083815574645996, "learning_rate": 0.004931453542190172, "loss": 0.5256573867797851, "step": 1850 }, { "epoch": 3.839514497639919, "grad_norm": 0.37412029504776, "learning_rate": 0.001994587590756397, "loss": 0.5135831451416015, "step": 1900 }, { "epoch": 3.9406608226567768, "grad_norm": 0.35141825675964355, "learning_rate": 0.00030089343432194825, "loss": 0.5098935699462891, "step": 1950 }, { "epoch": 4.0, "eval_accuracy": 0.7248677248677249, "eval_f1_macro": 0.7106796605474553, "eval_f1_weighted": 0.7248677248677249, "eval_loss": 0.6587123274803162, "eval_runtime": 0.4572, "eval_samples_per_second": 413.345, "eval_steps_per_second": 4.374, "step": 1980 } ], "logging_steps": 50, "max_steps": 1980, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 61833044017152.0, "train_batch_size": 128, "trial_name": null, "trial_params": null }