Instructions to use codegenstudio/codegen-350M-nosql2doc-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use codegenstudio/codegen-350M-nosql2doc-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/kaggle/working/models/base/Salesforce__codegen-350M-multi") model = PeftModel.from_pretrained(base_model, "codegenstudio/codegen-350M-nosql2doc-lora") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 1509, | |
| "best_metric": 1.013381004333496, | |
| "best_model_checkpoint": "/kaggle/working/models/checkpoints/v4/nosql2doc/checkpoint-1509", | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 1509, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 2.8841454654932024, | |
| "epoch": 0.01990049751243781, | |
| "grad_norm": 3.4684948921203613, | |
| "learning_rate": 7.142857142857143e-06, | |
| "loss": 3.3999290466308594, | |
| "mean_token_accuracy": 0.36815835647284983, | |
| "num_tokens": 84042.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 2.871115285158157, | |
| "epoch": 0.03980099502487562, | |
| "grad_norm": 3.199768304824829, | |
| "learning_rate": 1.5079365079365079e-05, | |
| "loss": 3.1389333724975588, | |
| "mean_token_accuracy": 0.41857333555817605, | |
| "num_tokens": 166453.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 2.689709846675396, | |
| "epoch": 0.05970149253731343, | |
| "grad_norm": 2.241548776626587, | |
| "learning_rate": 2.3015873015873015e-05, | |
| "loss": 2.5403181076049806, | |
| "mean_token_accuracy": 0.45860434919595716, | |
| "num_tokens": 248357.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 2.371776354312897, | |
| "epoch": 0.07960199004975124, | |
| "grad_norm": 2.2443745136260986, | |
| "learning_rate": 3.095238095238095e-05, | |
| "loss": 2.2156551361083983, | |
| "mean_token_accuracy": 0.534111600741744, | |
| "num_tokens": 329302.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.9646751508116722, | |
| "epoch": 0.09950248756218906, | |
| "grad_norm": 2.8479607105255127, | |
| "learning_rate": 3.888888888888889e-05, | |
| "loss": 1.9395181655883789, | |
| "mean_token_accuracy": 0.5719782687723637, | |
| "num_tokens": 410388.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.712027932703495, | |
| "epoch": 0.11940298507462686, | |
| "grad_norm": 2.5392374992370605, | |
| "learning_rate": 4.682539682539683e-05, | |
| "loss": 1.7669334411621094, | |
| "mean_token_accuracy": 0.5962413489818573, | |
| "num_tokens": 491142.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.6189243733882903, | |
| "epoch": 0.13930348258706468, | |
| "grad_norm": 2.8646080493927, | |
| "learning_rate": 5.4761904761904766e-05, | |
| "loss": 1.6198507308959962, | |
| "mean_token_accuracy": 0.6142528053373099, | |
| "num_tokens": 573054.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.6242131367325783, | |
| "epoch": 0.15920398009950248, | |
| "grad_norm": 3.0876874923706055, | |
| "learning_rate": 6.26984126984127e-05, | |
| "loss": 1.6246612548828125, | |
| "mean_token_accuracy": 0.626776534691453, | |
| "num_tokens": 658316.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.5123998656868936, | |
| "epoch": 0.1791044776119403, | |
| "grad_norm": 2.827972650527954, | |
| "learning_rate": 7.063492063492065e-05, | |
| "loss": 1.5039705276489257, | |
| "mean_token_accuracy": 0.6451249852776527, | |
| "num_tokens": 738196.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.4389337845146657, | |
| "epoch": 0.19900497512437812, | |
| "grad_norm": 2.794956684112549, | |
| "learning_rate": 7.857142857142858e-05, | |
| "loss": 1.4707328796386718, | |
| "mean_token_accuracy": 0.6486270293593407, | |
| "num_tokens": 818366.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.4290485948324203, | |
| "epoch": 0.21890547263681592, | |
| "grad_norm": 2.650611639022827, | |
| "learning_rate": 8.650793650793651e-05, | |
| "loss": 1.461697483062744, | |
| "mean_token_accuracy": 0.6452589213848114, | |
| "num_tokens": 900542.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.4537153281271458, | |
| "epoch": 0.23880597014925373, | |
| "grad_norm": 3.212292194366455, | |
| "learning_rate": 9.444444444444444e-05, | |
| "loss": 1.3799741744995118, | |
| "mean_token_accuracy": 0.665483495220542, | |
| "num_tokens": 983783.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.3213311471045017, | |
| "epoch": 0.25870646766169153, | |
| "grad_norm": 2.367784261703491, | |
| "learning_rate": 0.00010238095238095237, | |
| "loss": 1.339876365661621, | |
| "mean_token_accuracy": 0.6738482430577278, | |
| "num_tokens": 1065282.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.2877162352204323, | |
| "epoch": 0.27860696517412936, | |
| "grad_norm": 2.7096056938171387, | |
| "learning_rate": 0.00011031746031746033, | |
| "loss": 1.3189430236816406, | |
| "mean_token_accuracy": 0.6620625633746385, | |
| "num_tokens": 1147430.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.3201022632420063, | |
| "epoch": 0.29850746268656714, | |
| "grad_norm": 2.497452974319458, | |
| "learning_rate": 0.00011825396825396826, | |
| "loss": 1.3049938201904296, | |
| "mean_token_accuracy": 0.6833859849721193, | |
| "num_tokens": 1225840.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.2007936105132102, | |
| "epoch": 0.31840796019900497, | |
| "grad_norm": 3.0387496948242188, | |
| "learning_rate": 0.0001261904761904762, | |
| "loss": 1.231965923309326, | |
| "mean_token_accuracy": 0.7017441529780626, | |
| "num_tokens": 1309268.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 1.3119081839919091, | |
| "epoch": 0.3383084577114428, | |
| "grad_norm": 2.327012300491333, | |
| "learning_rate": 0.00013412698412698412, | |
| "loss": 1.2840826034545898, | |
| "mean_token_accuracy": 0.6792996764183045, | |
| "num_tokens": 1389094.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 1.2995639897882938, | |
| "epoch": 0.3582089552238806, | |
| "grad_norm": 2.426831007003784, | |
| "learning_rate": 0.00014206349206349208, | |
| "loss": 1.2992033958435059, | |
| "mean_token_accuracy": 0.6910909987986088, | |
| "num_tokens": 1471243.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 1.1952705256640912, | |
| "epoch": 0.3781094527363184, | |
| "grad_norm": 2.783355951309204, | |
| "learning_rate": 0.00015000000000000001, | |
| "loss": 1.1649029731750489, | |
| "mean_token_accuracy": 0.7020247872918844, | |
| "num_tokens": 1552783.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 1.2681411176919937, | |
| "epoch": 0.39800995024875624, | |
| "grad_norm": 2.162163019180298, | |
| "learning_rate": 0.00015793650793650795, | |
| "loss": 1.2627052307128905, | |
| "mean_token_accuracy": 0.6855453528463841, | |
| "num_tokens": 1635174.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 1.2593041777610778, | |
| "epoch": 0.417910447761194, | |
| "grad_norm": 2.3045036792755127, | |
| "learning_rate": 0.0001658730158730159, | |
| "loss": 1.237012004852295, | |
| "mean_token_accuracy": 0.6885611288249492, | |
| "num_tokens": 1720930.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 1.1904637023806572, | |
| "epoch": 0.43781094527363185, | |
| "grad_norm": 2.291395664215088, | |
| "learning_rate": 0.00017380952380952383, | |
| "loss": 1.2200750350952148, | |
| "mean_token_accuracy": 0.6859784577041864, | |
| "num_tokens": 1803132.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 1.1843627236783505, | |
| "epoch": 0.4577114427860697, | |
| "grad_norm": 2.553251266479492, | |
| "learning_rate": 0.00018174603174603177, | |
| "loss": 1.2164555549621583, | |
| "mean_token_accuracy": 0.6943051021546125, | |
| "num_tokens": 1884825.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 1.1876815035939217, | |
| "epoch": 0.47761194029850745, | |
| "grad_norm": 2.403580904006958, | |
| "learning_rate": 0.0001896825396825397, | |
| "loss": 1.1573832511901856, | |
| "mean_token_accuracy": 0.7180207531899214, | |
| "num_tokens": 1968914.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 1.1310456305742265, | |
| "epoch": 0.4975124378109453, | |
| "grad_norm": 2.3557302951812744, | |
| "learning_rate": 0.00019761904761904763, | |
| "loss": 1.1767531394958497, | |
| "mean_token_accuracy": 0.6986724361777306, | |
| "num_tokens": 2050602.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 1.2115244895219803, | |
| "epoch": 0.5174129353233831, | |
| "grad_norm": 2.430337905883789, | |
| "learning_rate": 0.0001999989408126818, | |
| "loss": 1.187550926208496, | |
| "mean_token_accuracy": 0.6943733543157578, | |
| "num_tokens": 2134774.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 1.1603886000812054, | |
| "epoch": 0.5373134328358209, | |
| "grad_norm": 1.848976969718933, | |
| "learning_rate": 0.0001999937530104439, | |
| "loss": 1.1683053970336914, | |
| "mean_token_accuracy": 0.6958795577287674, | |
| "num_tokens": 2214022.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 1.083036269247532, | |
| "epoch": 0.5572139303482587, | |
| "grad_norm": 2.297624111175537, | |
| "learning_rate": 0.00019998424227267588, | |
| "loss": 1.087782859802246, | |
| "mean_token_accuracy": 0.7164598941802979, | |
| "num_tokens": 2295817.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 1.1467085666954517, | |
| "epoch": 0.5771144278606966, | |
| "grad_norm": 2.1926214694976807, | |
| "learning_rate": 0.00019997040901054646, | |
| "loss": 1.1336830139160157, | |
| "mean_token_accuracy": 0.7070459358394146, | |
| "num_tokens": 2379081.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 1.1092145919799805, | |
| "epoch": 0.5970149253731343, | |
| "grad_norm": 2.108574390411377, | |
| "learning_rate": 0.000199952253822096, | |
| "loss": 1.104503059387207, | |
| "mean_token_accuracy": 0.7167623668909073, | |
| "num_tokens": 2461290.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 1.0762298285961152, | |
| "epoch": 0.6169154228855721, | |
| "grad_norm": 1.9235388040542603, | |
| "learning_rate": 0.00019992977749221064, | |
| "loss": 1.0758417129516602, | |
| "mean_token_accuracy": 0.7244217373430729, | |
| "num_tokens": 2546927.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 1.058315774053335, | |
| "epoch": 0.6368159203980099, | |
| "grad_norm": 2.015493154525757, | |
| "learning_rate": 0.0001999029809925883, | |
| "loss": 1.0714119911193847, | |
| "mean_token_accuracy": 0.7185824103653431, | |
| "num_tokens": 2627151.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 1.040397210419178, | |
| "epoch": 0.6567164179104478, | |
| "grad_norm": 1.824608564376831, | |
| "learning_rate": 0.00019987186548169682, | |
| "loss": 1.0344210624694825, | |
| "mean_token_accuracy": 0.7333592250943184, | |
| "num_tokens": 2711367.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.9891116008162498, | |
| "epoch": 0.6766169154228856, | |
| "grad_norm": 1.9432896375656128, | |
| "learning_rate": 0.0001998364323047236, | |
| "loss": 0.9733485221862793, | |
| "mean_token_accuracy": 0.7416356436908245, | |
| "num_tokens": 2793468.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 1.0004291333258153, | |
| "epoch": 0.6965174129353234, | |
| "grad_norm": 1.906457781791687, | |
| "learning_rate": 0.00019979668299351783, | |
| "loss": 1.0494978904724122, | |
| "mean_token_accuracy": 0.7176768533885479, | |
| "num_tokens": 2875166.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 1.0571318455040455, | |
| "epoch": 0.7164179104477612, | |
| "grad_norm": 1.7709777355194092, | |
| "learning_rate": 0.00019975261926652392, | |
| "loss": 1.0371734619140625, | |
| "mean_token_accuracy": 0.7288566574454307, | |
| "num_tokens": 2959671.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.9674378834664822, | |
| "epoch": 0.736318407960199, | |
| "grad_norm": 1.896713376045227, | |
| "learning_rate": 0.00019970424302870739, | |
| "loss": 0.9970813751220703, | |
| "mean_token_accuracy": 0.7395003981888294, | |
| "num_tokens": 3041437.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 1.1270258143544196, | |
| "epoch": 0.7562189054726368, | |
| "grad_norm": 1.7242449522018433, | |
| "learning_rate": 0.00019965155637147243, | |
| "loss": 1.0752775192260742, | |
| "mean_token_accuracy": 0.7305668473243714, | |
| "num_tokens": 3123865.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.9315242812037468, | |
| "epoch": 0.7761194029850746, | |
| "grad_norm": 1.781772255897522, | |
| "learning_rate": 0.0001995945615725716, | |
| "loss": 0.9751872062683106, | |
| "mean_token_accuracy": 0.7497406356036663, | |
| "num_tokens": 3205032.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 1.076903734356165, | |
| "epoch": 0.7960199004975125, | |
| "grad_norm": 1.8422024250030518, | |
| "learning_rate": 0.00019953326109600728, | |
| "loss": 1.0796968460083007, | |
| "mean_token_accuracy": 0.7176821112632752, | |
| "num_tokens": 3286003.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.9634652934968472, | |
| "epoch": 0.8159203980099502, | |
| "grad_norm": 1.7082111835479736, | |
| "learning_rate": 0.00019946765759192497, | |
| "loss": 0.9697890281677246, | |
| "mean_token_accuracy": 0.7406083434820175, | |
| "num_tokens": 3367484.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.9321402795612812, | |
| "epoch": 0.835820895522388, | |
| "grad_norm": 1.8066761493682861, | |
| "learning_rate": 0.00019939775389649916, | |
| "loss": 0.9277518272399903, | |
| "mean_token_accuracy": 0.7574292354285717, | |
| "num_tokens": 3453904.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.9754443395882845, | |
| "epoch": 0.8557213930348259, | |
| "grad_norm": 1.6425416469573975, | |
| "learning_rate": 0.00019932355303181026, | |
| "loss": 0.9705208778381348, | |
| "mean_token_accuracy": 0.7435099229216575, | |
| "num_tokens": 3536472.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.9742012087255716, | |
| "epoch": 0.8756218905472637, | |
| "grad_norm": 1.707189679145813, | |
| "learning_rate": 0.00019924505820571425, | |
| "loss": 1.036739444732666, | |
| "mean_token_accuracy": 0.7312861289829016, | |
| "num_tokens": 3616711.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 1.0537842728197575, | |
| "epoch": 0.8955223880597015, | |
| "grad_norm": 1.865692377090454, | |
| "learning_rate": 0.0001991622728117038, | |
| "loss": 1.0217846870422362, | |
| "mean_token_accuracy": 0.7338800489902496, | |
| "num_tokens": 3701126.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.989534855633974, | |
| "epoch": 0.9154228855721394, | |
| "grad_norm": 1.7353651523590088, | |
| "learning_rate": 0.00019907520042876172, | |
| "loss": 1.0003718376159667, | |
| "mean_token_accuracy": 0.7480997510254384, | |
| "num_tokens": 3783495.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.9294702004641294, | |
| "epoch": 0.9353233830845771, | |
| "grad_norm": 2.007262706756592, | |
| "learning_rate": 0.00019898384482120614, | |
| "loss": 1.0100757598876953, | |
| "mean_token_accuracy": 0.7364842720329762, | |
| "num_tokens": 3863784.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.9523782070726157, | |
| "epoch": 0.9552238805970149, | |
| "grad_norm": 1.9396175146102905, | |
| "learning_rate": 0.0001988882099385278, | |
| "loss": 0.9432971000671386, | |
| "mean_token_accuracy": 0.756897260248661, | |
| "num_tokens": 3947540.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.9421051684767008, | |
| "epoch": 0.9751243781094527, | |
| "grad_norm": 1.8582719564437866, | |
| "learning_rate": 0.00019878829991521935, | |
| "loss": 0.9125359535217286, | |
| "mean_token_accuracy": 0.7575220972299576, | |
| "num_tokens": 4031284.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.9381607126444578, | |
| "epoch": 0.9950248756218906, | |
| "grad_norm": 1.9623899459838867, | |
| "learning_rate": 0.00019868411907059645, | |
| "loss": 0.9656861305236817, | |
| "mean_token_accuracy": 0.7544871643185616, | |
| "num_tokens": 4112149.0, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_entropy": 0.9874700385516214, | |
| "eval_loss": 1.063795566558838, | |
| "eval_mean_token_accuracy": 0.7334998920847551, | |
| "eval_num_tokens": 4132656.0, | |
| "eval_runtime": 88.6229, | |
| "eval_samples_per_second": 11.679, | |
| "eval_steps_per_second": 5.845, | |
| "step": 503 | |
| }, | |
| { | |
| "entropy": 0.8532990099568116, | |
| "epoch": 1.0139303482587065, | |
| "grad_norm": 1.6549201011657715, | |
| "learning_rate": 0.00019857567190861126, | |
| "loss": 0.7886298179626465, | |
| "mean_token_accuracy": 0.7860889779893976, | |
| "num_tokens": 4190723.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.7671804554760456, | |
| "epoch": 1.0338308457711443, | |
| "grad_norm": 1.6148929595947266, | |
| "learning_rate": 0.00019846296311765754, | |
| "loss": 0.777919864654541, | |
| "mean_token_accuracy": 0.789631099998951, | |
| "num_tokens": 4273358.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.8041674952954054, | |
| "epoch": 1.053731343283582, | |
| "grad_norm": 1.765950322151184, | |
| "learning_rate": 0.00019834599757036803, | |
| "loss": 0.7967178821563721, | |
| "mean_token_accuracy": 0.784614659100771, | |
| "num_tokens": 4356030.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.7405303593724966, | |
| "epoch": 1.07363184079602, | |
| "grad_norm": 1.7868931293487549, | |
| "learning_rate": 0.00019822478032340387, | |
| "loss": 0.7301093578338623, | |
| "mean_token_accuracy": 0.8020888641476631, | |
| "num_tokens": 4440157.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.7550990927964449, | |
| "epoch": 1.0935323383084576, | |
| "grad_norm": 1.991782784461975, | |
| "learning_rate": 0.0001980993166172358, | |
| "loss": 0.7884031295776367, | |
| "mean_token_accuracy": 0.7879343688488006, | |
| "num_tokens": 4523343.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.812371177971363, | |
| "epoch": 1.1134328358208956, | |
| "grad_norm": 1.869396686553955, | |
| "learning_rate": 0.00019796961187591781, | |
| "loss": 0.8159590721130371, | |
| "mean_token_accuracy": 0.7711428456008435, | |
| "num_tokens": 4605454.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.7879433136433363, | |
| "epoch": 1.1333333333333333, | |
| "grad_norm": 1.9530060291290283, | |
| "learning_rate": 0.00019783567170685262, | |
| "loss": 0.8079433441162109, | |
| "mean_token_accuracy": 0.7875082984566688, | |
| "num_tokens": 4687318.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.8396137218922377, | |
| "epoch": 1.153233830845771, | |
| "grad_norm": 1.7895166873931885, | |
| "learning_rate": 0.00019769750190054905, | |
| "loss": 0.8188363075256347, | |
| "mean_token_accuracy": 0.7710263684391976, | |
| "num_tokens": 4768232.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.8406378872692585, | |
| "epoch": 1.173134328358209, | |
| "grad_norm": 1.8147255182266235, | |
| "learning_rate": 0.00019755510843037191, | |
| "loss": 0.8532954216003418, | |
| "mean_token_accuracy": 0.7680545568466186, | |
| "num_tokens": 4850366.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.7758986987173557, | |
| "epoch": 1.1930348258706467, | |
| "grad_norm": 1.9839149713516235, | |
| "learning_rate": 0.00019740849745228367, | |
| "loss": 0.7972042560577393, | |
| "mean_token_accuracy": 0.77668926268816, | |
| "num_tokens": 4932940.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.825455692410469, | |
| "epoch": 1.2129353233830846, | |
| "grad_norm": 1.776328444480896, | |
| "learning_rate": 0.00019725767530457837, | |
| "loss": 0.7664913654327392, | |
| "mean_token_accuracy": 0.7940710753202438, | |
| "num_tokens": 5012821.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.7286036755889654, | |
| "epoch": 1.2328358208955223, | |
| "grad_norm": 2.0241360664367676, | |
| "learning_rate": 0.00019710264850760756, | |
| "loss": 0.7731894969940185, | |
| "mean_token_accuracy": 0.7846131704747676, | |
| "num_tokens": 5095340.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.7920811083167791, | |
| "epoch": 1.25273631840796, | |
| "grad_norm": 1.7310129404067993, | |
| "learning_rate": 0.00019694342376349835, | |
| "loss": 0.7303972244262695, | |
| "mean_token_accuracy": 0.7983584970235824, | |
| "num_tokens": 5177547.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.7178942065685987, | |
| "epoch": 1.272636815920398, | |
| "grad_norm": 1.7608613967895508, | |
| "learning_rate": 0.00019678000795586386, | |
| "loss": 0.8018975257873535, | |
| "mean_token_accuracy": 0.7767767131328582, | |
| "num_tokens": 5265612.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.8001765824854374, | |
| "epoch": 1.292537313432836, | |
| "grad_norm": 2.0576155185699463, | |
| "learning_rate": 0.00019661240814950536, | |
| "loss": 0.7223423480987549, | |
| "mean_token_accuracy": 0.7918425254523754, | |
| "num_tokens": 5348652.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.7580439992249012, | |
| "epoch": 1.3124378109452737, | |
| "grad_norm": 1.539169430732727, | |
| "learning_rate": 0.00019644063159010716, | |
| "loss": 0.8217278480529785, | |
| "mean_token_accuracy": 0.7793662197887897, | |
| "num_tokens": 5431834.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.8075141672044992, | |
| "epoch": 1.3323383084577114, | |
| "grad_norm": 1.8933053016662598, | |
| "learning_rate": 0.00019626468570392298, | |
| "loss": 0.7759135723114013, | |
| "mean_token_accuracy": 0.7861333280801773, | |
| "num_tokens": 5514228.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.7623774103820324, | |
| "epoch": 1.3522388059701491, | |
| "grad_norm": 1.7051018476486206, | |
| "learning_rate": 0.00019608457809745537, | |
| "loss": 0.8088616371154785, | |
| "mean_token_accuracy": 0.7746041730046272, | |
| "num_tokens": 5594702.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.8089807592332363, | |
| "epoch": 1.372139303482587, | |
| "grad_norm": 1.8061248064041138, | |
| "learning_rate": 0.00019590031655712631, | |
| "loss": 0.7946909904479981, | |
| "mean_token_accuracy": 0.7781320951879025, | |
| "num_tokens": 5676309.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.7627177253365517, | |
| "epoch": 1.392039800995025, | |
| "grad_norm": 1.9005513191223145, | |
| "learning_rate": 0.00019571190904894115, | |
| "loss": 0.7615675926208496, | |
| "mean_token_accuracy": 0.788880155980587, | |
| "num_tokens": 5757314.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.7580569207668304, | |
| "epoch": 1.4119402985074627, | |
| "grad_norm": 1.9883071184158325, | |
| "learning_rate": 0.00019551936371814375, | |
| "loss": 0.7611291408538818, | |
| "mean_token_accuracy": 0.7861187107861042, | |
| "num_tokens": 5838877.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.7182941000908614, | |
| "epoch": 1.4318407960199004, | |
| "grad_norm": 2.187103033065796, | |
| "learning_rate": 0.0001953226888888647, | |
| "loss": 0.7204749584197998, | |
| "mean_token_accuracy": 0.7946790263056756, | |
| "num_tokens": 5920820.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.6957223568111658, | |
| "epoch": 1.4517412935323384, | |
| "grad_norm": 1.7006845474243164, | |
| "learning_rate": 0.00019512189306376118, | |
| "loss": 0.757196044921875, | |
| "mean_token_accuracy": 0.7921811021864414, | |
| "num_tokens": 6004382.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.7850441809743642, | |
| "epoch": 1.471641791044776, | |
| "grad_norm": 1.6335111856460571, | |
| "learning_rate": 0.0001949169849236496, | |
| "loss": 0.7292089462280273, | |
| "mean_token_accuracy": 0.797366950660944, | |
| "num_tokens": 6086449.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.7639980979263783, | |
| "epoch": 1.491542288557214, | |
| "grad_norm": 1.7224810123443604, | |
| "learning_rate": 0.00019470797332713012, | |
| "loss": 0.8179457664489747, | |
| "mean_token_accuracy": 0.7910384394228458, | |
| "num_tokens": 6168749.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.8024922411888837, | |
| "epoch": 1.5114427860696518, | |
| "grad_norm": 1.9208451509475708, | |
| "learning_rate": 0.0001944948673102038, | |
| "loss": 0.7916707515716552, | |
| "mean_token_accuracy": 0.7822470977902413, | |
| "num_tokens": 6248672.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.7430106606334448, | |
| "epoch": 1.5313432835820895, | |
| "grad_norm": 1.9618816375732422, | |
| "learning_rate": 0.00019427767608588183, | |
| "loss": 0.7538708209991455, | |
| "mean_token_accuracy": 0.7816703900694847, | |
| "num_tokens": 6331261.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 0.7457086000591516, | |
| "epoch": 1.5512437810945272, | |
| "grad_norm": 1.6858505010604858, | |
| "learning_rate": 0.0001940564090437875, | |
| "loss": 0.7316685676574707, | |
| "mean_token_accuracy": 0.8001063913106918, | |
| "num_tokens": 6415504.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 0.7096565395593644, | |
| "epoch": 1.5711442786069652, | |
| "grad_norm": 1.9956564903259277, | |
| "learning_rate": 0.00019383107574974984, | |
| "loss": 0.7277198791503906, | |
| "mean_token_accuracy": 0.7895878478884697, | |
| "num_tokens": 6497199.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 0.7606754396110773, | |
| "epoch": 1.591044776119403, | |
| "grad_norm": 1.7207188606262207, | |
| "learning_rate": 0.00019360168594539055, | |
| "loss": 0.7483164310455322, | |
| "mean_token_accuracy": 0.7934170700609684, | |
| "num_tokens": 6577494.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.7786010228097439, | |
| "epoch": 1.6109452736318408, | |
| "grad_norm": 1.7885297536849976, | |
| "learning_rate": 0.0001933682495477024, | |
| "loss": 0.7517632007598877, | |
| "mean_token_accuracy": 0.791710589081049, | |
| "num_tokens": 6660010.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 0.73126558996737, | |
| "epoch": 1.6308457711442785, | |
| "grad_norm": 1.929076910018921, | |
| "learning_rate": 0.00019313077664862092, | |
| "loss": 0.7747976303100585, | |
| "mean_token_accuracy": 0.7895058654248714, | |
| "num_tokens": 6739669.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 0.7332248043268919, | |
| "epoch": 1.6507462686567163, | |
| "grad_norm": 1.6692851781845093, | |
| "learning_rate": 0.00019288927751458766, | |
| "loss": 0.6981019020080567, | |
| "mean_token_accuracy": 0.8055072821676731, | |
| "num_tokens": 6819838.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 0.712925647944212, | |
| "epoch": 1.6706467661691542, | |
| "grad_norm": 1.5395867824554443, | |
| "learning_rate": 0.0001926437625861068, | |
| "loss": 0.7524178504943848, | |
| "mean_token_accuracy": 0.7908283203840256, | |
| "num_tokens": 6901777.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 0.7585150092840195, | |
| "epoch": 1.6905472636815921, | |
| "grad_norm": 1.6641769409179688, | |
| "learning_rate": 0.00019239424247729345, | |
| "loss": 0.7306118488311768, | |
| "mean_token_accuracy": 0.7910356394946575, | |
| "num_tokens": 6983222.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 0.7012663371860981, | |
| "epoch": 1.7104477611940299, | |
| "grad_norm": 1.9537489414215088, | |
| "learning_rate": 0.0001921407279754149, | |
| "loss": 0.752435302734375, | |
| "mean_token_accuracy": 0.8054570883512497, | |
| "num_tokens": 7067291.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 0.7264402851462364, | |
| "epoch": 1.7303482587064676, | |
| "grad_norm": 1.8359386920928955, | |
| "learning_rate": 0.00019188323004042435, | |
| "loss": 0.6932102680206299, | |
| "mean_token_accuracy": 0.802193396538496, | |
| "num_tokens": 7150268.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 0.6838662784546614, | |
| "epoch": 1.7502487562189055, | |
| "grad_norm": 1.9146333932876587, | |
| "learning_rate": 0.00019162175980448688, | |
| "loss": 0.7538199424743652, | |
| "mean_token_accuracy": 0.796929395198822, | |
| "num_tokens": 7231091.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 0.7262898899614811, | |
| "epoch": 1.7701492537313432, | |
| "grad_norm": 2.0510952472686768, | |
| "learning_rate": 0.0001913563285714984, | |
| "loss": 0.7104074954986572, | |
| "mean_token_accuracy": 0.8008449010550975, | |
| "num_tokens": 7313340.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 0.7481670882552862, | |
| "epoch": 1.7900497512437812, | |
| "grad_norm": 2.0180599689483643, | |
| "learning_rate": 0.0001910869478165969, | |
| "loss": 0.8105827331542969, | |
| "mean_token_accuracy": 0.7843330048024655, | |
| "num_tokens": 7393519.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 0.7768452275544405, | |
| "epoch": 1.809950248756219, | |
| "grad_norm": 1.646704912185669, | |
| "learning_rate": 0.00019081362918566618, | |
| "loss": 0.7446431636810302, | |
| "mean_token_accuracy": 0.8008080549538136, | |
| "num_tokens": 7475016.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 0.683229249343276, | |
| "epoch": 1.8298507462686566, | |
| "grad_norm": 1.638253092765808, | |
| "learning_rate": 0.00019053638449483259, | |
| "loss": 0.7266605854034424, | |
| "mean_token_accuracy": 0.7936579927802085, | |
| "num_tokens": 7559243.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 0.7504678606987, | |
| "epoch": 1.8497512437810946, | |
| "grad_norm": 1.6552717685699463, | |
| "learning_rate": 0.0001902552257299542, | |
| "loss": 0.738245677947998, | |
| "mean_token_accuracy": 0.7894984453916549, | |
| "num_tokens": 7643029.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 0.7069665104150772, | |
| "epoch": 1.8696517412935323, | |
| "grad_norm": 1.4619513750076294, | |
| "learning_rate": 0.00018997016504610246, | |
| "loss": 0.7275553226470948, | |
| "mean_token_accuracy": 0.8092396840453148, | |
| "num_tokens": 7726479.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 0.6909922767430544, | |
| "epoch": 1.8895522388059702, | |
| "grad_norm": 1.6785398721694946, | |
| "learning_rate": 0.00018968121476703678, | |
| "loss": 0.6958948612213135, | |
| "mean_token_accuracy": 0.8184511929750442, | |
| "num_tokens": 7808235.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 0.7206986505538225, | |
| "epoch": 1.909452736318408, | |
| "grad_norm": 1.8156358003616333, | |
| "learning_rate": 0.00018938838738467184, | |
| "loss": 0.7307656288146973, | |
| "mean_token_accuracy": 0.795404677093029, | |
| "num_tokens": 7888802.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 0.7154657423496247, | |
| "epoch": 1.9293532338308457, | |
| "grad_norm": 1.9570693969726562, | |
| "learning_rate": 0.00018909169555853743, | |
| "loss": 0.6951888084411622, | |
| "mean_token_accuracy": 0.7979383312165738, | |
| "num_tokens": 7970204.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 0.6446726582944393, | |
| "epoch": 1.9492537313432836, | |
| "grad_norm": 1.5071886777877808, | |
| "learning_rate": 0.00018879115211523117, | |
| "loss": 0.6544716358184814, | |
| "mean_token_accuracy": 0.8045676186680794, | |
| "num_tokens": 8053307.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 0.699823185056448, | |
| "epoch": 1.9691542288557216, | |
| "grad_norm": 1.4266027212142944, | |
| "learning_rate": 0.0001884867700478641, | |
| "loss": 0.7055366516113282, | |
| "mean_token_accuracy": 0.7992964766919612, | |
| "num_tokens": 8135193.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 0.7140736062079668, | |
| "epoch": 1.9890547263681593, | |
| "grad_norm": 2.0378243923187256, | |
| "learning_rate": 0.00018817856251549867, | |
| "loss": 0.7184643268585205, | |
| "mean_token_accuracy": 0.7989312529563903, | |
| "num_tokens": 8219594.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_entropy": 0.8002531397008988, | |
| "eval_loss": 1.0154445171356201, | |
| "eval_mean_token_accuracy": 0.7423216365709268, | |
| "eval_num_tokens": 8265312.0, | |
| "eval_runtime": 88.2, | |
| "eval_samples_per_second": 11.735, | |
| "eval_steps_per_second": 5.873, | |
| "step": 1006 | |
| }, | |
| { | |
| "entropy": 0.7038449613671554, | |
| "epoch": 2.007960199004975, | |
| "grad_norm": 1.6040326356887817, | |
| "learning_rate": 0.00018786654284258034, | |
| "loss": 0.6638185501098632, | |
| "mean_token_accuracy": 0.8091712115626586, | |
| "num_tokens": 8297623.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 0.5252644840627909, | |
| "epoch": 2.027860696517413, | |
| "grad_norm": 2.1827661991119385, | |
| "learning_rate": 0.00018755072451836097, | |
| "loss": 0.5153174877166748, | |
| "mean_token_accuracy": 0.8446948520839215, | |
| "num_tokens": 8379050.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 0.5121854435652494, | |
| "epoch": 2.047761194029851, | |
| "grad_norm": 1.8835452795028687, | |
| "learning_rate": 0.00018723112119631608, | |
| "loss": 0.5017234325408936, | |
| "mean_token_accuracy": 0.8539764225482941, | |
| "num_tokens": 8462847.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 0.5651770515367389, | |
| "epoch": 2.0676616915422885, | |
| "grad_norm": 1.6592763662338257, | |
| "learning_rate": 0.00018690774669355442, | |
| "loss": 0.5333661079406739, | |
| "mean_token_accuracy": 0.8419696733355522, | |
| "num_tokens": 8542681.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 0.47107693143188956, | |
| "epoch": 2.0875621890547262, | |
| "grad_norm": 1.8748646974563599, | |
| "learning_rate": 0.00018658061499022055, | |
| "loss": 0.4740941047668457, | |
| "mean_token_accuracy": 0.8567564368247986, | |
| "num_tokens": 8627432.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 0.49270418751984835, | |
| "epoch": 2.107462686567164, | |
| "grad_norm": 2.027717351913452, | |
| "learning_rate": 0.0001862497402288906, | |
| "loss": 0.48979806900024414, | |
| "mean_token_accuracy": 0.8501696541905404, | |
| "num_tokens": 8708822.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 0.4634111661463976, | |
| "epoch": 2.127363184079602, | |
| "grad_norm": 1.8452632427215576, | |
| "learning_rate": 0.0001859151367139608, | |
| "loss": 0.4521069049835205, | |
| "mean_token_accuracy": 0.8683336563408375, | |
| "num_tokens": 8789791.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 0.46942942440509794, | |
| "epoch": 2.14726368159204, | |
| "grad_norm": 1.9295680522918701, | |
| "learning_rate": 0.000185576818911029, | |
| "loss": 0.5178594589233398, | |
| "mean_token_accuracy": 0.8462874710559845, | |
| "num_tokens": 8870514.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 0.5393101962283253, | |
| "epoch": 2.1671641791044776, | |
| "grad_norm": 1.6308494806289673, | |
| "learning_rate": 0.00018523480144626948, | |
| "loss": 0.5196755409240723, | |
| "mean_token_accuracy": 0.8491615362465381, | |
| "num_tokens": 8952466.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 0.491584631241858, | |
| "epoch": 2.1870646766169153, | |
| "grad_norm": 1.9126944541931152, | |
| "learning_rate": 0.00018488909910580037, | |
| "loss": 0.507460069656372, | |
| "mean_token_accuracy": 0.8491294652223587, | |
| "num_tokens": 9034965.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 0.5460982380434871, | |
| "epoch": 2.206965174129353, | |
| "grad_norm": 2.245730400085449, | |
| "learning_rate": 0.00018453972683504466, | |
| "loss": 0.5434001445770263, | |
| "mean_token_accuracy": 0.8417311415076256, | |
| "num_tokens": 9117636.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 0.5413472417742013, | |
| "epoch": 2.226865671641791, | |
| "grad_norm": 1.7490206956863403, | |
| "learning_rate": 0.00018418669973808386, | |
| "loss": 0.5176630973815918, | |
| "mean_token_accuracy": 0.8437662713229657, | |
| "num_tokens": 9203719.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 0.5068975739181042, | |
| "epoch": 2.246766169154229, | |
| "grad_norm": 2.32169246673584, | |
| "learning_rate": 0.00018383003307700525, | |
| "loss": 0.4966591358184814, | |
| "mean_token_accuracy": 0.8558630302548409, | |
| "num_tokens": 9285285.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 0.472692010179162, | |
| "epoch": 2.2666666666666666, | |
| "grad_norm": 2.121119499206543, | |
| "learning_rate": 0.0001834697422712419, | |
| "loss": 0.4562082290649414, | |
| "mean_token_accuracy": 0.861832109093666, | |
| "num_tokens": 9368724.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 0.48463920764625074, | |
| "epoch": 2.2865671641791043, | |
| "grad_norm": 2.003596305847168, | |
| "learning_rate": 0.00018310584289690608, | |
| "loss": 0.5065945148468017, | |
| "mean_token_accuracy": 0.8411129087209701, | |
| "num_tokens": 9450345.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 0.5297361209988594, | |
| "epoch": 2.306467661691542, | |
| "grad_norm": 1.9170504808425903, | |
| "learning_rate": 0.0001827383506861159, | |
| "loss": 0.5093509674072265, | |
| "mean_token_accuracy": 0.8439007833600044, | |
| "num_tokens": 9531914.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 0.508120141364634, | |
| "epoch": 2.32636815920398, | |
| "grad_norm": 1.8182140588760376, | |
| "learning_rate": 0.00018236728152631526, | |
| "loss": 0.5065027236938476, | |
| "mean_token_accuracy": 0.8519511334598064, | |
| "num_tokens": 9613824.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 0.5490097716450691, | |
| "epoch": 2.346268656716418, | |
| "grad_norm": 1.6451319456100464, | |
| "learning_rate": 0.00018199265145958678, | |
| "loss": 0.5736330032348633, | |
| "mean_token_accuracy": 0.8286732420325279, | |
| "num_tokens": 9696070.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 0.5155842589214444, | |
| "epoch": 2.3661691542288557, | |
| "grad_norm": 1.8924293518066406, | |
| "learning_rate": 0.00018161447668195858, | |
| "loss": 0.5310076236724853, | |
| "mean_token_accuracy": 0.8431366585195065, | |
| "num_tokens": 9777568.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 0.4998965173959732, | |
| "epoch": 2.3860696517412934, | |
| "grad_norm": 1.9782637357711792, | |
| "learning_rate": 0.00018123277354270372, | |
| "loss": 0.46693716049194334, | |
| "mean_token_accuracy": 0.8578181132674217, | |
| "num_tokens": 9858081.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 0.5187313890084624, | |
| "epoch": 2.405970149253731, | |
| "grad_norm": 1.8333914279937744, | |
| "learning_rate": 0.00018084755854363377, | |
| "loss": 0.5384686946868896, | |
| "mean_token_accuracy": 0.8451795615255833, | |
| "num_tokens": 9940187.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 0.5085030103102326, | |
| "epoch": 2.4258706467661693, | |
| "grad_norm": 2.00839900970459, | |
| "learning_rate": 0.00018045884833838512, | |
| "loss": 0.5079335689544677, | |
| "mean_token_accuracy": 0.8514300569891929, | |
| "num_tokens": 10018432.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 0.5382265558466315, | |
| "epoch": 2.445771144278607, | |
| "grad_norm": 1.9003617763519287, | |
| "learning_rate": 0.00018006665973169911, | |
| "loss": 0.5386298179626465, | |
| "mean_token_accuracy": 0.8454402416944504, | |
| "num_tokens": 10100137.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 0.5438722034916281, | |
| "epoch": 2.4656716417910447, | |
| "grad_norm": 2.1470773220062256, | |
| "learning_rate": 0.0001796710096786956, | |
| "loss": 0.5553887367248536, | |
| "mean_token_accuracy": 0.8391343042254448, | |
| "num_tokens": 10184025.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 0.5251597924157977, | |
| "epoch": 2.4855721393034824, | |
| "grad_norm": 1.992197036743164, | |
| "learning_rate": 0.0001792719152841398, | |
| "loss": 0.5232258319854737, | |
| "mean_token_accuracy": 0.8480332940816879, | |
| "num_tokens": 10268664.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 0.5361188564449548, | |
| "epoch": 2.50547263681592, | |
| "grad_norm": 1.6610969305038452, | |
| "learning_rate": 0.0001788693938017029, | |
| "loss": 0.5130891799926758, | |
| "mean_token_accuracy": 0.8441365607082844, | |
| "num_tokens": 10349492.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 0.4794240856543183, | |
| "epoch": 2.5253731343283583, | |
| "grad_norm": 2.0173373222351074, | |
| "learning_rate": 0.00017846346263321623, | |
| "loss": 0.5028162956237793, | |
| "mean_token_accuracy": 0.84928208142519, | |
| "num_tokens": 10432597.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 0.5074908941984176, | |
| "epoch": 2.545273631840796, | |
| "grad_norm": 2.124582290649414, | |
| "learning_rate": 0.00017805413932791875, | |
| "loss": 0.5137399673461914, | |
| "mean_token_accuracy": 0.8484948351979256, | |
| "num_tokens": 10513192.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 0.5202818088233471, | |
| "epoch": 2.5651741293532337, | |
| "grad_norm": 1.7741371393203735, | |
| "learning_rate": 0.00017764144158169856, | |
| "loss": 0.5218567848205566, | |
| "mean_token_accuracy": 0.8525593280792236, | |
| "num_tokens": 10597049.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 0.5169114828109741, | |
| "epoch": 2.585074626865672, | |
| "grad_norm": 2.03674054145813, | |
| "learning_rate": 0.00017722538723632773, | |
| "loss": 0.5342438697814942, | |
| "mean_token_accuracy": 0.8379098229110241, | |
| "num_tokens": 10679839.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 0.527920619212091, | |
| "epoch": 2.604975124378109, | |
| "grad_norm": 1.7481690645217896, | |
| "learning_rate": 0.000176805994278691, | |
| "loss": 0.5268249988555909, | |
| "mean_token_accuracy": 0.8468565516173839, | |
| "num_tokens": 10763374.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 0.5612680882215499, | |
| "epoch": 2.6248756218905474, | |
| "grad_norm": 2.044337511062622, | |
| "learning_rate": 0.0001763832808400082, | |
| "loss": 0.5637305736541748, | |
| "mean_token_accuracy": 0.8389740340411663, | |
| "num_tokens": 10846467.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 0.526572679169476, | |
| "epoch": 2.644776119402985, | |
| "grad_norm": 1.5558581352233887, | |
| "learning_rate": 0.00017595726519505043, | |
| "loss": 0.5200609683990478, | |
| "mean_token_accuracy": 0.848398495465517, | |
| "num_tokens": 10929729.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 0.5076324449852109, | |
| "epoch": 2.664676616915423, | |
| "grad_norm": 2.233233690261841, | |
| "learning_rate": 0.00017552796576134985, | |
| "loss": 0.5190268993377686, | |
| "mean_token_accuracy": 0.841417095810175, | |
| "num_tokens": 11012769.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 0.5502721823751926, | |
| "epoch": 2.684577114427861, | |
| "grad_norm": 1.8738890886306763, | |
| "learning_rate": 0.00017509540109840365, | |
| "loss": 0.547359848022461, | |
| "mean_token_accuracy": 0.8380319178104401, | |
| "num_tokens": 11094716.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 0.5275072449818253, | |
| "epoch": 2.7044776119402982, | |
| "grad_norm": 1.8149367570877075, | |
| "learning_rate": 0.00017465958990687156, | |
| "loss": 0.5218305110931396, | |
| "mean_token_accuracy": 0.8568139627575875, | |
| "num_tokens": 11175013.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 0.5119684131816029, | |
| "epoch": 2.7243781094527364, | |
| "grad_norm": 1.698498010635376, | |
| "learning_rate": 0.0001742205510277674, | |
| "loss": 0.5018157482147216, | |
| "mean_token_accuracy": 0.8495248600840568, | |
| "num_tokens": 11256288.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 0.5109101135283709, | |
| "epoch": 2.744278606965174, | |
| "grad_norm": 1.837099552154541, | |
| "learning_rate": 0.00017377830344164464, | |
| "loss": 0.5008152484893799, | |
| "mean_token_accuracy": 0.8569738574326038, | |
| "num_tokens": 11338498.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 0.5329740956425667, | |
| "epoch": 2.764179104477612, | |
| "grad_norm": 2.1258440017700195, | |
| "learning_rate": 0.00017333286626777564, | |
| "loss": 0.5308613777160645, | |
| "mean_token_accuracy": 0.8408495858311653, | |
| "num_tokens": 11422122.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 0.5458354912698269, | |
| "epoch": 2.78407960199005, | |
| "grad_norm": 2.0416526794433594, | |
| "learning_rate": 0.00017288425876332527, | |
| "loss": 0.5461023807525635, | |
| "mean_token_accuracy": 0.8418126352131367, | |
| "num_tokens": 11506227.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 0.5177356921136379, | |
| "epoch": 2.8039800995024877, | |
| "grad_norm": 1.8857133388519287, | |
| "learning_rate": 0.00017243250032251823, | |
| "loss": 0.5320337772369385, | |
| "mean_token_accuracy": 0.8437633819878101, | |
| "num_tokens": 11586611.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 0.5068972071632742, | |
| "epoch": 2.8238805970149254, | |
| "grad_norm": 2.1604552268981934, | |
| "learning_rate": 0.00017197761047580082, | |
| "loss": 0.4947951793670654, | |
| "mean_token_accuracy": 0.8533644363284111, | |
| "num_tokens": 11670179.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 0.491135448589921, | |
| "epoch": 2.843781094527363, | |
| "grad_norm": 1.9001272916793823, | |
| "learning_rate": 0.00017151960888899627, | |
| "loss": 0.5062966346740723, | |
| "mean_token_accuracy": 0.8556574188172817, | |
| "num_tokens": 11750106.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 0.5211849508807063, | |
| "epoch": 2.863681592039801, | |
| "grad_norm": 1.9398213624954224, | |
| "learning_rate": 0.00017105851536245492, | |
| "loss": 0.48212461471557616, | |
| "mean_token_accuracy": 0.8569056294858456, | |
| "num_tokens": 11831237.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 0.4800686825066805, | |
| "epoch": 2.883582089552239, | |
| "grad_norm": 1.8992606401443481, | |
| "learning_rate": 0.0001705943498301979, | |
| "loss": 0.5234591960906982, | |
| "mean_token_accuracy": 0.8473109625279903, | |
| "num_tokens": 11915761.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 0.5110673246905207, | |
| "epoch": 2.9034825870646768, | |
| "grad_norm": 1.7360588312149048, | |
| "learning_rate": 0.00017012713235905547, | |
| "loss": 0.5000662803649902, | |
| "mean_token_accuracy": 0.8583845689892768, | |
| "num_tokens": 11996666.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 0.49351408518850803, | |
| "epoch": 2.9233830845771145, | |
| "grad_norm": 2.0405280590057373, | |
| "learning_rate": 0.00016965688314779956, | |
| "loss": 0.5083964824676513, | |
| "mean_token_accuracy": 0.8502242051064968, | |
| "num_tokens": 12082260.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 0.5278301501646638, | |
| "epoch": 2.943283582089552, | |
| "grad_norm": 1.9192203283309937, | |
| "learning_rate": 0.00016918362252627036, | |
| "loss": 0.5238072872161865, | |
| "mean_token_accuracy": 0.8439404472708703, | |
| "num_tokens": 12160973.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 0.5115002764388918, | |
| "epoch": 2.96318407960199, | |
| "grad_norm": 1.6478546857833862, | |
| "learning_rate": 0.00016870737095449754, | |
| "loss": 0.5171586036682129, | |
| "mean_token_accuracy": 0.8549239777028561, | |
| "num_tokens": 12244781.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 0.4658357990905643, | |
| "epoch": 2.983084577114428, | |
| "grad_norm": 2.152078866958618, | |
| "learning_rate": 0.00016822814902181583, | |
| "loss": 0.4724470615386963, | |
| "mean_token_accuracy": 0.8588747374713421, | |
| "num_tokens": 12328430.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_entropy": 0.6918873670421052, | |
| "eval_loss": 1.013381004333496, | |
| "eval_mean_token_accuracy": 0.7516806636537824, | |
| "eval_num_tokens": 12397968.0, | |
| "eval_runtime": 89.0725, | |
| "eval_samples_per_second": 11.62, | |
| "eval_steps_per_second": 5.815, | |
| "step": 1509 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5030, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 10, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 3, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.6428765983473664e+16, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |