{ "best_global_step": 1509, "best_metric": 1.013381004333496, "best_model_checkpoint": "/kaggle/working/models/checkpoints/v4/nosql2doc/checkpoint-1509", "epoch": 3.0, "eval_steps": 500, "global_step": 1509, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.8841454654932024, "epoch": 0.01990049751243781, "grad_norm": 3.4684948921203613, "learning_rate": 7.142857142857143e-06, "loss": 3.3999290466308594, "mean_token_accuracy": 0.36815835647284983, "num_tokens": 84042.0, "step": 10 }, { "entropy": 2.871115285158157, "epoch": 0.03980099502487562, "grad_norm": 3.199768304824829, "learning_rate": 1.5079365079365079e-05, "loss": 3.1389333724975588, "mean_token_accuracy": 0.41857333555817605, "num_tokens": 166453.0, "step": 20 }, { "entropy": 2.689709846675396, "epoch": 0.05970149253731343, "grad_norm": 2.241548776626587, "learning_rate": 2.3015873015873015e-05, "loss": 2.5403181076049806, "mean_token_accuracy": 0.45860434919595716, "num_tokens": 248357.0, "step": 30 }, { "entropy": 2.371776354312897, "epoch": 0.07960199004975124, "grad_norm": 2.2443745136260986, "learning_rate": 3.095238095238095e-05, "loss": 2.2156551361083983, "mean_token_accuracy": 0.534111600741744, "num_tokens": 329302.0, "step": 40 }, { "entropy": 1.9646751508116722, "epoch": 0.09950248756218906, "grad_norm": 2.8479607105255127, "learning_rate": 3.888888888888889e-05, "loss": 1.9395181655883789, "mean_token_accuracy": 0.5719782687723637, "num_tokens": 410388.0, "step": 50 }, { "entropy": 1.712027932703495, "epoch": 0.11940298507462686, "grad_norm": 2.5392374992370605, "learning_rate": 4.682539682539683e-05, "loss": 1.7669334411621094, "mean_token_accuracy": 0.5962413489818573, "num_tokens": 491142.0, "step": 60 }, { "entropy": 1.6189243733882903, "epoch": 0.13930348258706468, "grad_norm": 2.8646080493927, "learning_rate": 5.4761904761904766e-05, "loss": 1.6198507308959962, "mean_token_accuracy": 0.6142528053373099, "num_tokens": 573054.0, "step": 70 }, { "entropy": 1.6242131367325783, "epoch": 0.15920398009950248, "grad_norm": 3.0876874923706055, "learning_rate": 6.26984126984127e-05, "loss": 1.6246612548828125, "mean_token_accuracy": 0.626776534691453, "num_tokens": 658316.0, "step": 80 }, { "entropy": 1.5123998656868936, "epoch": 0.1791044776119403, "grad_norm": 2.827972650527954, "learning_rate": 7.063492063492065e-05, "loss": 1.5039705276489257, "mean_token_accuracy": 0.6451249852776527, "num_tokens": 738196.0, "step": 90 }, { "entropy": 1.4389337845146657, "epoch": 0.19900497512437812, "grad_norm": 2.794956684112549, "learning_rate": 7.857142857142858e-05, "loss": 1.4707328796386718, "mean_token_accuracy": 0.6486270293593407, "num_tokens": 818366.0, "step": 100 }, { "entropy": 1.4290485948324203, "epoch": 0.21890547263681592, "grad_norm": 2.650611639022827, "learning_rate": 8.650793650793651e-05, "loss": 1.461697483062744, "mean_token_accuracy": 0.6452589213848114, "num_tokens": 900542.0, "step": 110 }, { "entropy": 1.4537153281271458, "epoch": 0.23880597014925373, "grad_norm": 3.212292194366455, "learning_rate": 9.444444444444444e-05, "loss": 1.3799741744995118, "mean_token_accuracy": 0.665483495220542, "num_tokens": 983783.0, "step": 120 }, { "entropy": 1.3213311471045017, "epoch": 0.25870646766169153, "grad_norm": 2.367784261703491, "learning_rate": 0.00010238095238095237, "loss": 1.339876365661621, "mean_token_accuracy": 0.6738482430577278, "num_tokens": 1065282.0, "step": 130 }, { "entropy": 1.2877162352204323, "epoch": 0.27860696517412936, "grad_norm": 2.7096056938171387, "learning_rate": 0.00011031746031746033, "loss": 1.3189430236816406, "mean_token_accuracy": 0.6620625633746385, "num_tokens": 1147430.0, "step": 140 }, { "entropy": 1.3201022632420063, "epoch": 0.29850746268656714, "grad_norm": 2.497452974319458, "learning_rate": 0.00011825396825396826, "loss": 1.3049938201904296, "mean_token_accuracy": 0.6833859849721193, "num_tokens": 1225840.0, "step": 150 }, { "entropy": 1.2007936105132102, "epoch": 0.31840796019900497, "grad_norm": 3.0387496948242188, "learning_rate": 0.0001261904761904762, "loss": 1.231965923309326, "mean_token_accuracy": 0.7017441529780626, "num_tokens": 1309268.0, "step": 160 }, { "entropy": 1.3119081839919091, "epoch": 0.3383084577114428, "grad_norm": 2.327012300491333, "learning_rate": 0.00013412698412698412, "loss": 1.2840826034545898, "mean_token_accuracy": 0.6792996764183045, "num_tokens": 1389094.0, "step": 170 }, { "entropy": 1.2995639897882938, "epoch": 0.3582089552238806, "grad_norm": 2.426831007003784, "learning_rate": 0.00014206349206349208, "loss": 1.2992033958435059, "mean_token_accuracy": 0.6910909987986088, "num_tokens": 1471243.0, "step": 180 }, { "entropy": 1.1952705256640912, "epoch": 0.3781094527363184, "grad_norm": 2.783355951309204, "learning_rate": 0.00015000000000000001, "loss": 1.1649029731750489, "mean_token_accuracy": 0.7020247872918844, "num_tokens": 1552783.0, "step": 190 }, { "entropy": 1.2681411176919937, "epoch": 0.39800995024875624, "grad_norm": 2.162163019180298, "learning_rate": 0.00015793650793650795, "loss": 1.2627052307128905, "mean_token_accuracy": 0.6855453528463841, "num_tokens": 1635174.0, "step": 200 }, { "entropy": 1.2593041777610778, "epoch": 0.417910447761194, "grad_norm": 2.3045036792755127, "learning_rate": 0.0001658730158730159, "loss": 1.237012004852295, "mean_token_accuracy": 0.6885611288249492, "num_tokens": 1720930.0, "step": 210 }, { "entropy": 1.1904637023806572, "epoch": 0.43781094527363185, "grad_norm": 2.291395664215088, "learning_rate": 0.00017380952380952383, "loss": 1.2200750350952148, "mean_token_accuracy": 0.6859784577041864, "num_tokens": 1803132.0, "step": 220 }, { "entropy": 1.1843627236783505, "epoch": 0.4577114427860697, "grad_norm": 2.553251266479492, "learning_rate": 0.00018174603174603177, "loss": 1.2164555549621583, "mean_token_accuracy": 0.6943051021546125, "num_tokens": 1884825.0, "step": 230 }, { "entropy": 1.1876815035939217, "epoch": 0.47761194029850745, "grad_norm": 2.403580904006958, "learning_rate": 0.0001896825396825397, "loss": 1.1573832511901856, "mean_token_accuracy": 0.7180207531899214, "num_tokens": 1968914.0, "step": 240 }, { "entropy": 1.1310456305742265, "epoch": 0.4975124378109453, "grad_norm": 2.3557302951812744, "learning_rate": 0.00019761904761904763, "loss": 1.1767531394958497, "mean_token_accuracy": 0.6986724361777306, "num_tokens": 2050602.0, "step": 250 }, { "entropy": 1.2115244895219803, "epoch": 0.5174129353233831, "grad_norm": 2.430337905883789, "learning_rate": 0.0001999989408126818, "loss": 1.187550926208496, "mean_token_accuracy": 0.6943733543157578, "num_tokens": 2134774.0, "step": 260 }, { "entropy": 1.1603886000812054, "epoch": 0.5373134328358209, "grad_norm": 1.848976969718933, "learning_rate": 0.0001999937530104439, "loss": 1.1683053970336914, "mean_token_accuracy": 0.6958795577287674, "num_tokens": 2214022.0, "step": 270 }, { "entropy": 1.083036269247532, "epoch": 0.5572139303482587, "grad_norm": 2.297624111175537, "learning_rate": 0.00019998424227267588, "loss": 1.087782859802246, "mean_token_accuracy": 0.7164598941802979, "num_tokens": 2295817.0, "step": 280 }, { "entropy": 1.1467085666954517, "epoch": 0.5771144278606966, "grad_norm": 2.1926214694976807, "learning_rate": 0.00019997040901054646, "loss": 1.1336830139160157, "mean_token_accuracy": 0.7070459358394146, "num_tokens": 2379081.0, "step": 290 }, { "entropy": 1.1092145919799805, "epoch": 0.5970149253731343, "grad_norm": 2.108574390411377, "learning_rate": 0.000199952253822096, "loss": 1.104503059387207, "mean_token_accuracy": 0.7167623668909073, "num_tokens": 2461290.0, "step": 300 }, { "entropy": 1.0762298285961152, "epoch": 0.6169154228855721, "grad_norm": 1.9235388040542603, "learning_rate": 0.00019992977749221064, "loss": 1.0758417129516602, "mean_token_accuracy": 0.7244217373430729, "num_tokens": 2546927.0, "step": 310 }, { "entropy": 1.058315774053335, "epoch": 0.6368159203980099, "grad_norm": 2.015493154525757, "learning_rate": 0.0001999029809925883, "loss": 1.0714119911193847, "mean_token_accuracy": 0.7185824103653431, "num_tokens": 2627151.0, "step": 320 }, { "entropy": 1.040397210419178, "epoch": 0.6567164179104478, "grad_norm": 1.824608564376831, "learning_rate": 0.00019987186548169682, "loss": 1.0344210624694825, "mean_token_accuracy": 0.7333592250943184, "num_tokens": 2711367.0, "step": 330 }, { "entropy": 0.9891116008162498, "epoch": 0.6766169154228856, "grad_norm": 1.9432896375656128, "learning_rate": 0.0001998364323047236, "loss": 0.9733485221862793, "mean_token_accuracy": 0.7416356436908245, "num_tokens": 2793468.0, "step": 340 }, { "entropy": 1.0004291333258153, "epoch": 0.6965174129353234, "grad_norm": 1.906457781791687, "learning_rate": 0.00019979668299351783, "loss": 1.0494978904724122, "mean_token_accuracy": 0.7176768533885479, "num_tokens": 2875166.0, "step": 350 }, { "entropy": 1.0571318455040455, "epoch": 0.7164179104477612, "grad_norm": 1.7709777355194092, "learning_rate": 0.00019975261926652392, "loss": 1.0371734619140625, "mean_token_accuracy": 0.7288566574454307, "num_tokens": 2959671.0, "step": 360 }, { "entropy": 0.9674378834664822, "epoch": 0.736318407960199, "grad_norm": 1.896713376045227, "learning_rate": 0.00019970424302870739, "loss": 0.9970813751220703, "mean_token_accuracy": 0.7395003981888294, "num_tokens": 3041437.0, "step": 370 }, { "entropy": 1.1270258143544196, "epoch": 0.7562189054726368, "grad_norm": 1.7242449522018433, "learning_rate": 0.00019965155637147243, "loss": 1.0752775192260742, "mean_token_accuracy": 0.7305668473243714, "num_tokens": 3123865.0, "step": 380 }, { "entropy": 0.9315242812037468, "epoch": 0.7761194029850746, "grad_norm": 1.781772255897522, "learning_rate": 0.0001995945615725716, "loss": 0.9751872062683106, "mean_token_accuracy": 0.7497406356036663, "num_tokens": 3205032.0, "step": 390 }, { "entropy": 1.076903734356165, "epoch": 0.7960199004975125, "grad_norm": 1.8422024250030518, "learning_rate": 0.00019953326109600728, "loss": 1.0796968460083007, "mean_token_accuracy": 0.7176821112632752, "num_tokens": 3286003.0, "step": 400 }, { "entropy": 0.9634652934968472, "epoch": 0.8159203980099502, "grad_norm": 1.7082111835479736, "learning_rate": 0.00019946765759192497, "loss": 0.9697890281677246, "mean_token_accuracy": 0.7406083434820175, "num_tokens": 3367484.0, "step": 410 }, { "entropy": 0.9321402795612812, "epoch": 0.835820895522388, "grad_norm": 1.8066761493682861, "learning_rate": 0.00019939775389649916, "loss": 0.9277518272399903, "mean_token_accuracy": 0.7574292354285717, "num_tokens": 3453904.0, "step": 420 }, { "entropy": 0.9754443395882845, "epoch": 0.8557213930348259, "grad_norm": 1.6425416469573975, "learning_rate": 0.00019932355303181026, "loss": 0.9705208778381348, "mean_token_accuracy": 0.7435099229216575, "num_tokens": 3536472.0, "step": 430 }, { "entropy": 0.9742012087255716, "epoch": 0.8756218905472637, "grad_norm": 1.707189679145813, "learning_rate": 0.00019924505820571425, "loss": 1.036739444732666, "mean_token_accuracy": 0.7312861289829016, "num_tokens": 3616711.0, "step": 440 }, { "entropy": 1.0537842728197575, "epoch": 0.8955223880597015, "grad_norm": 1.865692377090454, "learning_rate": 0.0001991622728117038, "loss": 1.0217846870422362, "mean_token_accuracy": 0.7338800489902496, "num_tokens": 3701126.0, "step": 450 }, { "entropy": 0.989534855633974, "epoch": 0.9154228855721394, "grad_norm": 1.7353651523590088, "learning_rate": 0.00019907520042876172, "loss": 1.0003718376159667, "mean_token_accuracy": 0.7480997510254384, "num_tokens": 3783495.0, "step": 460 }, { "entropy": 0.9294702004641294, "epoch": 0.9353233830845771, "grad_norm": 2.007262706756592, "learning_rate": 0.00019898384482120614, "loss": 1.0100757598876953, "mean_token_accuracy": 0.7364842720329762, "num_tokens": 3863784.0, "step": 470 }, { "entropy": 0.9523782070726157, "epoch": 0.9552238805970149, "grad_norm": 1.9396175146102905, "learning_rate": 0.0001988882099385278, "loss": 0.9432971000671386, "mean_token_accuracy": 0.756897260248661, "num_tokens": 3947540.0, "step": 480 }, { "entropy": 0.9421051684767008, "epoch": 0.9751243781094527, "grad_norm": 1.8582719564437866, "learning_rate": 0.00019878829991521935, "loss": 0.9125359535217286, "mean_token_accuracy": 0.7575220972299576, "num_tokens": 4031284.0, "step": 490 }, { "entropy": 0.9381607126444578, "epoch": 0.9950248756218906, "grad_norm": 1.9623899459838867, "learning_rate": 0.00019868411907059645, "loss": 0.9656861305236817, "mean_token_accuracy": 0.7544871643185616, "num_tokens": 4112149.0, "step": 500 }, { "epoch": 1.0, "eval_entropy": 0.9874700385516214, "eval_loss": 1.063795566558838, "eval_mean_token_accuracy": 0.7334998920847551, "eval_num_tokens": 4132656.0, "eval_runtime": 88.6229, "eval_samples_per_second": 11.679, "eval_steps_per_second": 5.845, "step": 503 }, { "entropy": 0.8532990099568116, "epoch": 1.0139303482587065, "grad_norm": 1.6549201011657715, "learning_rate": 0.00019857567190861126, "loss": 0.7886298179626465, "mean_token_accuracy": 0.7860889779893976, "num_tokens": 4190723.0, "step": 510 }, { "entropy": 0.7671804554760456, "epoch": 1.0338308457711443, "grad_norm": 1.6148929595947266, "learning_rate": 0.00019846296311765754, "loss": 0.777919864654541, "mean_token_accuracy": 0.789631099998951, "num_tokens": 4273358.0, "step": 520 }, { "entropy": 0.8041674952954054, "epoch": 1.053731343283582, "grad_norm": 1.765950322151184, "learning_rate": 0.00019834599757036803, "loss": 0.7967178821563721, "mean_token_accuracy": 0.784614659100771, "num_tokens": 4356030.0, "step": 530 }, { "entropy": 0.7405303593724966, "epoch": 1.07363184079602, "grad_norm": 1.7868931293487549, "learning_rate": 0.00019822478032340387, "loss": 0.7301093578338623, "mean_token_accuracy": 0.8020888641476631, "num_tokens": 4440157.0, "step": 540 }, { "entropy": 0.7550990927964449, "epoch": 1.0935323383084576, "grad_norm": 1.991782784461975, "learning_rate": 0.0001980993166172358, "loss": 0.7884031295776367, "mean_token_accuracy": 0.7879343688488006, "num_tokens": 4523343.0, "step": 550 }, { "entropy": 0.812371177971363, "epoch": 1.1134328358208956, "grad_norm": 1.869396686553955, "learning_rate": 0.00019796961187591781, "loss": 0.8159590721130371, "mean_token_accuracy": 0.7711428456008435, "num_tokens": 4605454.0, "step": 560 }, { "entropy": 0.7879433136433363, "epoch": 1.1333333333333333, "grad_norm": 1.9530060291290283, "learning_rate": 0.00019783567170685262, "loss": 0.8079433441162109, "mean_token_accuracy": 0.7875082984566688, "num_tokens": 4687318.0, "step": 570 }, { "entropy": 0.8396137218922377, "epoch": 1.153233830845771, "grad_norm": 1.7895166873931885, "learning_rate": 0.00019769750190054905, "loss": 0.8188363075256347, "mean_token_accuracy": 0.7710263684391976, "num_tokens": 4768232.0, "step": 580 }, { "entropy": 0.8406378872692585, "epoch": 1.173134328358209, "grad_norm": 1.8147255182266235, "learning_rate": 0.00019755510843037191, "loss": 0.8532954216003418, "mean_token_accuracy": 0.7680545568466186, "num_tokens": 4850366.0, "step": 590 }, { "entropy": 0.7758986987173557, "epoch": 1.1930348258706467, "grad_norm": 1.9839149713516235, "learning_rate": 0.00019740849745228367, "loss": 0.7972042560577393, "mean_token_accuracy": 0.77668926268816, "num_tokens": 4932940.0, "step": 600 }, { "entropy": 0.825455692410469, "epoch": 1.2129353233830846, "grad_norm": 1.776328444480896, "learning_rate": 0.00019725767530457837, "loss": 0.7664913654327392, "mean_token_accuracy": 0.7940710753202438, "num_tokens": 5012821.0, "step": 610 }, { "entropy": 0.7286036755889654, "epoch": 1.2328358208955223, "grad_norm": 2.0241360664367676, "learning_rate": 0.00019710264850760756, "loss": 0.7731894969940185, "mean_token_accuracy": 0.7846131704747676, "num_tokens": 5095340.0, "step": 620 }, { "entropy": 0.7920811083167791, "epoch": 1.25273631840796, "grad_norm": 1.7310129404067993, "learning_rate": 0.00019694342376349835, "loss": 0.7303972244262695, "mean_token_accuracy": 0.7983584970235824, "num_tokens": 5177547.0, "step": 630 }, { "entropy": 0.7178942065685987, "epoch": 1.272636815920398, "grad_norm": 1.7608613967895508, "learning_rate": 0.00019678000795586386, "loss": 0.8018975257873535, "mean_token_accuracy": 0.7767767131328582, "num_tokens": 5265612.0, "step": 640 }, { "entropy": 0.8001765824854374, "epoch": 1.292537313432836, "grad_norm": 2.0576155185699463, "learning_rate": 0.00019661240814950536, "loss": 0.7223423480987549, "mean_token_accuracy": 0.7918425254523754, "num_tokens": 5348652.0, "step": 650 }, { "entropy": 0.7580439992249012, "epoch": 1.3124378109452737, "grad_norm": 1.539169430732727, "learning_rate": 0.00019644063159010716, "loss": 0.8217278480529785, "mean_token_accuracy": 0.7793662197887897, "num_tokens": 5431834.0, "step": 660 }, { "entropy": 0.8075141672044992, "epoch": 1.3323383084577114, "grad_norm": 1.8933053016662598, "learning_rate": 0.00019626468570392298, "loss": 0.7759135723114013, "mean_token_accuracy": 0.7861333280801773, "num_tokens": 5514228.0, "step": 670 }, { "entropy": 0.7623774103820324, "epoch": 1.3522388059701491, "grad_norm": 1.7051018476486206, "learning_rate": 0.00019608457809745537, "loss": 0.8088616371154785, "mean_token_accuracy": 0.7746041730046272, "num_tokens": 5594702.0, "step": 680 }, { "entropy": 0.8089807592332363, "epoch": 1.372139303482587, "grad_norm": 1.8061248064041138, "learning_rate": 0.00019590031655712631, "loss": 0.7946909904479981, "mean_token_accuracy": 0.7781320951879025, "num_tokens": 5676309.0, "step": 690 }, { "entropy": 0.7627177253365517, "epoch": 1.392039800995025, "grad_norm": 1.9005513191223145, "learning_rate": 0.00019571190904894115, "loss": 0.7615675926208496, "mean_token_accuracy": 0.788880155980587, "num_tokens": 5757314.0, "step": 700 }, { "entropy": 0.7580569207668304, "epoch": 1.4119402985074627, "grad_norm": 1.9883071184158325, "learning_rate": 0.00019551936371814375, "loss": 0.7611291408538818, "mean_token_accuracy": 0.7861187107861042, "num_tokens": 5838877.0, "step": 710 }, { "entropy": 0.7182941000908614, "epoch": 1.4318407960199004, "grad_norm": 2.187103033065796, "learning_rate": 0.0001953226888888647, "loss": 0.7204749584197998, "mean_token_accuracy": 0.7946790263056756, "num_tokens": 5920820.0, "step": 720 }, { "entropy": 0.6957223568111658, "epoch": 1.4517412935323384, "grad_norm": 1.7006845474243164, "learning_rate": 0.00019512189306376118, "loss": 0.757196044921875, "mean_token_accuracy": 0.7921811021864414, "num_tokens": 6004382.0, "step": 730 }, { "entropy": 0.7850441809743642, "epoch": 1.471641791044776, "grad_norm": 1.6335111856460571, "learning_rate": 0.0001949169849236496, "loss": 0.7292089462280273, "mean_token_accuracy": 0.797366950660944, "num_tokens": 6086449.0, "step": 740 }, { "entropy": 0.7639980979263783, "epoch": 1.491542288557214, "grad_norm": 1.7224810123443604, "learning_rate": 0.00019470797332713012, "loss": 0.8179457664489747, "mean_token_accuracy": 0.7910384394228458, "num_tokens": 6168749.0, "step": 750 }, { "entropy": 0.8024922411888837, "epoch": 1.5114427860696518, "grad_norm": 1.9208451509475708, "learning_rate": 0.0001944948673102038, "loss": 0.7916707515716552, "mean_token_accuracy": 0.7822470977902413, "num_tokens": 6248672.0, "step": 760 }, { "entropy": 0.7430106606334448, "epoch": 1.5313432835820895, "grad_norm": 1.9618816375732422, "learning_rate": 0.00019427767608588183, "loss": 0.7538708209991455, "mean_token_accuracy": 0.7816703900694847, "num_tokens": 6331261.0, "step": 770 }, { "entropy": 0.7457086000591516, "epoch": 1.5512437810945272, "grad_norm": 1.6858505010604858, "learning_rate": 0.0001940564090437875, "loss": 0.7316685676574707, "mean_token_accuracy": 0.8001063913106918, "num_tokens": 6415504.0, "step": 780 }, { "entropy": 0.7096565395593644, "epoch": 1.5711442786069652, "grad_norm": 1.9956564903259277, "learning_rate": 0.00019383107574974984, "loss": 0.7277198791503906, "mean_token_accuracy": 0.7895878478884697, "num_tokens": 6497199.0, "step": 790 }, { "entropy": 0.7606754396110773, "epoch": 1.591044776119403, "grad_norm": 1.7207188606262207, "learning_rate": 0.00019360168594539055, "loss": 0.7483164310455322, "mean_token_accuracy": 0.7934170700609684, "num_tokens": 6577494.0, "step": 800 }, { "entropy": 0.7786010228097439, "epoch": 1.6109452736318408, "grad_norm": 1.7885297536849976, "learning_rate": 0.0001933682495477024, "loss": 0.7517632007598877, "mean_token_accuracy": 0.791710589081049, "num_tokens": 6660010.0, "step": 810 }, { "entropy": 0.73126558996737, "epoch": 1.6308457711442785, "grad_norm": 1.929076910018921, "learning_rate": 0.00019313077664862092, "loss": 0.7747976303100585, "mean_token_accuracy": 0.7895058654248714, "num_tokens": 6739669.0, "step": 820 }, { "entropy": 0.7332248043268919, "epoch": 1.6507462686567163, "grad_norm": 1.6692851781845093, "learning_rate": 0.00019288927751458766, "loss": 0.6981019020080567, "mean_token_accuracy": 0.8055072821676731, "num_tokens": 6819838.0, "step": 830 }, { "entropy": 0.712925647944212, "epoch": 1.6706467661691542, "grad_norm": 1.5395867824554443, "learning_rate": 0.0001926437625861068, "loss": 0.7524178504943848, "mean_token_accuracy": 0.7908283203840256, "num_tokens": 6901777.0, "step": 840 }, { "entropy": 0.7585150092840195, "epoch": 1.6905472636815921, "grad_norm": 1.6641769409179688, "learning_rate": 0.00019239424247729345, "loss": 0.7306118488311768, "mean_token_accuracy": 0.7910356394946575, "num_tokens": 6983222.0, "step": 850 }, { "entropy": 0.7012663371860981, "epoch": 1.7104477611940299, "grad_norm": 1.9537489414215088, "learning_rate": 0.0001921407279754149, "loss": 0.752435302734375, "mean_token_accuracy": 0.8054570883512497, "num_tokens": 7067291.0, "step": 860 }, { "entropy": 0.7264402851462364, "epoch": 1.7303482587064676, "grad_norm": 1.8359386920928955, "learning_rate": 0.00019188323004042435, "loss": 0.6932102680206299, "mean_token_accuracy": 0.802193396538496, "num_tokens": 7150268.0, "step": 870 }, { "entropy": 0.6838662784546614, "epoch": 1.7502487562189055, "grad_norm": 1.9146333932876587, "learning_rate": 0.00019162175980448688, "loss": 0.7538199424743652, "mean_token_accuracy": 0.796929395198822, "num_tokens": 7231091.0, "step": 880 }, { "entropy": 0.7262898899614811, "epoch": 1.7701492537313432, "grad_norm": 2.0510952472686768, "learning_rate": 0.0001913563285714984, "loss": 0.7104074954986572, "mean_token_accuracy": 0.8008449010550975, "num_tokens": 7313340.0, "step": 890 }, { "entropy": 0.7481670882552862, "epoch": 1.7900497512437812, "grad_norm": 2.0180599689483643, "learning_rate": 0.0001910869478165969, "loss": 0.8105827331542969, "mean_token_accuracy": 0.7843330048024655, "num_tokens": 7393519.0, "step": 900 }, { "entropy": 0.7768452275544405, "epoch": 1.809950248756219, "grad_norm": 1.646704912185669, "learning_rate": 0.00019081362918566618, "loss": 0.7446431636810302, "mean_token_accuracy": 0.8008080549538136, "num_tokens": 7475016.0, "step": 910 }, { "entropy": 0.683229249343276, "epoch": 1.8298507462686566, "grad_norm": 1.638253092765808, "learning_rate": 0.00019053638449483259, "loss": 0.7266605854034424, "mean_token_accuracy": 0.7936579927802085, "num_tokens": 7559243.0, "step": 920 }, { "entropy": 0.7504678606987, "epoch": 1.8497512437810946, "grad_norm": 1.6552717685699463, "learning_rate": 0.0001902552257299542, "loss": 0.738245677947998, "mean_token_accuracy": 0.7894984453916549, "num_tokens": 7643029.0, "step": 930 }, { "entropy": 0.7069665104150772, "epoch": 1.8696517412935323, "grad_norm": 1.4619513750076294, "learning_rate": 0.00018997016504610246, "loss": 0.7275553226470948, "mean_token_accuracy": 0.8092396840453148, "num_tokens": 7726479.0, "step": 940 }, { "entropy": 0.6909922767430544, "epoch": 1.8895522388059702, "grad_norm": 1.6785398721694946, "learning_rate": 0.00018968121476703678, "loss": 0.6958948612213135, "mean_token_accuracy": 0.8184511929750442, "num_tokens": 7808235.0, "step": 950 }, { "entropy": 0.7206986505538225, "epoch": 1.909452736318408, "grad_norm": 1.8156358003616333, "learning_rate": 0.00018938838738467184, "loss": 0.7307656288146973, "mean_token_accuracy": 0.795404677093029, "num_tokens": 7888802.0, "step": 960 }, { "entropy": 0.7154657423496247, "epoch": 1.9293532338308457, "grad_norm": 1.9570693969726562, "learning_rate": 0.00018909169555853743, "loss": 0.6951888084411622, "mean_token_accuracy": 0.7979383312165738, "num_tokens": 7970204.0, "step": 970 }, { "entropy": 0.6446726582944393, "epoch": 1.9492537313432836, "grad_norm": 1.5071886777877808, "learning_rate": 0.00018879115211523117, "loss": 0.6544716358184814, "mean_token_accuracy": 0.8045676186680794, "num_tokens": 8053307.0, "step": 980 }, { "entropy": 0.699823185056448, "epoch": 1.9691542288557216, "grad_norm": 1.4266027212142944, "learning_rate": 0.0001884867700478641, "loss": 0.7055366516113282, "mean_token_accuracy": 0.7992964766919612, "num_tokens": 8135193.0, "step": 990 }, { "entropy": 0.7140736062079668, "epoch": 1.9890547263681593, "grad_norm": 2.0378243923187256, "learning_rate": 0.00018817856251549867, "loss": 0.7184643268585205, "mean_token_accuracy": 0.7989312529563903, "num_tokens": 8219594.0, "step": 1000 }, { "epoch": 2.0, "eval_entropy": 0.8002531397008988, "eval_loss": 1.0154445171356201, "eval_mean_token_accuracy": 0.7423216365709268, "eval_num_tokens": 8265312.0, "eval_runtime": 88.2, "eval_samples_per_second": 11.735, "eval_steps_per_second": 5.873, "step": 1006 }, { "entropy": 0.7038449613671554, "epoch": 2.007960199004975, "grad_norm": 1.6040326356887817, "learning_rate": 0.00018786654284258034, "loss": 0.6638185501098632, "mean_token_accuracy": 0.8091712115626586, "num_tokens": 8297623.0, "step": 1010 }, { "entropy": 0.5252644840627909, "epoch": 2.027860696517413, "grad_norm": 2.1827661991119385, "learning_rate": 0.00018755072451836097, "loss": 0.5153174877166748, "mean_token_accuracy": 0.8446948520839215, "num_tokens": 8379050.0, "step": 1020 }, { "entropy": 0.5121854435652494, "epoch": 2.047761194029851, "grad_norm": 1.8835452795028687, "learning_rate": 0.00018723112119631608, "loss": 0.5017234325408936, "mean_token_accuracy": 0.8539764225482941, "num_tokens": 8462847.0, "step": 1030 }, { "entropy": 0.5651770515367389, "epoch": 2.0676616915422885, "grad_norm": 1.6592763662338257, "learning_rate": 0.00018690774669355442, "loss": 0.5333661079406739, "mean_token_accuracy": 0.8419696733355522, "num_tokens": 8542681.0, "step": 1040 }, { "entropy": 0.47107693143188956, "epoch": 2.0875621890547262, "grad_norm": 1.8748646974563599, "learning_rate": 0.00018658061499022055, "loss": 0.4740941047668457, "mean_token_accuracy": 0.8567564368247986, "num_tokens": 8627432.0, "step": 1050 }, { "entropy": 0.49270418751984835, "epoch": 2.107462686567164, "grad_norm": 2.027717351913452, "learning_rate": 0.0001862497402288906, "loss": 0.48979806900024414, "mean_token_accuracy": 0.8501696541905404, "num_tokens": 8708822.0, "step": 1060 }, { "entropy": 0.4634111661463976, "epoch": 2.127363184079602, "grad_norm": 1.8452632427215576, "learning_rate": 0.0001859151367139608, "loss": 0.4521069049835205, "mean_token_accuracy": 0.8683336563408375, "num_tokens": 8789791.0, "step": 1070 }, { "entropy": 0.46942942440509794, "epoch": 2.14726368159204, "grad_norm": 1.9295680522918701, "learning_rate": 0.000185576818911029, "loss": 0.5178594589233398, "mean_token_accuracy": 0.8462874710559845, "num_tokens": 8870514.0, "step": 1080 }, { "entropy": 0.5393101962283253, "epoch": 2.1671641791044776, "grad_norm": 1.6308494806289673, "learning_rate": 0.00018523480144626948, "loss": 0.5196755409240723, "mean_token_accuracy": 0.8491615362465381, "num_tokens": 8952466.0, "step": 1090 }, { "entropy": 0.491584631241858, "epoch": 2.1870646766169153, "grad_norm": 1.9126944541931152, "learning_rate": 0.00018488909910580037, "loss": 0.507460069656372, "mean_token_accuracy": 0.8491294652223587, "num_tokens": 9034965.0, "step": 1100 }, { "entropy": 0.5460982380434871, "epoch": 2.206965174129353, "grad_norm": 2.245730400085449, "learning_rate": 0.00018453972683504466, "loss": 0.5434001445770263, "mean_token_accuracy": 0.8417311415076256, "num_tokens": 9117636.0, "step": 1110 }, { "entropy": 0.5413472417742013, "epoch": 2.226865671641791, "grad_norm": 1.7490206956863403, "learning_rate": 0.00018418669973808386, "loss": 0.5176630973815918, "mean_token_accuracy": 0.8437662713229657, "num_tokens": 9203719.0, "step": 1120 }, { "entropy": 0.5068975739181042, "epoch": 2.246766169154229, "grad_norm": 2.32169246673584, "learning_rate": 0.00018383003307700525, "loss": 0.4966591358184814, "mean_token_accuracy": 0.8558630302548409, "num_tokens": 9285285.0, "step": 1130 }, { "entropy": 0.472692010179162, "epoch": 2.2666666666666666, "grad_norm": 2.121119499206543, "learning_rate": 0.0001834697422712419, "loss": 0.4562082290649414, "mean_token_accuracy": 0.861832109093666, "num_tokens": 9368724.0, "step": 1140 }, { "entropy": 0.48463920764625074, "epoch": 2.2865671641791043, "grad_norm": 2.003596305847168, "learning_rate": 0.00018310584289690608, "loss": 0.5065945148468017, "mean_token_accuracy": 0.8411129087209701, "num_tokens": 9450345.0, "step": 1150 }, { "entropy": 0.5297361209988594, "epoch": 2.306467661691542, "grad_norm": 1.9170504808425903, "learning_rate": 0.0001827383506861159, "loss": 0.5093509674072265, "mean_token_accuracy": 0.8439007833600044, "num_tokens": 9531914.0, "step": 1160 }, { "entropy": 0.508120141364634, "epoch": 2.32636815920398, "grad_norm": 1.8182140588760376, "learning_rate": 0.00018236728152631526, "loss": 0.5065027236938476, "mean_token_accuracy": 0.8519511334598064, "num_tokens": 9613824.0, "step": 1170 }, { "entropy": 0.5490097716450691, "epoch": 2.346268656716418, "grad_norm": 1.6451319456100464, "learning_rate": 0.00018199265145958678, "loss": 0.5736330032348633, "mean_token_accuracy": 0.8286732420325279, "num_tokens": 9696070.0, "step": 1180 }, { "entropy": 0.5155842589214444, "epoch": 2.3661691542288557, "grad_norm": 1.8924293518066406, "learning_rate": 0.00018161447668195858, "loss": 0.5310076236724853, "mean_token_accuracy": 0.8431366585195065, "num_tokens": 9777568.0, "step": 1190 }, { "entropy": 0.4998965173959732, "epoch": 2.3860696517412934, "grad_norm": 1.9782637357711792, "learning_rate": 0.00018123277354270372, "loss": 0.46693716049194334, "mean_token_accuracy": 0.8578181132674217, "num_tokens": 9858081.0, "step": 1200 }, { "entropy": 0.5187313890084624, "epoch": 2.405970149253731, "grad_norm": 1.8333914279937744, "learning_rate": 0.00018084755854363377, "loss": 0.5384686946868896, "mean_token_accuracy": 0.8451795615255833, "num_tokens": 9940187.0, "step": 1210 }, { "entropy": 0.5085030103102326, "epoch": 2.4258706467661693, "grad_norm": 2.00839900970459, "learning_rate": 0.00018045884833838512, "loss": 0.5079335689544677, "mean_token_accuracy": 0.8514300569891929, "num_tokens": 10018432.0, "step": 1220 }, { "entropy": 0.5382265558466315, "epoch": 2.445771144278607, "grad_norm": 1.9003617763519287, "learning_rate": 0.00018006665973169911, "loss": 0.5386298179626465, "mean_token_accuracy": 0.8454402416944504, "num_tokens": 10100137.0, "step": 1230 }, { "entropy": 0.5438722034916281, "epoch": 2.4656716417910447, "grad_norm": 2.1470773220062256, "learning_rate": 0.0001796710096786956, "loss": 0.5553887367248536, "mean_token_accuracy": 0.8391343042254448, "num_tokens": 10184025.0, "step": 1240 }, { "entropy": 0.5251597924157977, "epoch": 2.4855721393034824, "grad_norm": 1.992197036743164, "learning_rate": 0.0001792719152841398, "loss": 0.5232258319854737, "mean_token_accuracy": 0.8480332940816879, "num_tokens": 10268664.0, "step": 1250 }, { "entropy": 0.5361188564449548, "epoch": 2.50547263681592, "grad_norm": 1.6610969305038452, "learning_rate": 0.0001788693938017029, "loss": 0.5130891799926758, "mean_token_accuracy": 0.8441365607082844, "num_tokens": 10349492.0, "step": 1260 }, { "entropy": 0.4794240856543183, "epoch": 2.5253731343283583, "grad_norm": 2.0173373222351074, "learning_rate": 0.00017846346263321623, "loss": 0.5028162956237793, "mean_token_accuracy": 0.84928208142519, "num_tokens": 10432597.0, "step": 1270 }, { "entropy": 0.5074908941984176, "epoch": 2.545273631840796, "grad_norm": 2.124582290649414, "learning_rate": 0.00017805413932791875, "loss": 0.5137399673461914, "mean_token_accuracy": 0.8484948351979256, "num_tokens": 10513192.0, "step": 1280 }, { "entropy": 0.5202818088233471, "epoch": 2.5651741293532337, "grad_norm": 1.7741371393203735, "learning_rate": 0.00017764144158169856, "loss": 0.5218567848205566, "mean_token_accuracy": 0.8525593280792236, "num_tokens": 10597049.0, "step": 1290 }, { "entropy": 0.5169114828109741, "epoch": 2.585074626865672, "grad_norm": 2.03674054145813, "learning_rate": 0.00017722538723632773, "loss": 0.5342438697814942, "mean_token_accuracy": 0.8379098229110241, "num_tokens": 10679839.0, "step": 1300 }, { "entropy": 0.527920619212091, "epoch": 2.604975124378109, "grad_norm": 1.7481690645217896, "learning_rate": 0.000176805994278691, "loss": 0.5268249988555909, "mean_token_accuracy": 0.8468565516173839, "num_tokens": 10763374.0, "step": 1310 }, { "entropy": 0.5612680882215499, "epoch": 2.6248756218905474, "grad_norm": 2.044337511062622, "learning_rate": 0.0001763832808400082, "loss": 0.5637305736541748, "mean_token_accuracy": 0.8389740340411663, "num_tokens": 10846467.0, "step": 1320 }, { "entropy": 0.526572679169476, "epoch": 2.644776119402985, "grad_norm": 1.5558581352233887, "learning_rate": 0.00017595726519505043, "loss": 0.5200609683990478, "mean_token_accuracy": 0.848398495465517, "num_tokens": 10929729.0, "step": 1330 }, { "entropy": 0.5076324449852109, "epoch": 2.664676616915423, "grad_norm": 2.233233690261841, "learning_rate": 0.00017552796576134985, "loss": 0.5190268993377686, "mean_token_accuracy": 0.841417095810175, "num_tokens": 11012769.0, "step": 1340 }, { "entropy": 0.5502721823751926, "epoch": 2.684577114427861, "grad_norm": 1.8738890886306763, "learning_rate": 0.00017509540109840365, "loss": 0.547359848022461, "mean_token_accuracy": 0.8380319178104401, "num_tokens": 11094716.0, "step": 1350 }, { "entropy": 0.5275072449818253, "epoch": 2.7044776119402982, "grad_norm": 1.8149367570877075, "learning_rate": 0.00017465958990687156, "loss": 0.5218305110931396, "mean_token_accuracy": 0.8568139627575875, "num_tokens": 11175013.0, "step": 1360 }, { "entropy": 0.5119684131816029, "epoch": 2.7243781094527364, "grad_norm": 1.698498010635376, "learning_rate": 0.0001742205510277674, "loss": 0.5018157482147216, "mean_token_accuracy": 0.8495248600840568, "num_tokens": 11256288.0, "step": 1370 }, { "entropy": 0.5109101135283709, "epoch": 2.744278606965174, "grad_norm": 1.837099552154541, "learning_rate": 0.00017377830344164464, "loss": 0.5008152484893799, "mean_token_accuracy": 0.8569738574326038, "num_tokens": 11338498.0, "step": 1380 }, { "entropy": 0.5329740956425667, "epoch": 2.764179104477612, "grad_norm": 2.1258440017700195, "learning_rate": 0.00017333286626777564, "loss": 0.5308613777160645, "mean_token_accuracy": 0.8408495858311653, "num_tokens": 11422122.0, "step": 1390 }, { "entropy": 0.5458354912698269, "epoch": 2.78407960199005, "grad_norm": 2.0416526794433594, "learning_rate": 0.00017288425876332527, "loss": 0.5461023807525635, "mean_token_accuracy": 0.8418126352131367, "num_tokens": 11506227.0, "step": 1400 }, { "entropy": 0.5177356921136379, "epoch": 2.8039800995024877, "grad_norm": 1.8857133388519287, "learning_rate": 0.00017243250032251823, "loss": 0.5320337772369385, "mean_token_accuracy": 0.8437633819878101, "num_tokens": 11586611.0, "step": 1410 }, { "entropy": 0.5068972071632742, "epoch": 2.8238805970149254, "grad_norm": 2.1604552268981934, "learning_rate": 0.00017197761047580082, "loss": 0.4947951793670654, "mean_token_accuracy": 0.8533644363284111, "num_tokens": 11670179.0, "step": 1420 }, { "entropy": 0.491135448589921, "epoch": 2.843781094527363, "grad_norm": 1.9001272916793823, "learning_rate": 0.00017151960888899627, "loss": 0.5062966346740723, "mean_token_accuracy": 0.8556574188172817, "num_tokens": 11750106.0, "step": 1430 }, { "entropy": 0.5211849508807063, "epoch": 2.863681592039801, "grad_norm": 1.9398213624954224, "learning_rate": 0.00017105851536245492, "loss": 0.48212461471557616, "mean_token_accuracy": 0.8569056294858456, "num_tokens": 11831237.0, "step": 1440 }, { "entropy": 0.4800686825066805, "epoch": 2.883582089552239, "grad_norm": 1.8992606401443481, "learning_rate": 0.0001705943498301979, "loss": 0.5234591960906982, "mean_token_accuracy": 0.8473109625279903, "num_tokens": 11915761.0, "step": 1450 }, { "entropy": 0.5110673246905207, "epoch": 2.9034825870646768, "grad_norm": 1.7360588312149048, "learning_rate": 0.00017012713235905547, "loss": 0.5000662803649902, "mean_token_accuracy": 0.8583845689892768, "num_tokens": 11996666.0, "step": 1460 }, { "entropy": 0.49351408518850803, "epoch": 2.9233830845771145, "grad_norm": 2.0405280590057373, "learning_rate": 0.00016965688314779956, "loss": 0.5083964824676513, "mean_token_accuracy": 0.8502242051064968, "num_tokens": 12082260.0, "step": 1470 }, { "entropy": 0.5278301501646638, "epoch": 2.943283582089552, "grad_norm": 1.9192203283309937, "learning_rate": 0.00016918362252627036, "loss": 0.5238072872161865, "mean_token_accuracy": 0.8439404472708703, "num_tokens": 12160973.0, "step": 1480 }, { "entropy": 0.5115002764388918, "epoch": 2.96318407960199, "grad_norm": 1.6478546857833862, "learning_rate": 0.00016870737095449754, "loss": 0.5171586036682129, "mean_token_accuracy": 0.8549239777028561, "num_tokens": 12244781.0, "step": 1490 }, { "entropy": 0.4658357990905643, "epoch": 2.983084577114428, "grad_norm": 2.152078866958618, "learning_rate": 0.00016822814902181583, "loss": 0.4724470615386963, "mean_token_accuracy": 0.8588747374713421, "num_tokens": 12328430.0, "step": 1500 }, { "epoch": 3.0, "eval_entropy": 0.6918873670421052, "eval_loss": 1.013381004333496, "eval_mean_token_accuracy": 0.7516806636537824, "eval_num_tokens": 12397968.0, "eval_runtime": 89.0725, "eval_samples_per_second": 11.62, "eval_steps_per_second": 5.815, "step": 1509 } ], "logging_steps": 10, "max_steps": 5030, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.6428765983473664e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }