{ "best_global_step": 1500, "best_metric": 0.03645886108279228, "best_model_checkpoint": "/kaggle/working/models/checkpoints/v4/sql2nosql/checkpoint-1500", "epoch": 3.0, "eval_steps": 500, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1209821447730064, "epoch": 0.020005001250312578, "grad_norm": 1.7302765846252441, "learning_rate": 7.2e-06, "loss": 1.3475940704345704, "mean_token_accuracy": 0.6775479473173618, "num_tokens": 65756.0, "step": 10 }, { "entropy": 1.0718491852283478, "epoch": 0.040010002500625155, "grad_norm": 1.598680853843689, "learning_rate": 1.52e-05, "loss": 1.1782958984375, "mean_token_accuracy": 0.6978455670177937, "num_tokens": 127350.0, "step": 20 }, { "entropy": 0.9551009342074395, "epoch": 0.06001500375093773, "grad_norm": 1.7650020122528076, "learning_rate": 2.32e-05, "loss": 0.9067621231079102, "mean_token_accuracy": 0.7337856531143189, "num_tokens": 191970.0, "step": 30 }, { "entropy": 0.7395371329039335, "epoch": 0.08002000500125031, "grad_norm": 1.2754874229431152, "learning_rate": 3.12e-05, "loss": 0.6462621212005615, "mean_token_accuracy": 0.815752174705267, "num_tokens": 257775.0, "step": 40 }, { "entropy": 0.5132245156913996, "epoch": 0.1000250062515629, "grad_norm": 1.6131094694137573, "learning_rate": 3.9200000000000004e-05, "loss": 0.4761983871459961, "mean_token_accuracy": 0.8625759541988373, "num_tokens": 319507.0, "step": 50 }, { "entropy": 0.35333055444061756, "epoch": 0.12003000750187547, "grad_norm": 1.9517418146133423, "learning_rate": 4.72e-05, "loss": 0.34327900409698486, "mean_token_accuracy": 0.9010166764259339, "num_tokens": 380952.0, "step": 60 }, { "entropy": 0.2581108913756907, "epoch": 0.14003500875218805, "grad_norm": 1.8101425170898438, "learning_rate": 5.520000000000001e-05, "loss": 0.25612337589263917, "mean_token_accuracy": 0.9237508125603199, "num_tokens": 443849.0, "step": 70 }, { "entropy": 0.23392133321613073, "epoch": 0.16004001000250062, "grad_norm": 1.4003955125808716, "learning_rate": 6.32e-05, "loss": 0.20029537677764891, "mean_token_accuracy": 0.940458069741726, "num_tokens": 505868.0, "step": 80 }, { "entropy": 0.1773814239539206, "epoch": 0.1800450112528132, "grad_norm": 1.2149077653884888, "learning_rate": 7.12e-05, "loss": 0.1597532272338867, "mean_token_accuracy": 0.9488845877349377, "num_tokens": 570792.0, "step": 90 }, { "entropy": 0.16433264631778002, "epoch": 0.2000500125031258, "grad_norm": 1.4650107622146606, "learning_rate": 7.920000000000001e-05, "loss": 0.15449292659759523, "mean_token_accuracy": 0.9529499627649785, "num_tokens": 634476.0, "step": 100 }, { "entropy": 0.1567419718950987, "epoch": 0.22005501375343836, "grad_norm": 1.2412768602371216, "learning_rate": 8.72e-05, "loss": 0.14979339838027955, "mean_token_accuracy": 0.9547351159155368, "num_tokens": 697928.0, "step": 110 }, { "entropy": 0.14790078573860227, "epoch": 0.24006001500375093, "grad_norm": 1.0941258668899536, "learning_rate": 9.52e-05, "loss": 0.15537588596343993, "mean_token_accuracy": 0.9548502139747143, "num_tokens": 761970.0, "step": 120 }, { "entropy": 0.14068418610841035, "epoch": 0.26006501625406353, "grad_norm": 1.3730136156082153, "learning_rate": 0.0001032, "loss": 0.12376174926757813, "mean_token_accuracy": 0.9643007285892964, "num_tokens": 827125.0, "step": 130 }, { "entropy": 0.10366909941658378, "epoch": 0.2800700175043761, "grad_norm": 0.859259843826294, "learning_rate": 0.00011120000000000002, "loss": 0.10419689416885376, "mean_token_accuracy": 0.9708971530199051, "num_tokens": 890387.0, "step": 140 }, { "entropy": 0.10762261427007616, "epoch": 0.30007501875468867, "grad_norm": 0.9888283610343933, "learning_rate": 0.0001192, "loss": 0.09227448105812072, "mean_token_accuracy": 0.9713370814919472, "num_tokens": 956032.0, "step": 150 }, { "entropy": 0.1130900933407247, "epoch": 0.32008002000500124, "grad_norm": 0.9545535445213318, "learning_rate": 0.0001272, "loss": 0.1083062767982483, "mean_token_accuracy": 0.9707557298243046, "num_tokens": 1020072.0, "step": 160 }, { "entropy": 0.0895556318340823, "epoch": 0.3400850212553138, "grad_norm": 0.9866153597831726, "learning_rate": 0.0001352, "loss": 0.07606152892112732, "mean_token_accuracy": 0.973467419296503, "num_tokens": 1083781.0, "step": 170 }, { "entropy": 0.09170240506064146, "epoch": 0.3600900225056264, "grad_norm": 1.0180600881576538, "learning_rate": 0.0001432, "loss": 0.10022411346435547, "mean_token_accuracy": 0.9705780848860741, "num_tokens": 1145466.0, "step": 180 }, { "entropy": 0.11426927694119512, "epoch": 0.380095023755939, "grad_norm": 1.129612684249878, "learning_rate": 0.00015120000000000002, "loss": 0.10711104869842529, "mean_token_accuracy": 0.9698869682848453, "num_tokens": 1208095.0, "step": 190 }, { "entropy": 0.09287996906787158, "epoch": 0.4001000250062516, "grad_norm": 0.6177782416343689, "learning_rate": 0.00015920000000000002, "loss": 0.08630093932151794, "mean_token_accuracy": 0.977255067974329, "num_tokens": 1273403.0, "step": 200 }, { "entropy": 0.0744264661334455, "epoch": 0.42010502625656415, "grad_norm": 0.766137957572937, "learning_rate": 0.0001672, "loss": 0.07393635511398315, "mean_token_accuracy": 0.9792576834559441, "num_tokens": 1334848.0, "step": 210 }, { "entropy": 0.10690853425767273, "epoch": 0.4401100275068767, "grad_norm": 0.6585826277732849, "learning_rate": 0.0001752, "loss": 0.09994233846664428, "mean_token_accuracy": 0.972873219102621, "num_tokens": 1400976.0, "step": 220 }, { "entropy": 0.06925062141381204, "epoch": 0.4601150287571893, "grad_norm": 0.7318869233131409, "learning_rate": 0.0001832, "loss": 0.06631548404693603, "mean_token_accuracy": 0.9832681395113468, "num_tokens": 1462530.0, "step": 230 }, { "entropy": 0.08352572850417346, "epoch": 0.48012003000750186, "grad_norm": 0.46499672532081604, "learning_rate": 0.0001912, "loss": 0.09161096215248107, "mean_token_accuracy": 0.9757984310388566, "num_tokens": 1523663.0, "step": 240 }, { "entropy": 0.06921031260862946, "epoch": 0.5001250312578145, "grad_norm": 0.6253766417503357, "learning_rate": 0.00019920000000000002, "loss": 0.05958831310272217, "mean_token_accuracy": 0.982395163923502, "num_tokens": 1588657.0, "step": 250 }, { "entropy": 0.06543620774755254, "epoch": 0.5201300325081271, "grad_norm": 0.6349820494651794, "learning_rate": 0.00019999822839757118, "loss": 0.06900651454925537, "mean_token_accuracy": 0.9801992796361446, "num_tokens": 1653260.0, "step": 260 }, { "entropy": 0.06953847317490727, "epoch": 0.5401350337584396, "grad_norm": 0.6046717166900635, "learning_rate": 0.00019999210442038162, "loss": 0.06709518432617187, "mean_token_accuracy": 0.9797540627419948, "num_tokens": 1718687.0, "step": 270 }, { "entropy": 0.08993639135733247, "epoch": 0.5601400350087522, "grad_norm": 0.7929577231407166, "learning_rate": 0.00019998160646461522, "loss": 0.09603813290596008, "mean_token_accuracy": 0.9745012931525707, "num_tokens": 1779338.0, "step": 280 }, { "entropy": 0.06307904429268092, "epoch": 0.5801450362590648, "grad_norm": 0.3916383683681488, "learning_rate": 0.00019996673498948658, "loss": 0.06412749290466309, "mean_token_accuracy": 0.9828441753983498, "num_tokens": 1842872.0, "step": 290 }, { "entropy": 0.05729433842934668, "epoch": 0.6001500375093773, "grad_norm": 0.38883084058761597, "learning_rate": 0.00019994749064552214, "loss": 0.051730161905288695, "mean_token_accuracy": 0.9857619300484657, "num_tokens": 1904154.0, "step": 300 }, { "entropy": 0.03964498438872397, "epoch": 0.6201550387596899, "grad_norm": 0.6382091045379639, "learning_rate": 0.0001999238742745319, "loss": 0.042625024914741516, "mean_token_accuracy": 0.9874393172562123, "num_tokens": 1966060.0, "step": 310 }, { "entropy": 0.05733265266753733, "epoch": 0.6401600400100025, "grad_norm": 0.6905948519706726, "learning_rate": 0.00019989588690957249, "loss": 0.06732727885246277, "mean_token_accuracy": 0.982555440813303, "num_tokens": 2031939.0, "step": 320 }, { "entropy": 0.07143733124248683, "epoch": 0.660165041260315, "grad_norm": 0.4337286949157715, "learning_rate": 0.0001998635297749018, "loss": 0.058036553859710696, "mean_token_accuracy": 0.9844090364873409, "num_tokens": 2095271.0, "step": 330 }, { "entropy": 0.04944599290611222, "epoch": 0.6801700425106276, "grad_norm": 0.3526521921157837, "learning_rate": 0.00019982680428592584, "loss": 0.053340816497802736, "mean_token_accuracy": 0.9839612312614918, "num_tokens": 2158321.0, "step": 340 }, { "entropy": 0.06322509178426117, "epoch": 0.7001750437609402, "grad_norm": 0.5422689318656921, "learning_rate": 0.00019978571204913638, "loss": 0.051858377456665036, "mean_token_accuracy": 0.9867838315665722, "num_tokens": 2225062.0, "step": 350 }, { "entropy": 0.046866965352091935, "epoch": 0.7201800450112528, "grad_norm": 0.7101793885231018, "learning_rate": 0.000199740254862041, "loss": 0.05608519911766052, "mean_token_accuracy": 0.9851541951298713, "num_tokens": 2291157.0, "step": 360 }, { "entropy": 0.06618997184559702, "epoch": 0.7401850462615653, "grad_norm": 0.6186705827713013, "learning_rate": 0.00019969043471308436, "loss": 0.056741136312484744, "mean_token_accuracy": 0.9844918318092823, "num_tokens": 2353621.0, "step": 370 }, { "entropy": 0.052203354140510784, "epoch": 0.760190047511878, "grad_norm": 0.9665183424949646, "learning_rate": 0.00019963625378156114, "loss": 0.05278732180595398, "mean_token_accuracy": 0.9863728702068328, "num_tokens": 2415518.0, "step": 380 }, { "entropy": 0.04799637275282294, "epoch": 0.7801950487621906, "grad_norm": 0.45738333463668823, "learning_rate": 0.00019957771443752083, "loss": 0.044900187849998476, "mean_token_accuracy": 0.9872696734964848, "num_tokens": 2477716.0, "step": 390 }, { "entropy": 0.045062902639620005, "epoch": 0.8002000500125032, "grad_norm": 0.4040285646915436, "learning_rate": 0.00019951481924166396, "loss": 0.043438228964805606, "mean_token_accuracy": 0.9878960207104683, "num_tokens": 2540807.0, "step": 400 }, { "entropy": 0.036265855759847906, "epoch": 0.8202050512628157, "grad_norm": 0.4411618411540985, "learning_rate": 0.0001994475709452301, "loss": 0.04615793526172638, "mean_token_accuracy": 0.9870041370391845, "num_tokens": 2603019.0, "step": 410 }, { "entropy": 0.05851077587576583, "epoch": 0.8402100525131283, "grad_norm": 0.31862467527389526, "learning_rate": 0.0001993759724898777, "loss": 0.045778676867485046, "mean_token_accuracy": 0.9873291261494159, "num_tokens": 2667216.0, "step": 420 }, { "entropy": 0.03860169492545538, "epoch": 0.8602150537634409, "grad_norm": 0.29344919323921204, "learning_rate": 0.00019930002700755507, "loss": 0.03828286230564117, "mean_token_accuracy": 0.988411296159029, "num_tokens": 2729805.0, "step": 430 }, { "entropy": 0.03951184251927771, "epoch": 0.8802200550137534, "grad_norm": 0.4283672571182251, "learning_rate": 0.00019921973782036366, "loss": 0.038545310497283936, "mean_token_accuracy": 0.9878928653895855, "num_tokens": 2793292.0, "step": 440 }, { "entropy": 0.028071055363398045, "epoch": 0.900225056264066, "grad_norm": 0.7173567414283752, "learning_rate": 0.0001991351084404126, "loss": 0.03233465254306793, "mean_token_accuracy": 0.9912850938737392, "num_tokens": 2855909.0, "step": 450 }, { "entropy": 0.04781279567687306, "epoch": 0.9202300575143786, "grad_norm": 0.3380762040615082, "learning_rate": 0.00019904614256966512, "loss": 0.040875044465065, "mean_token_accuracy": 0.9889427930116653, "num_tokens": 2916597.0, "step": 460 }, { "entropy": 0.045654052757890896, "epoch": 0.9402350587646912, "grad_norm": 0.21747978031635284, "learning_rate": 0.0001989528440997767, "loss": 0.04227911233901978, "mean_token_accuracy": 0.987830163538456, "num_tokens": 2977012.0, "step": 470 }, { "entropy": 0.039897680119611326, "epoch": 0.9602400600150037, "grad_norm": 0.3250534236431122, "learning_rate": 0.00019885521711192453, "loss": 0.03866271674633026, "mean_token_accuracy": 0.9888145305216313, "num_tokens": 3039866.0, "step": 480 }, { "entropy": 0.0344677664746996, "epoch": 0.9802450612653163, "grad_norm": 0.5867555141448975, "learning_rate": 0.00019875326587662941, "loss": 0.030780380964279173, "mean_token_accuracy": 0.9910528786480427, "num_tokens": 3102450.0, "step": 490 }, { "entropy": 0.03601513006665473, "epoch": 1.0, "grad_norm": 0.19166764616966248, "learning_rate": 0.00019864699485356866, "loss": 0.04189955592155457, "mean_token_accuracy": 0.989976388744161, "num_tokens": 3162838.0, "step": 500 }, { "epoch": 1.0, "eval_entropy": 0.051686967685315256, "eval_loss": 0.04872545599937439, "eval_mean_token_accuracy": 0.9849747346865164, "eval_num_tokens": 3162838.0, "eval_runtime": 69.4136, "eval_samples_per_second": 14.911, "eval_steps_per_second": 7.463, "step": 500 }, { "entropy": 0.04407569046597928, "epoch": 1.0200050012503126, "grad_norm": 0.2645007371902466, "learning_rate": 0.00019853640869138103, "loss": 0.03468368649482727, "mean_token_accuracy": 0.990016209334135, "num_tokens": 3228763.0, "step": 510 }, { "entropy": 0.035535094334045426, "epoch": 1.0400100025006251, "grad_norm": 0.40270644426345825, "learning_rate": 0.00019842151222746357, "loss": 0.03389493525028229, "mean_token_accuracy": 0.9887583516538143, "num_tokens": 3293010.0, "step": 520 }, { "entropy": 0.028601143200648948, "epoch": 1.0600150037509377, "grad_norm": 0.2681713104248047, "learning_rate": 0.00019830231048775977, "loss": 0.030898410081863403, "mean_token_accuracy": 0.9903686709702015, "num_tokens": 3354919.0, "step": 530 }, { "entropy": 0.034907517378451304, "epoch": 1.0800200050012503, "grad_norm": 0.23451267182826996, "learning_rate": 0.00019817880868653993, "loss": 0.03407395482063293, "mean_token_accuracy": 0.9890573389828206, "num_tokens": 3415784.0, "step": 540 }, { "entropy": 0.033313815778819846, "epoch": 1.1000250062515629, "grad_norm": 0.23950988054275513, "learning_rate": 0.0001980510122261729, "loss": 0.029421544075012206, "mean_token_accuracy": 0.9916689246892929, "num_tokens": 3480364.0, "step": 550 }, { "entropy": 0.02486751726246439, "epoch": 1.1200300075018754, "grad_norm": 0.4551165997982025, "learning_rate": 0.00019791892669688988, "loss": 0.020369285345077516, "mean_token_accuracy": 0.9940513521432877, "num_tokens": 3542678.0, "step": 560 }, { "entropy": 0.029150180192664264, "epoch": 1.140035008752188, "grad_norm": 0.20443572103977203, "learning_rate": 0.00019778255787653978, "loss": 0.02770337164402008, "mean_token_accuracy": 0.9897698886692524, "num_tokens": 3609086.0, "step": 570 }, { "entropy": 0.031121585314394906, "epoch": 1.1600400100025006, "grad_norm": 0.3653818368911743, "learning_rate": 0.00019764191173033663, "loss": 0.025546741485595704, "mean_token_accuracy": 0.9925875566899777, "num_tokens": 3670310.0, "step": 580 }, { "entropy": 0.02902457951568067, "epoch": 1.1800450112528131, "grad_norm": 0.4811317026615143, "learning_rate": 0.00019749699441059843, "loss": 0.027299800515174867, "mean_token_accuracy": 0.9906462356448174, "num_tokens": 3735307.0, "step": 590 }, { "entropy": 0.030135014103143475, "epoch": 1.2000500125031257, "grad_norm": 0.21709105372428894, "learning_rate": 0.00019734781225647828, "loss": 0.02665548324584961, "mean_token_accuracy": 0.9932463668286801, "num_tokens": 3797213.0, "step": 600 }, { "entropy": 0.03371675145754125, "epoch": 1.2200550137534383, "grad_norm": 0.631148636341095, "learning_rate": 0.00019719437179368688, "loss": 0.03535972833633423, "mean_token_accuracy": 0.9895499177277088, "num_tokens": 3859400.0, "step": 610 }, { "entropy": 0.028748418507166206, "epoch": 1.2400600150037508, "grad_norm": 0.42123743891716003, "learning_rate": 0.00019703667973420706, "loss": 0.027658408880233763, "mean_token_accuracy": 0.9910015679895878, "num_tokens": 3920848.0, "step": 620 }, { "entropy": 0.029886699473718182, "epoch": 1.2600650162540634, "grad_norm": 0.23473748564720154, "learning_rate": 0.00019687474297600045, "loss": 0.028230640292167663, "mean_token_accuracy": 0.9922301307320595, "num_tokens": 3984529.0, "step": 630 }, { "entropy": 0.03151440276997164, "epoch": 1.280070017504376, "grad_norm": 0.2611916661262512, "learning_rate": 0.00019670856860270542, "loss": 0.027012214064598083, "mean_token_accuracy": 0.9917375601828098, "num_tokens": 4048411.0, "step": 640 }, { "entropy": 0.027149295064737088, "epoch": 1.3000750187546886, "grad_norm": 0.12378375232219696, "learning_rate": 0.0001965381638833274, "loss": 0.023584455251693726, "mean_token_accuracy": 0.9936468034982682, "num_tokens": 4112116.0, "step": 650 }, { "entropy": 0.028390987019520253, "epoch": 1.3200800200050011, "grad_norm": 0.18841037154197693, "learning_rate": 0.00019636353627192082, "loss": 0.025832393765449525, "mean_token_accuracy": 0.9933209784328938, "num_tokens": 4175458.0, "step": 660 }, { "entropy": 0.032682666774780954, "epoch": 1.3400850212553137, "grad_norm": 0.292369544506073, "learning_rate": 0.00019618469340726319, "loss": 0.032191649079322815, "mean_token_accuracy": 0.9895716637372971, "num_tokens": 4236466.0, "step": 670 }, { "entropy": 0.032574003856279884, "epoch": 1.3600900225056263, "grad_norm": 0.2205415517091751, "learning_rate": 0.00019600164311252068, "loss": 0.02866535782814026, "mean_token_accuracy": 0.991417796164751, "num_tokens": 4299775.0, "step": 680 }, { "entropy": 0.04169052811048459, "epoch": 1.380095023755939, "grad_norm": 0.3276292681694031, "learning_rate": 0.00019581439339490624, "loss": 0.03524776101112366, "mean_token_accuracy": 0.9886757604777813, "num_tokens": 4365609.0, "step": 690 }, { "entropy": 0.03188371795695275, "epoch": 1.4001000250062516, "grad_norm": 0.4103780686855316, "learning_rate": 0.0001956229524453291, "loss": 0.035996857285499576, "mean_token_accuracy": 0.9892666183412075, "num_tokens": 4432330.0, "step": 700 }, { "entropy": 0.02871296225930564, "epoch": 1.4201050262565642, "grad_norm": 0.24775762856006622, "learning_rate": 0.00019542732863803662, "loss": 0.02328706532716751, "mean_token_accuracy": 0.9937438026070595, "num_tokens": 4496465.0, "step": 710 }, { "entropy": 0.03388670613931026, "epoch": 1.4401100275068768, "grad_norm": 0.25881657004356384, "learning_rate": 0.00019522753053024787, "loss": 0.03300818204879761, "mean_token_accuracy": 0.9890970505774022, "num_tokens": 4560755.0, "step": 720 }, { "entropy": 0.03670836841047276, "epoch": 1.4601150287571893, "grad_norm": 0.23787066340446472, "learning_rate": 0.00019502356686177926, "loss": 0.03214167952537537, "mean_token_accuracy": 0.9903383336961269, "num_tokens": 4625202.0, "step": 730 }, { "entropy": 0.03299383492558263, "epoch": 1.480120030007502, "grad_norm": 0.31929901242256165, "learning_rate": 0.00019481544655466245, "loss": 0.031187814474105836, "mean_token_accuracy": 0.9905215993523597, "num_tokens": 4692174.0, "step": 740 }, { "entropy": 0.023855643330898603, "epoch": 1.5001250312578145, "grad_norm": 0.24006661772727966, "learning_rate": 0.00019460317871275394, "loss": 0.025655516982078554, "mean_token_accuracy": 0.9913376875221729, "num_tokens": 4753192.0, "step": 750 }, { "entropy": 0.033190094074234365, "epoch": 1.520130032508127, "grad_norm": 0.2834339737892151, "learning_rate": 0.00019438677262133668, "loss": 0.03126271665096283, "mean_token_accuracy": 0.9907064586877823, "num_tokens": 4817884.0, "step": 760 }, { "entropy": 0.03176074127841275, "epoch": 1.5401350337584396, "grad_norm": 0.4165857136249542, "learning_rate": 0.00019416623774671425, "loss": 0.033395078778266904, "mean_token_accuracy": 0.9902952447533607, "num_tokens": 4879601.0, "step": 770 }, { "entropy": 0.03441936054150574, "epoch": 1.5601400350087522, "grad_norm": 0.5297831296920776, "learning_rate": 0.00019394158373579645, "loss": 0.02917470932006836, "mean_token_accuracy": 0.9917018190026283, "num_tokens": 4946026.0, "step": 780 }, { "entropy": 0.029212182367336935, "epoch": 1.5801450362590648, "grad_norm": 0.3761133849620819, "learning_rate": 0.00019371282041567752, "loss": 0.02672044336795807, "mean_token_accuracy": 0.9930847369134426, "num_tokens": 5009097.0, "step": 790 }, { "entropy": 0.03556556548574008, "epoch": 1.6001500375093773, "grad_norm": 0.2545328438282013, "learning_rate": 0.0001934799577932062, "loss": 0.0338908702135086, "mean_token_accuracy": 0.990411739051342, "num_tokens": 5076314.0, "step": 800 }, { "entropy": 0.02515874128730502, "epoch": 1.62015503875969, "grad_norm": 0.3428667187690735, "learning_rate": 0.0001932430060545479, "loss": 0.022386419773101806, "mean_token_accuracy": 0.9932228110730648, "num_tokens": 5135522.0, "step": 810 }, { "entropy": 0.021622967024450192, "epoch": 1.6401600400100025, "grad_norm": 0.19730041921138763, "learning_rate": 0.00019300197556473936, "loss": 0.02211230844259262, "mean_token_accuracy": 0.993052315711975, "num_tokens": 5198651.0, "step": 820 }, { "entropy": 0.022755468662944624, "epoch": 1.660165041260315, "grad_norm": 0.24043497443199158, "learning_rate": 0.00019275687686723497, "loss": 0.021593029797077178, "mean_token_accuracy": 0.9927247293293476, "num_tokens": 5258441.0, "step": 830 }, { "entropy": 0.02988760783628095, "epoch": 1.6801700425106276, "grad_norm": 0.22126108407974243, "learning_rate": 0.0001925077206834458, "loss": 0.02743455469608307, "mean_token_accuracy": 0.9924947433173656, "num_tokens": 5323635.0, "step": 840 }, { "entropy": 0.022633779112948105, "epoch": 1.7001750437609402, "grad_norm": 0.2528051435947418, "learning_rate": 0.00019225451791227052, "loss": 0.01915370374917984, "mean_token_accuracy": 0.9935295671224594, "num_tokens": 5388098.0, "step": 850 }, { "entropy": 0.024347139010205864, "epoch": 1.7201800450112528, "grad_norm": 0.35426992177963257, "learning_rate": 0.00019199727962961852, "loss": 0.025216898322105406, "mean_token_accuracy": 0.9927972495555878, "num_tokens": 5450303.0, "step": 860 }, { "entropy": 0.02343553317186888, "epoch": 1.7401850462615653, "grad_norm": 0.2603664994239807, "learning_rate": 0.00019173601708792566, "loss": 0.022424712777137756, "mean_token_accuracy": 0.9926920354366302, "num_tokens": 5513723.0, "step": 870 }, { "entropy": 0.03952418522676453, "epoch": 1.7601900475118781, "grad_norm": 0.21528302133083344, "learning_rate": 0.0001914707417156619, "loss": 0.03777352273464203, "mean_token_accuracy": 0.9895162962377071, "num_tokens": 5575942.0, "step": 880 }, { "entropy": 0.037056630512233825, "epoch": 1.7801950487621907, "grad_norm": 0.39761167764663696, "learning_rate": 0.00019120146511683142, "loss": 0.02916957139968872, "mean_token_accuracy": 0.9906649015843868, "num_tokens": 5640243.0, "step": 890 }, { "entropy": 0.022086267481790857, "epoch": 1.8002000500125033, "grad_norm": 0.43694376945495605, "learning_rate": 0.00019092819907046493, "loss": 0.023631574213504793, "mean_token_accuracy": 0.9936031945049763, "num_tokens": 5702162.0, "step": 900 }, { "entropy": 0.028572715594782493, "epoch": 1.8202050512628158, "grad_norm": 0.4214474558830261, "learning_rate": 0.00019065095553010458, "loss": 0.025940075516700745, "mean_token_accuracy": 0.9905624501407146, "num_tokens": 5764127.0, "step": 910 }, { "entropy": 0.028239472245331854, "epoch": 1.8402100525131284, "grad_norm": 0.40316465497016907, "learning_rate": 0.00019036974662328096, "loss": 0.027613845467567445, "mean_token_accuracy": 0.991669587045908, "num_tokens": 5827235.0, "step": 920 }, { "entropy": 0.028241146955406294, "epoch": 1.860215053763441, "grad_norm": 0.524972677230835, "learning_rate": 0.0001900845846509827, "loss": 0.03177001476287842, "mean_token_accuracy": 0.9903169378638268, "num_tokens": 5890040.0, "step": 930 }, { "entropy": 0.03260187199921347, "epoch": 1.8802200550137536, "grad_norm": 0.43904051184654236, "learning_rate": 0.00018979548208711817, "loss": 0.02139996737241745, "mean_token_accuracy": 0.9935068063437938, "num_tokens": 5953149.0, "step": 940 }, { "entropy": 0.025593279630993494, "epoch": 1.9002250562640661, "grad_norm": 0.25154390931129456, "learning_rate": 0.00018950245157797014, "loss": 0.02489333599805832, "mean_token_accuracy": 0.9933448024094105, "num_tokens": 6014655.0, "step": 950 }, { "entropy": 0.025231685642211232, "epoch": 1.9202300575143787, "grad_norm": 0.2318635731935501, "learning_rate": 0.00018920550594164238, "loss": 0.02543329894542694, "mean_token_accuracy": 0.9929649449884892, "num_tokens": 6078667.0, "step": 960 }, { "entropy": 0.0415392193797743, "epoch": 1.9402350587646913, "grad_norm": 0.2020518183708191, "learning_rate": 0.00018890465816749896, "loss": 0.03582499623298645, "mean_token_accuracy": 0.9897747471928596, "num_tokens": 6139688.0, "step": 970 }, { "entropy": 0.026439224516798275, "epoch": 1.9602400600150038, "grad_norm": 0.25302180647850037, "learning_rate": 0.00018859992141559615, "loss": 0.023522551357746124, "mean_token_accuracy": 0.9931276544928551, "num_tokens": 6203193.0, "step": 980 }, { "entropy": 0.02257391346647637, "epoch": 1.9802450612653164, "grad_norm": 0.37129050493240356, "learning_rate": 0.00018829130901610667, "loss": 0.023089873790740966, "mean_token_accuracy": 0.9930807471275329, "num_tokens": 6265353.0, "step": 990 }, { "entropy": 0.024826381788765894, "epoch": 2.0, "grad_norm": 0.1416839361190796, "learning_rate": 0.00018797883446873662, "loss": 0.020879687368869783, "mean_token_accuracy": 0.9931328839893583, "num_tokens": 6325676.0, "step": 1000 }, { "epoch": 2.0, "eval_entropy": 0.028477752043098808, "eval_loss": 0.042340315878391266, "eval_mean_token_accuracy": 0.988268693211456, "eval_num_tokens": 6325676.0, "eval_runtime": 69.2562, "eval_samples_per_second": 14.945, "eval_steps_per_second": 7.479, "step": 1000 }, { "entropy": 0.021088267347658986, "epoch": 2.0200050012503126, "grad_norm": 0.33506715297698975, "learning_rate": 0.00018766251144213504, "loss": 0.0183292493224144, "mean_token_accuracy": 0.9939773567020893, "num_tokens": 6391016.0, "step": 1010 }, { "entropy": 0.021377279089938382, "epoch": 2.040010002500625, "grad_norm": 0.10510263592004776, "learning_rate": 0.00018734235377329582, "loss": 0.016541089117527007, "mean_token_accuracy": 0.9943198271095752, "num_tokens": 6455040.0, "step": 1020 }, { "entropy": 0.01835900279111229, "epoch": 2.0600150037509377, "grad_norm": 0.25538530945777893, "learning_rate": 0.0001870183754669526, "loss": 0.017676208913326264, "mean_token_accuracy": 0.9943479098379612, "num_tokens": 6517983.0, "step": 1030 }, { "entropy": 0.024707998137455434, "epoch": 2.0800200050012503, "grad_norm": 0.1953907310962677, "learning_rate": 0.00018669059069496594, "loss": 0.018231543898582458, "mean_token_accuracy": 0.9940299488604069, "num_tokens": 6582155.0, "step": 1040 }, { "entropy": 0.016339628079731484, "epoch": 2.100025006251563, "grad_norm": 0.23519866168498993, "learning_rate": 0.00018635901379570377, "loss": 0.015705856680870055, "mean_token_accuracy": 0.9944866336882114, "num_tokens": 6644403.0, "step": 1050 }, { "entropy": 0.021186151236179285, "epoch": 2.1200300075018754, "grad_norm": 0.7782704830169678, "learning_rate": 0.00018602365927341375, "loss": 0.0239964097738266, "mean_token_accuracy": 0.9942199148237705, "num_tokens": 6709057.0, "step": 1060 }, { "entropy": 0.02400836138986051, "epoch": 2.140035008752188, "grad_norm": 0.25117242336273193, "learning_rate": 0.0001856845417975891, "loss": 0.0214329332113266, "mean_token_accuracy": 0.99395372569561, "num_tokens": 6772040.0, "step": 1070 }, { "entropy": 0.01854798578133341, "epoch": 2.1600400100025006, "grad_norm": 0.24927817285060883, "learning_rate": 0.0001853416762023268, "loss": 0.01707075983285904, "mean_token_accuracy": 0.9950113117694854, "num_tokens": 6835866.0, "step": 1080 }, { "entropy": 0.019260429358109833, "epoch": 2.180045011252813, "grad_norm": 0.24353672564029694, "learning_rate": 0.00018499507748567873, "loss": 0.014785376191139222, "mean_token_accuracy": 0.9959283553063869, "num_tokens": 6899725.0, "step": 1090 }, { "entropy": 0.02487965851032641, "epoch": 2.2000500125031257, "grad_norm": 0.288215309381485, "learning_rate": 0.00018464476080899559, "loss": 0.019350311160087584, "mean_token_accuracy": 0.9941258184611798, "num_tokens": 6963141.0, "step": 1100 }, { "entropy": 0.01580278711626306, "epoch": 2.2200550137534383, "grad_norm": 0.0646059513092041, "learning_rate": 0.00018429074149626363, "loss": 0.017427970468997956, "mean_token_accuracy": 0.9952689491212368, "num_tokens": 7028325.0, "step": 1110 }, { "entropy": 0.020199327028240077, "epoch": 2.240060015003751, "grad_norm": 0.160948246717453, "learning_rate": 0.0001839330350334345, "loss": 0.01726052612066269, "mean_token_accuracy": 0.9933249458670617, "num_tokens": 7092920.0, "step": 1120 }, { "entropy": 0.021389624777657445, "epoch": 2.2600650162540634, "grad_norm": 0.2359917163848877, "learning_rate": 0.00018357165706774767, "loss": 0.01608244627714157, "mean_token_accuracy": 0.9940837919712067, "num_tokens": 7160997.0, "step": 1130 }, { "entropy": 0.02022790874907514, "epoch": 2.280070017504376, "grad_norm": 0.07118914276361465, "learning_rate": 0.00018320662340704609, "loss": 0.020376379787921905, "mean_token_accuracy": 0.9942706093192101, "num_tokens": 7226007.0, "step": 1140 }, { "entropy": 0.01867675751855131, "epoch": 2.3000750187546886, "grad_norm": 0.25310513377189636, "learning_rate": 0.00018283795001908457, "loss": 0.01612715721130371, "mean_token_accuracy": 0.9942055746912957, "num_tokens": 7287986.0, "step": 1150 }, { "entropy": 0.015577676898101345, "epoch": 2.320080020005001, "grad_norm": 0.2142266184091568, "learning_rate": 0.0001824656530308315, "loss": 0.016605789959430694, "mean_token_accuracy": 0.9948085315525532, "num_tokens": 7349421.0, "step": 1160 }, { "entropy": 0.020357475349737798, "epoch": 2.3400850212553137, "grad_norm": 0.07947535812854767, "learning_rate": 0.00018208974872776322, "loss": 0.018196111917495726, "mean_token_accuracy": 0.993843074887991, "num_tokens": 7411941.0, "step": 1170 }, { "entropy": 0.017023067966511006, "epoch": 2.3600900225056263, "grad_norm": 0.19202570617198944, "learning_rate": 0.00018171025355315164, "loss": 0.016091108322143555, "mean_token_accuracy": 0.9953217662870883, "num_tokens": 7474356.0, "step": 1180 }, { "entropy": 0.01825423450791277, "epoch": 2.380095023755939, "grad_norm": 0.24460658431053162, "learning_rate": 0.00018132718410734515, "loss": 0.015425822138786316, "mean_token_accuracy": 0.9943965286016464, "num_tokens": 7536565.0, "step": 1190 }, { "entropy": 0.015542891589575447, "epoch": 2.4001000250062514, "grad_norm": 0.24659694731235504, "learning_rate": 0.00018094055714704225, "loss": 0.013514925539493561, "mean_token_accuracy": 0.9943179704248906, "num_tokens": 7599751.0, "step": 1200 }, { "entropy": 0.015307287167524919, "epoch": 2.420105026256564, "grad_norm": 0.2550601065158844, "learning_rate": 0.0001805503895845587, "loss": 0.012726837396621704, "mean_token_accuracy": 0.9962130591273308, "num_tokens": 7661520.0, "step": 1210 }, { "entropy": 0.01749844834121177, "epoch": 2.4401100275068766, "grad_norm": 0.15603283047676086, "learning_rate": 0.00018015669848708767, "loss": 0.012257835268974305, "mean_token_accuracy": 0.9954387851059436, "num_tokens": 7726291.0, "step": 1220 }, { "entropy": 0.019737370508664753, "epoch": 2.460115028757189, "grad_norm": 0.22746174037456512, "learning_rate": 0.0001797595010759531, "loss": 0.018561355769634247, "mean_token_accuracy": 0.9940820440649987, "num_tokens": 7788766.0, "step": 1230 }, { "entropy": 0.015929855390277227, "epoch": 2.4801200300075017, "grad_norm": 0.3152976334095001, "learning_rate": 0.0001793588147258565, "loss": 0.013849316537380219, "mean_token_accuracy": 0.9952766291797162, "num_tokens": 7851396.0, "step": 1240 }, { "entropy": 0.02108022033935413, "epoch": 2.5001250312578147, "grad_norm": 0.2762889862060547, "learning_rate": 0.00017895465696411692, "loss": 0.019299986958503722, "mean_token_accuracy": 0.9940553769469261, "num_tokens": 7915421.0, "step": 1250 }, { "entropy": 0.020866505106096157, "epoch": 2.520130032508127, "grad_norm": 0.24086585640907288, "learning_rate": 0.00017854704546990408, "loss": 0.020875005424022673, "mean_token_accuracy": 0.9940896175801754, "num_tokens": 7977133.0, "step": 1260 }, { "entropy": 0.020857046739547514, "epoch": 2.54013503375844, "grad_norm": 0.23781460523605347, "learning_rate": 0.0001781359980734653, "loss": 0.018643879890441896, "mean_token_accuracy": 0.9929048053920269, "num_tokens": 8040191.0, "step": 1270 }, { "entropy": 0.021198420476866885, "epoch": 2.560140035008752, "grad_norm": 0.2054099142551422, "learning_rate": 0.0001777215327553452, "loss": 0.017947974801063537, "mean_token_accuracy": 0.9934561550617218, "num_tokens": 8100152.0, "step": 1280 }, { "entropy": 0.018285114454920405, "epoch": 2.580145036259065, "grad_norm": 0.469458669424057, "learning_rate": 0.00017730366764559955, "loss": 0.0151192307472229, "mean_token_accuracy": 0.9951836079359054, "num_tokens": 8162591.0, "step": 1290 }, { "entropy": 0.018374070005665998, "epoch": 2.600150037509377, "grad_norm": 0.2882782518863678, "learning_rate": 0.00017688242102300192, "loss": 0.0184975802898407, "mean_token_accuracy": 0.9948060251772404, "num_tokens": 8225224.0, "step": 1300 }, { "entropy": 0.022974171601526906, "epoch": 2.62015503875969, "grad_norm": 0.21924524009227753, "learning_rate": 0.00017645781131424423, "loss": 0.023296315968036652, "mean_token_accuracy": 0.9924322210252285, "num_tokens": 8290274.0, "step": 1310 }, { "entropy": 0.02169415617827326, "epoch": 2.6401600400100023, "grad_norm": 0.354758620262146, "learning_rate": 0.00017602985709313073, "loss": 0.017917373776435853, "mean_token_accuracy": 0.9948078036308289, "num_tokens": 8354370.0, "step": 1320 }, { "entropy": 0.016268294051405972, "epoch": 2.6601650412603153, "grad_norm": 0.4151551127433777, "learning_rate": 0.00017559857707976536, "loss": 0.012286465615034103, "mean_token_accuracy": 0.9961770802736283, "num_tokens": 8415022.0, "step": 1330 }, { "entropy": 0.0170176492218161, "epoch": 2.6801700425106274, "grad_norm": 0.4065402150154114, "learning_rate": 0.0001751639901397331, "loss": 0.01499750316143036, "mean_token_accuracy": 0.9952280893921852, "num_tokens": 8478286.0, "step": 1340 }, { "entropy": 0.018367627350380646, "epoch": 2.7001750437609404, "grad_norm": 0.1335880309343338, "learning_rate": 0.0001747261152832746, "loss": 0.015018537640571594, "mean_token_accuracy": 0.9949840374290944, "num_tokens": 8541154.0, "step": 1350 }, { "entropy": 0.019403737914399245, "epoch": 2.7201800450112525, "grad_norm": 0.20553363859653473, "learning_rate": 0.00017428497166445452, "loss": 0.019237272441387177, "mean_token_accuracy": 0.9930156201124192, "num_tokens": 8605361.0, "step": 1360 }, { "entropy": 0.02298831292137038, "epoch": 2.7401850462615656, "grad_norm": 0.31576329469680786, "learning_rate": 0.00017384057858032393, "loss": 0.019147740304470064, "mean_token_accuracy": 0.9930574476718903, "num_tokens": 8669155.0, "step": 1370 }, { "entropy": 0.01718737747578416, "epoch": 2.760190047511878, "grad_norm": 0.21389739215373993, "learning_rate": 0.00017339295547007594, "loss": 0.017152118682861327, "mean_token_accuracy": 0.995334691554308, "num_tokens": 8735019.0, "step": 1380 }, { "entropy": 0.019683032816101332, "epoch": 2.7801950487621907, "grad_norm": 0.26539650559425354, "learning_rate": 0.00017294212191419547, "loss": 0.019429606199264527, "mean_token_accuracy": 0.9936951123178005, "num_tokens": 8800972.0, "step": 1390 }, { "entropy": 0.018636453218641692, "epoch": 2.8002000500125033, "grad_norm": 0.2084941565990448, "learning_rate": 0.00017248809763360277, "loss": 0.01909356415271759, "mean_token_accuracy": 0.9940625011920929, "num_tokens": 8867596.0, "step": 1400 }, { "entropy": 0.023316194582730532, "epoch": 2.820205051262816, "grad_norm": 0.21403200924396515, "learning_rate": 0.0001720309024887907, "loss": 0.018046848475933075, "mean_token_accuracy": 0.9939217306673527, "num_tokens": 8927516.0, "step": 1410 }, { "entropy": 0.01655098560877377, "epoch": 2.8402100525131284, "grad_norm": 0.33148443698883057, "learning_rate": 0.000171570556478956, "loss": 0.018755699694156646, "mean_token_accuracy": 0.9942230053246022, "num_tokens": 8989089.0, "step": 1420 }, { "entropy": 0.02549898542056326, "epoch": 2.860215053763441, "grad_norm": 0.18521511554718018, "learning_rate": 0.00017110707974112447, "loss": 0.024141687154769897, "mean_token_accuracy": 0.9930150359869003, "num_tokens": 9054435.0, "step": 1430 }, { "entropy": 0.01900827525241766, "epoch": 2.8802200550137536, "grad_norm": 0.23067928850650787, "learning_rate": 0.0001706404925492701, "loss": 0.020157690346240997, "mean_token_accuracy": 0.9943146407604218, "num_tokens": 9114274.0, "step": 1440 }, { "entropy": 0.01623811650206335, "epoch": 2.900225056264066, "grad_norm": 0.5235961079597473, "learning_rate": 0.00017017081531342813, "loss": 0.014147150516510009, "mean_token_accuracy": 0.9944271765649318, "num_tokens": 9174841.0, "step": 1450 }, { "entropy": 0.023971330239146483, "epoch": 2.9202300575143787, "grad_norm": 0.11377973109483719, "learning_rate": 0.00016969806857880241, "loss": 0.022856634855270386, "mean_token_accuracy": 0.9932261377573013, "num_tokens": 9239456.0, "step": 1460 }, { "entropy": 0.02552748184389202, "epoch": 2.9402350587646913, "grad_norm": 0.12835904955863953, "learning_rate": 0.00016922227302486667, "loss": 0.02486345320940018, "mean_token_accuracy": 0.9918816141784191, "num_tokens": 9305144.0, "step": 1470 }, { "entropy": 0.019867337332107125, "epoch": 2.960240060015004, "grad_norm": 0.18033206462860107, "learning_rate": 0.00016874344946445974, "loss": 0.018220885097980498, "mean_token_accuracy": 0.9945706635713577, "num_tokens": 9365854.0, "step": 1480 }, { "entropy": 0.01948691344150575, "epoch": 2.9802450612653164, "grad_norm": 0.2495020180940628, "learning_rate": 0.00016826161884287533, "loss": 0.01618766337633133, "mean_token_accuracy": 0.9956672258675099, "num_tokens": 9427287.0, "step": 1490 }, { "entropy": 0.022937397798228586, "epoch": 3.0, "grad_norm": 0.2727943956851959, "learning_rate": 0.00016777680223694575, "loss": 0.024902991950511932, "mean_token_accuracy": 0.9909723401069641, "num_tokens": 9488514.0, "step": 1500 }, { "epoch": 3.0, "eval_entropy": 0.02839457441272365, "eval_loss": 0.03645886108279228, "eval_mean_token_accuracy": 0.9902446437986661, "eval_num_tokens": 9488514.0, "eval_runtime": 69.2921, "eval_samples_per_second": 14.937, "eval_steps_per_second": 7.476, "step": 1500 } ], "logging_steps": 10, "max_steps": 5000, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.1295589576933376e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }