{ "best_global_step": 15850, "best_metric": 0.5063754320144653, "best_model_checkpoint": "output/LightOnOCR-ft-catmus/checkpoint-6500", "epoch": 2.0, "eval_steps": 50, "global_step": 18184, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0054994912970550225, "grad_norm": 1.7269556522369385, "learning_rate": 5.9871244635193135e-05, "loss": 3.2000225830078124, "step": 50 }, { "epoch": 0.0054994912970550225, "eval_loss": 2.544747829437256, "eval_runtime": 1.22, "eval_samples_per_second": 81.966, "eval_steps_per_second": 13.934, "step": 50 }, { "epoch": 0.010998982594110045, "grad_norm": 2.1817049980163574, "learning_rate": 5.970617365467151e-05, "loss": 2.204842987060547, "step": 100 }, { "epoch": 0.010998982594110045, "eval_loss": 1.9304633140563965, "eval_runtime": 1.2142, "eval_samples_per_second": 82.358, "eval_steps_per_second": 14.001, "step": 100 }, { "epoch": 0.01649847389116507, "grad_norm": 2.861886739730835, "learning_rate": 5.954110267414989e-05, "loss": 1.7260311889648436, "step": 150 }, { "epoch": 0.01649847389116507, "eval_loss": 1.7684886455535889, "eval_runtime": 1.2169, "eval_samples_per_second": 82.178, "eval_steps_per_second": 13.97, "step": 150 }, { "epoch": 0.02199796518822009, "grad_norm": 2.9910781383514404, "learning_rate": 5.937603169362826e-05, "loss": 1.5795289611816405, "step": 200 }, { "epoch": 0.02199796518822009, "eval_loss": 1.5510659217834473, "eval_runtime": 1.2158, "eval_samples_per_second": 82.249, "eval_steps_per_second": 13.982, "step": 200 }, { "epoch": 0.027497456485275112, "grad_norm": 3.234337329864502, "learning_rate": 5.921096071310663e-05, "loss": 1.4427146911621094, "step": 250 }, { "epoch": 0.027497456485275112, "eval_loss": 1.4127395153045654, "eval_runtime": 1.2374, "eval_samples_per_second": 80.816, "eval_steps_per_second": 13.739, "step": 250 }, { "epoch": 0.03299694778233014, "grad_norm": 3.6628358364105225, "learning_rate": 5.904588973258501e-05, "loss": 1.3803778076171875, "step": 300 }, { "epoch": 0.03299694778233014, "eval_loss": 1.3498808145523071, "eval_runtime": 1.2372, "eval_samples_per_second": 80.827, "eval_steps_per_second": 13.741, "step": 300 }, { "epoch": 0.03849643907938516, "grad_norm": 3.2028181552886963, "learning_rate": 5.8880818752063386e-05, "loss": 1.2370665740966797, "step": 350 }, { "epoch": 0.03849643907938516, "eval_loss": 1.3298417329788208, "eval_runtime": 1.2864, "eval_samples_per_second": 77.736, "eval_steps_per_second": 13.215, "step": 350 }, { "epoch": 0.04399593037644018, "grad_norm": 3.344433307647705, "learning_rate": 5.8715747771541766e-05, "loss": 1.1885470581054687, "step": 400 }, { "epoch": 0.04399593037644018, "eval_loss": 1.296607494354248, "eval_runtime": 1.2337, "eval_samples_per_second": 81.058, "eval_steps_per_second": 13.78, "step": 400 }, { "epoch": 0.0494954216734952, "grad_norm": 3.601663827896118, "learning_rate": 5.855067679102014e-05, "loss": 1.149856185913086, "step": 450 }, { "epoch": 0.0494954216734952, "eval_loss": 1.264522910118103, "eval_runtime": 1.2178, "eval_samples_per_second": 82.114, "eval_steps_per_second": 13.959, "step": 450 }, { "epoch": 0.054994912970550223, "grad_norm": 4.889139175415039, "learning_rate": 5.838560581049852e-05, "loss": 1.0299188232421874, "step": 500 }, { "epoch": 0.054994912970550223, "eval_loss": 1.2139334678649902, "eval_runtime": 1.2138, "eval_samples_per_second": 82.388, "eval_steps_per_second": 14.006, "step": 500 }, { "epoch": 0.060494404267605245, "grad_norm": 4.471691608428955, "learning_rate": 5.822053482997689e-05, "loss": 1.063873519897461, "step": 550 }, { "epoch": 0.060494404267605245, "eval_loss": 1.1947441101074219, "eval_runtime": 1.2397, "eval_samples_per_second": 80.663, "eval_steps_per_second": 13.713, "step": 550 }, { "epoch": 0.06599389556466027, "grad_norm": 5.005523204803467, "learning_rate": 5.805546384945527e-05, "loss": 1.0306187438964844, "step": 600 }, { "epoch": 0.06599389556466027, "eval_loss": 1.1054185628890991, "eval_runtime": 1.2867, "eval_samples_per_second": 77.72, "eval_steps_per_second": 13.212, "step": 600 }, { "epoch": 0.07149338686171529, "grad_norm": 5.433160781860352, "learning_rate": 5.7890392868933643e-05, "loss": 0.9948115539550781, "step": 650 }, { "epoch": 0.07149338686171529, "eval_loss": 1.118335247039795, "eval_runtime": 1.2905, "eval_samples_per_second": 77.488, "eval_steps_per_second": 13.173, "step": 650 }, { "epoch": 0.07699287815877032, "grad_norm": 4.089204788208008, "learning_rate": 5.7725321888412016e-05, "loss": 0.9623870086669922, "step": 700 }, { "epoch": 0.07699287815877032, "eval_loss": 1.1011381149291992, "eval_runtime": 1.2137, "eval_samples_per_second": 82.396, "eval_steps_per_second": 14.007, "step": 700 }, { "epoch": 0.08249236945582533, "grad_norm": 4.5177459716796875, "learning_rate": 5.7560250907890396e-05, "loss": 0.9822674560546875, "step": 750 }, { "epoch": 0.08249236945582533, "eval_loss": 1.0355230569839478, "eval_runtime": 1.2185, "eval_samples_per_second": 82.066, "eval_steps_per_second": 13.951, "step": 750 }, { "epoch": 0.08799186075288036, "grad_norm": 5.314192295074463, "learning_rate": 5.7395179927368776e-05, "loss": 0.9478108978271484, "step": 800 }, { "epoch": 0.08799186075288036, "eval_loss": 1.026939868927002, "eval_runtime": 1.2207, "eval_samples_per_second": 81.923, "eval_steps_per_second": 13.927, "step": 800 }, { "epoch": 0.09349135204993538, "grad_norm": 4.419743061065674, "learning_rate": 5.723010894684714e-05, "loss": 0.9230728149414062, "step": 850 }, { "epoch": 0.09349135204993538, "eval_loss": 1.0253421068191528, "eval_runtime": 1.2215, "eval_samples_per_second": 81.867, "eval_steps_per_second": 13.917, "step": 850 }, { "epoch": 0.0989908433469904, "grad_norm": 4.689808368682861, "learning_rate": 5.706503796632552e-05, "loss": 0.9336647033691406, "step": 900 }, { "epoch": 0.0989908433469904, "eval_loss": 0.9888076782226562, "eval_runtime": 1.2198, "eval_samples_per_second": 81.981, "eval_steps_per_second": 13.937, "step": 900 }, { "epoch": 0.10449033464404543, "grad_norm": 4.178891181945801, "learning_rate": 5.68999669858039e-05, "loss": 0.8509888458251953, "step": 950 }, { "epoch": 0.10449033464404543, "eval_loss": 0.9283347129821777, "eval_runtime": 1.2217, "eval_samples_per_second": 81.854, "eval_steps_per_second": 13.915, "step": 950 }, { "epoch": 0.10998982594110045, "grad_norm": 4.549170017242432, "learning_rate": 5.6734896005282274e-05, "loss": 0.8530999755859375, "step": 1000 }, { "epoch": 0.10998982594110045, "eval_loss": 0.9180505871772766, "eval_runtime": 1.2178, "eval_samples_per_second": 82.114, "eval_steps_per_second": 13.959, "step": 1000 }, { "epoch": 0.11548931723815548, "grad_norm": 5.8048095703125, "learning_rate": 5.656982502476065e-05, "loss": 0.8161511993408204, "step": 1050 }, { "epoch": 0.11548931723815548, "eval_loss": 0.9668211936950684, "eval_runtime": 1.2152, "eval_samples_per_second": 82.292, "eval_steps_per_second": 13.99, "step": 1050 }, { "epoch": 0.12098880853521049, "grad_norm": 4.776002883911133, "learning_rate": 5.6404754044239026e-05, "loss": 0.8362539672851562, "step": 1100 }, { "epoch": 0.12098880853521049, "eval_loss": 0.9686654806137085, "eval_runtime": 1.21, "eval_samples_per_second": 82.647, "eval_steps_per_second": 14.05, "step": 1100 }, { "epoch": 0.1264882998322655, "grad_norm": 4.652673721313477, "learning_rate": 5.62396830637174e-05, "loss": 0.8160650634765625, "step": 1150 }, { "epoch": 0.1264882998322655, "eval_loss": 0.9779856204986572, "eval_runtime": 1.2121, "eval_samples_per_second": 82.5, "eval_steps_per_second": 14.025, "step": 1150 }, { "epoch": 0.13198779112932055, "grad_norm": 4.988180160522461, "learning_rate": 5.607461208319577e-05, "loss": 0.8510865020751953, "step": 1200 }, { "epoch": 0.13198779112932055, "eval_loss": 0.9197137951850891, "eval_runtime": 1.2363, "eval_samples_per_second": 80.884, "eval_steps_per_second": 13.75, "step": 1200 }, { "epoch": 0.13748728242637556, "grad_norm": 5.33247709274292, "learning_rate": 5.590954110267415e-05, "loss": 0.8393131256103515, "step": 1250 }, { "epoch": 0.13748728242637556, "eval_loss": 0.9012404084205627, "eval_runtime": 1.2371, "eval_samples_per_second": 80.834, "eval_steps_per_second": 13.742, "step": 1250 }, { "epoch": 0.14298677372343058, "grad_norm": 4.81198787689209, "learning_rate": 5.5744470122152525e-05, "loss": 0.7720973205566406, "step": 1300 }, { "epoch": 0.14298677372343058, "eval_loss": 0.8723539710044861, "eval_runtime": 1.2195, "eval_samples_per_second": 81.999, "eval_steps_per_second": 13.94, "step": 1300 }, { "epoch": 0.1484862650204856, "grad_norm": 4.492185115814209, "learning_rate": 5.5579399141630904e-05, "loss": 0.8052091217041015, "step": 1350 }, { "epoch": 0.1484862650204856, "eval_loss": 0.8542118668556213, "eval_runtime": 1.2288, "eval_samples_per_second": 81.379, "eval_steps_per_second": 13.834, "step": 1350 }, { "epoch": 0.15398575631754063, "grad_norm": 3.353337287902832, "learning_rate": 5.541432816110928e-05, "loss": 0.7565326690673828, "step": 1400 }, { "epoch": 0.15398575631754063, "eval_loss": 0.8505687117576599, "eval_runtime": 1.2947, "eval_samples_per_second": 77.24, "eval_steps_per_second": 13.131, "step": 1400 }, { "epoch": 0.15948524761459565, "grad_norm": 4.658541202545166, "learning_rate": 5.524925718058765e-05, "loss": 0.7905632781982422, "step": 1450 }, { "epoch": 0.15948524761459565, "eval_loss": 0.8416154980659485, "eval_runtime": 1.3011, "eval_samples_per_second": 76.857, "eval_steps_per_second": 13.066, "step": 1450 }, { "epoch": 0.16498473891165066, "grad_norm": 4.894554615020752, "learning_rate": 5.508418620006603e-05, "loss": 0.7522599029541016, "step": 1500 }, { "epoch": 0.16498473891165066, "eval_loss": 0.8781094551086426, "eval_runtime": 1.3077, "eval_samples_per_second": 76.472, "eval_steps_per_second": 13.0, "step": 1500 }, { "epoch": 0.1704842302087057, "grad_norm": 5.099001407623291, "learning_rate": 5.491911521954441e-05, "loss": 0.7591278076171875, "step": 1550 }, { "epoch": 0.1704842302087057, "eval_loss": 0.8455641269683838, "eval_runtime": 1.3309, "eval_samples_per_second": 75.138, "eval_steps_per_second": 12.773, "step": 1550 }, { "epoch": 0.17598372150576072, "grad_norm": 4.108503818511963, "learning_rate": 5.4754044239022776e-05, "loss": 0.7117195129394531, "step": 1600 }, { "epoch": 0.17598372150576072, "eval_loss": 0.8469740152359009, "eval_runtime": 1.3312, "eval_samples_per_second": 75.123, "eval_steps_per_second": 12.771, "step": 1600 }, { "epoch": 0.18148321280281574, "grad_norm": 4.5479536056518555, "learning_rate": 5.4588973258501155e-05, "loss": 0.7624311828613282, "step": 1650 }, { "epoch": 0.18148321280281574, "eval_loss": 0.8670312762260437, "eval_runtime": 1.3395, "eval_samples_per_second": 74.652, "eval_steps_per_second": 12.691, "step": 1650 }, { "epoch": 0.18698270409987075, "grad_norm": 4.809026718139648, "learning_rate": 5.4423902277979535e-05, "loss": 0.7137515258789062, "step": 1700 }, { "epoch": 0.18698270409987075, "eval_loss": 0.8062080144882202, "eval_runtime": 1.3269, "eval_samples_per_second": 75.364, "eval_steps_per_second": 12.812, "step": 1700 }, { "epoch": 0.1924821953969258, "grad_norm": 5.400925636291504, "learning_rate": 5.4258831297457914e-05, "loss": 0.6972386932373047, "step": 1750 }, { "epoch": 0.1924821953969258, "eval_loss": 0.8285601735115051, "eval_runtime": 1.3236, "eval_samples_per_second": 75.551, "eval_steps_per_second": 12.844, "step": 1750 }, { "epoch": 0.1979816866939808, "grad_norm": 6.0628461837768555, "learning_rate": 5.409376031693628e-05, "loss": 0.7547286987304688, "step": 1800 }, { "epoch": 0.1979816866939808, "eval_loss": 0.8063403964042664, "eval_runtime": 1.3254, "eval_samples_per_second": 75.448, "eval_steps_per_second": 12.826, "step": 1800 }, { "epoch": 0.20348117799103582, "grad_norm": 5.176665306091309, "learning_rate": 5.392868933641466e-05, "loss": 0.7166018676757813, "step": 1850 }, { "epoch": 0.20348117799103582, "eval_loss": 0.7977473735809326, "eval_runtime": 1.3331, "eval_samples_per_second": 75.013, "eval_steps_per_second": 12.752, "step": 1850 }, { "epoch": 0.20898066928809086, "grad_norm": 5.566205024719238, "learning_rate": 5.376361835589304e-05, "loss": 0.7202009582519531, "step": 1900 }, { "epoch": 0.20898066928809086, "eval_loss": 0.7941867709159851, "eval_runtime": 1.2966, "eval_samples_per_second": 77.126, "eval_steps_per_second": 13.112, "step": 1900 }, { "epoch": 0.21448016058514588, "grad_norm": 6.071581840515137, "learning_rate": 5.359854737537141e-05, "loss": 0.718297119140625, "step": 1950 }, { "epoch": 0.21448016058514588, "eval_loss": 0.8194384574890137, "eval_runtime": 1.2884, "eval_samples_per_second": 77.613, "eval_steps_per_second": 13.194, "step": 1950 }, { "epoch": 0.2199796518822009, "grad_norm": 5.566873073577881, "learning_rate": 5.3433476394849786e-05, "loss": 0.7216673278808594, "step": 2000 }, { "epoch": 0.2199796518822009, "eval_loss": 0.7815269231796265, "eval_runtime": 1.2875, "eval_samples_per_second": 77.668, "eval_steps_per_second": 13.204, "step": 2000 }, { "epoch": 0.2254791431792559, "grad_norm": 5.567185878753662, "learning_rate": 5.3268405414328165e-05, "loss": 0.7164375305175781, "step": 2050 }, { "epoch": 0.2254791431792559, "eval_loss": 0.8178561925888062, "eval_runtime": 1.2891, "eval_samples_per_second": 77.574, "eval_steps_per_second": 13.188, "step": 2050 }, { "epoch": 0.23097863447631095, "grad_norm": 4.171028137207031, "learning_rate": 5.310333443380654e-05, "loss": 0.6996173095703125, "step": 2100 }, { "epoch": 0.23097863447631095, "eval_loss": 0.791594922542572, "eval_runtime": 1.287, "eval_samples_per_second": 77.698, "eval_steps_per_second": 13.209, "step": 2100 }, { "epoch": 0.23647812577336597, "grad_norm": 4.468926906585693, "learning_rate": 5.293826345328491e-05, "loss": 0.685142822265625, "step": 2150 }, { "epoch": 0.23647812577336597, "eval_loss": 0.8206081986427307, "eval_runtime": 1.2124, "eval_samples_per_second": 82.479, "eval_steps_per_second": 14.021, "step": 2150 }, { "epoch": 0.24197761707042098, "grad_norm": 3.9659266471862793, "learning_rate": 5.277319247276329e-05, "loss": 0.701788330078125, "step": 2200 }, { "epoch": 0.24197761707042098, "eval_loss": 0.7930644750595093, "eval_runtime": 1.2014, "eval_samples_per_second": 83.24, "eval_steps_per_second": 14.151, "step": 2200 }, { "epoch": 0.247477108367476, "grad_norm": 4.476805686950684, "learning_rate": 5.2608121492241664e-05, "loss": 0.710376968383789, "step": 2250 }, { "epoch": 0.247477108367476, "eval_loss": 0.7881377339363098, "eval_runtime": 1.1999, "eval_samples_per_second": 83.337, "eval_steps_per_second": 14.167, "step": 2250 }, { "epoch": 0.252976599664531, "grad_norm": 3.8596489429473877, "learning_rate": 5.244305051172004e-05, "loss": 0.7032179260253906, "step": 2300 }, { "epoch": 0.252976599664531, "eval_loss": 0.7591221332550049, "eval_runtime": 1.2149, "eval_samples_per_second": 82.31, "eval_steps_per_second": 13.993, "step": 2300 }, { "epoch": 0.2584760909615861, "grad_norm": 4.368955135345459, "learning_rate": 5.2277979531198416e-05, "loss": 0.6489437103271485, "step": 2350 }, { "epoch": 0.2584760909615861, "eval_loss": 0.8142778873443604, "eval_runtime": 1.2006, "eval_samples_per_second": 83.294, "eval_steps_per_second": 14.16, "step": 2350 }, { "epoch": 0.2639755822586411, "grad_norm": 4.408853530883789, "learning_rate": 5.211290855067679e-05, "loss": 0.6344734954833985, "step": 2400 }, { "epoch": 0.2639755822586411, "eval_loss": 0.789002001285553, "eval_runtime": 1.2016, "eval_samples_per_second": 83.219, "eval_steps_per_second": 14.147, "step": 2400 }, { "epoch": 0.2694750735556961, "grad_norm": 4.636422157287598, "learning_rate": 5.194783757015517e-05, "loss": 0.6603395080566407, "step": 2450 }, { "epoch": 0.2694750735556961, "eval_loss": 0.739583432674408, "eval_runtime": 1.2017, "eval_samples_per_second": 83.216, "eval_steps_per_second": 14.147, "step": 2450 }, { "epoch": 0.2749745648527511, "grad_norm": 4.370145797729492, "learning_rate": 5.178276658963355e-05, "loss": 0.6568155670166016, "step": 2500 }, { "epoch": 0.2749745648527511, "eval_loss": 0.8292286396026611, "eval_runtime": 1.1996, "eval_samples_per_second": 83.364, "eval_steps_per_second": 14.172, "step": 2500 }, { "epoch": 0.28047405614980614, "grad_norm": 4.47123384475708, "learning_rate": 5.1617695609111914e-05, "loss": 0.6639788055419922, "step": 2550 }, { "epoch": 0.28047405614980614, "eval_loss": 0.820250391960144, "eval_runtime": 1.2058, "eval_samples_per_second": 82.933, "eval_steps_per_second": 14.099, "step": 2550 }, { "epoch": 0.28597354744686115, "grad_norm": 4.769968509674072, "learning_rate": 5.1452624628590294e-05, "loss": 0.6434815979003906, "step": 2600 }, { "epoch": 0.28597354744686115, "eval_loss": 0.8330257534980774, "eval_runtime": 1.2003, "eval_samples_per_second": 83.313, "eval_steps_per_second": 14.163, "step": 2600 }, { "epoch": 0.29147303874391617, "grad_norm": 4.403727054595947, "learning_rate": 5.1287553648068674e-05, "loss": 0.6872652435302734, "step": 2650 }, { "epoch": 0.29147303874391617, "eval_loss": 0.7691981792449951, "eval_runtime": 1.1997, "eval_samples_per_second": 83.351, "eval_steps_per_second": 14.17, "step": 2650 }, { "epoch": 0.2969725300409712, "grad_norm": 3.7627687454223633, "learning_rate": 5.1122482667547047e-05, "loss": 0.625857925415039, "step": 2700 }, { "epoch": 0.2969725300409712, "eval_loss": 0.7727508544921875, "eval_runtime": 1.2264, "eval_samples_per_second": 81.538, "eval_steps_per_second": 13.861, "step": 2700 }, { "epoch": 0.30247202133802625, "grad_norm": 5.441561222076416, "learning_rate": 5.095741168702542e-05, "loss": 0.6458732604980468, "step": 2750 }, { "epoch": 0.30247202133802625, "eval_loss": 0.7701953053474426, "eval_runtime": 1.222, "eval_samples_per_second": 81.833, "eval_steps_per_second": 13.912, "step": 2750 }, { "epoch": 0.30797151263508127, "grad_norm": 4.965064525604248, "learning_rate": 5.07923407065038e-05, "loss": 0.6677908325195312, "step": 2800 }, { "epoch": 0.30797151263508127, "eval_loss": 0.7164813280105591, "eval_runtime": 1.2202, "eval_samples_per_second": 81.956, "eval_steps_per_second": 13.933, "step": 2800 }, { "epoch": 0.3134710039321363, "grad_norm": 3.931856870651245, "learning_rate": 5.062726972598217e-05, "loss": 0.5885476684570312, "step": 2850 }, { "epoch": 0.3134710039321363, "eval_loss": 0.7336059808731079, "eval_runtime": 1.2203, "eval_samples_per_second": 81.948, "eval_steps_per_second": 13.931, "step": 2850 }, { "epoch": 0.3189704952291913, "grad_norm": 4.760177135467529, "learning_rate": 5.046219874546055e-05, "loss": 0.6489822387695312, "step": 2900 }, { "epoch": 0.3189704952291913, "eval_loss": 0.7551103830337524, "eval_runtime": 1.2183, "eval_samples_per_second": 82.079, "eval_steps_per_second": 13.953, "step": 2900 }, { "epoch": 0.3244699865262463, "grad_norm": 4.375728130340576, "learning_rate": 5.0297127764938924e-05, "loss": 0.6457704162597656, "step": 2950 }, { "epoch": 0.3244699865262463, "eval_loss": 0.7187867164611816, "eval_runtime": 1.2036, "eval_samples_per_second": 83.084, "eval_steps_per_second": 14.124, "step": 2950 }, { "epoch": 0.3299694778233013, "grad_norm": 4.091928005218506, "learning_rate": 5.0132056784417304e-05, "loss": 0.6391205596923828, "step": 3000 }, { "epoch": 0.3299694778233013, "eval_loss": 0.7715049982070923, "eval_runtime": 1.2016, "eval_samples_per_second": 83.22, "eval_steps_per_second": 14.147, "step": 3000 }, { "epoch": 0.33546896912035634, "grad_norm": 4.569828510284424, "learning_rate": 4.996698580389568e-05, "loss": 0.6714089965820312, "step": 3050 }, { "epoch": 0.33546896912035634, "eval_loss": 0.7370268106460571, "eval_runtime": 1.2171, "eval_samples_per_second": 82.162, "eval_steps_per_second": 13.967, "step": 3050 }, { "epoch": 0.3409684604174114, "grad_norm": 5.741940975189209, "learning_rate": 4.980191482337405e-05, "loss": 0.6890049743652343, "step": 3100 }, { "epoch": 0.3409684604174114, "eval_loss": 0.7069912552833557, "eval_runtime": 1.1974, "eval_samples_per_second": 83.514, "eval_steps_per_second": 14.197, "step": 3100 }, { "epoch": 0.3464679517144664, "grad_norm": 4.857932090759277, "learning_rate": 4.963684384285243e-05, "loss": 0.5919662475585937, "step": 3150 }, { "epoch": 0.3464679517144664, "eval_loss": 0.7350116968154907, "eval_runtime": 1.1974, "eval_samples_per_second": 83.515, "eval_steps_per_second": 14.198, "step": 3150 }, { "epoch": 0.35196744301152144, "grad_norm": 4.636399745941162, "learning_rate": 4.94717728623308e-05, "loss": 0.6361312866210938, "step": 3200 }, { "epoch": 0.35196744301152144, "eval_loss": 0.7743600606918335, "eval_runtime": 1.271, "eval_samples_per_second": 78.677, "eval_steps_per_second": 13.375, "step": 3200 }, { "epoch": 0.35746693430857646, "grad_norm": 5.155900955200195, "learning_rate": 4.930670188180918e-05, "loss": 0.602264518737793, "step": 3250 }, { "epoch": 0.35746693430857646, "eval_loss": 0.7555291652679443, "eval_runtime": 1.2803, "eval_samples_per_second": 78.105, "eval_steps_per_second": 13.278, "step": 3250 }, { "epoch": 0.36296642560563147, "grad_norm": 3.4023196697235107, "learning_rate": 4.9141630901287555e-05, "loss": 0.5788230133056641, "step": 3300 }, { "epoch": 0.36296642560563147, "eval_loss": 0.7717245221138, "eval_runtime": 1.3149, "eval_samples_per_second": 76.053, "eval_steps_per_second": 12.929, "step": 3300 }, { "epoch": 0.3684659169026865, "grad_norm": 4.329448223114014, "learning_rate": 4.897655992076593e-05, "loss": 0.6438528442382813, "step": 3350 }, { "epoch": 0.3684659169026865, "eval_loss": 0.6952827572822571, "eval_runtime": 1.2957, "eval_samples_per_second": 77.176, "eval_steps_per_second": 13.12, "step": 3350 }, { "epoch": 0.3739654081997415, "grad_norm": 3.610276222229004, "learning_rate": 4.881148894024431e-05, "loss": 0.6141637802124024, "step": 3400 }, { "epoch": 0.3739654081997415, "eval_loss": 0.6926187872886658, "eval_runtime": 1.3466, "eval_samples_per_second": 74.259, "eval_steps_per_second": 12.624, "step": 3400 }, { "epoch": 0.37946489949679657, "grad_norm": 6.178794860839844, "learning_rate": 4.864641795972269e-05, "loss": 0.6356156158447266, "step": 3450 }, { "epoch": 0.37946489949679657, "eval_loss": 0.7247772216796875, "eval_runtime": 1.3462, "eval_samples_per_second": 74.281, "eval_steps_per_second": 12.628, "step": 3450 }, { "epoch": 0.3849643907938516, "grad_norm": 4.9943695068359375, "learning_rate": 4.848134697920105e-05, "loss": 0.6148456192016601, "step": 3500 }, { "epoch": 0.3849643907938516, "eval_loss": 0.7180845141410828, "eval_runtime": 1.3322, "eval_samples_per_second": 75.061, "eval_steps_per_second": 12.76, "step": 3500 }, { "epoch": 0.3904638820909066, "grad_norm": 3.8332393169403076, "learning_rate": 4.831627599867943e-05, "loss": 0.625141716003418, "step": 3550 }, { "epoch": 0.3904638820909066, "eval_loss": 0.6876647472381592, "eval_runtime": 1.3382, "eval_samples_per_second": 74.73, "eval_steps_per_second": 12.704, "step": 3550 }, { "epoch": 0.3959633733879616, "grad_norm": 4.58771276473999, "learning_rate": 4.815120501815781e-05, "loss": 0.6502104187011719, "step": 3600 }, { "epoch": 0.3959633733879616, "eval_loss": 0.690920352935791, "eval_runtime": 1.343, "eval_samples_per_second": 74.46, "eval_steps_per_second": 12.658, "step": 3600 }, { "epoch": 0.40146286468501663, "grad_norm": 4.435539722442627, "learning_rate": 4.7986134037636185e-05, "loss": 0.6129857635498047, "step": 3650 }, { "epoch": 0.40146286468501663, "eval_loss": 0.6758005023002625, "eval_runtime": 1.34, "eval_samples_per_second": 74.628, "eval_steps_per_second": 12.687, "step": 3650 }, { "epoch": 0.40696235598207164, "grad_norm": 4.618966102600098, "learning_rate": 4.782106305711456e-05, "loss": 0.6234348678588867, "step": 3700 }, { "epoch": 0.40696235598207164, "eval_loss": 0.7179376482963562, "eval_runtime": 1.3332, "eval_samples_per_second": 75.01, "eval_steps_per_second": 12.752, "step": 3700 }, { "epoch": 0.41246184727912666, "grad_norm": 4.0562052726745605, "learning_rate": 4.765599207659294e-05, "loss": 0.6168152999877929, "step": 3750 }, { "epoch": 0.41246184727912666, "eval_loss": 0.7127401828765869, "eval_runtime": 1.3374, "eval_samples_per_second": 74.769, "eval_steps_per_second": 12.711, "step": 3750 }, { "epoch": 0.41796133857618173, "grad_norm": 5.699039459228516, "learning_rate": 4.749092109607131e-05, "loss": 0.5789441680908203, "step": 3800 }, { "epoch": 0.41796133857618173, "eval_loss": 0.6780041456222534, "eval_runtime": 1.3483, "eval_samples_per_second": 74.167, "eval_steps_per_second": 12.608, "step": 3800 }, { "epoch": 0.42346082987323674, "grad_norm": 3.523623466491699, "learning_rate": 4.7325850115549684e-05, "loss": 0.5945124053955078, "step": 3850 }, { "epoch": 0.42346082987323674, "eval_loss": 0.695915699005127, "eval_runtime": 1.345, "eval_samples_per_second": 74.351, "eval_steps_per_second": 12.64, "step": 3850 }, { "epoch": 0.42896032117029176, "grad_norm": 4.008049488067627, "learning_rate": 4.716077913502806e-05, "loss": 0.5782461929321289, "step": 3900 }, { "epoch": 0.42896032117029176, "eval_loss": 0.6521520018577576, "eval_runtime": 1.342, "eval_samples_per_second": 74.517, "eval_steps_per_second": 12.668, "step": 3900 }, { "epoch": 0.4344598124673468, "grad_norm": 4.809508323669434, "learning_rate": 4.6995708154506436e-05, "loss": 0.5954169464111329, "step": 3950 }, { "epoch": 0.4344598124673468, "eval_loss": 0.6668588519096375, "eval_runtime": 1.347, "eval_samples_per_second": 74.241, "eval_steps_per_second": 12.621, "step": 3950 }, { "epoch": 0.4399593037644018, "grad_norm": 4.741697788238525, "learning_rate": 4.6830637173984816e-05, "loss": 0.5780908584594726, "step": 4000 }, { "epoch": 0.4399593037644018, "eval_loss": 0.6712077260017395, "eval_runtime": 1.3399, "eval_samples_per_second": 74.63, "eval_steps_per_second": 12.687, "step": 4000 }, { "epoch": 0.4454587950614568, "grad_norm": 5.006357192993164, "learning_rate": 4.666556619346319e-05, "loss": 0.5816222763061524, "step": 4050 }, { "epoch": 0.4454587950614568, "eval_loss": 0.659636378288269, "eval_runtime": 1.3383, "eval_samples_per_second": 74.724, "eval_steps_per_second": 12.703, "step": 4050 }, { "epoch": 0.4509582863585118, "grad_norm": 4.562034606933594, "learning_rate": 4.650049521294156e-05, "loss": 0.6115531539916992, "step": 4100 }, { "epoch": 0.4509582863585118, "eval_loss": 0.7120453715324402, "eval_runtime": 1.3432, "eval_samples_per_second": 74.446, "eval_steps_per_second": 12.656, "step": 4100 }, { "epoch": 0.4564577776555669, "grad_norm": 4.5262837409973145, "learning_rate": 4.633542423241994e-05, "loss": 0.5980755233764649, "step": 4150 }, { "epoch": 0.4564577776555669, "eval_loss": 0.6733386516571045, "eval_runtime": 1.3413, "eval_samples_per_second": 74.555, "eval_steps_per_second": 12.674, "step": 4150 }, { "epoch": 0.4619572689526219, "grad_norm": 3.8390605449676514, "learning_rate": 4.617035325189832e-05, "loss": 0.5741873931884766, "step": 4200 }, { "epoch": 0.4619572689526219, "eval_loss": 0.6623669266700745, "eval_runtime": 1.341, "eval_samples_per_second": 74.57, "eval_steps_per_second": 12.677, "step": 4200 }, { "epoch": 0.4674567602496769, "grad_norm": 4.214045524597168, "learning_rate": 4.6005282271376694e-05, "loss": 0.5255369186401367, "step": 4250 }, { "epoch": 0.4674567602496769, "eval_loss": 0.6530551910400391, "eval_runtime": 1.3425, "eval_samples_per_second": 74.487, "eval_steps_per_second": 12.663, "step": 4250 }, { "epoch": 0.47295625154673193, "grad_norm": 4.7830729484558105, "learning_rate": 4.5840211290855067e-05, "loss": 0.5830232620239257, "step": 4300 }, { "epoch": 0.47295625154673193, "eval_loss": 0.6643821001052856, "eval_runtime": 1.344, "eval_samples_per_second": 74.407, "eval_steps_per_second": 12.649, "step": 4300 }, { "epoch": 0.47845574284378695, "grad_norm": 4.745019435882568, "learning_rate": 4.5675140310333446e-05, "loss": 0.5781446075439454, "step": 4350 }, { "epoch": 0.47845574284378695, "eval_loss": 0.6928694844245911, "eval_runtime": 1.5854, "eval_samples_per_second": 63.074, "eval_steps_per_second": 10.723, "step": 4350 }, { "epoch": 0.48395523414084196, "grad_norm": 4.537078380584717, "learning_rate": 4.5510069329811826e-05, "loss": 0.531302490234375, "step": 4400 }, { "epoch": 0.48395523414084196, "eval_loss": 0.6292517185211182, "eval_runtime": 1.3445, "eval_samples_per_second": 74.375, "eval_steps_per_second": 12.644, "step": 4400 }, { "epoch": 0.489454725437897, "grad_norm": 4.4869384765625, "learning_rate": 4.534499834929019e-05, "loss": 0.5715638732910157, "step": 4450 }, { "epoch": 0.489454725437897, "eval_loss": 0.6663034558296204, "eval_runtime": 1.2938, "eval_samples_per_second": 77.291, "eval_steps_per_second": 13.14, "step": 4450 }, { "epoch": 0.494954216734952, "grad_norm": 4.644640922546387, "learning_rate": 4.517992736876857e-05, "loss": 0.6143413162231446, "step": 4500 }, { "epoch": 0.494954216734952, "eval_loss": 0.6727674007415771, "eval_runtime": 1.2823, "eval_samples_per_second": 77.986, "eval_steps_per_second": 13.258, "step": 4500 }, { "epoch": 0.5004537080320071, "grad_norm": 4.451071262359619, "learning_rate": 4.501485638824695e-05, "loss": 0.6003995132446289, "step": 4550 }, { "epoch": 0.5004537080320071, "eval_loss": 0.7084936499595642, "eval_runtime": 1.292, "eval_samples_per_second": 77.4, "eval_steps_per_second": 13.158, "step": 4550 }, { "epoch": 0.505953199329062, "grad_norm": 3.566272020339966, "learning_rate": 4.4849785407725324e-05, "loss": 0.5423797607421875, "step": 4600 }, { "epoch": 0.505953199329062, "eval_loss": 0.6627475023269653, "eval_runtime": 1.2898, "eval_samples_per_second": 77.531, "eval_steps_per_second": 13.18, "step": 4600 }, { "epoch": 0.5114526906261171, "grad_norm": 4.810975074768066, "learning_rate": 4.46847144272037e-05, "loss": 0.6348634719848633, "step": 4650 }, { "epoch": 0.5114526906261171, "eval_loss": 0.5990252494812012, "eval_runtime": 1.2836, "eval_samples_per_second": 77.908, "eval_steps_per_second": 13.244, "step": 4650 }, { "epoch": 0.5169521819231722, "grad_norm": 4.475234031677246, "learning_rate": 4.451964344668208e-05, "loss": 0.5570141220092774, "step": 4700 }, { "epoch": 0.5169521819231722, "eval_loss": 0.6244956254959106, "eval_runtime": 1.2837, "eval_samples_per_second": 77.898, "eval_steps_per_second": 13.243, "step": 4700 }, { "epoch": 0.5224516732202271, "grad_norm": 4.3085103034973145, "learning_rate": 4.435457246616045e-05, "loss": 0.55887451171875, "step": 4750 }, { "epoch": 0.5224516732202271, "eval_loss": 0.6636219620704651, "eval_runtime": 1.2809, "eval_samples_per_second": 78.068, "eval_steps_per_second": 13.272, "step": 4750 }, { "epoch": 0.5279511645172822, "grad_norm": 3.598691940307617, "learning_rate": 4.418950148563882e-05, "loss": 0.5753656005859376, "step": 4800 }, { "epoch": 0.5279511645172822, "eval_loss": 0.6499161720275879, "eval_runtime": 1.2822, "eval_samples_per_second": 77.991, "eval_steps_per_second": 13.258, "step": 4800 }, { "epoch": 0.5334506558143371, "grad_norm": 4.494378089904785, "learning_rate": 4.40244305051172e-05, "loss": 0.5845529174804688, "step": 4850 }, { "epoch": 0.5334506558143371, "eval_loss": 0.629128634929657, "eval_runtime": 1.5134, "eval_samples_per_second": 66.078, "eval_steps_per_second": 11.233, "step": 4850 }, { "epoch": 0.5389501471113922, "grad_norm": 4.149122714996338, "learning_rate": 4.3859359524595575e-05, "loss": 0.527508659362793, "step": 4900 }, { "epoch": 0.5389501471113922, "eval_loss": 0.6683360934257507, "eval_runtime": 1.2806, "eval_samples_per_second": 78.088, "eval_steps_per_second": 13.275, "step": 4900 }, { "epoch": 0.5444496384084472, "grad_norm": 4.04086971282959, "learning_rate": 4.3694288544073955e-05, "loss": 0.602709732055664, "step": 4950 }, { "epoch": 0.5444496384084472, "eval_loss": 0.646293044090271, "eval_runtime": 1.2828, "eval_samples_per_second": 77.952, "eval_steps_per_second": 13.252, "step": 4950 }, { "epoch": 0.5499491297055022, "grad_norm": 4.0907440185546875, "learning_rate": 4.352921756355233e-05, "loss": 0.5631252670288086, "step": 5000 }, { "epoch": 0.5499491297055022, "eval_loss": 0.6324547529220581, "eval_runtime": 1.2809, "eval_samples_per_second": 78.07, "eval_steps_per_second": 13.272, "step": 5000 }, { "epoch": 0.5554486210025573, "grad_norm": 4.2775654792785645, "learning_rate": 4.33641465830307e-05, "loss": 0.5570418930053711, "step": 5050 }, { "epoch": 0.5554486210025573, "eval_loss": 0.6621595621109009, "eval_runtime": 1.2825, "eval_samples_per_second": 77.971, "eval_steps_per_second": 13.255, "step": 5050 }, { "epoch": 0.5609481122996123, "grad_norm": 4.414310932159424, "learning_rate": 4.319907560250908e-05, "loss": 0.5383467483520508, "step": 5100 }, { "epoch": 0.5609481122996123, "eval_loss": 0.6726260185241699, "eval_runtime": 1.2823, "eval_samples_per_second": 77.983, "eval_steps_per_second": 13.257, "step": 5100 }, { "epoch": 0.5664476035966673, "grad_norm": 3.679974317550659, "learning_rate": 4.303400462198746e-05, "loss": 0.5569720840454102, "step": 5150 }, { "epoch": 0.5664476035966673, "eval_loss": 0.6547858715057373, "eval_runtime": 1.289, "eval_samples_per_second": 77.579, "eval_steps_per_second": 13.188, "step": 5150 }, { "epoch": 0.5719470948937223, "grad_norm": 5.782617568969727, "learning_rate": 4.2868933641465826e-05, "loss": 0.5539520263671875, "step": 5200 }, { "epoch": 0.5719470948937223, "eval_loss": 0.6701158881187439, "eval_runtime": 1.2849, "eval_samples_per_second": 77.825, "eval_steps_per_second": 13.23, "step": 5200 }, { "epoch": 0.5774465861907774, "grad_norm": 4.194858074188232, "learning_rate": 4.2703862660944205e-05, "loss": 0.5348934173583985, "step": 5250 }, { "epoch": 0.5774465861907774, "eval_loss": 0.6580336093902588, "eval_runtime": 1.2831, "eval_samples_per_second": 77.938, "eval_steps_per_second": 13.249, "step": 5250 }, { "epoch": 0.5829460774878323, "grad_norm": 4.302168369293213, "learning_rate": 4.2538791680422585e-05, "loss": 0.5106255340576172, "step": 5300 }, { "epoch": 0.5829460774878323, "eval_loss": 0.6552238464355469, "eval_runtime": 1.2852, "eval_samples_per_second": 77.81, "eval_steps_per_second": 13.228, "step": 5300 }, { "epoch": 0.5884455687848874, "grad_norm": 4.042543411254883, "learning_rate": 4.237372069990096e-05, "loss": 0.5317581558227539, "step": 5350 }, { "epoch": 0.5884455687848874, "eval_loss": 0.6482524275779724, "eval_runtime": 1.5001, "eval_samples_per_second": 66.661, "eval_steps_per_second": 11.332, "step": 5350 }, { "epoch": 0.5939450600819424, "grad_norm": 4.4569830894470215, "learning_rate": 4.220864971937933e-05, "loss": 0.5747990036010742, "step": 5400 }, { "epoch": 0.5939450600819424, "eval_loss": 0.6177729368209839, "eval_runtime": 1.2798, "eval_samples_per_second": 78.134, "eval_steps_per_second": 13.283, "step": 5400 }, { "epoch": 0.5994445513789974, "grad_norm": 4.751041889190674, "learning_rate": 4.204357873885771e-05, "loss": 0.5374135971069336, "step": 5450 }, { "epoch": 0.5994445513789974, "eval_loss": 0.6517400145530701, "eval_runtime": 1.28, "eval_samples_per_second": 78.128, "eval_steps_per_second": 13.282, "step": 5450 }, { "epoch": 0.6049440426760525, "grad_norm": 7.24479341506958, "learning_rate": 4.187850775833609e-05, "loss": 0.5593222045898437, "step": 5500 }, { "epoch": 0.6049440426760525, "eval_loss": 0.6892206072807312, "eval_runtime": 1.2818, "eval_samples_per_second": 78.014, "eval_steps_per_second": 13.262, "step": 5500 }, { "epoch": 0.6104435339731075, "grad_norm": 4.312963008880615, "learning_rate": 4.171343677781446e-05, "loss": 0.5525634002685547, "step": 5550 }, { "epoch": 0.6104435339731075, "eval_loss": 0.6747671365737915, "eval_runtime": 1.2815, "eval_samples_per_second": 78.036, "eval_steps_per_second": 13.266, "step": 5550 }, { "epoch": 0.6159430252701625, "grad_norm": 4.606757164001465, "learning_rate": 4.1548365797292836e-05, "loss": 0.5449155807495117, "step": 5600 }, { "epoch": 0.6159430252701625, "eval_loss": 0.6547083854675293, "eval_runtime": 1.2835, "eval_samples_per_second": 77.914, "eval_steps_per_second": 13.245, "step": 5600 }, { "epoch": 0.6214425165672175, "grad_norm": 5.024621486663818, "learning_rate": 4.1383294816771216e-05, "loss": 0.6019486618041993, "step": 5650 }, { "epoch": 0.6214425165672175, "eval_loss": 0.6467494964599609, "eval_runtime": 1.2839, "eval_samples_per_second": 77.889, "eval_steps_per_second": 13.241, "step": 5650 }, { "epoch": 0.6269420078642726, "grad_norm": 4.251932144165039, "learning_rate": 4.121822383624959e-05, "loss": 0.5073886489868165, "step": 5700 }, { "epoch": 0.6269420078642726, "eval_loss": 0.6638882160186768, "eval_runtime": 1.2832, "eval_samples_per_second": 77.932, "eval_steps_per_second": 13.249, "step": 5700 }, { "epoch": 0.6324414991613275, "grad_norm": 3.3922533988952637, "learning_rate": 4.105315285572796e-05, "loss": 0.531150894165039, "step": 5750 }, { "epoch": 0.6324414991613275, "eval_loss": 0.6248385310173035, "eval_runtime": 1.2919, "eval_samples_per_second": 77.406, "eval_steps_per_second": 13.159, "step": 5750 }, { "epoch": 0.6379409904583826, "grad_norm": 4.290137767791748, "learning_rate": 4.088808187520634e-05, "loss": 0.5194898986816406, "step": 5800 }, { "epoch": 0.6379409904583826, "eval_loss": 0.6306109428405762, "eval_runtime": 1.2834, "eval_samples_per_second": 77.918, "eval_steps_per_second": 13.246, "step": 5800 }, { "epoch": 0.6434404817554377, "grad_norm": 4.854128837585449, "learning_rate": 4.0723010894684714e-05, "loss": 0.5465607833862305, "step": 5850 }, { "epoch": 0.6434404817554377, "eval_loss": 0.6254453063011169, "eval_runtime": 1.5113, "eval_samples_per_second": 66.169, "eval_steps_per_second": 11.249, "step": 5850 }, { "epoch": 0.6489399730524926, "grad_norm": 4.647885799407959, "learning_rate": 4.0557939914163093e-05, "loss": 0.5407907104492188, "step": 5900 }, { "epoch": 0.6489399730524926, "eval_loss": 0.6638280749320984, "eval_runtime": 1.2958, "eval_samples_per_second": 77.17, "eval_steps_per_second": 13.119, "step": 5900 }, { "epoch": 0.6544394643495477, "grad_norm": 4.279372215270996, "learning_rate": 4.0392868933641466e-05, "loss": 0.5451357269287109, "step": 5950 }, { "epoch": 0.6544394643495477, "eval_loss": 0.6228541731834412, "eval_runtime": 1.3241, "eval_samples_per_second": 75.524, "eval_steps_per_second": 12.839, "step": 5950 }, { "epoch": 0.6599389556466027, "grad_norm": 4.0558247566223145, "learning_rate": 4.022779795311984e-05, "loss": 0.5368893814086914, "step": 6000 }, { "epoch": 0.6599389556466027, "eval_loss": 0.6732752323150635, "eval_runtime": 1.3368, "eval_samples_per_second": 74.807, "eval_steps_per_second": 12.717, "step": 6000 }, { "epoch": 0.6654384469436577, "grad_norm": 3.353104591369629, "learning_rate": 4.006272697259822e-05, "loss": 0.5184137344360351, "step": 6050 }, { "epoch": 0.6654384469436577, "eval_loss": 0.6266540884971619, "eval_runtime": 1.3374, "eval_samples_per_second": 74.773, "eval_steps_per_second": 12.711, "step": 6050 }, { "epoch": 0.6709379382407127, "grad_norm": 3.8511996269226074, "learning_rate": 3.98976559920766e-05, "loss": 0.5407165145874023, "step": 6100 }, { "epoch": 0.6709379382407127, "eval_loss": 0.6703444123268127, "eval_runtime": 1.3374, "eval_samples_per_second": 74.77, "eval_steps_per_second": 12.711, "step": 6100 }, { "epoch": 0.6764374295377678, "grad_norm": 3.9859249591827393, "learning_rate": 3.9732585011554965e-05, "loss": 0.4901425552368164, "step": 6150 }, { "epoch": 0.6764374295377678, "eval_loss": 0.6332722902297974, "eval_runtime": 1.341, "eval_samples_per_second": 74.569, "eval_steps_per_second": 12.677, "step": 6150 }, { "epoch": 0.6819369208348228, "grad_norm": 3.666247844696045, "learning_rate": 3.9567514031033344e-05, "loss": 0.5188226318359375, "step": 6200 }, { "epoch": 0.6819369208348228, "eval_loss": 0.5851776599884033, "eval_runtime": 1.3337, "eval_samples_per_second": 74.982, "eval_steps_per_second": 12.747, "step": 6200 }, { "epoch": 0.6874364121318778, "grad_norm": 4.355357646942139, "learning_rate": 3.9402443050511724e-05, "loss": 0.523404426574707, "step": 6250 }, { "epoch": 0.6874364121318778, "eval_loss": 0.5948991179466248, "eval_runtime": 1.3477, "eval_samples_per_second": 74.199, "eval_steps_per_second": 12.614, "step": 6250 }, { "epoch": 0.6929359034289329, "grad_norm": 4.099778652191162, "learning_rate": 3.92373720699901e-05, "loss": 0.5017270278930664, "step": 6300 }, { "epoch": 0.6929359034289329, "eval_loss": 0.6322646737098694, "eval_runtime": 1.3296, "eval_samples_per_second": 75.208, "eval_steps_per_second": 12.785, "step": 6300 }, { "epoch": 0.6984353947259878, "grad_norm": 5.135687351226807, "learning_rate": 3.907230108946847e-05, "loss": 0.5303592300415039, "step": 6350 }, { "epoch": 0.6984353947259878, "eval_loss": 0.6268444657325745, "eval_runtime": 1.5763, "eval_samples_per_second": 63.442, "eval_steps_per_second": 10.785, "step": 6350 }, { "epoch": 0.7039348860230429, "grad_norm": 4.834221839904785, "learning_rate": 3.890723010894685e-05, "loss": 0.5274005889892578, "step": 6400 }, { "epoch": 0.7039348860230429, "eval_loss": 0.5901980996131897, "eval_runtime": 1.3333, "eval_samples_per_second": 75.003, "eval_steps_per_second": 12.75, "step": 6400 }, { "epoch": 0.7094343773200978, "grad_norm": 5.028069496154785, "learning_rate": 3.874215912842522e-05, "loss": 0.5233419799804687, "step": 6450 }, { "epoch": 0.7094343773200978, "eval_loss": 0.6389637589454651, "eval_runtime": 1.2872, "eval_samples_per_second": 77.685, "eval_steps_per_second": 13.206, "step": 6450 }, { "epoch": 0.7149338686171529, "grad_norm": 4.620915412902832, "learning_rate": 3.85770881479036e-05, "loss": 0.5316643905639649, "step": 6500 }, { "epoch": 0.7149338686171529, "eval_loss": 0.5779242515563965, "eval_runtime": 1.2776, "eval_samples_per_second": 78.271, "eval_steps_per_second": 13.306, "step": 6500 }, { "epoch": 0.720433359914208, "grad_norm": 3.9142255783081055, "learning_rate": 3.8412017167381975e-05, "loss": 0.4801639175415039, "step": 6550 }, { "epoch": 0.720433359914208, "eval_loss": 0.5951541662216187, "eval_runtime": 1.2302, "eval_samples_per_second": 81.288, "eval_steps_per_second": 13.819, "step": 6550 }, { "epoch": 0.7259328512112629, "grad_norm": 4.454485893249512, "learning_rate": 3.824694618686035e-05, "loss": 0.5149478912353516, "step": 6600 }, { "epoch": 0.7259328512112629, "eval_loss": 0.5860444903373718, "eval_runtime": 1.235, "eval_samples_per_second": 80.974, "eval_steps_per_second": 13.766, "step": 6600 }, { "epoch": 0.731432342508318, "grad_norm": 4.176424026489258, "learning_rate": 3.808187520633873e-05, "loss": 0.543246192932129, "step": 6650 }, { "epoch": 0.731432342508318, "eval_loss": 0.5805695056915283, "eval_runtime": 1.2369, "eval_samples_per_second": 80.844, "eval_steps_per_second": 13.744, "step": 6650 }, { "epoch": 0.736931833805373, "grad_norm": 3.361717462539673, "learning_rate": 3.79168042258171e-05, "loss": 0.5410548400878906, "step": 6700 }, { "epoch": 0.736931833805373, "eval_loss": 0.5974660515785217, "eval_runtime": 1.2286, "eval_samples_per_second": 81.396, "eval_steps_per_second": 13.837, "step": 6700 }, { "epoch": 0.742431325102428, "grad_norm": 5.069472312927246, "learning_rate": 3.775173324529548e-05, "loss": 0.5026102447509766, "step": 6750 }, { "epoch": 0.742431325102428, "eval_loss": 0.5945417284965515, "eval_runtime": 1.2116, "eval_samples_per_second": 82.533, "eval_steps_per_second": 14.031, "step": 6750 }, { "epoch": 0.747930816399483, "grad_norm": 4.298215389251709, "learning_rate": 3.758666226477385e-05, "loss": 0.5604416275024414, "step": 6800 }, { "epoch": 0.747930816399483, "eval_loss": 0.5883623361587524, "eval_runtime": 1.2141, "eval_samples_per_second": 82.363, "eval_steps_per_second": 14.002, "step": 6800 }, { "epoch": 0.7534303076965381, "grad_norm": 3.469435930252075, "learning_rate": 3.742159128425223e-05, "loss": 0.5037693023681641, "step": 6850 }, { "epoch": 0.7534303076965381, "eval_loss": 0.5655568838119507, "eval_runtime": 1.3814, "eval_samples_per_second": 72.389, "eval_steps_per_second": 12.306, "step": 6850 }, { "epoch": 0.7589297989935931, "grad_norm": 4.014948844909668, "learning_rate": 3.7256520303730605e-05, "loss": 0.5645696258544922, "step": 6900 }, { "epoch": 0.7589297989935931, "eval_loss": 0.6064311265945435, "eval_runtime": 1.2076, "eval_samples_per_second": 82.809, "eval_steps_per_second": 14.078, "step": 6900 }, { "epoch": 0.7644292902906481, "grad_norm": 3.9340033531188965, "learning_rate": 3.709144932320898e-05, "loss": 0.5047724914550781, "step": 6950 }, { "epoch": 0.7644292902906481, "eval_loss": 0.5839043259620667, "eval_runtime": 1.221, "eval_samples_per_second": 81.901, "eval_steps_per_second": 13.923, "step": 6950 }, { "epoch": 0.7699287815877032, "grad_norm": 3.939054250717163, "learning_rate": 3.692637834268736e-05, "loss": 0.5168508529663086, "step": 7000 }, { "epoch": 0.7699287815877032, "eval_loss": 0.5967159867286682, "eval_runtime": 1.2228, "eval_samples_per_second": 81.776, "eval_steps_per_second": 13.902, "step": 7000 }, { "epoch": 0.7754282728847581, "grad_norm": 4.098312854766846, "learning_rate": 3.676130736216574e-05, "loss": 0.49574569702148436, "step": 7050 }, { "epoch": 0.7754282728847581, "eval_loss": 0.6113559603691101, "eval_runtime": 1.2197, "eval_samples_per_second": 81.991, "eval_steps_per_second": 13.938, "step": 7050 }, { "epoch": 0.7809277641818132, "grad_norm": 5.130489826202393, "learning_rate": 3.6596236381644103e-05, "loss": 0.5368572235107422, "step": 7100 }, { "epoch": 0.7809277641818132, "eval_loss": 0.5671849250793457, "eval_runtime": 1.2087, "eval_samples_per_second": 82.733, "eval_steps_per_second": 14.065, "step": 7100 }, { "epoch": 0.7864272554788682, "grad_norm": 3.2629666328430176, "learning_rate": 3.643116540112248e-05, "loss": 0.5247505569458008, "step": 7150 }, { "epoch": 0.7864272554788682, "eval_loss": 0.5848333835601807, "eval_runtime": 1.2165, "eval_samples_per_second": 82.205, "eval_steps_per_second": 13.975, "step": 7150 }, { "epoch": 0.7919267467759232, "grad_norm": 3.4071853160858154, "learning_rate": 3.626609442060086e-05, "loss": 0.5215546417236329, "step": 7200 }, { "epoch": 0.7919267467759232, "eval_loss": 0.5874826312065125, "eval_runtime": 1.2062, "eval_samples_per_second": 82.907, "eval_steps_per_second": 14.094, "step": 7200 }, { "epoch": 0.7974262380729783, "grad_norm": 4.264019966125488, "learning_rate": 3.6101023440079236e-05, "loss": 0.48300968170166014, "step": 7250 }, { "epoch": 0.7974262380729783, "eval_loss": 0.6169635057449341, "eval_runtime": 1.2014, "eval_samples_per_second": 83.24, "eval_steps_per_second": 14.151, "step": 7250 }, { "epoch": 0.8029257293700333, "grad_norm": 3.845081090927124, "learning_rate": 3.593595245955761e-05, "loss": 0.5431819152832031, "step": 7300 }, { "epoch": 0.8029257293700333, "eval_loss": 0.5864665508270264, "eval_runtime": 1.1999, "eval_samples_per_second": 83.339, "eval_steps_per_second": 14.168, "step": 7300 }, { "epoch": 0.8084252206670883, "grad_norm": 4.696225166320801, "learning_rate": 3.577088147903599e-05, "loss": 0.5017805480957032, "step": 7350 }, { "epoch": 0.8084252206670883, "eval_loss": 0.5771105289459229, "eval_runtime": 1.3868, "eval_samples_per_second": 72.106, "eval_steps_per_second": 12.258, "step": 7350 }, { "epoch": 0.8139247119641433, "grad_norm": 3.846862316131592, "learning_rate": 3.560581049851436e-05, "loss": 0.4925709915161133, "step": 7400 }, { "epoch": 0.8139247119641433, "eval_loss": 0.5872745513916016, "eval_runtime": 1.2193, "eval_samples_per_second": 82.016, "eval_steps_per_second": 13.943, "step": 7400 }, { "epoch": 0.8194242032611984, "grad_norm": 5.725467681884766, "learning_rate": 3.544073951799274e-05, "loss": 0.5305783081054688, "step": 7450 }, { "epoch": 0.8194242032611984, "eval_loss": 0.5858078002929688, "eval_runtime": 1.209, "eval_samples_per_second": 82.716, "eval_steps_per_second": 14.062, "step": 7450 }, { "epoch": 0.8249236945582533, "grad_norm": 5.1305766105651855, "learning_rate": 3.5275668537471114e-05, "loss": 0.49862171173095704, "step": 7500 }, { "epoch": 0.8249236945582533, "eval_loss": 0.5829967260360718, "eval_runtime": 1.2108, "eval_samples_per_second": 82.588, "eval_steps_per_second": 14.04, "step": 7500 }, { "epoch": 0.8304231858553084, "grad_norm": 3.6588644981384277, "learning_rate": 3.5110597556949486e-05, "loss": 0.47825916290283205, "step": 7550 }, { "epoch": 0.8304231858553084, "eval_loss": 0.6038760542869568, "eval_runtime": 1.2158, "eval_samples_per_second": 82.251, "eval_steps_per_second": 13.983, "step": 7550 }, { "epoch": 0.8359226771523635, "grad_norm": 4.205902576446533, "learning_rate": 3.4945526576427866e-05, "loss": 0.49293697357177735, "step": 7600 }, { "epoch": 0.8359226771523635, "eval_loss": 0.5801113843917847, "eval_runtime": 1.2352, "eval_samples_per_second": 80.957, "eval_steps_per_second": 13.763, "step": 7600 }, { "epoch": 0.8414221684494184, "grad_norm": 3.2005882263183594, "learning_rate": 3.478045559590624e-05, "loss": 0.4907111740112305, "step": 7650 }, { "epoch": 0.8414221684494184, "eval_loss": 0.5856965184211731, "eval_runtime": 1.2264, "eval_samples_per_second": 81.54, "eval_steps_per_second": 13.862, "step": 7650 }, { "epoch": 0.8469216597464735, "grad_norm": 5.1610636711120605, "learning_rate": 3.461538461538461e-05, "loss": 0.5118446731567383, "step": 7700 }, { "epoch": 0.8469216597464735, "eval_loss": 0.5943632125854492, "eval_runtime": 1.2029, "eval_samples_per_second": 83.135, "eval_steps_per_second": 14.133, "step": 7700 }, { "epoch": 0.8524211510435284, "grad_norm": 3.638803482055664, "learning_rate": 3.445031363486299e-05, "loss": 0.5173551559448242, "step": 7750 }, { "epoch": 0.8524211510435284, "eval_loss": 0.5883214473724365, "eval_runtime": 1.2146, "eval_samples_per_second": 82.334, "eval_steps_per_second": 13.997, "step": 7750 }, { "epoch": 0.8579206423405835, "grad_norm": 4.749381065368652, "learning_rate": 3.428524265434137e-05, "loss": 0.5153055953979492, "step": 7800 }, { "epoch": 0.8579206423405835, "eval_loss": 0.5808895230293274, "eval_runtime": 1.2469, "eval_samples_per_second": 80.201, "eval_steps_per_second": 13.634, "step": 7800 }, { "epoch": 0.8634201336376385, "grad_norm": 4.376150608062744, "learning_rate": 3.4120171673819744e-05, "loss": 0.5378147506713867, "step": 7850 }, { "epoch": 0.8634201336376385, "eval_loss": 0.5930312871932983, "eval_runtime": 1.3832, "eval_samples_per_second": 72.299, "eval_steps_per_second": 12.291, "step": 7850 }, { "epoch": 0.8689196249346935, "grad_norm": 4.232579708099365, "learning_rate": 3.395510069329812e-05, "loss": 0.505134048461914, "step": 7900 }, { "epoch": 0.8689196249346935, "eval_loss": 0.6020961999893188, "eval_runtime": 1.2142, "eval_samples_per_second": 82.356, "eval_steps_per_second": 14.0, "step": 7900 }, { "epoch": 0.8744191162317486, "grad_norm": 5.355160713195801, "learning_rate": 3.3790029712776497e-05, "loss": 0.5102433776855468, "step": 7950 }, { "epoch": 0.8744191162317486, "eval_loss": 0.5917235016822815, "eval_runtime": 1.206, "eval_samples_per_second": 82.917, "eval_steps_per_second": 14.096, "step": 7950 }, { "epoch": 0.8799186075288036, "grad_norm": 3.3613343238830566, "learning_rate": 3.3624958732254876e-05, "loss": 0.4822299194335937, "step": 8000 }, { "epoch": 0.8799186075288036, "eval_loss": 0.5934929251670837, "eval_runtime": 1.2112, "eval_samples_per_second": 82.566, "eval_steps_per_second": 14.036, "step": 8000 }, { "epoch": 0.8854180988258586, "grad_norm": 4.434471130371094, "learning_rate": 3.345988775173324e-05, "loss": 0.49528308868408205, "step": 8050 }, { "epoch": 0.8854180988258586, "eval_loss": 0.5964680314064026, "eval_runtime": 1.2137, "eval_samples_per_second": 82.39, "eval_steps_per_second": 14.006, "step": 8050 }, { "epoch": 0.8909175901229136, "grad_norm": 4.2046403884887695, "learning_rate": 3.329481677121162e-05, "loss": 0.48887725830078127, "step": 8100 }, { "epoch": 0.8909175901229136, "eval_loss": 0.5806313753128052, "eval_runtime": 1.2203, "eval_samples_per_second": 81.947, "eval_steps_per_second": 13.931, "step": 8100 }, { "epoch": 0.8964170814199687, "grad_norm": 4.626391410827637, "learning_rate": 3.312974579069e-05, "loss": 0.5233592987060547, "step": 8150 }, { "epoch": 0.8964170814199687, "eval_loss": 0.6079022884368896, "eval_runtime": 1.216, "eval_samples_per_second": 82.236, "eval_steps_per_second": 13.98, "step": 8150 }, { "epoch": 0.9019165727170236, "grad_norm": 4.376235008239746, "learning_rate": 3.2964674810168374e-05, "loss": 0.4639776611328125, "step": 8200 }, { "epoch": 0.9019165727170236, "eval_loss": 0.6205313205718994, "eval_runtime": 1.2055, "eval_samples_per_second": 82.955, "eval_steps_per_second": 14.102, "step": 8200 }, { "epoch": 0.9074160640140787, "grad_norm": 3.8218092918395996, "learning_rate": 3.279960382964675e-05, "loss": 0.44373504638671873, "step": 8250 }, { "epoch": 0.9074160640140787, "eval_loss": 0.5643773078918457, "eval_runtime": 1.2145, "eval_samples_per_second": 82.339, "eval_steps_per_second": 13.998, "step": 8250 }, { "epoch": 0.9129155553111338, "grad_norm": 3.81736159324646, "learning_rate": 3.263453284912513e-05, "loss": 0.48470027923583986, "step": 8300 }, { "epoch": 0.9129155553111338, "eval_loss": 0.5744062066078186, "eval_runtime": 1.2167, "eval_samples_per_second": 82.188, "eval_steps_per_second": 13.972, "step": 8300 }, { "epoch": 0.9184150466081887, "grad_norm": 5.86279296875, "learning_rate": 3.24694618686035e-05, "loss": 0.4852021408081055, "step": 8350 }, { "epoch": 0.9184150466081887, "eval_loss": 0.5889118313789368, "eval_runtime": 1.423, "eval_samples_per_second": 70.273, "eval_steps_per_second": 11.946, "step": 8350 }, { "epoch": 0.9239145379052438, "grad_norm": 3.33119535446167, "learning_rate": 3.230439088808188e-05, "loss": 0.47623142242431643, "step": 8400 }, { "epoch": 0.9239145379052438, "eval_loss": 0.6064158082008362, "eval_runtime": 1.204, "eval_samples_per_second": 83.056, "eval_steps_per_second": 14.119, "step": 8400 }, { "epoch": 0.9294140292022988, "grad_norm": 2.885103940963745, "learning_rate": 3.213931990756025e-05, "loss": 0.49996829986572267, "step": 8450 }, { "epoch": 0.9294140292022988, "eval_loss": 0.5843780040740967, "eval_runtime": 1.2023, "eval_samples_per_second": 83.174, "eval_steps_per_second": 14.14, "step": 8450 }, { "epoch": 0.9349135204993538, "grad_norm": 4.857532978057861, "learning_rate": 3.1974248927038625e-05, "loss": 0.47324295043945314, "step": 8500 }, { "epoch": 0.9349135204993538, "eval_loss": 0.6105228662490845, "eval_runtime": 1.2083, "eval_samples_per_second": 82.759, "eval_steps_per_second": 14.069, "step": 8500 }, { "epoch": 0.9404130117964088, "grad_norm": 3.946885108947754, "learning_rate": 3.1809177946517005e-05, "loss": 0.49978759765625, "step": 8550 }, { "epoch": 0.9404130117964088, "eval_loss": 0.5941745638847351, "eval_runtime": 1.2125, "eval_samples_per_second": 82.477, "eval_steps_per_second": 14.021, "step": 8550 }, { "epoch": 0.9459125030934639, "grad_norm": 4.021317005157471, "learning_rate": 3.164410696599538e-05, "loss": 0.528785514831543, "step": 8600 }, { "epoch": 0.9459125030934639, "eval_loss": 0.6242286562919617, "eval_runtime": 1.2102, "eval_samples_per_second": 82.628, "eval_steps_per_second": 14.047, "step": 8600 }, { "epoch": 0.9514119943905188, "grad_norm": 3.708808183670044, "learning_rate": 3.147903598547375e-05, "loss": 0.46576389312744143, "step": 8650 }, { "epoch": 0.9514119943905188, "eval_loss": 0.611571192741394, "eval_runtime": 1.204, "eval_samples_per_second": 83.055, "eval_steps_per_second": 14.119, "step": 8650 }, { "epoch": 0.9569114856875739, "grad_norm": 3.2899420261383057, "learning_rate": 3.131396500495213e-05, "loss": 0.46845787048339843, "step": 8700 }, { "epoch": 0.9569114856875739, "eval_loss": 0.6180684566497803, "eval_runtime": 1.212, "eval_samples_per_second": 82.506, "eval_steps_per_second": 14.026, "step": 8700 }, { "epoch": 0.962410976984629, "grad_norm": 5.375493049621582, "learning_rate": 3.114889402443051e-05, "loss": 0.4573846435546875, "step": 8750 }, { "epoch": 0.962410976984629, "eval_loss": 0.6240963935852051, "eval_runtime": 1.2083, "eval_samples_per_second": 82.759, "eval_steps_per_second": 14.069, "step": 8750 }, { "epoch": 0.9679104682816839, "grad_norm": 3.9251935482025146, "learning_rate": 3.0983823043908876e-05, "loss": 0.4789009094238281, "step": 8800 }, { "epoch": 0.9679104682816839, "eval_loss": 0.6151527762413025, "eval_runtime": 1.245, "eval_samples_per_second": 80.322, "eval_steps_per_second": 13.655, "step": 8800 }, { "epoch": 0.973409959578739, "grad_norm": 4.760181903839111, "learning_rate": 3.0818752063387256e-05, "loss": 0.4835487365722656, "step": 8850 }, { "epoch": 0.973409959578739, "eval_loss": 0.6076204776763916, "eval_runtime": 1.3823, "eval_samples_per_second": 72.341, "eval_steps_per_second": 12.298, "step": 8850 }, { "epoch": 0.978909450875794, "grad_norm": 4.721770763397217, "learning_rate": 3.0653681082865635e-05, "loss": 0.4760139083862305, "step": 8900 }, { "epoch": 0.978909450875794, "eval_loss": 0.6116940975189209, "eval_runtime": 1.2074, "eval_samples_per_second": 82.823, "eval_steps_per_second": 14.08, "step": 8900 }, { "epoch": 0.984408942172849, "grad_norm": 2.7520203590393066, "learning_rate": 3.0488610102344005e-05, "loss": 0.46280517578125, "step": 8950 }, { "epoch": 0.984408942172849, "eval_loss": 0.594266951084137, "eval_runtime": 1.2134, "eval_samples_per_second": 82.416, "eval_steps_per_second": 14.011, "step": 8950 }, { "epoch": 0.989908433469904, "grad_norm": 3.4478979110717773, "learning_rate": 3.0323539121822385e-05, "loss": 0.48518154144287107, "step": 9000 }, { "epoch": 0.989908433469904, "eval_loss": 0.6080638766288757, "eval_runtime": 1.2202, "eval_samples_per_second": 81.953, "eval_steps_per_second": 13.932, "step": 9000 }, { "epoch": 0.995407924766959, "grad_norm": 3.8885610103607178, "learning_rate": 3.015846814130076e-05, "loss": 0.4918204116821289, "step": 9050 }, { "epoch": 0.995407924766959, "eval_loss": 0.6131730079650879, "eval_runtime": 1.236, "eval_samples_per_second": 80.906, "eval_steps_per_second": 13.754, "step": 9050 }, { "epoch": 1.0008799186075288, "grad_norm": 3.4417338371276855, "learning_rate": 2.9993397160779137e-05, "loss": 0.4655106353759766, "step": 9100 }, { "epoch": 1.0008799186075288, "eval_loss": 0.6303781270980835, "eval_runtime": 1.2182, "eval_samples_per_second": 82.087, "eval_steps_per_second": 13.955, "step": 9100 }, { "epoch": 1.0063794099045837, "grad_norm": 4.042264461517334, "learning_rate": 2.982832618025751e-05, "loss": 0.4372904968261719, "step": 9150 }, { "epoch": 1.0063794099045837, "eval_loss": 0.6115362048149109, "eval_runtime": 1.2191, "eval_samples_per_second": 82.028, "eval_steps_per_second": 13.945, "step": 9150 }, { "epoch": 1.011878901201639, "grad_norm": 4.3367018699646, "learning_rate": 2.966325519973589e-05, "loss": 0.4454679489135742, "step": 9200 }, { "epoch": 1.011878901201639, "eval_loss": 0.598572850227356, "eval_runtime": 1.2205, "eval_samples_per_second": 81.932, "eval_steps_per_second": 13.928, "step": 9200 }, { "epoch": 1.0173783924986939, "grad_norm": 5.504449844360352, "learning_rate": 2.9498184219214262e-05, "loss": 0.4694999694824219, "step": 9250 }, { "epoch": 1.0173783924986939, "eval_loss": 0.5946099162101746, "eval_runtime": 1.2073, "eval_samples_per_second": 82.832, "eval_steps_per_second": 14.081, "step": 9250 }, { "epoch": 1.0228778837957488, "grad_norm": 5.267527103424072, "learning_rate": 2.933311323869264e-05, "loss": 0.44829036712646486, "step": 9300 }, { "epoch": 1.0228778837957488, "eval_loss": 0.596511960029602, "eval_runtime": 1.2164, "eval_samples_per_second": 82.213, "eval_steps_per_second": 13.976, "step": 9300 }, { "epoch": 1.028377375092804, "grad_norm": 2.8371832370758057, "learning_rate": 2.9168042258171015e-05, "loss": 0.4043942642211914, "step": 9350 }, { "epoch": 1.028377375092804, "eval_loss": 0.600749671459198, "eval_runtime": 1.2377, "eval_samples_per_second": 80.796, "eval_steps_per_second": 13.735, "step": 9350 }, { "epoch": 1.033876866389859, "grad_norm": 3.1648924350738525, "learning_rate": 2.9002971277649388e-05, "loss": 0.47807037353515625, "step": 9400 }, { "epoch": 1.033876866389859, "eval_loss": 0.6105673909187317, "eval_runtime": 1.2193, "eval_samples_per_second": 82.012, "eval_steps_per_second": 13.942, "step": 9400 }, { "epoch": 1.039376357686914, "grad_norm": 4.341183662414551, "learning_rate": 2.8837900297127767e-05, "loss": 0.4305224609375, "step": 9450 }, { "epoch": 1.039376357686914, "eval_loss": 0.5932527184486389, "eval_runtime": 1.2151, "eval_samples_per_second": 82.297, "eval_steps_per_second": 13.991, "step": 9450 }, { "epoch": 1.044875848983969, "grad_norm": 3.4657225608825684, "learning_rate": 2.867282931660614e-05, "loss": 0.3872489929199219, "step": 9500 }, { "epoch": 1.044875848983969, "eval_loss": 0.6022618412971497, "eval_runtime": 1.203, "eval_samples_per_second": 83.129, "eval_steps_per_second": 14.132, "step": 9500 }, { "epoch": 1.050375340281024, "grad_norm": 3.8219797611236572, "learning_rate": 2.8507758336084517e-05, "loss": 0.44281375885009766, "step": 9550 }, { "epoch": 1.050375340281024, "eval_loss": 0.5904479026794434, "eval_runtime": 1.1999, "eval_samples_per_second": 83.343, "eval_steps_per_second": 14.168, "step": 9550 }, { "epoch": 1.055874831578079, "grad_norm": 3.437319755554199, "learning_rate": 2.8342687355562893e-05, "loss": 0.453095703125, "step": 9600 }, { "epoch": 1.055874831578079, "eval_loss": 0.5905536413192749, "eval_runtime": 1.2019, "eval_samples_per_second": 83.203, "eval_steps_per_second": 14.144, "step": 9600 }, { "epoch": 1.061374322875134, "grad_norm": 5.347193241119385, "learning_rate": 2.817761637504127e-05, "loss": 0.4297781753540039, "step": 9650 }, { "epoch": 1.061374322875134, "eval_loss": 0.5929006338119507, "eval_runtime": 1.2006, "eval_samples_per_second": 83.292, "eval_steps_per_second": 14.16, "step": 9650 }, { "epoch": 1.066873814172189, "grad_norm": 3.720005750656128, "learning_rate": 2.8012545394519642e-05, "loss": 0.42318790435791015, "step": 9700 }, { "epoch": 1.066873814172189, "eval_loss": 0.5905603766441345, "eval_runtime": 1.2021, "eval_samples_per_second": 83.187, "eval_steps_per_second": 14.142, "step": 9700 }, { "epoch": 1.0723733054692441, "grad_norm": 4.219228267669678, "learning_rate": 2.784747441399802e-05, "loss": 0.4420646286010742, "step": 9750 }, { "epoch": 1.0723733054692441, "eval_loss": 0.5723536014556885, "eval_runtime": 1.2102, "eval_samples_per_second": 82.63, "eval_steps_per_second": 14.047, "step": 9750 }, { "epoch": 1.077872796766299, "grad_norm": 5.102869987487793, "learning_rate": 2.7682403433476395e-05, "loss": 0.44880119323730466, "step": 9800 }, { "epoch": 1.077872796766299, "eval_loss": 0.5921871662139893, "eval_runtime": 1.2009, "eval_samples_per_second": 83.271, "eval_steps_per_second": 14.156, "step": 9800 }, { "epoch": 1.083372288063354, "grad_norm": 4.417986869812012, "learning_rate": 2.751733245295477e-05, "loss": 0.43164543151855467, "step": 9850 }, { "epoch": 1.083372288063354, "eval_loss": 0.5745819211006165, "eval_runtime": 1.199, "eval_samples_per_second": 83.404, "eval_steps_per_second": 14.179, "step": 9850 }, { "epoch": 1.0888717793604092, "grad_norm": 4.315613746643066, "learning_rate": 2.7352261472433147e-05, "loss": 0.4114876937866211, "step": 9900 }, { "epoch": 1.0888717793604092, "eval_loss": 0.6222988367080688, "eval_runtime": 1.2039, "eval_samples_per_second": 83.064, "eval_steps_per_second": 14.121, "step": 9900 }, { "epoch": 1.0943712706574642, "grad_norm": 3.8662261962890625, "learning_rate": 2.7187190491911523e-05, "loss": 0.4395499420166016, "step": 9950 }, { "epoch": 1.0943712706574642, "eval_loss": 0.598095178604126, "eval_runtime": 1.2065, "eval_samples_per_second": 82.886, "eval_steps_per_second": 14.091, "step": 9950 }, { "epoch": 1.0998707619545192, "grad_norm": 4.77580451965332, "learning_rate": 2.70221195113899e-05, "loss": 0.4401175308227539, "step": 10000 }, { "epoch": 1.0998707619545192, "eval_loss": 0.6062231659889221, "eval_runtime": 1.1984, "eval_samples_per_second": 83.447, "eval_steps_per_second": 14.186, "step": 10000 }, { "epoch": 1.1053702532515741, "grad_norm": 5.308359146118164, "learning_rate": 2.6857048530868276e-05, "loss": 0.38489757537841796, "step": 10050 }, { "epoch": 1.1053702532515741, "eval_loss": 0.574999988079071, "eval_runtime": 1.1984, "eval_samples_per_second": 83.444, "eval_steps_per_second": 14.186, "step": 10050 }, { "epoch": 1.1108697445486293, "grad_norm": 3.92620587348938, "learning_rate": 2.669197755034665e-05, "loss": 0.445535888671875, "step": 10100 }, { "epoch": 1.1108697445486293, "eval_loss": 0.5968570113182068, "eval_runtime": 1.2009, "eval_samples_per_second": 83.268, "eval_steps_per_second": 14.156, "step": 10100 }, { "epoch": 1.1163692358456843, "grad_norm": 3.6382229328155518, "learning_rate": 2.652690656982503e-05, "loss": 0.43107017517089846, "step": 10150 }, { "epoch": 1.1163692358456843, "eval_loss": 0.6031837463378906, "eval_runtime": 1.1994, "eval_samples_per_second": 83.378, "eval_steps_per_second": 14.174, "step": 10150 }, { "epoch": 1.1218687271427392, "grad_norm": 5.4295148849487305, "learning_rate": 2.63618355893034e-05, "loss": 0.44390846252441407, "step": 10200 }, { "epoch": 1.1218687271427392, "eval_loss": 0.5818211436271667, "eval_runtime": 1.2017, "eval_samples_per_second": 83.212, "eval_steps_per_second": 14.146, "step": 10200 }, { "epoch": 1.1273682184397944, "grad_norm": 4.309296607971191, "learning_rate": 2.6196764608781774e-05, "loss": 0.45012378692626953, "step": 10250 }, { "epoch": 1.1273682184397944, "eval_loss": 0.5798439979553223, "eval_runtime": 1.2245, "eval_samples_per_second": 81.667, "eval_steps_per_second": 13.883, "step": 10250 }, { "epoch": 1.1328677097368494, "grad_norm": 4.410998821258545, "learning_rate": 2.6031693628260154e-05, "loss": 0.4658625411987305, "step": 10300 }, { "epoch": 1.1328677097368494, "eval_loss": 0.5707818865776062, "eval_runtime": 1.1991, "eval_samples_per_second": 83.396, "eval_steps_per_second": 14.177, "step": 10300 }, { "epoch": 1.1383672010339043, "grad_norm": 2.5657384395599365, "learning_rate": 2.5866622647738527e-05, "loss": 0.4424343490600586, "step": 10350 }, { "epoch": 1.1383672010339043, "eval_loss": 0.5677274465560913, "eval_runtime": 1.1985, "eval_samples_per_second": 83.439, "eval_steps_per_second": 14.185, "step": 10350 }, { "epoch": 1.1438666923309593, "grad_norm": 4.544326305389404, "learning_rate": 2.5701551667216903e-05, "loss": 0.4189057922363281, "step": 10400 }, { "epoch": 1.1438666923309593, "eval_loss": 0.5669907331466675, "eval_runtime": 1.2023, "eval_samples_per_second": 83.172, "eval_steps_per_second": 14.139, "step": 10400 }, { "epoch": 1.1493661836280145, "grad_norm": 4.390478134155273, "learning_rate": 2.553648068669528e-05, "loss": 0.44770816802978514, "step": 10450 }, { "epoch": 1.1493661836280145, "eval_loss": 0.5683467388153076, "eval_runtime": 1.1991, "eval_samples_per_second": 83.395, "eval_steps_per_second": 14.177, "step": 10450 }, { "epoch": 1.1548656749250694, "grad_norm": 3.9074809551239014, "learning_rate": 2.5371409706173655e-05, "loss": 0.4494611740112305, "step": 10500 }, { "epoch": 1.1548656749250694, "eval_loss": 0.5813124179840088, "eval_runtime": 1.1995, "eval_samples_per_second": 83.365, "eval_steps_per_second": 14.172, "step": 10500 }, { "epoch": 1.1603651662221244, "grad_norm": 3.1746835708618164, "learning_rate": 2.520633872565203e-05, "loss": 0.42440425872802734, "step": 10550 }, { "epoch": 1.1603651662221244, "eval_loss": 0.5736593008041382, "eval_runtime": 1.2009, "eval_samples_per_second": 83.272, "eval_steps_per_second": 14.156, "step": 10550 }, { "epoch": 1.1658646575191796, "grad_norm": 5.491518497467041, "learning_rate": 2.5041267745130408e-05, "loss": 0.4350612258911133, "step": 10600 }, { "epoch": 1.1658646575191796, "eval_loss": 0.57778000831604, "eval_runtime": 1.1993, "eval_samples_per_second": 83.38, "eval_steps_per_second": 14.175, "step": 10600 }, { "epoch": 1.1713641488162345, "grad_norm": 4.8435468673706055, "learning_rate": 2.487619676460878e-05, "loss": 0.4232054901123047, "step": 10650 }, { "epoch": 1.1713641488162345, "eval_loss": 0.5833326578140259, "eval_runtime": 1.1979, "eval_samples_per_second": 83.477, "eval_steps_per_second": 14.191, "step": 10650 }, { "epoch": 1.1768636401132895, "grad_norm": 5.074549674987793, "learning_rate": 2.471112578408716e-05, "loss": 0.45191131591796874, "step": 10700 }, { "epoch": 1.1768636401132895, "eval_loss": 0.5973538160324097, "eval_runtime": 1.2004, "eval_samples_per_second": 83.305, "eval_steps_per_second": 14.162, "step": 10700 }, { "epoch": 1.1823631314103444, "grad_norm": 3.509275436401367, "learning_rate": 2.4546054803565533e-05, "loss": 0.4495719528198242, "step": 10750 }, { "epoch": 1.1823631314103444, "eval_loss": 0.5876668095588684, "eval_runtime": 1.2029, "eval_samples_per_second": 83.13, "eval_steps_per_second": 14.132, "step": 10750 }, { "epoch": 1.1878626227073996, "grad_norm": 3.4657552242279053, "learning_rate": 2.438098382304391e-05, "loss": 0.4320774459838867, "step": 10800 }, { "epoch": 1.1878626227073996, "eval_loss": 0.5911355018615723, "eval_runtime": 1.2004, "eval_samples_per_second": 83.303, "eval_steps_per_second": 14.161, "step": 10800 }, { "epoch": 1.1933621140044546, "grad_norm": 3.424093008041382, "learning_rate": 2.4215912842522286e-05, "loss": 0.41817344665527345, "step": 10850 }, { "epoch": 1.1933621140044546, "eval_loss": 0.558462381362915, "eval_runtime": 1.2044, "eval_samples_per_second": 83.032, "eval_steps_per_second": 14.115, "step": 10850 }, { "epoch": 1.1988616053015095, "grad_norm": 5.278721332550049, "learning_rate": 2.4050841862000662e-05, "loss": 0.42692329406738283, "step": 10900 }, { "epoch": 1.1988616053015095, "eval_loss": 0.5609988570213318, "eval_runtime": 1.2061, "eval_samples_per_second": 82.911, "eval_steps_per_second": 14.095, "step": 10900 }, { "epoch": 1.2043610965985647, "grad_norm": 4.2132248878479, "learning_rate": 2.3885770881479035e-05, "loss": 0.4087539291381836, "step": 10950 }, { "epoch": 1.2043610965985647, "eval_loss": 0.5824187397956848, "eval_runtime": 1.2378, "eval_samples_per_second": 80.789, "eval_steps_per_second": 13.734, "step": 10950 }, { "epoch": 1.2098605878956197, "grad_norm": 4.436295509338379, "learning_rate": 2.3720699900957415e-05, "loss": 0.3884201812744141, "step": 11000 }, { "epoch": 1.2098605878956197, "eval_loss": 0.5735225677490234, "eval_runtime": 1.2641, "eval_samples_per_second": 79.108, "eval_steps_per_second": 13.448, "step": 11000 }, { "epoch": 1.2153600791926746, "grad_norm": 4.041130542755127, "learning_rate": 2.3555628920435788e-05, "loss": 0.3993444061279297, "step": 11050 }, { "epoch": 1.2153600791926746, "eval_loss": 0.5744249820709229, "eval_runtime": 1.2074, "eval_samples_per_second": 82.822, "eval_steps_per_second": 14.08, "step": 11050 }, { "epoch": 1.2208595704897296, "grad_norm": 4.301640510559082, "learning_rate": 2.3390557939914164e-05, "loss": 0.39464141845703127, "step": 11100 }, { "epoch": 1.2208595704897296, "eval_loss": 0.5948730111122131, "eval_runtime": 1.2581, "eval_samples_per_second": 79.487, "eval_steps_per_second": 13.513, "step": 11100 }, { "epoch": 1.2263590617867848, "grad_norm": 5.845645427703857, "learning_rate": 2.322548695939254e-05, "loss": 0.4228610610961914, "step": 11150 }, { "epoch": 1.2263590617867848, "eval_loss": 0.5744452476501465, "eval_runtime": 1.2349, "eval_samples_per_second": 80.975, "eval_steps_per_second": 13.766, "step": 11150 }, { "epoch": 1.2318585530838397, "grad_norm": 4.14743185043335, "learning_rate": 2.3060415978870913e-05, "loss": 0.43561710357666017, "step": 11200 }, { "epoch": 1.2318585530838397, "eval_loss": 0.5542231798171997, "eval_runtime": 1.2462, "eval_samples_per_second": 80.242, "eval_steps_per_second": 13.641, "step": 11200 }, { "epoch": 1.2373580443808947, "grad_norm": 4.9092607498168945, "learning_rate": 2.2895344998349293e-05, "loss": 0.4485149765014648, "step": 11250 }, { "epoch": 1.2373580443808947, "eval_loss": 0.5608264803886414, "eval_runtime": 1.2042, "eval_samples_per_second": 83.044, "eval_steps_per_second": 14.118, "step": 11250 }, { "epoch": 1.2428575356779499, "grad_norm": 4.795513153076172, "learning_rate": 2.2730274017827665e-05, "loss": 0.4002879333496094, "step": 11300 }, { "epoch": 1.2428575356779499, "eval_loss": 0.5752193927764893, "eval_runtime": 1.2005, "eval_samples_per_second": 83.3, "eval_steps_per_second": 14.161, "step": 11300 }, { "epoch": 1.2483570269750048, "grad_norm": 4.756551742553711, "learning_rate": 2.2565203037306042e-05, "loss": 0.4129877853393555, "step": 11350 }, { "epoch": 1.2483570269750048, "eval_loss": 0.5692643523216248, "eval_runtime": 1.202, "eval_samples_per_second": 83.198, "eval_steps_per_second": 14.144, "step": 11350 }, { "epoch": 1.2538565182720598, "grad_norm": 4.6832051277160645, "learning_rate": 2.2400132056784418e-05, "loss": 0.40815105438232424, "step": 11400 }, { "epoch": 1.2538565182720598, "eval_loss": 0.5672106742858887, "eval_runtime": 1.2026, "eval_samples_per_second": 83.153, "eval_steps_per_second": 14.136, "step": 11400 }, { "epoch": 1.2593560095691148, "grad_norm": 4.295003414154053, "learning_rate": 2.2235061076262794e-05, "loss": 0.43860099792480467, "step": 11450 }, { "epoch": 1.2593560095691148, "eval_loss": 0.5500693321228027, "eval_runtime": 1.1996, "eval_samples_per_second": 83.363, "eval_steps_per_second": 14.172, "step": 11450 }, { "epoch": 1.26485550086617, "grad_norm": 3.2815680503845215, "learning_rate": 2.2069990095741167e-05, "loss": 0.39200534820556643, "step": 11500 }, { "epoch": 1.26485550086617, "eval_loss": 0.5783631801605225, "eval_runtime": 1.2001, "eval_samples_per_second": 83.324, "eval_steps_per_second": 14.165, "step": 11500 }, { "epoch": 1.270354992163225, "grad_norm": 5.105454921722412, "learning_rate": 2.1904919115219547e-05, "loss": 0.447188606262207, "step": 11550 }, { "epoch": 1.270354992163225, "eval_loss": 0.5806690454483032, "eval_runtime": 1.2018, "eval_samples_per_second": 83.21, "eval_steps_per_second": 14.146, "step": 11550 }, { "epoch": 1.2758544834602799, "grad_norm": 7.1614580154418945, "learning_rate": 2.173984813469792e-05, "loss": 0.4186487579345703, "step": 11600 }, { "epoch": 1.2758544834602799, "eval_loss": 0.5866115689277649, "eval_runtime": 1.2043, "eval_samples_per_second": 83.036, "eval_steps_per_second": 14.116, "step": 11600 }, { "epoch": 1.281353974757335, "grad_norm": 3.8269095420837402, "learning_rate": 2.1574777154176296e-05, "loss": 0.38072307586669923, "step": 11650 }, { "epoch": 1.281353974757335, "eval_loss": 0.5898852944374084, "eval_runtime": 1.2117, "eval_samples_per_second": 82.525, "eval_steps_per_second": 14.029, "step": 11650 }, { "epoch": 1.28685346605439, "grad_norm": 4.064493179321289, "learning_rate": 2.1409706173654672e-05, "loss": 0.4382596206665039, "step": 11700 }, { "epoch": 1.28685346605439, "eval_loss": 0.5848357677459717, "eval_runtime": 1.1999, "eval_samples_per_second": 83.34, "eval_steps_per_second": 14.168, "step": 11700 }, { "epoch": 1.292352957351445, "grad_norm": 5.449599742889404, "learning_rate": 2.124463519313305e-05, "loss": 0.42343997955322266, "step": 11750 }, { "epoch": 1.292352957351445, "eval_loss": 0.5586597323417664, "eval_runtime": 1.2023, "eval_samples_per_second": 83.172, "eval_steps_per_second": 14.139, "step": 11750 }, { "epoch": 1.2978524486485, "grad_norm": 3.673954725265503, "learning_rate": 2.107956421261142e-05, "loss": 0.41550613403320313, "step": 11800 }, { "epoch": 1.2978524486485, "eval_loss": 0.5658605694770813, "eval_runtime": 1.1991, "eval_samples_per_second": 83.399, "eval_steps_per_second": 14.178, "step": 11800 }, { "epoch": 1.303351939945555, "grad_norm": 3.6161746978759766, "learning_rate": 2.09144932320898e-05, "loss": 0.4265287780761719, "step": 11850 }, { "epoch": 1.303351939945555, "eval_loss": 0.5512486100196838, "eval_runtime": 1.2044, "eval_samples_per_second": 83.029, "eval_steps_per_second": 14.115, "step": 11850 }, { "epoch": 1.30885143124261, "grad_norm": 4.095085620880127, "learning_rate": 2.0749422251568174e-05, "loss": 0.44609962463378905, "step": 11900 }, { "epoch": 1.30885143124261, "eval_loss": 0.5730013847351074, "eval_runtime": 1.2017, "eval_samples_per_second": 83.215, "eval_steps_per_second": 14.147, "step": 11900 }, { "epoch": 1.314350922539665, "grad_norm": 4.820618152618408, "learning_rate": 2.0584351271046554e-05, "loss": 0.4422262191772461, "step": 11950 }, { "epoch": 1.314350922539665, "eval_loss": 0.5577285289764404, "eval_runtime": 1.1984, "eval_samples_per_second": 83.443, "eval_steps_per_second": 14.185, "step": 11950 }, { "epoch": 1.3198504138367202, "grad_norm": 3.5373456478118896, "learning_rate": 2.0419280290524926e-05, "loss": 0.42433460235595705, "step": 12000 }, { "epoch": 1.3198504138367202, "eval_loss": 0.5625931024551392, "eval_runtime": 1.1987, "eval_samples_per_second": 83.422, "eval_steps_per_second": 14.182, "step": 12000 }, { "epoch": 1.3253499051337752, "grad_norm": 4.760179042816162, "learning_rate": 2.0254209310003303e-05, "loss": 0.3792121887207031, "step": 12050 }, { "epoch": 1.3253499051337752, "eval_loss": 0.5574110746383667, "eval_runtime": 1.2015, "eval_samples_per_second": 83.233, "eval_steps_per_second": 14.15, "step": 12050 }, { "epoch": 1.3308493964308301, "grad_norm": 5.790397644042969, "learning_rate": 2.008913832948168e-05, "loss": 0.4382122039794922, "step": 12100 }, { "epoch": 1.3308493964308301, "eval_loss": 0.5597708225250244, "eval_runtime": 1.2092, "eval_samples_per_second": 82.703, "eval_steps_per_second": 14.059, "step": 12100 }, { "epoch": 1.336348887727885, "grad_norm": 4.420812606811523, "learning_rate": 1.9924067348960052e-05, "loss": 0.42329288482666017, "step": 12150 }, { "epoch": 1.336348887727885, "eval_loss": 0.5556257367134094, "eval_runtime": 1.1986, "eval_samples_per_second": 83.431, "eval_steps_per_second": 14.183, "step": 12150 }, { "epoch": 1.3418483790249403, "grad_norm": 4.655048370361328, "learning_rate": 1.9758996368438428e-05, "loss": 0.4278908920288086, "step": 12200 }, { "epoch": 1.3418483790249403, "eval_loss": 0.543867290019989, "eval_runtime": 1.1984, "eval_samples_per_second": 83.442, "eval_steps_per_second": 14.185, "step": 12200 }, { "epoch": 1.3473478703219952, "grad_norm": 4.914540767669678, "learning_rate": 1.9593925387916804e-05, "loss": 0.42110458374023435, "step": 12250 }, { "epoch": 1.3473478703219952, "eval_loss": 0.5576221346855164, "eval_runtime": 1.2024, "eval_samples_per_second": 83.17, "eval_steps_per_second": 14.139, "step": 12250 }, { "epoch": 1.3528473616190502, "grad_norm": 3.613415002822876, "learning_rate": 1.942885440739518e-05, "loss": 0.408565788269043, "step": 12300 }, { "epoch": 1.3528473616190502, "eval_loss": 0.5335881114006042, "eval_runtime": 1.1993, "eval_samples_per_second": 83.383, "eval_steps_per_second": 14.175, "step": 12300 }, { "epoch": 1.3583468529161054, "grad_norm": 4.228052616119385, "learning_rate": 1.9263783426873553e-05, "loss": 0.40878799438476565, "step": 12350 }, { "epoch": 1.3583468529161054, "eval_loss": 0.5544968247413635, "eval_runtime": 1.2063, "eval_samples_per_second": 82.896, "eval_steps_per_second": 14.092, "step": 12350 }, { "epoch": 1.3638463442131603, "grad_norm": 3.1512410640716553, "learning_rate": 1.9098712446351933e-05, "loss": 0.40386688232421875, "step": 12400 }, { "epoch": 1.3638463442131603, "eval_loss": 0.5391093492507935, "eval_runtime": 1.206, "eval_samples_per_second": 82.92, "eval_steps_per_second": 14.096, "step": 12400 }, { "epoch": 1.3693458355102153, "grad_norm": 4.095332145690918, "learning_rate": 1.8933641465830306e-05, "loss": 0.4119942092895508, "step": 12450 }, { "epoch": 1.3693458355102153, "eval_loss": 0.5375053286552429, "eval_runtime": 1.1993, "eval_samples_per_second": 83.383, "eval_steps_per_second": 14.175, "step": 12450 }, { "epoch": 1.3748453268072702, "grad_norm": 4.36025333404541, "learning_rate": 1.8768570485308686e-05, "loss": 0.42032379150390625, "step": 12500 }, { "epoch": 1.3748453268072702, "eval_loss": 0.5409677624702454, "eval_runtime": 1.1988, "eval_samples_per_second": 83.417, "eval_steps_per_second": 14.181, "step": 12500 }, { "epoch": 1.3803448181043254, "grad_norm": 3.8784241676330566, "learning_rate": 1.860349950478706e-05, "loss": 0.3923546600341797, "step": 12550 }, { "epoch": 1.3803448181043254, "eval_loss": 0.5505947470664978, "eval_runtime": 1.2002, "eval_samples_per_second": 83.318, "eval_steps_per_second": 14.164, "step": 12550 }, { "epoch": 1.3858443094013804, "grad_norm": 4.052207946777344, "learning_rate": 1.8438428524265435e-05, "loss": 0.38611976623535155, "step": 12600 }, { "epoch": 1.3858443094013804, "eval_loss": 0.5389760732650757, "eval_runtime": 1.2026, "eval_samples_per_second": 83.155, "eval_steps_per_second": 14.136, "step": 12600 }, { "epoch": 1.3913438006984353, "grad_norm": 5.018970489501953, "learning_rate": 1.827335754374381e-05, "loss": 0.4026565933227539, "step": 12650 }, { "epoch": 1.3913438006984353, "eval_loss": 0.5398291945457458, "eval_runtime": 1.2079, "eval_samples_per_second": 82.791, "eval_steps_per_second": 14.074, "step": 12650 }, { "epoch": 1.3968432919954905, "grad_norm": 3.710087537765503, "learning_rate": 1.8108286563222187e-05, "loss": 0.4165144729614258, "step": 12700 }, { "epoch": 1.3968432919954905, "eval_loss": 0.5442482233047485, "eval_runtime": 1.2705, "eval_samples_per_second": 78.709, "eval_steps_per_second": 13.381, "step": 12700 }, { "epoch": 1.4023427832925455, "grad_norm": 4.182759761810303, "learning_rate": 1.794321558270056e-05, "loss": 0.3919545745849609, "step": 12750 }, { "epoch": 1.4023427832925455, "eval_loss": 0.5415162444114685, "eval_runtime": 1.2788, "eval_samples_per_second": 78.199, "eval_steps_per_second": 13.294, "step": 12750 }, { "epoch": 1.4078422745896004, "grad_norm": 4.3373870849609375, "learning_rate": 1.777814460217894e-05, "loss": 0.40383522033691405, "step": 12800 }, { "epoch": 1.4078422745896004, "eval_loss": 0.5278663635253906, "eval_runtime": 1.2779, "eval_samples_per_second": 78.256, "eval_steps_per_second": 13.304, "step": 12800 }, { "epoch": 1.4133417658866554, "grad_norm": 3.619389533996582, "learning_rate": 1.7613073621657313e-05, "loss": 0.44847320556640624, "step": 12850 }, { "epoch": 1.4133417658866554, "eval_loss": 0.5374107360839844, "eval_runtime": 1.2797, "eval_samples_per_second": 78.145, "eval_steps_per_second": 13.285, "step": 12850 }, { "epoch": 1.4188412571837106, "grad_norm": 3.119107246398926, "learning_rate": 1.744800264113569e-05, "loss": 0.39309986114501955, "step": 12900 }, { "epoch": 1.4188412571837106, "eval_loss": 0.5523837804794312, "eval_runtime": 1.278, "eval_samples_per_second": 78.245, "eval_steps_per_second": 13.302, "step": 12900 }, { "epoch": 1.4243407484807655, "grad_norm": 3.7152740955352783, "learning_rate": 1.7282931660614065e-05, "loss": 0.42365001678466796, "step": 12950 }, { "epoch": 1.4243407484807655, "eval_loss": 0.5404840707778931, "eval_runtime": 1.2774, "eval_samples_per_second": 78.282, "eval_steps_per_second": 13.308, "step": 12950 }, { "epoch": 1.4298402397778205, "grad_norm": 4.347856521606445, "learning_rate": 1.7117860680092438e-05, "loss": 0.39466506958007813, "step": 13000 }, { "epoch": 1.4298402397778205, "eval_loss": 0.5432237386703491, "eval_runtime": 1.2709, "eval_samples_per_second": 78.687, "eval_steps_per_second": 13.377, "step": 13000 }, { "epoch": 1.4353397310748757, "grad_norm": 4.440253257751465, "learning_rate": 1.6952789699570814e-05, "loss": 0.4289556121826172, "step": 13050 }, { "epoch": 1.4353397310748757, "eval_loss": 0.5323364734649658, "eval_runtime": 1.1995, "eval_samples_per_second": 83.369, "eval_steps_per_second": 14.173, "step": 13050 }, { "epoch": 1.4408392223719306, "grad_norm": 4.130159854888916, "learning_rate": 1.678771871904919e-05, "loss": 0.4275970458984375, "step": 13100 }, { "epoch": 1.4408392223719306, "eval_loss": 0.5353785157203674, "eval_runtime": 1.2118, "eval_samples_per_second": 82.52, "eval_steps_per_second": 14.028, "step": 13100 }, { "epoch": 1.4463387136689856, "grad_norm": 3.5807628631591797, "learning_rate": 1.6622647738527567e-05, "loss": 0.414808464050293, "step": 13150 }, { "epoch": 1.4463387136689856, "eval_loss": 0.5167968273162842, "eval_runtime": 1.2016, "eval_samples_per_second": 83.223, "eval_steps_per_second": 14.148, "step": 13150 }, { "epoch": 1.4518382049660405, "grad_norm": 3.19081449508667, "learning_rate": 1.6457576758005943e-05, "loss": 0.4333197021484375, "step": 13200 }, { "epoch": 1.4518382049660405, "eval_loss": 0.5306875109672546, "eval_runtime": 1.2826, "eval_samples_per_second": 77.965, "eval_steps_per_second": 13.254, "step": 13200 }, { "epoch": 1.4573376962630957, "grad_norm": 3.25466251373291, "learning_rate": 1.629250577748432e-05, "loss": 0.39129966735839844, "step": 13250 }, { "epoch": 1.4573376962630957, "eval_loss": 0.5385807752609253, "eval_runtime": 1.282, "eval_samples_per_second": 78.006, "eval_steps_per_second": 13.261, "step": 13250 }, { "epoch": 1.4628371875601507, "grad_norm": 3.3677966594696045, "learning_rate": 1.6127434796962692e-05, "loss": 0.40751338958740235, "step": 13300 }, { "epoch": 1.4628371875601507, "eval_loss": 0.516380250453949, "eval_runtime": 1.2802, "eval_samples_per_second": 78.112, "eval_steps_per_second": 13.279, "step": 13300 }, { "epoch": 1.4683366788572056, "grad_norm": 3.450413465499878, "learning_rate": 1.5962363816441072e-05, "loss": 0.40498565673828124, "step": 13350 }, { "epoch": 1.4683366788572056, "eval_loss": 0.5298721194267273, "eval_runtime": 1.2815, "eval_samples_per_second": 78.034, "eval_steps_per_second": 13.266, "step": 13350 }, { "epoch": 1.4738361701542608, "grad_norm": 3.3262946605682373, "learning_rate": 1.5797292835919445e-05, "loss": 0.3863627243041992, "step": 13400 }, { "epoch": 1.4738361701542608, "eval_loss": 0.516625165939331, "eval_runtime": 1.2809, "eval_samples_per_second": 78.067, "eval_steps_per_second": 13.271, "step": 13400 }, { "epoch": 1.4793356614513158, "grad_norm": 3.365875720977783, "learning_rate": 1.563222185539782e-05, "loss": 0.4204134750366211, "step": 13450 }, { "epoch": 1.4793356614513158, "eval_loss": 0.5206517577171326, "eval_runtime": 1.2817, "eval_samples_per_second": 78.02, "eval_steps_per_second": 13.263, "step": 13450 }, { "epoch": 1.4848351527483707, "grad_norm": 3.2131149768829346, "learning_rate": 1.5467150874876197e-05, "loss": 0.40632450103759765, "step": 13500 }, { "epoch": 1.4848351527483707, "eval_loss": 0.5308406949043274, "eval_runtime": 1.2811, "eval_samples_per_second": 78.057, "eval_steps_per_second": 13.27, "step": 13500 }, { "epoch": 1.4903346440454257, "grad_norm": 3.364225387573242, "learning_rate": 1.5302079894354574e-05, "loss": 0.4048501205444336, "step": 13550 }, { "epoch": 1.4903346440454257, "eval_loss": 0.52863609790802, "eval_runtime": 1.2813, "eval_samples_per_second": 78.044, "eval_steps_per_second": 13.268, "step": 13550 }, { "epoch": 1.4958341353424809, "grad_norm": 3.1679489612579346, "learning_rate": 1.5137008913832946e-05, "loss": 0.4006618881225586, "step": 13600 }, { "epoch": 1.4958341353424809, "eval_loss": 0.517315149307251, "eval_runtime": 1.2806, "eval_samples_per_second": 78.087, "eval_steps_per_second": 13.275, "step": 13600 }, { "epoch": 1.5013336266395358, "grad_norm": 4.6463518142700195, "learning_rate": 1.4971937933311324e-05, "loss": 0.4259402847290039, "step": 13650 }, { "epoch": 1.5013336266395358, "eval_loss": 0.5239192843437195, "eval_runtime": 1.2834, "eval_samples_per_second": 77.921, "eval_steps_per_second": 13.246, "step": 13650 }, { "epoch": 1.506833117936591, "grad_norm": 3.8338677883148193, "learning_rate": 1.4806866952789699e-05, "loss": 0.45359893798828127, "step": 13700 }, { "epoch": 1.506833117936591, "eval_loss": 0.5376471877098083, "eval_runtime": 1.1985, "eval_samples_per_second": 83.437, "eval_steps_per_second": 14.184, "step": 13700 }, { "epoch": 1.512332609233646, "grad_norm": 4.828174114227295, "learning_rate": 1.4641795972268075e-05, "loss": 0.4245915985107422, "step": 13750 }, { "epoch": 1.512332609233646, "eval_loss": 0.545063853263855, "eval_runtime": 1.2015, "eval_samples_per_second": 83.226, "eval_steps_per_second": 14.148, "step": 13750 }, { "epoch": 1.517832100530701, "grad_norm": 4.063199996948242, "learning_rate": 1.4476724991746452e-05, "loss": 0.42612323760986326, "step": 13800 }, { "epoch": 1.517832100530701, "eval_loss": 0.5337764620780945, "eval_runtime": 1.2015, "eval_samples_per_second": 83.227, "eval_steps_per_second": 14.149, "step": 13800 }, { "epoch": 1.523331591827756, "grad_norm": 4.409724235534668, "learning_rate": 1.4311654011224828e-05, "loss": 0.4229386138916016, "step": 13850 }, { "epoch": 1.523331591827756, "eval_loss": 0.5254413485527039, "eval_runtime": 1.2114, "eval_samples_per_second": 82.546, "eval_steps_per_second": 14.033, "step": 13850 }, { "epoch": 1.5288310831248109, "grad_norm": 4.604098320007324, "learning_rate": 1.4146583030703202e-05, "loss": 0.4207559967041016, "step": 13900 }, { "epoch": 1.5288310831248109, "eval_loss": 0.5319836139678955, "eval_runtime": 1.2009, "eval_samples_per_second": 83.273, "eval_steps_per_second": 14.156, "step": 13900 }, { "epoch": 1.5343305744218658, "grad_norm": 3.5800247192382812, "learning_rate": 1.3981512050181579e-05, "loss": 0.4052052307128906, "step": 13950 }, { "epoch": 1.5343305744218658, "eval_loss": 0.5325583815574646, "eval_runtime": 1.2085, "eval_samples_per_second": 82.747, "eval_steps_per_second": 14.067, "step": 13950 }, { "epoch": 1.539830065718921, "grad_norm": 4.180997371673584, "learning_rate": 1.3816441069659955e-05, "loss": 0.41810825347900393, "step": 14000 }, { "epoch": 1.539830065718921, "eval_loss": 0.5244957804679871, "eval_runtime": 1.1981, "eval_samples_per_second": 83.464, "eval_steps_per_second": 14.189, "step": 14000 }, { "epoch": 1.5453295570159762, "grad_norm": 4.035894393920898, "learning_rate": 1.365137008913833e-05, "loss": 0.4168061065673828, "step": 14050 }, { "epoch": 1.5453295570159762, "eval_loss": 0.5245411396026611, "eval_runtime": 1.1978, "eval_samples_per_second": 83.485, "eval_steps_per_second": 14.192, "step": 14050 }, { "epoch": 1.5508290483130311, "grad_norm": 2.8827695846557617, "learning_rate": 1.3486299108616706e-05, "loss": 0.40900135040283203, "step": 14100 }, { "epoch": 1.5508290483130311, "eval_loss": 0.5175855755805969, "eval_runtime": 1.2709, "eval_samples_per_second": 78.686, "eval_steps_per_second": 13.377, "step": 14100 }, { "epoch": 1.556328539610086, "grad_norm": 4.7631516456604, "learning_rate": 1.3321228128095082e-05, "loss": 0.4275320434570313, "step": 14150 }, { "epoch": 1.556328539610086, "eval_loss": 0.5145242214202881, "eval_runtime": 1.2206, "eval_samples_per_second": 81.93, "eval_steps_per_second": 13.928, "step": 14150 }, { "epoch": 1.561828030907141, "grad_norm": 4.559270858764648, "learning_rate": 1.3156157147573458e-05, "loss": 0.3759859848022461, "step": 14200 }, { "epoch": 1.561828030907141, "eval_loss": 0.5150010585784912, "eval_runtime": 1.1982, "eval_samples_per_second": 83.457, "eval_steps_per_second": 14.188, "step": 14200 }, { "epoch": 1.567327522204196, "grad_norm": 3.3630456924438477, "learning_rate": 1.2991086167051833e-05, "loss": 0.39138256072998046, "step": 14250 }, { "epoch": 1.567327522204196, "eval_loss": 0.5457283854484558, "eval_runtime": 1.2043, "eval_samples_per_second": 83.038, "eval_steps_per_second": 14.116, "step": 14250 }, { "epoch": 1.572827013501251, "grad_norm": 3.256690740585327, "learning_rate": 1.2826015186530209e-05, "loss": 0.3982016372680664, "step": 14300 }, { "epoch": 1.572827013501251, "eval_loss": 0.5194215774536133, "eval_runtime": 1.2004, "eval_samples_per_second": 83.303, "eval_steps_per_second": 14.161, "step": 14300 }, { "epoch": 1.5783265047983062, "grad_norm": 4.9264020919799805, "learning_rate": 1.2660944206008584e-05, "loss": 0.37310329437255857, "step": 14350 }, { "epoch": 1.5783265047983062, "eval_loss": 0.537217915058136, "eval_runtime": 1.2037, "eval_samples_per_second": 83.077, "eval_steps_per_second": 14.123, "step": 14350 }, { "epoch": 1.5838259960953613, "grad_norm": 3.917881965637207, "learning_rate": 1.2495873225486958e-05, "loss": 0.40028915405273435, "step": 14400 }, { "epoch": 1.5838259960953613, "eval_loss": 0.5212844014167786, "eval_runtime": 1.2024, "eval_samples_per_second": 83.166, "eval_steps_per_second": 14.138, "step": 14400 }, { "epoch": 1.5893254873924163, "grad_norm": 3.8361563682556152, "learning_rate": 1.2330802244965334e-05, "loss": 0.40108360290527345, "step": 14450 }, { "epoch": 1.5893254873924163, "eval_loss": 0.5083942413330078, "eval_runtime": 1.2046, "eval_samples_per_second": 83.018, "eval_steps_per_second": 14.113, "step": 14450 }, { "epoch": 1.5948249786894713, "grad_norm": 3.184602737426758, "learning_rate": 1.216573126444371e-05, "loss": 0.4339041519165039, "step": 14500 }, { "epoch": 1.5948249786894713, "eval_loss": 0.5342686176300049, "eval_runtime": 1.2031, "eval_samples_per_second": 83.12, "eval_steps_per_second": 14.13, "step": 14500 }, { "epoch": 1.6003244699865262, "grad_norm": 4.491968154907227, "learning_rate": 1.2000660283922087e-05, "loss": 0.3967703628540039, "step": 14550 }, { "epoch": 1.6003244699865262, "eval_loss": 0.520110547542572, "eval_runtime": 1.2023, "eval_samples_per_second": 83.17, "eval_steps_per_second": 14.139, "step": 14550 }, { "epoch": 1.6058239612835812, "grad_norm": 3.78524112701416, "learning_rate": 1.1835589303400462e-05, "loss": 0.3790835189819336, "step": 14600 }, { "epoch": 1.6058239612835812, "eval_loss": 0.5195483565330505, "eval_runtime": 1.2016, "eval_samples_per_second": 83.223, "eval_steps_per_second": 14.148, "step": 14600 }, { "epoch": 1.6113234525806361, "grad_norm": 4.135509014129639, "learning_rate": 1.1670518322878838e-05, "loss": 0.40242374420166016, "step": 14650 }, { "epoch": 1.6113234525806361, "eval_loss": 0.516440212726593, "eval_runtime": 1.2033, "eval_samples_per_second": 83.105, "eval_steps_per_second": 14.128, "step": 14650 }, { "epoch": 1.6168229438776913, "grad_norm": 4.210612773895264, "learning_rate": 1.1505447342357214e-05, "loss": 0.4028606414794922, "step": 14700 }, { "epoch": 1.6168229438776913, "eval_loss": 0.5266108512878418, "eval_runtime": 1.2087, "eval_samples_per_second": 82.733, "eval_steps_per_second": 14.065, "step": 14700 }, { "epoch": 1.6223224351747465, "grad_norm": 5.338522911071777, "learning_rate": 1.1340376361835589e-05, "loss": 0.39550567626953126, "step": 14750 }, { "epoch": 1.6223224351747465, "eval_loss": 0.5249260663986206, "eval_runtime": 1.2038, "eval_samples_per_second": 83.073, "eval_steps_per_second": 14.122, "step": 14750 }, { "epoch": 1.6278219264718015, "grad_norm": 2.723923921585083, "learning_rate": 1.1175305381313965e-05, "loss": 0.41064441680908204, "step": 14800 }, { "epoch": 1.6278219264718015, "eval_loss": 0.520072877407074, "eval_runtime": 1.2005, "eval_samples_per_second": 83.302, "eval_steps_per_second": 14.161, "step": 14800 }, { "epoch": 1.6333214177688564, "grad_norm": 3.793158531188965, "learning_rate": 1.1010234400792341e-05, "loss": 0.38922351837158203, "step": 14850 }, { "epoch": 1.6333214177688564, "eval_loss": 0.5236958861351013, "eval_runtime": 1.2009, "eval_samples_per_second": 83.269, "eval_steps_per_second": 14.156, "step": 14850 }, { "epoch": 1.6388209090659114, "grad_norm": 5.206042766571045, "learning_rate": 1.0845163420270717e-05, "loss": 0.3783760070800781, "step": 14900 }, { "epoch": 1.6388209090659114, "eval_loss": 0.5220252871513367, "eval_runtime": 1.2755, "eval_samples_per_second": 78.399, "eval_steps_per_second": 13.328, "step": 14900 }, { "epoch": 1.6443204003629663, "grad_norm": 3.5335276126861572, "learning_rate": 1.0680092439749092e-05, "loss": 0.36626754760742186, "step": 14950 }, { "epoch": 1.6443204003629663, "eval_loss": 0.5257189869880676, "eval_runtime": 1.2584, "eval_samples_per_second": 79.467, "eval_steps_per_second": 13.509, "step": 14950 }, { "epoch": 1.6498198916600213, "grad_norm": 5.903299331665039, "learning_rate": 1.0515021459227468e-05, "loss": 0.4300186538696289, "step": 15000 }, { "epoch": 1.6498198916600213, "eval_loss": 0.5119779109954834, "eval_runtime": 1.2824, "eval_samples_per_second": 77.977, "eval_steps_per_second": 13.256, "step": 15000 }, { "epoch": 1.6553193829570765, "grad_norm": 4.042174339294434, "learning_rate": 1.0349950478705845e-05, "loss": 0.4231399154663086, "step": 15050 }, { "epoch": 1.6553193829570765, "eval_loss": 0.5127305388450623, "eval_runtime": 1.2793, "eval_samples_per_second": 78.169, "eval_steps_per_second": 13.289, "step": 15050 }, { "epoch": 1.6608188742541314, "grad_norm": 4.595501899719238, "learning_rate": 1.018487949818422e-05, "loss": 0.3916609573364258, "step": 15100 }, { "epoch": 1.6608188742541314, "eval_loss": 0.5223040580749512, "eval_runtime": 1.2795, "eval_samples_per_second": 78.156, "eval_steps_per_second": 13.286, "step": 15100 }, { "epoch": 1.6663183655511866, "grad_norm": 4.4538798332214355, "learning_rate": 1.0019808517662595e-05, "loss": 0.4184587860107422, "step": 15150 }, { "epoch": 1.6663183655511866, "eval_loss": 0.534669041633606, "eval_runtime": 1.2782, "eval_samples_per_second": 78.233, "eval_steps_per_second": 13.3, "step": 15150 }, { "epoch": 1.6718178568482416, "grad_norm": 3.8044581413269043, "learning_rate": 9.854737537140972e-06, "loss": 0.39158470153808594, "step": 15200 }, { "epoch": 1.6718178568482416, "eval_loss": 0.5418866872787476, "eval_runtime": 1.2799, "eval_samples_per_second": 78.131, "eval_steps_per_second": 13.282, "step": 15200 }, { "epoch": 1.6773173481452965, "grad_norm": 2.9677321910858154, "learning_rate": 9.689666556619348e-06, "loss": 0.43468849182128905, "step": 15250 }, { "epoch": 1.6773173481452965, "eval_loss": 0.526294469833374, "eval_runtime": 1.2805, "eval_samples_per_second": 78.096, "eval_steps_per_second": 13.276, "step": 15250 }, { "epoch": 1.6828168394423515, "grad_norm": 3.6569182872772217, "learning_rate": 9.52459557609772e-06, "loss": 0.4084419631958008, "step": 15300 }, { "epoch": 1.6828168394423515, "eval_loss": 0.5179707407951355, "eval_runtime": 1.2802, "eval_samples_per_second": 78.114, "eval_steps_per_second": 13.279, "step": 15300 }, { "epoch": 1.6883163307394065, "grad_norm": 4.213144302368164, "learning_rate": 9.359524595576097e-06, "loss": 0.40570945739746095, "step": 15350 }, { "epoch": 1.6883163307394065, "eval_loss": 0.523230791091919, "eval_runtime": 1.2787, "eval_samples_per_second": 78.203, "eval_steps_per_second": 13.294, "step": 15350 }, { "epoch": 1.6938158220364616, "grad_norm": 4.362399578094482, "learning_rate": 9.194453615054473e-06, "loss": 0.40546306610107424, "step": 15400 }, { "epoch": 1.6938158220364616, "eval_loss": 0.5279385447502136, "eval_runtime": 1.2871, "eval_samples_per_second": 77.697, "eval_steps_per_second": 13.208, "step": 15400 }, { "epoch": 1.6993153133335166, "grad_norm": 5.424959182739258, "learning_rate": 9.02938263453285e-06, "loss": 0.39811588287353517, "step": 15450 }, { "epoch": 1.6993153133335166, "eval_loss": 0.538982093334198, "eval_runtime": 1.3011, "eval_samples_per_second": 76.856, "eval_steps_per_second": 13.065, "step": 15450 }, { "epoch": 1.7048148046305718, "grad_norm": 3.6755897998809814, "learning_rate": 8.864311654011224e-06, "loss": 0.4292662811279297, "step": 15500 }, { "epoch": 1.7048148046305718, "eval_loss": 0.5277052521705627, "eval_runtime": 1.2769, "eval_samples_per_second": 78.312, "eval_steps_per_second": 13.313, "step": 15500 }, { "epoch": 1.7103142959276267, "grad_norm": 3.7990050315856934, "learning_rate": 8.6992406734896e-06, "loss": 0.38744674682617186, "step": 15550 }, { "epoch": 1.7103142959276267, "eval_loss": 0.5234823226928711, "eval_runtime": 1.2814, "eval_samples_per_second": 78.04, "eval_steps_per_second": 13.267, "step": 15550 }, { "epoch": 1.7158137872246817, "grad_norm": 5.55524206161499, "learning_rate": 8.534169692967977e-06, "loss": 0.39183277130126953, "step": 15600 }, { "epoch": 1.7158137872246817, "eval_loss": 0.5209484100341797, "eval_runtime": 1.2795, "eval_samples_per_second": 78.157, "eval_steps_per_second": 13.287, "step": 15600 }, { "epoch": 1.7213132785217367, "grad_norm": 4.018246173858643, "learning_rate": 8.369098712446351e-06, "loss": 0.4041017532348633, "step": 15650 }, { "epoch": 1.7213132785217367, "eval_loss": 0.526258111000061, "eval_runtime": 1.2793, "eval_samples_per_second": 78.17, "eval_steps_per_second": 13.289, "step": 15650 }, { "epoch": 1.7268127698187916, "grad_norm": 4.710935592651367, "learning_rate": 8.204027731924728e-06, "loss": 0.3836952209472656, "step": 15700 }, { "epoch": 1.7268127698187916, "eval_loss": 0.5209237933158875, "eval_runtime": 1.279, "eval_samples_per_second": 78.187, "eval_steps_per_second": 13.292, "step": 15700 }, { "epoch": 1.7323122611158468, "grad_norm": 3.7639029026031494, "learning_rate": 8.038956751403104e-06, "loss": 0.3907876968383789, "step": 15750 }, { "epoch": 1.7323122611158468, "eval_loss": 0.5245873928070068, "eval_runtime": 1.2785, "eval_samples_per_second": 78.214, "eval_steps_per_second": 13.296, "step": 15750 }, { "epoch": 1.7378117524129018, "grad_norm": 3.944993257522583, "learning_rate": 7.87388577088148e-06, "loss": 0.3886819839477539, "step": 15800 }, { "epoch": 1.7378117524129018, "eval_loss": 0.5302055478096008, "eval_runtime": 1.2805, "eval_samples_per_second": 78.095, "eval_steps_per_second": 13.276, "step": 15800 }, { "epoch": 1.743311243709957, "grad_norm": 3.7543132305145264, "learning_rate": 7.708814790359855e-06, "loss": 0.4201182174682617, "step": 15850 }, { "epoch": 1.743311243709957, "eval_loss": 0.5063754320144653, "eval_runtime": 1.2803, "eval_samples_per_second": 78.105, "eval_steps_per_second": 13.278, "step": 15850 }, { "epoch": 1.748810735007012, "grad_norm": 2.934755325317383, "learning_rate": 7.543743809838231e-06, "loss": 0.3904559326171875, "step": 15900 }, { "epoch": 1.748810735007012, "eval_loss": 0.5102057456970215, "eval_runtime": 1.2789, "eval_samples_per_second": 78.19, "eval_steps_per_second": 13.292, "step": 15900 }, { "epoch": 1.7543102263040669, "grad_norm": 4.1210246086120605, "learning_rate": 7.378672829316606e-06, "loss": 0.3794166946411133, "step": 15950 }, { "epoch": 1.7543102263040669, "eval_loss": 0.5126526355743408, "eval_runtime": 1.2826, "eval_samples_per_second": 77.967, "eval_steps_per_second": 13.254, "step": 15950 }, { "epoch": 1.7598097176011218, "grad_norm": 3.7067854404449463, "learning_rate": 7.213601848794982e-06, "loss": 0.3692531967163086, "step": 16000 }, { "epoch": 1.7598097176011218, "eval_loss": 0.5274832248687744, "eval_runtime": 1.2797, "eval_samples_per_second": 78.143, "eval_steps_per_second": 13.284, "step": 16000 }, { "epoch": 1.7653092088981768, "grad_norm": 3.6420602798461914, "learning_rate": 7.048530868273357e-06, "loss": 0.3824466705322266, "step": 16050 }, { "epoch": 1.7653092088981768, "eval_loss": 0.5196187496185303, "eval_runtime": 1.2795, "eval_samples_per_second": 78.158, "eval_steps_per_second": 13.287, "step": 16050 }, { "epoch": 1.770808700195232, "grad_norm": 4.638594150543213, "learning_rate": 6.883459887751733e-06, "loss": 0.4514438629150391, "step": 16100 }, { "epoch": 1.770808700195232, "eval_loss": 0.5215907096862793, "eval_runtime": 1.2805, "eval_samples_per_second": 78.097, "eval_steps_per_second": 13.277, "step": 16100 }, { "epoch": 1.776308191492287, "grad_norm": 3.9953904151916504, "learning_rate": 6.718388907230109e-06, "loss": 0.387623176574707, "step": 16150 }, { "epoch": 1.776308191492287, "eval_loss": 0.5224502682685852, "eval_runtime": 1.2817, "eval_samples_per_second": 78.022, "eval_steps_per_second": 13.264, "step": 16150 }, { "epoch": 1.781807682789342, "grad_norm": 4.487403869628906, "learning_rate": 6.553317926708485e-06, "loss": 0.4063478088378906, "step": 16200 }, { "epoch": 1.781807682789342, "eval_loss": 0.5166334509849548, "eval_runtime": 1.277, "eval_samples_per_second": 78.307, "eval_steps_per_second": 13.312, "step": 16200 }, { "epoch": 1.787307174086397, "grad_norm": 3.7964556217193604, "learning_rate": 6.3882469461868605e-06, "loss": 0.3855398559570313, "step": 16250 }, { "epoch": 1.787307174086397, "eval_loss": 0.5154201984405518, "eval_runtime": 1.2833, "eval_samples_per_second": 77.926, "eval_steps_per_second": 13.247, "step": 16250 }, { "epoch": 1.792806665383452, "grad_norm": 4.513696193695068, "learning_rate": 6.223175965665237e-06, "loss": 0.3669796371459961, "step": 16300 }, { "epoch": 1.792806665383452, "eval_loss": 0.5084086656570435, "eval_runtime": 1.28, "eval_samples_per_second": 78.125, "eval_steps_per_second": 13.281, "step": 16300 }, { "epoch": 1.798306156680507, "grad_norm": 3.982877254486084, "learning_rate": 6.058104985143612e-06, "loss": 0.38849113464355467, "step": 16350 }, { "epoch": 1.798306156680507, "eval_loss": 0.5200368762016296, "eval_runtime": 1.2802, "eval_samples_per_second": 78.112, "eval_steps_per_second": 13.279, "step": 16350 }, { "epoch": 1.803805647977562, "grad_norm": 3.997793436050415, "learning_rate": 5.8930340046219876e-06, "loss": 0.39702865600585935, "step": 16400 }, { "epoch": 1.803805647977562, "eval_loss": 0.5119373798370361, "eval_runtime": 1.283, "eval_samples_per_second": 77.941, "eval_steps_per_second": 13.25, "step": 16400 }, { "epoch": 1.8093051392746171, "grad_norm": 3.6325302124023438, "learning_rate": 5.727963024100363e-06, "loss": 0.37990386962890627, "step": 16450 }, { "epoch": 1.8093051392746171, "eval_loss": 0.5215651988983154, "eval_runtime": 1.2798, "eval_samples_per_second": 78.139, "eval_steps_per_second": 13.284, "step": 16450 }, { "epoch": 1.814804630571672, "grad_norm": 4.198485374450684, "learning_rate": 5.562892043578738e-06, "loss": 0.412078857421875, "step": 16500 }, { "epoch": 1.814804630571672, "eval_loss": 0.5170506238937378, "eval_runtime": 1.2894, "eval_samples_per_second": 77.558, "eval_steps_per_second": 13.185, "step": 16500 }, { "epoch": 1.8203041218687273, "grad_norm": 4.591159820556641, "learning_rate": 5.397821063057115e-06, "loss": 0.37816055297851564, "step": 16550 }, { "epoch": 1.8203041218687273, "eval_loss": 0.5147603750228882, "eval_runtime": 1.2799, "eval_samples_per_second": 78.134, "eval_steps_per_second": 13.283, "step": 16550 }, { "epoch": 1.8258036131657822, "grad_norm": 4.216943264007568, "learning_rate": 5.23275008253549e-06, "loss": 0.39028087615966794, "step": 16600 }, { "epoch": 1.8258036131657822, "eval_loss": 0.5204047560691833, "eval_runtime": 1.2795, "eval_samples_per_second": 78.156, "eval_steps_per_second": 13.286, "step": 16600 }, { "epoch": 1.8313031044628372, "grad_norm": 4.006322383880615, "learning_rate": 5.067679102013866e-06, "loss": 0.38647769927978515, "step": 16650 }, { "epoch": 1.8313031044628372, "eval_loss": 0.5153352618217468, "eval_runtime": 1.279, "eval_samples_per_second": 78.184, "eval_steps_per_second": 13.291, "step": 16650 }, { "epoch": 1.8368025957598921, "grad_norm": 4.710324287414551, "learning_rate": 4.902608121492242e-06, "loss": 0.356781005859375, "step": 16700 }, { "epoch": 1.8368025957598921, "eval_loss": 0.5207862257957458, "eval_runtime": 1.2799, "eval_samples_per_second": 78.134, "eval_steps_per_second": 13.283, "step": 16700 }, { "epoch": 1.842302087056947, "grad_norm": 4.920437812805176, "learning_rate": 4.737537140970618e-06, "loss": 0.37074081420898436, "step": 16750 }, { "epoch": 1.842302087056947, "eval_loss": 0.5112919807434082, "eval_runtime": 1.2801, "eval_samples_per_second": 78.118, "eval_steps_per_second": 13.28, "step": 16750 }, { "epoch": 1.8478015783540023, "grad_norm": 4.515045166015625, "learning_rate": 4.5724661604489934e-06, "loss": 0.4274590301513672, "step": 16800 }, { "epoch": 1.8478015783540023, "eval_loss": 0.5242478847503662, "eval_runtime": 1.279, "eval_samples_per_second": 78.188, "eval_steps_per_second": 13.292, "step": 16800 }, { "epoch": 1.8533010696510572, "grad_norm": 3.6244614124298096, "learning_rate": 4.40739517992737e-06, "loss": 0.3897795867919922, "step": 16850 }, { "epoch": 1.8533010696510572, "eval_loss": 0.5210970044136047, "eval_runtime": 1.2792, "eval_samples_per_second": 78.176, "eval_steps_per_second": 13.29, "step": 16850 }, { "epoch": 1.8588005609481124, "grad_norm": 4.448500633239746, "learning_rate": 4.242324199405744e-06, "loss": 0.43310935974121095, "step": 16900 }, { "epoch": 1.8588005609481124, "eval_loss": 0.5130022764205933, "eval_runtime": 1.2867, "eval_samples_per_second": 77.716, "eval_steps_per_second": 13.212, "step": 16900 }, { "epoch": 1.8643000522451674, "grad_norm": 5.259810924530029, "learning_rate": 4.07725321888412e-06, "loss": 0.4260225677490234, "step": 16950 }, { "epoch": 1.8643000522451674, "eval_loss": 0.5134211778640747, "eval_runtime": 1.2967, "eval_samples_per_second": 77.117, "eval_steps_per_second": 13.11, "step": 16950 }, { "epoch": 1.8697995435422223, "grad_norm": 4.863224983215332, "learning_rate": 3.912182238362496e-06, "loss": 0.3758648681640625, "step": 17000 }, { "epoch": 1.8697995435422223, "eval_loss": 0.5177444219589233, "eval_runtime": 1.28, "eval_samples_per_second": 78.125, "eval_steps_per_second": 13.281, "step": 17000 }, { "epoch": 1.8752990348392773, "grad_norm": 4.33119535446167, "learning_rate": 3.747111257840872e-06, "loss": 0.3959685516357422, "step": 17050 }, { "epoch": 1.8752990348392773, "eval_loss": 0.5147886872291565, "eval_runtime": 1.2779, "eval_samples_per_second": 78.252, "eval_steps_per_second": 13.303, "step": 17050 }, { "epoch": 1.8807985261363322, "grad_norm": 4.343754768371582, "learning_rate": 3.582040277319247e-06, "loss": 0.3876182556152344, "step": 17100 }, { "epoch": 1.8807985261363322, "eval_loss": 0.5101519227027893, "eval_runtime": 1.2814, "eval_samples_per_second": 78.041, "eval_steps_per_second": 13.267, "step": 17100 }, { "epoch": 1.8862980174333874, "grad_norm": 4.579135894775391, "learning_rate": 3.416969296797623e-06, "loss": 0.3915593338012695, "step": 17150 }, { "epoch": 1.8862980174333874, "eval_loss": 0.5131881833076477, "eval_runtime": 1.3052, "eval_samples_per_second": 76.615, "eval_steps_per_second": 13.025, "step": 17150 }, { "epoch": 1.8917975087304424, "grad_norm": 4.940543174743652, "learning_rate": 3.251898316275999e-06, "loss": 0.38781646728515623, "step": 17200 }, { "epoch": 1.8917975087304424, "eval_loss": 0.514817476272583, "eval_runtime": 1.2836, "eval_samples_per_second": 77.907, "eval_steps_per_second": 13.244, "step": 17200 }, { "epoch": 1.8972970000274976, "grad_norm": 5.684414386749268, "learning_rate": 3.0868273357543743e-06, "loss": 0.40284725189208986, "step": 17250 }, { "epoch": 1.8972970000274976, "eval_loss": 0.5099514126777649, "eval_runtime": 1.3521, "eval_samples_per_second": 73.959, "eval_steps_per_second": 12.573, "step": 17250 }, { "epoch": 1.9027964913245525, "grad_norm": 4.87332820892334, "learning_rate": 2.92175635523275e-06, "loss": 0.40561714172363283, "step": 17300 }, { "epoch": 1.9027964913245525, "eval_loss": 0.5140570402145386, "eval_runtime": 1.2856, "eval_samples_per_second": 77.787, "eval_steps_per_second": 13.224, "step": 17300 }, { "epoch": 1.9082959826216075, "grad_norm": 4.406585216522217, "learning_rate": 2.756685374711126e-06, "loss": 0.4014255523681641, "step": 17350 }, { "epoch": 1.9082959826216075, "eval_loss": 0.5200029611587524, "eval_runtime": 1.2949, "eval_samples_per_second": 77.224, "eval_steps_per_second": 13.128, "step": 17350 }, { "epoch": 1.9137954739186624, "grad_norm": 3.8450374603271484, "learning_rate": 2.591614394189502e-06, "loss": 0.3946284103393555, "step": 17400 }, { "epoch": 1.9137954739186624, "eval_loss": 0.5157837867736816, "eval_runtime": 1.2818, "eval_samples_per_second": 78.013, "eval_steps_per_second": 13.262, "step": 17400 }, { "epoch": 1.9192949652157174, "grad_norm": 2.9785866737365723, "learning_rate": 2.4265434136678772e-06, "loss": 0.38735130310058596, "step": 17450 }, { "epoch": 1.9192949652157174, "eval_loss": 0.5129509568214417, "eval_runtime": 1.2915, "eval_samples_per_second": 77.427, "eval_steps_per_second": 13.163, "step": 17450 }, { "epoch": 1.9247944565127726, "grad_norm": 4.774247646331787, "learning_rate": 2.2614724331462527e-06, "loss": 0.3915607452392578, "step": 17500 }, { "epoch": 1.9247944565127726, "eval_loss": 0.512159526348114, "eval_runtime": 1.3529, "eval_samples_per_second": 73.915, "eval_steps_per_second": 12.566, "step": 17500 }, { "epoch": 1.9302939478098275, "grad_norm": 3.1161727905273438, "learning_rate": 2.0964014526246285e-06, "loss": 0.3839557647705078, "step": 17550 }, { "epoch": 1.9302939478098275, "eval_loss": 0.5124543905258179, "eval_runtime": 1.3002, "eval_samples_per_second": 76.909, "eval_steps_per_second": 13.075, "step": 17550 }, { "epoch": 1.9357934391068827, "grad_norm": 4.420716762542725, "learning_rate": 1.9313304721030043e-06, "loss": 0.4010445022583008, "step": 17600 }, { "epoch": 1.9357934391068827, "eval_loss": 0.5172660946846008, "eval_runtime": 1.2925, "eval_samples_per_second": 77.37, "eval_steps_per_second": 13.153, "step": 17600 }, { "epoch": 1.9412929304039377, "grad_norm": 4.979782581329346, "learning_rate": 1.76625949158138e-06, "loss": 0.3870741653442383, "step": 17650 }, { "epoch": 1.9412929304039377, "eval_loss": 0.5163105130195618, "eval_runtime": 1.2824, "eval_samples_per_second": 77.978, "eval_steps_per_second": 13.256, "step": 17650 }, { "epoch": 1.9467924217009926, "grad_norm": 5.315701484680176, "learning_rate": 1.6011885110597558e-06, "loss": 0.3857357406616211, "step": 17700 }, { "epoch": 1.9467924217009926, "eval_loss": 0.5164580345153809, "eval_runtime": 1.2821, "eval_samples_per_second": 77.995, "eval_steps_per_second": 13.259, "step": 17700 }, { "epoch": 1.9522919129980476, "grad_norm": 3.6524667739868164, "learning_rate": 1.4361175305381314e-06, "loss": 0.42781547546386717, "step": 17750 }, { "epoch": 1.9522919129980476, "eval_loss": 0.5149794816970825, "eval_runtime": 1.3408, "eval_samples_per_second": 74.583, "eval_steps_per_second": 12.679, "step": 17750 }, { "epoch": 1.9577914042951026, "grad_norm": 4.06256103515625, "learning_rate": 1.2710465500165073e-06, "loss": 0.380059700012207, "step": 17800 }, { "epoch": 1.9577914042951026, "eval_loss": 0.5115500688552856, "eval_runtime": 1.3186, "eval_samples_per_second": 75.841, "eval_steps_per_second": 12.893, "step": 17800 }, { "epoch": 1.9632908955921577, "grad_norm": 3.9045357704162598, "learning_rate": 1.1059755694948827e-06, "loss": 0.38892536163330077, "step": 17850 }, { "epoch": 1.9632908955921577, "eval_loss": 0.5084894895553589, "eval_runtime": 1.2809, "eval_samples_per_second": 78.07, "eval_steps_per_second": 13.272, "step": 17850 }, { "epoch": 1.9687903868892127, "grad_norm": 4.216691970825195, "learning_rate": 9.409045889732585e-07, "loss": 0.40333850860595705, "step": 17900 }, { "epoch": 1.9687903868892127, "eval_loss": 0.5091243982315063, "eval_runtime": 1.3023, "eval_samples_per_second": 76.788, "eval_steps_per_second": 13.054, "step": 17900 }, { "epoch": 1.9742898781862679, "grad_norm": 4.339031219482422, "learning_rate": 7.758336084516343e-07, "loss": 0.41892166137695314, "step": 17950 }, { "epoch": 1.9742898781862679, "eval_loss": 0.5089672207832336, "eval_runtime": 1.3698, "eval_samples_per_second": 73.001, "eval_steps_per_second": 12.41, "step": 17950 }, { "epoch": 1.9797893694833228, "grad_norm": 5.501232147216797, "learning_rate": 6.107626279300099e-07, "loss": 0.38524158477783205, "step": 18000 }, { "epoch": 1.9797893694833228, "eval_loss": 0.5088917016983032, "eval_runtime": 1.3056, "eval_samples_per_second": 76.593, "eval_steps_per_second": 13.021, "step": 18000 }, { "epoch": 1.9852888607803778, "grad_norm": 4.044425010681152, "learning_rate": 4.456916474083856e-07, "loss": 0.36035297393798826, "step": 18050 }, { "epoch": 1.9852888607803778, "eval_loss": 0.50870680809021, "eval_runtime": 1.2937, "eval_samples_per_second": 77.298, "eval_steps_per_second": 13.141, "step": 18050 }, { "epoch": 1.9907883520774328, "grad_norm": 3.8273727893829346, "learning_rate": 2.8062066688676135e-07, "loss": 0.3866265869140625, "step": 18100 }, { "epoch": 1.9907883520774328, "eval_loss": 0.5090622901916504, "eval_runtime": 1.2874, "eval_samples_per_second": 77.679, "eval_steps_per_second": 13.205, "step": 18100 }, { "epoch": 1.9962878433744877, "grad_norm": 5.9300537109375, "learning_rate": 1.15549686365137e-07, "loss": 0.3838529586791992, "step": 18150 }, { "epoch": 1.9962878433744877, "eval_loss": 0.5087066292762756, "eval_runtime": 1.2885, "eval_samples_per_second": 77.61, "eval_steps_per_second": 13.194, "step": 18150 } ], "logging_steps": 50, "max_steps": 18184, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.6375279506569626e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }