wjbmattingly commited on
Commit
b91bac2
·
verified ·
1 Parent(s): 6668d59

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,193 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ language:
3
+ - cu
4
+ - orv
5
+ license: apache-2.0
6
+ library_name: transformers
7
+ base_model: lightonai/LightOnOCR-2-1B-base
8
+ tags:
9
+ - ocr
10
+ - old-church-slavonic
11
+ - ocs
12
+ - manuscript
13
+ - vision-language
14
+ - lightonocr
15
+ - document-understanding
16
+ datasets:
17
+ - CATMuS/medieval
18
+ pipeline_tag: image-text-to-text
19
+ ---
20
+
21
+ # LightOnOCR-2-1B for Old Church Slavonic (Line-Level)
22
+
23
+ <p align="center">
24
+ <img src="https://huggingface.co/lightonai/LightOnOCR-2-1B-base/resolve/main/lightonocr-banner.png" alt="LightOnOCR Banner" width="600"/>
25
+ </p>
26
+
27
+ This model is a **fine-tuned version of [lightonai/LightOnOCR-2-1B-base](https://huggingface.co/lightonai/LightOnOCR-2-1B-base)** specifically trained for **line-level OCR** of Old Church Slavonic (OCS) manuscripts.
28
+
29
+ ## Model Description
30
+
31
+ - **Base Model:** [lightonai/LightOnOCR-2-1B-base](https://huggingface.co/lightonai/LightOnOCR-2-1B-base)
32
+ - **Training Data:** [CATMuS/medieval](https://huggingface.co/datasets/CATMuS/medieval)
33
+ - **Task:** Line-level text transcription from manuscript images
34
+ - **Language:** Old Church Slavonic (cu/orv)
35
+ - **Architecture:** Vision-Language Model (1B parameters)
36
+
37
+ This is a **line-level model** - it expects cropped line images as input, not full pages. Each image should contain a single line of text.
38
+
39
+ ## Evaluation Results
40
+
41
+ Evaluated on 50 samples from the test set:
42
+
43
+ | Metric | Base Model | **Finetuned** | Improvement |
44
+ |--------|------------|---------------|-------------|
45
+ | CER (%) | 194.75 | **41.93** | +152.82 |
46
+ | WER (%) | 218.38 | **70.19** | +148.19 |
47
+ | Perfect Matches | 0 | **4** | +4 |
48
+
49
+ *Lower CER/WER is better. Higher perfect matches is better.*
50
+
51
+ ### Example Outputs
52
+
53
+ | # | Ground Truth | Base Model | **Finetuned** |
54
+ |---|--------------|------------|---------------|
55
+ | 1 | dos cartas anios: de un deuor Esta carta... | | cas casas duesa de iom esas apos fue fre... |
56
+ | 2 | cl̃igo de yung̃ra. Et yo Maran gañz esc... | | T̾tore te N̾um̃m. Et coa delapto h̃oꝵ aͣ... |
57
+ | 3 | ssegũd q̃ enella diçe. Siño q̃l qͥer ... | | |
58
+ | 4 | consseiõ ⁊ con otorgamiento dela Reyna ... | | |
59
+ | 5 | tos ⁊ con todas sus ꝑtenençias ⁊ con to... | তত্ত্ব ন এম সোলার নীতি যুক্তিমানতা ন এম ... | tõt ⁊ en tõtas sus prenengas ⁊ en tõtas ... |
60
+
61
+ *✓ = exact match*
62
+
63
+ ## Usage
64
+
65
+ ### Installation
66
+
67
+ ```bash
68
+ # Requires transformers from source
69
+ pip install git+https://github.com/huggingface/transformers
70
+ pip install pillow torch
71
+ ```
72
+
73
+ ### Python Usage
74
+
75
+ ```python
76
+ import torch
77
+ from transformers import LightOnOcrForConditionalGeneration, LightOnOcrProcessor
78
+ from PIL import Image
79
+
80
+ # Load model and processor
81
+ model_id = "wjbmattingly/LightOnOCR-2-1B-catmus"
82
+ device = "cuda" if torch.cuda.is_available() else "cpu"
83
+ dtype = torch.bfloat16 if device == "cuda" else torch.float32
84
+
85
+ processor = LightOnOcrProcessor.from_pretrained(model_id)
86
+ model = LightOnOcrForConditionalGeneration.from_pretrained(
87
+ model_id,
88
+ torch_dtype=dtype,
89
+ ).to(device)
90
+
91
+ # Load your line image
92
+ image = Image.open("your_line_image.jpg").convert("RGB")
93
+
94
+ # Prepare input
95
+ messages = [{"role": "user", "content": [{"type": "image"}]}]
96
+ text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
97
+
98
+ inputs = processor(
99
+ text=[text],
100
+ images=[[image]],
101
+ return_tensors="pt",
102
+ padding=True,
103
+ size={"longest_edge": 700},
104
+ ).to(device)
105
+ inputs["pixel_values"] = inputs["pixel_values"].to(dtype)
106
+
107
+ # Generate transcription
108
+ with torch.no_grad():
109
+ outputs = model.generate(**inputs, max_new_tokens=256, do_sample=False)
110
+
111
+ # Decode output
112
+ input_length = inputs["input_ids"].shape[1]
113
+ generated_ids = outputs[0, input_length:]
114
+ transcription = processor.decode(generated_ids, skip_special_tokens=True)
115
+
116
+ print(transcription)
117
+ # Example output: дьници въсиꙗють рєчє сл҃нцє ꙗко лоуна∙ ꙗко
118
+ ```
119
+
120
+ ### Batch Inference
121
+
122
+ ```python
123
+ from datasets import load_dataset
124
+
125
+ # Load dataset
126
+ dataset = load_dataset("CATMuS/medieval", split="train[:10]")
127
+
128
+ # Process batch
129
+ images = [[img.convert("RGB")] for img in dataset["image"]]
130
+ messages = [{"role": "user", "content": [{"type": "image"}]}]
131
+ text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
132
+ texts = [text] * len(images)
133
+
134
+ inputs = processor(
135
+ text=texts,
136
+ images=images,
137
+ return_tensors="pt",
138
+ padding=True,
139
+ size={"longest_edge": 700},
140
+ ).to(device)
141
+ inputs["pixel_values"] = inputs["pixel_values"].to(dtype)
142
+
143
+ outputs = model.generate(**inputs, max_new_tokens=256, do_sample=False)
144
+ predictions = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)
145
+
146
+ for pred, gt in zip(predictions, dataset["text"]):
147
+ print(f"Prediction: {pred}")
148
+ print(f"Ground Truth: {gt}")
149
+ print()
150
+ ```
151
+
152
+ ## Training Details
153
+
154
+ - **Base Model:** [lightonai/LightOnOCR-2-1B-base](https://huggingface.co/lightonai/LightOnOCR-2-1B-base)
155
+ - **Training Method:** Fine-tuning with frozen language model backbone
156
+ - **Optimizer:** AdamW (fused)
157
+ - **Learning Rate:** 6e-5 with linear decay
158
+ - **Precision:** bfloat16
159
+
160
+ ## Limitations
161
+
162
+ - This model is trained on **line-level images** only. For full-page transcription, you need to first segment the page into individual lines.
163
+ - Performance may vary on manuscript styles not represented in the training data.
164
+ - Old Church Slavonic has many abbreviations and special characters that may require domain-specific post-processing.
165
+
166
+ ## Citation
167
+
168
+ If you use this model, please cite:
169
+
170
+ ```bibtex
171
+ @misc{lightonocr2_ocs_2026,
172
+ title = {LightOnOCR Fine-tuned for Old Church Slavonic},
173
+ author = {William Mattingly},
174
+ year = {2026},
175
+ howpublished = {\url{https://huggingface.co/wjbmattingly/LightOnOCR-2-1B-catmus}}
176
+ }
177
+ ```
178
+
179
+ And the original LightOnOCR paper:
180
+
181
+ ```bibtex
182
+ @misc{lightonocr2_2026,
183
+ title = {LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR},
184
+ author = {Said Taghadouini and Adrien Cavaill\`{e}s and Baptiste Aubertin},
185
+ year = {2026},
186
+ howpublished = {\url{https://arxiv.org/pdf/2601.14251}}
187
+ }
188
+ ```
189
+
190
+ ## Acknowledgments
191
+
192
+ - [LightOn AI](https://www.lighton.ai/) for the excellent LightOnOCR base model
193
+ - The creators of the Old Church Slavonic dataset
adapter_config.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "lightonai/LightOnOCR-2-1B-base",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 16,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": null,
25
+ "peft_type": "LORA",
26
+ "peft_version": "0.18.1",
27
+ "qalora_group_size": 16,
28
+ "r": 8,
29
+ "rank_pattern": {},
30
+ "revision": null,
31
+ "target_modules": [
32
+ "o_proj",
33
+ "gate_proj",
34
+ "up_proj",
35
+ "down_proj"
36
+ ],
37
+ "target_parameters": null,
38
+ "task_type": "CAUSAL_LM",
39
+ "trainable_token_indices": null,
40
+ "use_dora": false,
41
+ "use_qalora": false,
42
+ "use_rslora": false
43
+ }
adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:933ec05c7e79009cbbd02c4f3e78d23680d4991fcbe3287fe28a5d3be666a235
3
+ size 27195864
chat_template.jinja ADDED
@@ -0,0 +1,26 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {% set image_count = namespace(value=0) %}
2
+ {% for message in messages %}
3
+ {% if loop.first and message['role'] != 'system' %}
4
+ <|im_start|>system<|im_end|>
5
+ {% endif %}
6
+ <|im_start|>{{ message['role'] }}
7
+ {% if message['content'] is string %}
8
+ {{ message['content'] }}<|im_end|>
9
+ {% else %}
10
+ {% for content in message['content'] %}
11
+ {% if content['type'] == 'image' or 'image' in content or 'image_url' in content %}
12
+ {% set image_count.value = image_count.value + 1 %}
13
+ {% if add_vision_id %}
14
+ Picture {{ image_count.value }}:
15
+ {% endif -%}
16
+ <|image_pad|>
17
+ {%- elif 'text' in content %}
18
+ {{ content['text'] }}
19
+ {% endif %}
20
+ {% endfor %}
21
+ <|im_end|>
22
+ {% endif %}
23
+ {% endfor %}
24
+ {% if add_generation_prompt %}
25
+ <|im_start|>assistant
26
+ {% endif %}
optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4445e0e9a16aadae19a633cd6cde22dd5e5766c581278f1cd6c1f72efce11d4f
3
+ size 54619587
processor_config.json ADDED
@@ -0,0 +1,42 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "crop_size": null,
4
+ "data_format": "channels_first",
5
+ "default_to_square": true,
6
+ "device": null,
7
+ "disable_grouping": null,
8
+ "do_center_crop": null,
9
+ "do_convert_rgb": true,
10
+ "do_normalize": true,
11
+ "do_pad": null,
12
+ "do_rescale": true,
13
+ "do_resize": true,
14
+ "image_mean": [
15
+ 0.48145466,
16
+ 0.4578275,
17
+ 0.40821073
18
+ ],
19
+ "image_processor_type": "PixtralImageProcessor",
20
+ "image_seq_length": null,
21
+ "image_std": [
22
+ 0.26862954,
23
+ 0.26130258,
24
+ 0.27577711
25
+ ],
26
+ "input_data_format": null,
27
+ "pad_size": null,
28
+ "patch_size": {
29
+ "height": 14,
30
+ "width": 14
31
+ },
32
+ "resample": 3,
33
+ "rescale_factor": 0.00392156862745098,
34
+ "return_tensors": null,
35
+ "size": {
36
+ "longest_edge": 1540
37
+ }
38
+ },
39
+ "patch_size": 14,
40
+ "processor_class": "LightOnOcrProcessor",
41
+ "spatial_merge_size": 2
42
+ }
rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:030da978017015da3fe26f53d72a3b732670056e0706187eb6457a22768b1863
3
+ size 14645
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6bf3a357417911ae5868483660e5ebab7ca7bf876831d53ab728de3c18fc0ceb
3
+ size 1465
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f54b55fa0c3aba0c91ce09ea79ae4e62da24e2a1a630f96c4bae34aba25e234a
3
+ size 11422822
tokenizer_config.json ADDED
@@ -0,0 +1,38 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|im_start|>",
10
+ "<|im_end|>",
11
+ "<|object_ref_start|>",
12
+ "<|object_ref_end|>",
13
+ "<|box_start|>",
14
+ "<|box_end|>",
15
+ "<|quad_start|>",
16
+ "<|quad_end|>",
17
+ "<|vision_start|>",
18
+ "<|vision_end|>",
19
+ "<|vision_pad|>",
20
+ "<|image_pad|>",
21
+ "<|video_pad|>"
22
+ ],
23
+ "image_break_token": "<|vision_pad|>",
24
+ "image_end_token": "<|vision_end|>",
25
+ "image_token": "<|image_pad|>",
26
+ "is_local": false,
27
+ "max_length": null,
28
+ "model_max_length": 131072,
29
+ "model_specific_special_tokens": {},
30
+ "pad_to_multiple_of": null,
31
+ "pad_token": "<|endoftext|>",
32
+ "pad_token_type_id": 0,
33
+ "padding_side": "right",
34
+ "processor_class": "LightOnOcrProcessor",
35
+ "split_special_tokens": false,
36
+ "tokenizer_class": "TokenizersBackend",
37
+ "unk_token": null
38
+ }
trainer_state.json ADDED
@@ -0,0 +1,1234 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 3900,
3
+ "best_metric": 0.6521520018577576,
4
+ "best_model_checkpoint": "output/LightOnOCR-ft-catmus/checkpoint-2000",
5
+ "epoch": 0.4399593037644018,
6
+ "eval_steps": 50,
7
+ "global_step": 4000,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0054994912970550225,
14
+ "grad_norm": 1.7269556522369385,
15
+ "learning_rate": 5.9871244635193135e-05,
16
+ "loss": 3.2000225830078124,
17
+ "step": 50
18
+ },
19
+ {
20
+ "epoch": 0.0054994912970550225,
21
+ "eval_loss": 2.544747829437256,
22
+ "eval_runtime": 1.22,
23
+ "eval_samples_per_second": 81.966,
24
+ "eval_steps_per_second": 13.934,
25
+ "step": 50
26
+ },
27
+ {
28
+ "epoch": 0.010998982594110045,
29
+ "grad_norm": 2.1817049980163574,
30
+ "learning_rate": 5.970617365467151e-05,
31
+ "loss": 2.204842987060547,
32
+ "step": 100
33
+ },
34
+ {
35
+ "epoch": 0.010998982594110045,
36
+ "eval_loss": 1.9304633140563965,
37
+ "eval_runtime": 1.2142,
38
+ "eval_samples_per_second": 82.358,
39
+ "eval_steps_per_second": 14.001,
40
+ "step": 100
41
+ },
42
+ {
43
+ "epoch": 0.01649847389116507,
44
+ "grad_norm": 2.861886739730835,
45
+ "learning_rate": 5.954110267414989e-05,
46
+ "loss": 1.7260311889648436,
47
+ "step": 150
48
+ },
49
+ {
50
+ "epoch": 0.01649847389116507,
51
+ "eval_loss": 1.7684886455535889,
52
+ "eval_runtime": 1.2169,
53
+ "eval_samples_per_second": 82.178,
54
+ "eval_steps_per_second": 13.97,
55
+ "step": 150
56
+ },
57
+ {
58
+ "epoch": 0.02199796518822009,
59
+ "grad_norm": 2.9910781383514404,
60
+ "learning_rate": 5.937603169362826e-05,
61
+ "loss": 1.5795289611816405,
62
+ "step": 200
63
+ },
64
+ {
65
+ "epoch": 0.02199796518822009,
66
+ "eval_loss": 1.5510659217834473,
67
+ "eval_runtime": 1.2158,
68
+ "eval_samples_per_second": 82.249,
69
+ "eval_steps_per_second": 13.982,
70
+ "step": 200
71
+ },
72
+ {
73
+ "epoch": 0.027497456485275112,
74
+ "grad_norm": 3.234337329864502,
75
+ "learning_rate": 5.921096071310663e-05,
76
+ "loss": 1.4427146911621094,
77
+ "step": 250
78
+ },
79
+ {
80
+ "epoch": 0.027497456485275112,
81
+ "eval_loss": 1.4127395153045654,
82
+ "eval_runtime": 1.2374,
83
+ "eval_samples_per_second": 80.816,
84
+ "eval_steps_per_second": 13.739,
85
+ "step": 250
86
+ },
87
+ {
88
+ "epoch": 0.03299694778233014,
89
+ "grad_norm": 3.6628358364105225,
90
+ "learning_rate": 5.904588973258501e-05,
91
+ "loss": 1.3803778076171875,
92
+ "step": 300
93
+ },
94
+ {
95
+ "epoch": 0.03299694778233014,
96
+ "eval_loss": 1.3498808145523071,
97
+ "eval_runtime": 1.2372,
98
+ "eval_samples_per_second": 80.827,
99
+ "eval_steps_per_second": 13.741,
100
+ "step": 300
101
+ },
102
+ {
103
+ "epoch": 0.03849643907938516,
104
+ "grad_norm": 3.2028181552886963,
105
+ "learning_rate": 5.8880818752063386e-05,
106
+ "loss": 1.2370665740966797,
107
+ "step": 350
108
+ },
109
+ {
110
+ "epoch": 0.03849643907938516,
111
+ "eval_loss": 1.3298417329788208,
112
+ "eval_runtime": 1.2864,
113
+ "eval_samples_per_second": 77.736,
114
+ "eval_steps_per_second": 13.215,
115
+ "step": 350
116
+ },
117
+ {
118
+ "epoch": 0.04399593037644018,
119
+ "grad_norm": 3.344433307647705,
120
+ "learning_rate": 5.8715747771541766e-05,
121
+ "loss": 1.1885470581054687,
122
+ "step": 400
123
+ },
124
+ {
125
+ "epoch": 0.04399593037644018,
126
+ "eval_loss": 1.296607494354248,
127
+ "eval_runtime": 1.2337,
128
+ "eval_samples_per_second": 81.058,
129
+ "eval_steps_per_second": 13.78,
130
+ "step": 400
131
+ },
132
+ {
133
+ "epoch": 0.0494954216734952,
134
+ "grad_norm": 3.601663827896118,
135
+ "learning_rate": 5.855067679102014e-05,
136
+ "loss": 1.149856185913086,
137
+ "step": 450
138
+ },
139
+ {
140
+ "epoch": 0.0494954216734952,
141
+ "eval_loss": 1.264522910118103,
142
+ "eval_runtime": 1.2178,
143
+ "eval_samples_per_second": 82.114,
144
+ "eval_steps_per_second": 13.959,
145
+ "step": 450
146
+ },
147
+ {
148
+ "epoch": 0.054994912970550223,
149
+ "grad_norm": 4.889139175415039,
150
+ "learning_rate": 5.838560581049852e-05,
151
+ "loss": 1.0299188232421874,
152
+ "step": 500
153
+ },
154
+ {
155
+ "epoch": 0.054994912970550223,
156
+ "eval_loss": 1.2139334678649902,
157
+ "eval_runtime": 1.2138,
158
+ "eval_samples_per_second": 82.388,
159
+ "eval_steps_per_second": 14.006,
160
+ "step": 500
161
+ },
162
+ {
163
+ "epoch": 0.060494404267605245,
164
+ "grad_norm": 4.471691608428955,
165
+ "learning_rate": 5.822053482997689e-05,
166
+ "loss": 1.063873519897461,
167
+ "step": 550
168
+ },
169
+ {
170
+ "epoch": 0.060494404267605245,
171
+ "eval_loss": 1.1947441101074219,
172
+ "eval_runtime": 1.2397,
173
+ "eval_samples_per_second": 80.663,
174
+ "eval_steps_per_second": 13.713,
175
+ "step": 550
176
+ },
177
+ {
178
+ "epoch": 0.06599389556466027,
179
+ "grad_norm": 5.005523204803467,
180
+ "learning_rate": 5.805546384945527e-05,
181
+ "loss": 1.0306187438964844,
182
+ "step": 600
183
+ },
184
+ {
185
+ "epoch": 0.06599389556466027,
186
+ "eval_loss": 1.1054185628890991,
187
+ "eval_runtime": 1.2867,
188
+ "eval_samples_per_second": 77.72,
189
+ "eval_steps_per_second": 13.212,
190
+ "step": 600
191
+ },
192
+ {
193
+ "epoch": 0.07149338686171529,
194
+ "grad_norm": 5.433160781860352,
195
+ "learning_rate": 5.7890392868933643e-05,
196
+ "loss": 0.9948115539550781,
197
+ "step": 650
198
+ },
199
+ {
200
+ "epoch": 0.07149338686171529,
201
+ "eval_loss": 1.118335247039795,
202
+ "eval_runtime": 1.2905,
203
+ "eval_samples_per_second": 77.488,
204
+ "eval_steps_per_second": 13.173,
205
+ "step": 650
206
+ },
207
+ {
208
+ "epoch": 0.07699287815877032,
209
+ "grad_norm": 4.089204788208008,
210
+ "learning_rate": 5.7725321888412016e-05,
211
+ "loss": 0.9623870086669922,
212
+ "step": 700
213
+ },
214
+ {
215
+ "epoch": 0.07699287815877032,
216
+ "eval_loss": 1.1011381149291992,
217
+ "eval_runtime": 1.2137,
218
+ "eval_samples_per_second": 82.396,
219
+ "eval_steps_per_second": 14.007,
220
+ "step": 700
221
+ },
222
+ {
223
+ "epoch": 0.08249236945582533,
224
+ "grad_norm": 4.5177459716796875,
225
+ "learning_rate": 5.7560250907890396e-05,
226
+ "loss": 0.9822674560546875,
227
+ "step": 750
228
+ },
229
+ {
230
+ "epoch": 0.08249236945582533,
231
+ "eval_loss": 1.0355230569839478,
232
+ "eval_runtime": 1.2185,
233
+ "eval_samples_per_second": 82.066,
234
+ "eval_steps_per_second": 13.951,
235
+ "step": 750
236
+ },
237
+ {
238
+ "epoch": 0.08799186075288036,
239
+ "grad_norm": 5.314192295074463,
240
+ "learning_rate": 5.7395179927368776e-05,
241
+ "loss": 0.9478108978271484,
242
+ "step": 800
243
+ },
244
+ {
245
+ "epoch": 0.08799186075288036,
246
+ "eval_loss": 1.026939868927002,
247
+ "eval_runtime": 1.2207,
248
+ "eval_samples_per_second": 81.923,
249
+ "eval_steps_per_second": 13.927,
250
+ "step": 800
251
+ },
252
+ {
253
+ "epoch": 0.09349135204993538,
254
+ "grad_norm": 4.419743061065674,
255
+ "learning_rate": 5.723010894684714e-05,
256
+ "loss": 0.9230728149414062,
257
+ "step": 850
258
+ },
259
+ {
260
+ "epoch": 0.09349135204993538,
261
+ "eval_loss": 1.0253421068191528,
262
+ "eval_runtime": 1.2215,
263
+ "eval_samples_per_second": 81.867,
264
+ "eval_steps_per_second": 13.917,
265
+ "step": 850
266
+ },
267
+ {
268
+ "epoch": 0.0989908433469904,
269
+ "grad_norm": 4.689808368682861,
270
+ "learning_rate": 5.706503796632552e-05,
271
+ "loss": 0.9336647033691406,
272
+ "step": 900
273
+ },
274
+ {
275
+ "epoch": 0.0989908433469904,
276
+ "eval_loss": 0.9888076782226562,
277
+ "eval_runtime": 1.2198,
278
+ "eval_samples_per_second": 81.981,
279
+ "eval_steps_per_second": 13.937,
280
+ "step": 900
281
+ },
282
+ {
283
+ "epoch": 0.10449033464404543,
284
+ "grad_norm": 4.178891181945801,
285
+ "learning_rate": 5.68999669858039e-05,
286
+ "loss": 0.8509888458251953,
287
+ "step": 950
288
+ },
289
+ {
290
+ "epoch": 0.10449033464404543,
291
+ "eval_loss": 0.9283347129821777,
292
+ "eval_runtime": 1.2217,
293
+ "eval_samples_per_second": 81.854,
294
+ "eval_steps_per_second": 13.915,
295
+ "step": 950
296
+ },
297
+ {
298
+ "epoch": 0.10998982594110045,
299
+ "grad_norm": 4.549170017242432,
300
+ "learning_rate": 5.6734896005282274e-05,
301
+ "loss": 0.8530999755859375,
302
+ "step": 1000
303
+ },
304
+ {
305
+ "epoch": 0.10998982594110045,
306
+ "eval_loss": 0.9180505871772766,
307
+ "eval_runtime": 1.2178,
308
+ "eval_samples_per_second": 82.114,
309
+ "eval_steps_per_second": 13.959,
310
+ "step": 1000
311
+ },
312
+ {
313
+ "epoch": 0.11548931723815548,
314
+ "grad_norm": 5.8048095703125,
315
+ "learning_rate": 5.656982502476065e-05,
316
+ "loss": 0.8161511993408204,
317
+ "step": 1050
318
+ },
319
+ {
320
+ "epoch": 0.11548931723815548,
321
+ "eval_loss": 0.9668211936950684,
322
+ "eval_runtime": 1.2152,
323
+ "eval_samples_per_second": 82.292,
324
+ "eval_steps_per_second": 13.99,
325
+ "step": 1050
326
+ },
327
+ {
328
+ "epoch": 0.12098880853521049,
329
+ "grad_norm": 4.776002883911133,
330
+ "learning_rate": 5.6404754044239026e-05,
331
+ "loss": 0.8362539672851562,
332
+ "step": 1100
333
+ },
334
+ {
335
+ "epoch": 0.12098880853521049,
336
+ "eval_loss": 0.9686654806137085,
337
+ "eval_runtime": 1.21,
338
+ "eval_samples_per_second": 82.647,
339
+ "eval_steps_per_second": 14.05,
340
+ "step": 1100
341
+ },
342
+ {
343
+ "epoch": 0.1264882998322655,
344
+ "grad_norm": 4.652673721313477,
345
+ "learning_rate": 5.62396830637174e-05,
346
+ "loss": 0.8160650634765625,
347
+ "step": 1150
348
+ },
349
+ {
350
+ "epoch": 0.1264882998322655,
351
+ "eval_loss": 0.9779856204986572,
352
+ "eval_runtime": 1.2121,
353
+ "eval_samples_per_second": 82.5,
354
+ "eval_steps_per_second": 14.025,
355
+ "step": 1150
356
+ },
357
+ {
358
+ "epoch": 0.13198779112932055,
359
+ "grad_norm": 4.988180160522461,
360
+ "learning_rate": 5.607461208319577e-05,
361
+ "loss": 0.8510865020751953,
362
+ "step": 1200
363
+ },
364
+ {
365
+ "epoch": 0.13198779112932055,
366
+ "eval_loss": 0.9197137951850891,
367
+ "eval_runtime": 1.2363,
368
+ "eval_samples_per_second": 80.884,
369
+ "eval_steps_per_second": 13.75,
370
+ "step": 1200
371
+ },
372
+ {
373
+ "epoch": 0.13748728242637556,
374
+ "grad_norm": 5.33247709274292,
375
+ "learning_rate": 5.590954110267415e-05,
376
+ "loss": 0.8393131256103515,
377
+ "step": 1250
378
+ },
379
+ {
380
+ "epoch": 0.13748728242637556,
381
+ "eval_loss": 0.9012404084205627,
382
+ "eval_runtime": 1.2371,
383
+ "eval_samples_per_second": 80.834,
384
+ "eval_steps_per_second": 13.742,
385
+ "step": 1250
386
+ },
387
+ {
388
+ "epoch": 0.14298677372343058,
389
+ "grad_norm": 4.81198787689209,
390
+ "learning_rate": 5.5744470122152525e-05,
391
+ "loss": 0.7720973205566406,
392
+ "step": 1300
393
+ },
394
+ {
395
+ "epoch": 0.14298677372343058,
396
+ "eval_loss": 0.8723539710044861,
397
+ "eval_runtime": 1.2195,
398
+ "eval_samples_per_second": 81.999,
399
+ "eval_steps_per_second": 13.94,
400
+ "step": 1300
401
+ },
402
+ {
403
+ "epoch": 0.1484862650204856,
404
+ "grad_norm": 4.492185115814209,
405
+ "learning_rate": 5.5579399141630904e-05,
406
+ "loss": 0.8052091217041015,
407
+ "step": 1350
408
+ },
409
+ {
410
+ "epoch": 0.1484862650204856,
411
+ "eval_loss": 0.8542118668556213,
412
+ "eval_runtime": 1.2288,
413
+ "eval_samples_per_second": 81.379,
414
+ "eval_steps_per_second": 13.834,
415
+ "step": 1350
416
+ },
417
+ {
418
+ "epoch": 0.15398575631754063,
419
+ "grad_norm": 3.353337287902832,
420
+ "learning_rate": 5.541432816110928e-05,
421
+ "loss": 0.7565326690673828,
422
+ "step": 1400
423
+ },
424
+ {
425
+ "epoch": 0.15398575631754063,
426
+ "eval_loss": 0.8505687117576599,
427
+ "eval_runtime": 1.2947,
428
+ "eval_samples_per_second": 77.24,
429
+ "eval_steps_per_second": 13.131,
430
+ "step": 1400
431
+ },
432
+ {
433
+ "epoch": 0.15948524761459565,
434
+ "grad_norm": 4.658541202545166,
435
+ "learning_rate": 5.524925718058765e-05,
436
+ "loss": 0.7905632781982422,
437
+ "step": 1450
438
+ },
439
+ {
440
+ "epoch": 0.15948524761459565,
441
+ "eval_loss": 0.8416154980659485,
442
+ "eval_runtime": 1.3011,
443
+ "eval_samples_per_second": 76.857,
444
+ "eval_steps_per_second": 13.066,
445
+ "step": 1450
446
+ },
447
+ {
448
+ "epoch": 0.16498473891165066,
449
+ "grad_norm": 4.894554615020752,
450
+ "learning_rate": 5.508418620006603e-05,
451
+ "loss": 0.7522599029541016,
452
+ "step": 1500
453
+ },
454
+ {
455
+ "epoch": 0.16498473891165066,
456
+ "eval_loss": 0.8781094551086426,
457
+ "eval_runtime": 1.3077,
458
+ "eval_samples_per_second": 76.472,
459
+ "eval_steps_per_second": 13.0,
460
+ "step": 1500
461
+ },
462
+ {
463
+ "epoch": 0.1704842302087057,
464
+ "grad_norm": 5.099001407623291,
465
+ "learning_rate": 5.491911521954441e-05,
466
+ "loss": 0.7591278076171875,
467
+ "step": 1550
468
+ },
469
+ {
470
+ "epoch": 0.1704842302087057,
471
+ "eval_loss": 0.8455641269683838,
472
+ "eval_runtime": 1.3309,
473
+ "eval_samples_per_second": 75.138,
474
+ "eval_steps_per_second": 12.773,
475
+ "step": 1550
476
+ },
477
+ {
478
+ "epoch": 0.17598372150576072,
479
+ "grad_norm": 4.108503818511963,
480
+ "learning_rate": 5.4754044239022776e-05,
481
+ "loss": 0.7117195129394531,
482
+ "step": 1600
483
+ },
484
+ {
485
+ "epoch": 0.17598372150576072,
486
+ "eval_loss": 0.8469740152359009,
487
+ "eval_runtime": 1.3312,
488
+ "eval_samples_per_second": 75.123,
489
+ "eval_steps_per_second": 12.771,
490
+ "step": 1600
491
+ },
492
+ {
493
+ "epoch": 0.18148321280281574,
494
+ "grad_norm": 4.5479536056518555,
495
+ "learning_rate": 5.4588973258501155e-05,
496
+ "loss": 0.7624311828613282,
497
+ "step": 1650
498
+ },
499
+ {
500
+ "epoch": 0.18148321280281574,
501
+ "eval_loss": 0.8670312762260437,
502
+ "eval_runtime": 1.3395,
503
+ "eval_samples_per_second": 74.652,
504
+ "eval_steps_per_second": 12.691,
505
+ "step": 1650
506
+ },
507
+ {
508
+ "epoch": 0.18698270409987075,
509
+ "grad_norm": 4.809026718139648,
510
+ "learning_rate": 5.4423902277979535e-05,
511
+ "loss": 0.7137515258789062,
512
+ "step": 1700
513
+ },
514
+ {
515
+ "epoch": 0.18698270409987075,
516
+ "eval_loss": 0.8062080144882202,
517
+ "eval_runtime": 1.3269,
518
+ "eval_samples_per_second": 75.364,
519
+ "eval_steps_per_second": 12.812,
520
+ "step": 1700
521
+ },
522
+ {
523
+ "epoch": 0.1924821953969258,
524
+ "grad_norm": 5.400925636291504,
525
+ "learning_rate": 5.4258831297457914e-05,
526
+ "loss": 0.6972386932373047,
527
+ "step": 1750
528
+ },
529
+ {
530
+ "epoch": 0.1924821953969258,
531
+ "eval_loss": 0.8285601735115051,
532
+ "eval_runtime": 1.3236,
533
+ "eval_samples_per_second": 75.551,
534
+ "eval_steps_per_second": 12.844,
535
+ "step": 1750
536
+ },
537
+ {
538
+ "epoch": 0.1979816866939808,
539
+ "grad_norm": 6.0628461837768555,
540
+ "learning_rate": 5.409376031693628e-05,
541
+ "loss": 0.7547286987304688,
542
+ "step": 1800
543
+ },
544
+ {
545
+ "epoch": 0.1979816866939808,
546
+ "eval_loss": 0.8063403964042664,
547
+ "eval_runtime": 1.3254,
548
+ "eval_samples_per_second": 75.448,
549
+ "eval_steps_per_second": 12.826,
550
+ "step": 1800
551
+ },
552
+ {
553
+ "epoch": 0.20348117799103582,
554
+ "grad_norm": 5.176665306091309,
555
+ "learning_rate": 5.392868933641466e-05,
556
+ "loss": 0.7166018676757813,
557
+ "step": 1850
558
+ },
559
+ {
560
+ "epoch": 0.20348117799103582,
561
+ "eval_loss": 0.7977473735809326,
562
+ "eval_runtime": 1.3331,
563
+ "eval_samples_per_second": 75.013,
564
+ "eval_steps_per_second": 12.752,
565
+ "step": 1850
566
+ },
567
+ {
568
+ "epoch": 0.20898066928809086,
569
+ "grad_norm": 5.566205024719238,
570
+ "learning_rate": 5.376361835589304e-05,
571
+ "loss": 0.7202009582519531,
572
+ "step": 1900
573
+ },
574
+ {
575
+ "epoch": 0.20898066928809086,
576
+ "eval_loss": 0.7941867709159851,
577
+ "eval_runtime": 1.2966,
578
+ "eval_samples_per_second": 77.126,
579
+ "eval_steps_per_second": 13.112,
580
+ "step": 1900
581
+ },
582
+ {
583
+ "epoch": 0.21448016058514588,
584
+ "grad_norm": 6.071581840515137,
585
+ "learning_rate": 5.359854737537141e-05,
586
+ "loss": 0.718297119140625,
587
+ "step": 1950
588
+ },
589
+ {
590
+ "epoch": 0.21448016058514588,
591
+ "eval_loss": 0.8194384574890137,
592
+ "eval_runtime": 1.2884,
593
+ "eval_samples_per_second": 77.613,
594
+ "eval_steps_per_second": 13.194,
595
+ "step": 1950
596
+ },
597
+ {
598
+ "epoch": 0.2199796518822009,
599
+ "grad_norm": 5.566873073577881,
600
+ "learning_rate": 5.3433476394849786e-05,
601
+ "loss": 0.7216673278808594,
602
+ "step": 2000
603
+ },
604
+ {
605
+ "epoch": 0.2199796518822009,
606
+ "eval_loss": 0.7815269231796265,
607
+ "eval_runtime": 1.2875,
608
+ "eval_samples_per_second": 77.668,
609
+ "eval_steps_per_second": 13.204,
610
+ "step": 2000
611
+ },
612
+ {
613
+ "epoch": 0.2254791431792559,
614
+ "grad_norm": 5.567185878753662,
615
+ "learning_rate": 5.3268405414328165e-05,
616
+ "loss": 0.7164375305175781,
617
+ "step": 2050
618
+ },
619
+ {
620
+ "epoch": 0.2254791431792559,
621
+ "eval_loss": 0.8178561925888062,
622
+ "eval_runtime": 1.2891,
623
+ "eval_samples_per_second": 77.574,
624
+ "eval_steps_per_second": 13.188,
625
+ "step": 2050
626
+ },
627
+ {
628
+ "epoch": 0.23097863447631095,
629
+ "grad_norm": 4.171028137207031,
630
+ "learning_rate": 5.310333443380654e-05,
631
+ "loss": 0.6996173095703125,
632
+ "step": 2100
633
+ },
634
+ {
635
+ "epoch": 0.23097863447631095,
636
+ "eval_loss": 0.791594922542572,
637
+ "eval_runtime": 1.287,
638
+ "eval_samples_per_second": 77.698,
639
+ "eval_steps_per_second": 13.209,
640
+ "step": 2100
641
+ },
642
+ {
643
+ "epoch": 0.23647812577336597,
644
+ "grad_norm": 4.468926906585693,
645
+ "learning_rate": 5.293826345328491e-05,
646
+ "loss": 0.685142822265625,
647
+ "step": 2150
648
+ },
649
+ {
650
+ "epoch": 0.23647812577336597,
651
+ "eval_loss": 0.8206081986427307,
652
+ "eval_runtime": 1.2124,
653
+ "eval_samples_per_second": 82.479,
654
+ "eval_steps_per_second": 14.021,
655
+ "step": 2150
656
+ },
657
+ {
658
+ "epoch": 0.24197761707042098,
659
+ "grad_norm": 3.9659266471862793,
660
+ "learning_rate": 5.277319247276329e-05,
661
+ "loss": 0.701788330078125,
662
+ "step": 2200
663
+ },
664
+ {
665
+ "epoch": 0.24197761707042098,
666
+ "eval_loss": 0.7930644750595093,
667
+ "eval_runtime": 1.2014,
668
+ "eval_samples_per_second": 83.24,
669
+ "eval_steps_per_second": 14.151,
670
+ "step": 2200
671
+ },
672
+ {
673
+ "epoch": 0.247477108367476,
674
+ "grad_norm": 4.476805686950684,
675
+ "learning_rate": 5.2608121492241664e-05,
676
+ "loss": 0.710376968383789,
677
+ "step": 2250
678
+ },
679
+ {
680
+ "epoch": 0.247477108367476,
681
+ "eval_loss": 0.7881377339363098,
682
+ "eval_runtime": 1.1999,
683
+ "eval_samples_per_second": 83.337,
684
+ "eval_steps_per_second": 14.167,
685
+ "step": 2250
686
+ },
687
+ {
688
+ "epoch": 0.252976599664531,
689
+ "grad_norm": 3.8596489429473877,
690
+ "learning_rate": 5.244305051172004e-05,
691
+ "loss": 0.7032179260253906,
692
+ "step": 2300
693
+ },
694
+ {
695
+ "epoch": 0.252976599664531,
696
+ "eval_loss": 0.7591221332550049,
697
+ "eval_runtime": 1.2149,
698
+ "eval_samples_per_second": 82.31,
699
+ "eval_steps_per_second": 13.993,
700
+ "step": 2300
701
+ },
702
+ {
703
+ "epoch": 0.2584760909615861,
704
+ "grad_norm": 4.368955135345459,
705
+ "learning_rate": 5.2277979531198416e-05,
706
+ "loss": 0.6489437103271485,
707
+ "step": 2350
708
+ },
709
+ {
710
+ "epoch": 0.2584760909615861,
711
+ "eval_loss": 0.8142778873443604,
712
+ "eval_runtime": 1.2006,
713
+ "eval_samples_per_second": 83.294,
714
+ "eval_steps_per_second": 14.16,
715
+ "step": 2350
716
+ },
717
+ {
718
+ "epoch": 0.2639755822586411,
719
+ "grad_norm": 4.408853530883789,
720
+ "learning_rate": 5.211290855067679e-05,
721
+ "loss": 0.6344734954833985,
722
+ "step": 2400
723
+ },
724
+ {
725
+ "epoch": 0.2639755822586411,
726
+ "eval_loss": 0.789002001285553,
727
+ "eval_runtime": 1.2016,
728
+ "eval_samples_per_second": 83.219,
729
+ "eval_steps_per_second": 14.147,
730
+ "step": 2400
731
+ },
732
+ {
733
+ "epoch": 0.2694750735556961,
734
+ "grad_norm": 4.636422157287598,
735
+ "learning_rate": 5.194783757015517e-05,
736
+ "loss": 0.6603395080566407,
737
+ "step": 2450
738
+ },
739
+ {
740
+ "epoch": 0.2694750735556961,
741
+ "eval_loss": 0.739583432674408,
742
+ "eval_runtime": 1.2017,
743
+ "eval_samples_per_second": 83.216,
744
+ "eval_steps_per_second": 14.147,
745
+ "step": 2450
746
+ },
747
+ {
748
+ "epoch": 0.2749745648527511,
749
+ "grad_norm": 4.370145797729492,
750
+ "learning_rate": 5.178276658963355e-05,
751
+ "loss": 0.6568155670166016,
752
+ "step": 2500
753
+ },
754
+ {
755
+ "epoch": 0.2749745648527511,
756
+ "eval_loss": 0.8292286396026611,
757
+ "eval_runtime": 1.1996,
758
+ "eval_samples_per_second": 83.364,
759
+ "eval_steps_per_second": 14.172,
760
+ "step": 2500
761
+ },
762
+ {
763
+ "epoch": 0.28047405614980614,
764
+ "grad_norm": 4.47123384475708,
765
+ "learning_rate": 5.1617695609111914e-05,
766
+ "loss": 0.6639788055419922,
767
+ "step": 2550
768
+ },
769
+ {
770
+ "epoch": 0.28047405614980614,
771
+ "eval_loss": 0.820250391960144,
772
+ "eval_runtime": 1.2058,
773
+ "eval_samples_per_second": 82.933,
774
+ "eval_steps_per_second": 14.099,
775
+ "step": 2550
776
+ },
777
+ {
778
+ "epoch": 0.28597354744686115,
779
+ "grad_norm": 4.769968509674072,
780
+ "learning_rate": 5.1452624628590294e-05,
781
+ "loss": 0.6434815979003906,
782
+ "step": 2600
783
+ },
784
+ {
785
+ "epoch": 0.28597354744686115,
786
+ "eval_loss": 0.8330257534980774,
787
+ "eval_runtime": 1.2003,
788
+ "eval_samples_per_second": 83.313,
789
+ "eval_steps_per_second": 14.163,
790
+ "step": 2600
791
+ },
792
+ {
793
+ "epoch": 0.29147303874391617,
794
+ "grad_norm": 4.403727054595947,
795
+ "learning_rate": 5.1287553648068674e-05,
796
+ "loss": 0.6872652435302734,
797
+ "step": 2650
798
+ },
799
+ {
800
+ "epoch": 0.29147303874391617,
801
+ "eval_loss": 0.7691981792449951,
802
+ "eval_runtime": 1.1997,
803
+ "eval_samples_per_second": 83.351,
804
+ "eval_steps_per_second": 14.17,
805
+ "step": 2650
806
+ },
807
+ {
808
+ "epoch": 0.2969725300409712,
809
+ "grad_norm": 3.7627687454223633,
810
+ "learning_rate": 5.1122482667547047e-05,
811
+ "loss": 0.625857925415039,
812
+ "step": 2700
813
+ },
814
+ {
815
+ "epoch": 0.2969725300409712,
816
+ "eval_loss": 0.7727508544921875,
817
+ "eval_runtime": 1.2264,
818
+ "eval_samples_per_second": 81.538,
819
+ "eval_steps_per_second": 13.861,
820
+ "step": 2700
821
+ },
822
+ {
823
+ "epoch": 0.30247202133802625,
824
+ "grad_norm": 5.441561222076416,
825
+ "learning_rate": 5.095741168702542e-05,
826
+ "loss": 0.6458732604980468,
827
+ "step": 2750
828
+ },
829
+ {
830
+ "epoch": 0.30247202133802625,
831
+ "eval_loss": 0.7701953053474426,
832
+ "eval_runtime": 1.222,
833
+ "eval_samples_per_second": 81.833,
834
+ "eval_steps_per_second": 13.912,
835
+ "step": 2750
836
+ },
837
+ {
838
+ "epoch": 0.30797151263508127,
839
+ "grad_norm": 4.965064525604248,
840
+ "learning_rate": 5.07923407065038e-05,
841
+ "loss": 0.6677908325195312,
842
+ "step": 2800
843
+ },
844
+ {
845
+ "epoch": 0.30797151263508127,
846
+ "eval_loss": 0.7164813280105591,
847
+ "eval_runtime": 1.2202,
848
+ "eval_samples_per_second": 81.956,
849
+ "eval_steps_per_second": 13.933,
850
+ "step": 2800
851
+ },
852
+ {
853
+ "epoch": 0.3134710039321363,
854
+ "grad_norm": 3.931856870651245,
855
+ "learning_rate": 5.062726972598217e-05,
856
+ "loss": 0.5885476684570312,
857
+ "step": 2850
858
+ },
859
+ {
860
+ "epoch": 0.3134710039321363,
861
+ "eval_loss": 0.7336059808731079,
862
+ "eval_runtime": 1.2203,
863
+ "eval_samples_per_second": 81.948,
864
+ "eval_steps_per_second": 13.931,
865
+ "step": 2850
866
+ },
867
+ {
868
+ "epoch": 0.3189704952291913,
869
+ "grad_norm": 4.760177135467529,
870
+ "learning_rate": 5.046219874546055e-05,
871
+ "loss": 0.6489822387695312,
872
+ "step": 2900
873
+ },
874
+ {
875
+ "epoch": 0.3189704952291913,
876
+ "eval_loss": 0.7551103830337524,
877
+ "eval_runtime": 1.2183,
878
+ "eval_samples_per_second": 82.079,
879
+ "eval_steps_per_second": 13.953,
880
+ "step": 2900
881
+ },
882
+ {
883
+ "epoch": 0.3244699865262463,
884
+ "grad_norm": 4.375728130340576,
885
+ "learning_rate": 5.0297127764938924e-05,
886
+ "loss": 0.6457704162597656,
887
+ "step": 2950
888
+ },
889
+ {
890
+ "epoch": 0.3244699865262463,
891
+ "eval_loss": 0.7187867164611816,
892
+ "eval_runtime": 1.2036,
893
+ "eval_samples_per_second": 83.084,
894
+ "eval_steps_per_second": 14.124,
895
+ "step": 2950
896
+ },
897
+ {
898
+ "epoch": 0.3299694778233013,
899
+ "grad_norm": 4.091928005218506,
900
+ "learning_rate": 5.0132056784417304e-05,
901
+ "loss": 0.6391205596923828,
902
+ "step": 3000
903
+ },
904
+ {
905
+ "epoch": 0.3299694778233013,
906
+ "eval_loss": 0.7715049982070923,
907
+ "eval_runtime": 1.2016,
908
+ "eval_samples_per_second": 83.22,
909
+ "eval_steps_per_second": 14.147,
910
+ "step": 3000
911
+ },
912
+ {
913
+ "epoch": 0.33546896912035634,
914
+ "grad_norm": 4.569828510284424,
915
+ "learning_rate": 4.996698580389568e-05,
916
+ "loss": 0.6714089965820312,
917
+ "step": 3050
918
+ },
919
+ {
920
+ "epoch": 0.33546896912035634,
921
+ "eval_loss": 0.7370268106460571,
922
+ "eval_runtime": 1.2171,
923
+ "eval_samples_per_second": 82.162,
924
+ "eval_steps_per_second": 13.967,
925
+ "step": 3050
926
+ },
927
+ {
928
+ "epoch": 0.3409684604174114,
929
+ "grad_norm": 5.741940975189209,
930
+ "learning_rate": 4.980191482337405e-05,
931
+ "loss": 0.6890049743652343,
932
+ "step": 3100
933
+ },
934
+ {
935
+ "epoch": 0.3409684604174114,
936
+ "eval_loss": 0.7069912552833557,
937
+ "eval_runtime": 1.1974,
938
+ "eval_samples_per_second": 83.514,
939
+ "eval_steps_per_second": 14.197,
940
+ "step": 3100
941
+ },
942
+ {
943
+ "epoch": 0.3464679517144664,
944
+ "grad_norm": 4.857932090759277,
945
+ "learning_rate": 4.963684384285243e-05,
946
+ "loss": 0.5919662475585937,
947
+ "step": 3150
948
+ },
949
+ {
950
+ "epoch": 0.3464679517144664,
951
+ "eval_loss": 0.7350116968154907,
952
+ "eval_runtime": 1.1974,
953
+ "eval_samples_per_second": 83.515,
954
+ "eval_steps_per_second": 14.198,
955
+ "step": 3150
956
+ },
957
+ {
958
+ "epoch": 0.35196744301152144,
959
+ "grad_norm": 4.636399745941162,
960
+ "learning_rate": 4.94717728623308e-05,
961
+ "loss": 0.6361312866210938,
962
+ "step": 3200
963
+ },
964
+ {
965
+ "epoch": 0.35196744301152144,
966
+ "eval_loss": 0.7743600606918335,
967
+ "eval_runtime": 1.271,
968
+ "eval_samples_per_second": 78.677,
969
+ "eval_steps_per_second": 13.375,
970
+ "step": 3200
971
+ },
972
+ {
973
+ "epoch": 0.35746693430857646,
974
+ "grad_norm": 5.155900955200195,
975
+ "learning_rate": 4.930670188180918e-05,
976
+ "loss": 0.602264518737793,
977
+ "step": 3250
978
+ },
979
+ {
980
+ "epoch": 0.35746693430857646,
981
+ "eval_loss": 0.7555291652679443,
982
+ "eval_runtime": 1.2803,
983
+ "eval_samples_per_second": 78.105,
984
+ "eval_steps_per_second": 13.278,
985
+ "step": 3250
986
+ },
987
+ {
988
+ "epoch": 0.36296642560563147,
989
+ "grad_norm": 3.4023196697235107,
990
+ "learning_rate": 4.9141630901287555e-05,
991
+ "loss": 0.5788230133056641,
992
+ "step": 3300
993
+ },
994
+ {
995
+ "epoch": 0.36296642560563147,
996
+ "eval_loss": 0.7717245221138,
997
+ "eval_runtime": 1.3149,
998
+ "eval_samples_per_second": 76.053,
999
+ "eval_steps_per_second": 12.929,
1000
+ "step": 3300
1001
+ },
1002
+ {
1003
+ "epoch": 0.3684659169026865,
1004
+ "grad_norm": 4.329448223114014,
1005
+ "learning_rate": 4.897655992076593e-05,
1006
+ "loss": 0.6438528442382813,
1007
+ "step": 3350
1008
+ },
1009
+ {
1010
+ "epoch": 0.3684659169026865,
1011
+ "eval_loss": 0.6952827572822571,
1012
+ "eval_runtime": 1.2957,
1013
+ "eval_samples_per_second": 77.176,
1014
+ "eval_steps_per_second": 13.12,
1015
+ "step": 3350
1016
+ },
1017
+ {
1018
+ "epoch": 0.3739654081997415,
1019
+ "grad_norm": 3.610276222229004,
1020
+ "learning_rate": 4.881148894024431e-05,
1021
+ "loss": 0.6141637802124024,
1022
+ "step": 3400
1023
+ },
1024
+ {
1025
+ "epoch": 0.3739654081997415,
1026
+ "eval_loss": 0.6926187872886658,
1027
+ "eval_runtime": 1.3466,
1028
+ "eval_samples_per_second": 74.259,
1029
+ "eval_steps_per_second": 12.624,
1030
+ "step": 3400
1031
+ },
1032
+ {
1033
+ "epoch": 0.37946489949679657,
1034
+ "grad_norm": 6.178794860839844,
1035
+ "learning_rate": 4.864641795972269e-05,
1036
+ "loss": 0.6356156158447266,
1037
+ "step": 3450
1038
+ },
1039
+ {
1040
+ "epoch": 0.37946489949679657,
1041
+ "eval_loss": 0.7247772216796875,
1042
+ "eval_runtime": 1.3462,
1043
+ "eval_samples_per_second": 74.281,
1044
+ "eval_steps_per_second": 12.628,
1045
+ "step": 3450
1046
+ },
1047
+ {
1048
+ "epoch": 0.3849643907938516,
1049
+ "grad_norm": 4.9943695068359375,
1050
+ "learning_rate": 4.848134697920105e-05,
1051
+ "loss": 0.6148456192016601,
1052
+ "step": 3500
1053
+ },
1054
+ {
1055
+ "epoch": 0.3849643907938516,
1056
+ "eval_loss": 0.7180845141410828,
1057
+ "eval_runtime": 1.3322,
1058
+ "eval_samples_per_second": 75.061,
1059
+ "eval_steps_per_second": 12.76,
1060
+ "step": 3500
1061
+ },
1062
+ {
1063
+ "epoch": 0.3904638820909066,
1064
+ "grad_norm": 3.8332393169403076,
1065
+ "learning_rate": 4.831627599867943e-05,
1066
+ "loss": 0.625141716003418,
1067
+ "step": 3550
1068
+ },
1069
+ {
1070
+ "epoch": 0.3904638820909066,
1071
+ "eval_loss": 0.6876647472381592,
1072
+ "eval_runtime": 1.3382,
1073
+ "eval_samples_per_second": 74.73,
1074
+ "eval_steps_per_second": 12.704,
1075
+ "step": 3550
1076
+ },
1077
+ {
1078
+ "epoch": 0.3959633733879616,
1079
+ "grad_norm": 4.58771276473999,
1080
+ "learning_rate": 4.815120501815781e-05,
1081
+ "loss": 0.6502104187011719,
1082
+ "step": 3600
1083
+ },
1084
+ {
1085
+ "epoch": 0.3959633733879616,
1086
+ "eval_loss": 0.690920352935791,
1087
+ "eval_runtime": 1.343,
1088
+ "eval_samples_per_second": 74.46,
1089
+ "eval_steps_per_second": 12.658,
1090
+ "step": 3600
1091
+ },
1092
+ {
1093
+ "epoch": 0.40146286468501663,
1094
+ "grad_norm": 4.435539722442627,
1095
+ "learning_rate": 4.7986134037636185e-05,
1096
+ "loss": 0.6129857635498047,
1097
+ "step": 3650
1098
+ },
1099
+ {
1100
+ "epoch": 0.40146286468501663,
1101
+ "eval_loss": 0.6758005023002625,
1102
+ "eval_runtime": 1.34,
1103
+ "eval_samples_per_second": 74.628,
1104
+ "eval_steps_per_second": 12.687,
1105
+ "step": 3650
1106
+ },
1107
+ {
1108
+ "epoch": 0.40696235598207164,
1109
+ "grad_norm": 4.618966102600098,
1110
+ "learning_rate": 4.782106305711456e-05,
1111
+ "loss": 0.6234348678588867,
1112
+ "step": 3700
1113
+ },
1114
+ {
1115
+ "epoch": 0.40696235598207164,
1116
+ "eval_loss": 0.7179376482963562,
1117
+ "eval_runtime": 1.3332,
1118
+ "eval_samples_per_second": 75.01,
1119
+ "eval_steps_per_second": 12.752,
1120
+ "step": 3700
1121
+ },
1122
+ {
1123
+ "epoch": 0.41246184727912666,
1124
+ "grad_norm": 4.0562052726745605,
1125
+ "learning_rate": 4.765599207659294e-05,
1126
+ "loss": 0.6168152999877929,
1127
+ "step": 3750
1128
+ },
1129
+ {
1130
+ "epoch": 0.41246184727912666,
1131
+ "eval_loss": 0.7127401828765869,
1132
+ "eval_runtime": 1.3374,
1133
+ "eval_samples_per_second": 74.769,
1134
+ "eval_steps_per_second": 12.711,
1135
+ "step": 3750
1136
+ },
1137
+ {
1138
+ "epoch": 0.41796133857618173,
1139
+ "grad_norm": 5.699039459228516,
1140
+ "learning_rate": 4.749092109607131e-05,
1141
+ "loss": 0.5789441680908203,
1142
+ "step": 3800
1143
+ },
1144
+ {
1145
+ "epoch": 0.41796133857618173,
1146
+ "eval_loss": 0.6780041456222534,
1147
+ "eval_runtime": 1.3483,
1148
+ "eval_samples_per_second": 74.167,
1149
+ "eval_steps_per_second": 12.608,
1150
+ "step": 3800
1151
+ },
1152
+ {
1153
+ "epoch": 0.42346082987323674,
1154
+ "grad_norm": 3.523623466491699,
1155
+ "learning_rate": 4.7325850115549684e-05,
1156
+ "loss": 0.5945124053955078,
1157
+ "step": 3850
1158
+ },
1159
+ {
1160
+ "epoch": 0.42346082987323674,
1161
+ "eval_loss": 0.695915699005127,
1162
+ "eval_runtime": 1.345,
1163
+ "eval_samples_per_second": 74.351,
1164
+ "eval_steps_per_second": 12.64,
1165
+ "step": 3850
1166
+ },
1167
+ {
1168
+ "epoch": 0.42896032117029176,
1169
+ "grad_norm": 4.008049488067627,
1170
+ "learning_rate": 4.716077913502806e-05,
1171
+ "loss": 0.5782461929321289,
1172
+ "step": 3900
1173
+ },
1174
+ {
1175
+ "epoch": 0.42896032117029176,
1176
+ "eval_loss": 0.6521520018577576,
1177
+ "eval_runtime": 1.342,
1178
+ "eval_samples_per_second": 74.517,
1179
+ "eval_steps_per_second": 12.668,
1180
+ "step": 3900
1181
+ },
1182
+ {
1183
+ "epoch": 0.4344598124673468,
1184
+ "grad_norm": 4.809508323669434,
1185
+ "learning_rate": 4.6995708154506436e-05,
1186
+ "loss": 0.5954169464111329,
1187
+ "step": 3950
1188
+ },
1189
+ {
1190
+ "epoch": 0.4344598124673468,
1191
+ "eval_loss": 0.6668588519096375,
1192
+ "eval_runtime": 1.347,
1193
+ "eval_samples_per_second": 74.241,
1194
+ "eval_steps_per_second": 12.621,
1195
+ "step": 3950
1196
+ },
1197
+ {
1198
+ "epoch": 0.4399593037644018,
1199
+ "grad_norm": 4.741697788238525,
1200
+ "learning_rate": 4.6830637173984816e-05,
1201
+ "loss": 0.5780908584594726,
1202
+ "step": 4000
1203
+ },
1204
+ {
1205
+ "epoch": 0.4399593037644018,
1206
+ "eval_loss": 0.6712077260017395,
1207
+ "eval_runtime": 1.3399,
1208
+ "eval_samples_per_second": 74.63,
1209
+ "eval_steps_per_second": 12.687,
1210
+ "step": 4000
1211
+ }
1212
+ ],
1213
+ "logging_steps": 50,
1214
+ "max_steps": 18184,
1215
+ "num_input_tokens_seen": 0,
1216
+ "num_train_epochs": 2,
1217
+ "save_steps": 500,
1218
+ "stateful_callbacks": {
1219
+ "TrainerControl": {
1220
+ "args": {
1221
+ "should_epoch_stop": false,
1222
+ "should_evaluate": false,
1223
+ "should_log": false,
1224
+ "should_save": true,
1225
+ "should_training_stop": false
1226
+ },
1227
+ "attributes": {}
1228
+ }
1229
+ },
1230
+ "total_flos": 3.600928640036045e+16,
1231
+ "train_batch_size": 4,
1232
+ "trial_name": null,
1233
+ "trial_params": null
1234
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2c6a9e13e2fe214895d1d166dd41dde5c9df0f04611cacb808c08c1ada3007b4
3
+ size 5201