diff --git a/.gitattributes b/.gitattributes
index a6344aac8c09253b3b630fb776ae94478aa0275b..38dfff0f16e89369f5f3a7712ebe4988ce478c6f 100644
--- a/.gitattributes
+++ b/.gitattributes
@@ -33,3 +33,9 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
+checkpoint-200/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+checkpoint-400/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+checkpoint-600/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+checkpoint-800/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+checkpoint-879/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/README.md b/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..26e95dfdb2ce21d15943da03dc221885e4e0766b
--- /dev/null
+++ b/README.md
@@ -0,0 +1,209 @@
+---
+base_model: deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.20.0
\ No newline at end of file
diff --git a/adapter_config.json b/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..3e6084886e22b204a0c346cc3c9e491f44a217f3
--- /dev/null
+++ b/adapter_config.json
@@ -0,0 +1,50 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 32,
+ "lora_bias": false,
+ "lora_dropout": 0.05,
+ "lora_ga_config": null,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "monteclora_config": null,
+ "peft_type": "LORA",
+ "peft_version": "0.20.0",
+ "qalora_group_size": 16,
+ "r": 16,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "q_proj",
+ "up_proj",
+ "down_proj",
+ "k_proj",
+ "o_proj",
+ "v_proj",
+ "gate_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_bdlora": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false,
+ "velora_config": null
+}
\ No newline at end of file
diff --git a/adapter_model.safetensors b/adapter_model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..d1f76a1750f9a8eefc9bbc81dc76e88088c50bd3
--- /dev/null
+++ b/adapter_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8de8bf2fd18381ef12444c3a4498a621e7212eb593668a78afcdd21768f5b0fa
+size 73911112
diff --git a/checkpoint-200/README.md b/checkpoint-200/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..26e95dfdb2ce21d15943da03dc221885e4e0766b
--- /dev/null
+++ b/checkpoint-200/README.md
@@ -0,0 +1,209 @@
+---
+base_model: deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.20.0
\ No newline at end of file
diff --git a/checkpoint-200/adapter_config.json b/checkpoint-200/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..3e6084886e22b204a0c346cc3c9e491f44a217f3
--- /dev/null
+++ b/checkpoint-200/adapter_config.json
@@ -0,0 +1,50 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 32,
+ "lora_bias": false,
+ "lora_dropout": 0.05,
+ "lora_ga_config": null,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "monteclora_config": null,
+ "peft_type": "LORA",
+ "peft_version": "0.20.0",
+ "qalora_group_size": 16,
+ "r": 16,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "q_proj",
+ "up_proj",
+ "down_proj",
+ "k_proj",
+ "o_proj",
+ "v_proj",
+ "gate_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_bdlora": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false,
+ "velora_config": null
+}
\ No newline at end of file
diff --git a/checkpoint-200/adapter_model.safetensors b/checkpoint-200/adapter_model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..7720e04d9bd22bc74d0d2603db587ac019d944a6
--- /dev/null
+++ b/checkpoint-200/adapter_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:cb7df524a13f132acd4e14dd36411982f44552153da805f36658baba203ef6ec
+size 73911112
diff --git a/checkpoint-200/optimizer.pt b/checkpoint-200/optimizer.pt
new file mode 100644
index 0000000000000000000000000000000000000000..90a378f184a3bd132acf90a41e56fa32bdff3ffb
--- /dev/null
+++ b/checkpoint-200/optimizer.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8ad9065bb4340c236a62d7ec1fc12f7c4678de00c0244cc25bc0c4ba5ea10138
+size 37969268
diff --git a/checkpoint-200/rng_state.pth b/checkpoint-200/rng_state.pth
new file mode 100644
index 0000000000000000000000000000000000000000..02c40ed8084ebf1800bcca70baebd4245a230448
--- /dev/null
+++ b/checkpoint-200/rng_state.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:fbd5dc3846fde0a8e01887b93f1b5753679875cb16005c0f2219d5be2fb0f717
+size 14244
diff --git a/checkpoint-200/scheduler.pt b/checkpoint-200/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..a6934d389a6b865ef182c29e9a1f1fd268a8bdf8
--- /dev/null
+++ b/checkpoint-200/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:5f0a841d0fa965ade7dbf3a34a1021756a215f73311c59e711208417d012e806
+size 1064
diff --git a/checkpoint-200/special_tokens_map.json b/checkpoint-200/special_tokens_map.json
new file mode 100644
index 0000000000000000000000000000000000000000..d53f816edeeee223cdcd54b743a647b49ee6d5f2
--- /dev/null
+++ b/checkpoint-200/special_tokens_map.json
@@ -0,0 +1,17 @@
+{
+ "bos_token": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "eos_token": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": "<|end▁of▁sentence|>"
+}
diff --git a/checkpoint-200/tokenizer.json b/checkpoint-200/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..1a2db243e47cbc113f6b2ddcc388aeeb8fe1a94c
--- /dev/null
+++ b/checkpoint-200/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e20ddafc659ba90242154b55275402edeca0715e5dbb30f56815a4ce081f4893
+size 11422778
diff --git a/checkpoint-200/tokenizer_config.json b/checkpoint-200/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..8095baa150cba7889d4b1d0f1b6564f886ac4618
--- /dev/null
+++ b/checkpoint-200/tokenizer_config.json
@@ -0,0 +1,194 @@
+{
+ "add_bos_token": true,
+ "add_eos_token": false,
+ "add_prefix_space": null,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|User|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151645": {
+ "content": "<|Assistant|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151646": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|EOT|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151648": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151649": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "bos_token": "<|begin▁of▁sentence|>",
+ "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set ns = namespace(is_first=false, is_tool=false, is_output_first=true, system_prompt='') %}{%- for message in messages %}{%- if message['role'] == 'system' %}{% set ns.system_prompt = message['content'] %}{%- endif %}{%- endfor %}{{bos_token}}{{ns.system_prompt}}{%- for message in messages %}{%- if message['role'] == 'user' %}{%- set ns.is_tool = false -%}{{'<|User|>' + message['content']}}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is none %}{%- set ns.is_tool = false -%}{%- for tool in message['tool_calls']%}{%- if not ns.is_first %}{{'<|Assistant|><|tool▁calls▁begin|><|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{%- set ns.is_first = true -%}{%- else %}{{'\\n' + '<|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{{'<|tool▁calls▁end|><|end▁of▁sentence|>'}}{%- endif %}{%- endfor %}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is not none %}{%- if ns.is_tool %}{{'<|tool▁outputs▁end|>' + message['content'] + '<|end▁of▁sentence|>'}}{%- set ns.is_tool = false -%}{%- else %}{% set content = message['content'] %}{% if '' in content %}{% set content = content.split('')[-1] %}{% endif %}{{'<|Assistant|>' + content + '<|end▁of▁sentence|>'}}{%- endif %}{%- endif %}{%- if message['role'] == 'tool' %}{%- set ns.is_tool = true -%}{%- if ns.is_output_first %}{{'<|tool▁outputs▁begin|><|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- set ns.is_output_first = false %}{%- else %}{{'\\n<|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- endif %}{%- endif %}{%- endfor -%}{% if ns.is_tool %}{{'<|tool▁outputs▁end|>'}}{% endif %}{% if add_generation_prompt and not ns.is_tool %}{{'<|Assistant|>\\n'}}{% endif %}",
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|end▁of▁sentence|>",
+ "legacy": true,
+ "model_max_length": 16384,
+ "pad_token": "<|end▁of▁sentence|>",
+ "sp_model_kwargs": {},
+ "tokenizer_class": "LlamaTokenizer",
+ "unk_token": null,
+ "use_default_system_prompt": false
+}
diff --git a/checkpoint-200/trainer_state.json b/checkpoint-200/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..4ea5cabd00d873a3b1459b1b27693921080229b0
--- /dev/null
+++ b/checkpoint-200/trainer_state.json
@@ -0,0 +1,393 @@
+{
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.6811409110259685,
+ "eval_steps": 500,
+ "global_step": 200,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "epoch": 0.017028522775649212,
+ "grad_norm": 2.3286359310150146,
+ "learning_rate": 0.0001988623435722412,
+ "loss": 4.1641,
+ "mean_token_accuracy": 0.3866006717085838,
+ "num_tokens": 4326.0,
+ "step": 5
+ },
+ {
+ "epoch": 0.034057045551298425,
+ "grad_norm": 1.4926602840423584,
+ "learning_rate": 0.00019772468714448238,
+ "loss": 2.0591,
+ "mean_token_accuracy": 0.6790341928601265,
+ "num_tokens": 8676.0,
+ "step": 10
+ },
+ {
+ "epoch": 0.05108556832694764,
+ "grad_norm": 1.0835968255996704,
+ "learning_rate": 0.00019658703071672356,
+ "loss": 1.3145,
+ "mean_token_accuracy": 0.8256841972470284,
+ "num_tokens": 12796.0,
+ "step": 15
+ },
+ {
+ "epoch": 0.06811409110259685,
+ "grad_norm": 0.7724414467811584,
+ "learning_rate": 0.00019544937428896475,
+ "loss": 1.3324,
+ "mean_token_accuracy": 0.8117582932114601,
+ "num_tokens": 17119.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.08514261387824607,
+ "grad_norm": 0.785762369632721,
+ "learning_rate": 0.00019431171786120593,
+ "loss": 1.3375,
+ "mean_token_accuracy": 0.8029867172241211,
+ "num_tokens": 21499.0,
+ "step": 25
+ },
+ {
+ "epoch": 0.10217113665389528,
+ "grad_norm": 0.6702725291252136,
+ "learning_rate": 0.00019317406143344712,
+ "loss": 1.2159,
+ "mean_token_accuracy": 0.8230627462267875,
+ "num_tokens": 25785.0,
+ "step": 30
+ },
+ {
+ "epoch": 0.11919965942954448,
+ "grad_norm": 0.6287369728088379,
+ "learning_rate": 0.0001920364050056883,
+ "loss": 1.1634,
+ "mean_token_accuracy": 0.8315445825457572,
+ "num_tokens": 29980.0,
+ "step": 35
+ },
+ {
+ "epoch": 0.1362281822051937,
+ "grad_norm": 0.6573143005371094,
+ "learning_rate": 0.00019089874857792946,
+ "loss": 1.3762,
+ "mean_token_accuracy": 0.7971536681056023,
+ "num_tokens": 34497.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.1532567049808429,
+ "grad_norm": 0.6560688614845276,
+ "learning_rate": 0.00018976109215017067,
+ "loss": 1.1589,
+ "mean_token_accuracy": 0.8251897826790809,
+ "num_tokens": 38800.0,
+ "step": 45
+ },
+ {
+ "epoch": 0.17028522775649213,
+ "grad_norm": 0.6654791831970215,
+ "learning_rate": 0.00018862343572241183,
+ "loss": 1.1498,
+ "mean_token_accuracy": 0.8319168403744698,
+ "num_tokens": 43055.0,
+ "step": 50
+ },
+ {
+ "epoch": 0.18731375053214133,
+ "grad_norm": 0.7387417554855347,
+ "learning_rate": 0.00018748577929465302,
+ "loss": 1.1265,
+ "mean_token_accuracy": 0.8290244281291962,
+ "num_tokens": 47346.0,
+ "step": 55
+ },
+ {
+ "epoch": 0.20434227330779056,
+ "grad_norm": 0.5795997977256775,
+ "learning_rate": 0.0001863481228668942,
+ "loss": 1.0046,
+ "mean_token_accuracy": 0.8534704640507698,
+ "num_tokens": 51485.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.22137079608343976,
+ "grad_norm": 0.6834130883216858,
+ "learning_rate": 0.0001852104664391354,
+ "loss": 1.113,
+ "mean_token_accuracy": 0.8345914751291275,
+ "num_tokens": 55716.0,
+ "step": 65
+ },
+ {
+ "epoch": 0.23839931885908897,
+ "grad_norm": 0.7211284041404724,
+ "learning_rate": 0.00018407281001137657,
+ "loss": 1.2132,
+ "mean_token_accuracy": 0.8207321017980576,
+ "num_tokens": 60030.0,
+ "step": 70
+ },
+ {
+ "epoch": 0.2554278416347382,
+ "grad_norm": 0.6312271356582642,
+ "learning_rate": 0.00018293515358361776,
+ "loss": 1.0987,
+ "mean_token_accuracy": 0.8333725541830063,
+ "num_tokens": 64288.0,
+ "step": 75
+ },
+ {
+ "epoch": 0.2724563644103874,
+ "grad_norm": 0.7119404077529907,
+ "learning_rate": 0.00018179749715585894,
+ "loss": 1.0981,
+ "mean_token_accuracy": 0.8323698997497558,
+ "num_tokens": 68548.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.2894848871860366,
+ "grad_norm": 0.9000201225280762,
+ "learning_rate": 0.00018065984072810013,
+ "loss": 1.146,
+ "mean_token_accuracy": 0.8253335595130921,
+ "num_tokens": 72914.0,
+ "step": 85
+ },
+ {
+ "epoch": 0.3065134099616858,
+ "grad_norm": 0.6050537824630737,
+ "learning_rate": 0.0001795221843003413,
+ "loss": 1.0111,
+ "mean_token_accuracy": 0.842674246430397,
+ "num_tokens": 77168.0,
+ "step": 90
+ },
+ {
+ "epoch": 0.32354193273733506,
+ "grad_norm": 0.684512197971344,
+ "learning_rate": 0.0001783845278725825,
+ "loss": 1.1186,
+ "mean_token_accuracy": 0.8351956441998482,
+ "num_tokens": 81439.0,
+ "step": 95
+ },
+ {
+ "epoch": 0.34057045551298426,
+ "grad_norm": 0.7323129773139954,
+ "learning_rate": 0.00017724687144482368,
+ "loss": 1.1287,
+ "mean_token_accuracy": 0.8245970487594605,
+ "num_tokens": 85773.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.35759897828863346,
+ "grad_norm": 0.7547741532325745,
+ "learning_rate": 0.00017610921501706487,
+ "loss": 1.0868,
+ "mean_token_accuracy": 0.8298466548323631,
+ "num_tokens": 90117.0,
+ "step": 105
+ },
+ {
+ "epoch": 0.37462750106428266,
+ "grad_norm": 0.7113769054412842,
+ "learning_rate": 0.00017497155858930602,
+ "loss": 1.1214,
+ "mean_token_accuracy": 0.8299670115113258,
+ "num_tokens": 94412.0,
+ "step": 110
+ },
+ {
+ "epoch": 0.39165602383993187,
+ "grad_norm": 0.7486220002174377,
+ "learning_rate": 0.00017383390216154724,
+ "loss": 1.1452,
+ "mean_token_accuracy": 0.8283886179327965,
+ "num_tokens": 98782.0,
+ "step": 115
+ },
+ {
+ "epoch": 0.4086845466155811,
+ "grad_norm": 0.658633828163147,
+ "learning_rate": 0.0001726962457337884,
+ "loss": 1.0415,
+ "mean_token_accuracy": 0.8431179687380791,
+ "num_tokens": 103011.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.4257130693912303,
+ "grad_norm": 0.783794105052948,
+ "learning_rate": 0.0001715585893060296,
+ "loss": 1.1056,
+ "mean_token_accuracy": 0.8254878520965576,
+ "num_tokens": 107402.0,
+ "step": 125
+ },
+ {
+ "epoch": 0.4427415921668795,
+ "grad_norm": 0.7954565286636353,
+ "learning_rate": 0.00017042093287827076,
+ "loss": 1.0518,
+ "mean_token_accuracy": 0.8375606715679169,
+ "num_tokens": 111707.0,
+ "step": 130
+ },
+ {
+ "epoch": 0.45977011494252873,
+ "grad_norm": 0.6913949847221375,
+ "learning_rate": 0.00016928327645051198,
+ "loss": 1.1104,
+ "mean_token_accuracy": 0.8326424166560173,
+ "num_tokens": 115998.0,
+ "step": 135
+ },
+ {
+ "epoch": 0.47679863771817793,
+ "grad_norm": 0.7918037176132202,
+ "learning_rate": 0.00016814562002275313,
+ "loss": 1.0495,
+ "mean_token_accuracy": 0.8390962019562721,
+ "num_tokens": 120271.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.49382716049382713,
+ "grad_norm": 0.7816826701164246,
+ "learning_rate": 0.00016700796359499432,
+ "loss": 1.0463,
+ "mean_token_accuracy": 0.8433194428682327,
+ "num_tokens": 124461.0,
+ "step": 145
+ },
+ {
+ "epoch": 0.5108556832694764,
+ "grad_norm": 0.8069042563438416,
+ "learning_rate": 0.0001658703071672355,
+ "loss": 1.0664,
+ "mean_token_accuracy": 0.8278923153877258,
+ "num_tokens": 128781.0,
+ "step": 150
+ },
+ {
+ "epoch": 0.5278842060451255,
+ "grad_norm": 1.0114731788635254,
+ "learning_rate": 0.0001647326507394767,
+ "loss": 1.1217,
+ "mean_token_accuracy": 0.8267972275614739,
+ "num_tokens": 133167.0,
+ "step": 155
+ },
+ {
+ "epoch": 0.5449127288207748,
+ "grad_norm": 0.7900378704071045,
+ "learning_rate": 0.00016359499431171787,
+ "loss": 0.971,
+ "mean_token_accuracy": 0.8421565622091294,
+ "num_tokens": 137464.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.561941251596424,
+ "grad_norm": 0.8059927821159363,
+ "learning_rate": 0.00016245733788395906,
+ "loss": 1.0457,
+ "mean_token_accuracy": 0.8381335601210594,
+ "num_tokens": 141760.0,
+ "step": 165
+ },
+ {
+ "epoch": 0.5789697743720732,
+ "grad_norm": 0.7589371800422668,
+ "learning_rate": 0.00016131968145620024,
+ "loss": 1.0208,
+ "mean_token_accuracy": 0.8342296928167343,
+ "num_tokens": 146051.0,
+ "step": 170
+ },
+ {
+ "epoch": 0.5959982971477225,
+ "grad_norm": 0.692416250705719,
+ "learning_rate": 0.00016018202502844143,
+ "loss": 0.9837,
+ "mean_token_accuracy": 0.8510025009512902,
+ "num_tokens": 150270.0,
+ "step": 175
+ },
+ {
+ "epoch": 0.6130268199233716,
+ "grad_norm": 0.6662923097610474,
+ "learning_rate": 0.0001590443686006826,
+ "loss": 0.9835,
+ "mean_token_accuracy": 0.8463438332080842,
+ "num_tokens": 154537.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.6300553426990209,
+ "grad_norm": 0.7452691793441772,
+ "learning_rate": 0.0001579067121729238,
+ "loss": 1.0496,
+ "mean_token_accuracy": 0.8375737622380257,
+ "num_tokens": 158810.0,
+ "step": 185
+ },
+ {
+ "epoch": 0.6470838654746701,
+ "grad_norm": 0.809700608253479,
+ "learning_rate": 0.00015676905574516496,
+ "loss": 1.0595,
+ "mean_token_accuracy": 0.8294038504362107,
+ "num_tokens": 163213.0,
+ "step": 190
+ },
+ {
+ "epoch": 0.6641123882503193,
+ "grad_norm": 0.7708745002746582,
+ "learning_rate": 0.00015563139931740617,
+ "loss": 1.0976,
+ "mean_token_accuracy": 0.8289313957095146,
+ "num_tokens": 167607.0,
+ "step": 195
+ },
+ {
+ "epoch": 0.6811409110259685,
+ "grad_norm": 0.6482141613960266,
+ "learning_rate": 0.00015449374288964733,
+ "loss": 1.0701,
+ "mean_token_accuracy": 0.8261386752128601,
+ "num_tokens": 172024.0,
+ "step": 200
+ }
+ ],
+ "logging_steps": 5,
+ "max_steps": 879,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 3,
+ "save_steps": 200,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1612393756090368.0,
+ "train_batch_size": 1,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/checkpoint-200/training_args.bin b/checkpoint-200/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..b2b3017298d5c921f7f2203bfc0351607fabc713
--- /dev/null
+++ b/checkpoint-200/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:001de43419a04313fd3d652571d90911489fbcebf2f0e7c3f8aa624286dfc855
+size 5624
diff --git a/checkpoint-400/README.md b/checkpoint-400/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..26e95dfdb2ce21d15943da03dc221885e4e0766b
--- /dev/null
+++ b/checkpoint-400/README.md
@@ -0,0 +1,209 @@
+---
+base_model: deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.20.0
\ No newline at end of file
diff --git a/checkpoint-400/adapter_config.json b/checkpoint-400/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..3e6084886e22b204a0c346cc3c9e491f44a217f3
--- /dev/null
+++ b/checkpoint-400/adapter_config.json
@@ -0,0 +1,50 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 32,
+ "lora_bias": false,
+ "lora_dropout": 0.05,
+ "lora_ga_config": null,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "monteclora_config": null,
+ "peft_type": "LORA",
+ "peft_version": "0.20.0",
+ "qalora_group_size": 16,
+ "r": 16,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "q_proj",
+ "up_proj",
+ "down_proj",
+ "k_proj",
+ "o_proj",
+ "v_proj",
+ "gate_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_bdlora": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false,
+ "velora_config": null
+}
\ No newline at end of file
diff --git a/checkpoint-400/adapter_model.safetensors b/checkpoint-400/adapter_model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..390291034d6da2fe43f6a3bb276e9ea597f0630a
--- /dev/null
+++ b/checkpoint-400/adapter_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:71ac0ee7f7bbd14b6f156757d2e936048b87875596ffc471cfa5e817bbd96942
+size 73911112
diff --git a/checkpoint-400/optimizer.pt b/checkpoint-400/optimizer.pt
new file mode 100644
index 0000000000000000000000000000000000000000..ed69e33d127688b583c10087e74958a298805a91
--- /dev/null
+++ b/checkpoint-400/optimizer.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:19f063558cb0368749b80f6045392123df659ff5c089159e50672040f61f19a3
+size 37969652
diff --git a/checkpoint-400/rng_state.pth b/checkpoint-400/rng_state.pth
new file mode 100644
index 0000000000000000000000000000000000000000..57efee6cb6fc31268bfa864c6952505582a62742
--- /dev/null
+++ b/checkpoint-400/rng_state.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:36af5667dfbe01f624b0c26ca62afba73c7149bbea27ed1ff6944191087a2212
+size 14244
diff --git a/checkpoint-400/scheduler.pt b/checkpoint-400/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..5705e146302954aa7419a1f92c128f22f55c90bb
--- /dev/null
+++ b/checkpoint-400/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:fbaa767a1867f6f8022ea209ef1a03a369e44768800ec83f2966bcd9939650bb
+size 1064
diff --git a/checkpoint-400/special_tokens_map.json b/checkpoint-400/special_tokens_map.json
new file mode 100644
index 0000000000000000000000000000000000000000..d53f816edeeee223cdcd54b743a647b49ee6d5f2
--- /dev/null
+++ b/checkpoint-400/special_tokens_map.json
@@ -0,0 +1,17 @@
+{
+ "bos_token": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "eos_token": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": "<|end▁of▁sentence|>"
+}
diff --git a/checkpoint-400/tokenizer.json b/checkpoint-400/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..1a2db243e47cbc113f6b2ddcc388aeeb8fe1a94c
--- /dev/null
+++ b/checkpoint-400/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e20ddafc659ba90242154b55275402edeca0715e5dbb30f56815a4ce081f4893
+size 11422778
diff --git a/checkpoint-400/tokenizer_config.json b/checkpoint-400/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..8095baa150cba7889d4b1d0f1b6564f886ac4618
--- /dev/null
+++ b/checkpoint-400/tokenizer_config.json
@@ -0,0 +1,194 @@
+{
+ "add_bos_token": true,
+ "add_eos_token": false,
+ "add_prefix_space": null,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|User|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151645": {
+ "content": "<|Assistant|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151646": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|EOT|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151648": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151649": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "bos_token": "<|begin▁of▁sentence|>",
+ "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set ns = namespace(is_first=false, is_tool=false, is_output_first=true, system_prompt='') %}{%- for message in messages %}{%- if message['role'] == 'system' %}{% set ns.system_prompt = message['content'] %}{%- endif %}{%- endfor %}{{bos_token}}{{ns.system_prompt}}{%- for message in messages %}{%- if message['role'] == 'user' %}{%- set ns.is_tool = false -%}{{'<|User|>' + message['content']}}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is none %}{%- set ns.is_tool = false -%}{%- for tool in message['tool_calls']%}{%- if not ns.is_first %}{{'<|Assistant|><|tool▁calls▁begin|><|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{%- set ns.is_first = true -%}{%- else %}{{'\\n' + '<|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{{'<|tool▁calls▁end|><|end▁of▁sentence|>'}}{%- endif %}{%- endfor %}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is not none %}{%- if ns.is_tool %}{{'<|tool▁outputs▁end|>' + message['content'] + '<|end▁of▁sentence|>'}}{%- set ns.is_tool = false -%}{%- else %}{% set content = message['content'] %}{% if '' in content %}{% set content = content.split('')[-1] %}{% endif %}{{'<|Assistant|>' + content + '<|end▁of▁sentence|>'}}{%- endif %}{%- endif %}{%- if message['role'] == 'tool' %}{%- set ns.is_tool = true -%}{%- if ns.is_output_first %}{{'<|tool▁outputs▁begin|><|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- set ns.is_output_first = false %}{%- else %}{{'\\n<|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- endif %}{%- endif %}{%- endfor -%}{% if ns.is_tool %}{{'<|tool▁outputs▁end|>'}}{% endif %}{% if add_generation_prompt and not ns.is_tool %}{{'<|Assistant|>\\n'}}{% endif %}",
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|end▁of▁sentence|>",
+ "legacy": true,
+ "model_max_length": 16384,
+ "pad_token": "<|end▁of▁sentence|>",
+ "sp_model_kwargs": {},
+ "tokenizer_class": "LlamaTokenizer",
+ "unk_token": null,
+ "use_default_system_prompt": false
+}
diff --git a/checkpoint-400/trainer_state.json b/checkpoint-400/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..9efa714c1fb64336733f3c0e1010d9f69c2481d1
--- /dev/null
+++ b/checkpoint-400/trainer_state.json
@@ -0,0 +1,753 @@
+{
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 1.362281822051937,
+ "eval_steps": 500,
+ "global_step": 400,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "epoch": 0.017028522775649212,
+ "grad_norm": 2.3286359310150146,
+ "learning_rate": 0.0001988623435722412,
+ "loss": 4.1641,
+ "mean_token_accuracy": 0.3866006717085838,
+ "num_tokens": 4326.0,
+ "step": 5
+ },
+ {
+ "epoch": 0.034057045551298425,
+ "grad_norm": 1.4926602840423584,
+ "learning_rate": 0.00019772468714448238,
+ "loss": 2.0591,
+ "mean_token_accuracy": 0.6790341928601265,
+ "num_tokens": 8676.0,
+ "step": 10
+ },
+ {
+ "epoch": 0.05108556832694764,
+ "grad_norm": 1.0835968255996704,
+ "learning_rate": 0.00019658703071672356,
+ "loss": 1.3145,
+ "mean_token_accuracy": 0.8256841972470284,
+ "num_tokens": 12796.0,
+ "step": 15
+ },
+ {
+ "epoch": 0.06811409110259685,
+ "grad_norm": 0.7724414467811584,
+ "learning_rate": 0.00019544937428896475,
+ "loss": 1.3324,
+ "mean_token_accuracy": 0.8117582932114601,
+ "num_tokens": 17119.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.08514261387824607,
+ "grad_norm": 0.785762369632721,
+ "learning_rate": 0.00019431171786120593,
+ "loss": 1.3375,
+ "mean_token_accuracy": 0.8029867172241211,
+ "num_tokens": 21499.0,
+ "step": 25
+ },
+ {
+ "epoch": 0.10217113665389528,
+ "grad_norm": 0.6702725291252136,
+ "learning_rate": 0.00019317406143344712,
+ "loss": 1.2159,
+ "mean_token_accuracy": 0.8230627462267875,
+ "num_tokens": 25785.0,
+ "step": 30
+ },
+ {
+ "epoch": 0.11919965942954448,
+ "grad_norm": 0.6287369728088379,
+ "learning_rate": 0.0001920364050056883,
+ "loss": 1.1634,
+ "mean_token_accuracy": 0.8315445825457572,
+ "num_tokens": 29980.0,
+ "step": 35
+ },
+ {
+ "epoch": 0.1362281822051937,
+ "grad_norm": 0.6573143005371094,
+ "learning_rate": 0.00019089874857792946,
+ "loss": 1.3762,
+ "mean_token_accuracy": 0.7971536681056023,
+ "num_tokens": 34497.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.1532567049808429,
+ "grad_norm": 0.6560688614845276,
+ "learning_rate": 0.00018976109215017067,
+ "loss": 1.1589,
+ "mean_token_accuracy": 0.8251897826790809,
+ "num_tokens": 38800.0,
+ "step": 45
+ },
+ {
+ "epoch": 0.17028522775649213,
+ "grad_norm": 0.6654791831970215,
+ "learning_rate": 0.00018862343572241183,
+ "loss": 1.1498,
+ "mean_token_accuracy": 0.8319168403744698,
+ "num_tokens": 43055.0,
+ "step": 50
+ },
+ {
+ "epoch": 0.18731375053214133,
+ "grad_norm": 0.7387417554855347,
+ "learning_rate": 0.00018748577929465302,
+ "loss": 1.1265,
+ "mean_token_accuracy": 0.8290244281291962,
+ "num_tokens": 47346.0,
+ "step": 55
+ },
+ {
+ "epoch": 0.20434227330779056,
+ "grad_norm": 0.5795997977256775,
+ "learning_rate": 0.0001863481228668942,
+ "loss": 1.0046,
+ "mean_token_accuracy": 0.8534704640507698,
+ "num_tokens": 51485.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.22137079608343976,
+ "grad_norm": 0.6834130883216858,
+ "learning_rate": 0.0001852104664391354,
+ "loss": 1.113,
+ "mean_token_accuracy": 0.8345914751291275,
+ "num_tokens": 55716.0,
+ "step": 65
+ },
+ {
+ "epoch": 0.23839931885908897,
+ "grad_norm": 0.7211284041404724,
+ "learning_rate": 0.00018407281001137657,
+ "loss": 1.2132,
+ "mean_token_accuracy": 0.8207321017980576,
+ "num_tokens": 60030.0,
+ "step": 70
+ },
+ {
+ "epoch": 0.2554278416347382,
+ "grad_norm": 0.6312271356582642,
+ "learning_rate": 0.00018293515358361776,
+ "loss": 1.0987,
+ "mean_token_accuracy": 0.8333725541830063,
+ "num_tokens": 64288.0,
+ "step": 75
+ },
+ {
+ "epoch": 0.2724563644103874,
+ "grad_norm": 0.7119404077529907,
+ "learning_rate": 0.00018179749715585894,
+ "loss": 1.0981,
+ "mean_token_accuracy": 0.8323698997497558,
+ "num_tokens": 68548.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.2894848871860366,
+ "grad_norm": 0.9000201225280762,
+ "learning_rate": 0.00018065984072810013,
+ "loss": 1.146,
+ "mean_token_accuracy": 0.8253335595130921,
+ "num_tokens": 72914.0,
+ "step": 85
+ },
+ {
+ "epoch": 0.3065134099616858,
+ "grad_norm": 0.6050537824630737,
+ "learning_rate": 0.0001795221843003413,
+ "loss": 1.0111,
+ "mean_token_accuracy": 0.842674246430397,
+ "num_tokens": 77168.0,
+ "step": 90
+ },
+ {
+ "epoch": 0.32354193273733506,
+ "grad_norm": 0.684512197971344,
+ "learning_rate": 0.0001783845278725825,
+ "loss": 1.1186,
+ "mean_token_accuracy": 0.8351956441998482,
+ "num_tokens": 81439.0,
+ "step": 95
+ },
+ {
+ "epoch": 0.34057045551298426,
+ "grad_norm": 0.7323129773139954,
+ "learning_rate": 0.00017724687144482368,
+ "loss": 1.1287,
+ "mean_token_accuracy": 0.8245970487594605,
+ "num_tokens": 85773.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.35759897828863346,
+ "grad_norm": 0.7547741532325745,
+ "learning_rate": 0.00017610921501706487,
+ "loss": 1.0868,
+ "mean_token_accuracy": 0.8298466548323631,
+ "num_tokens": 90117.0,
+ "step": 105
+ },
+ {
+ "epoch": 0.37462750106428266,
+ "grad_norm": 0.7113769054412842,
+ "learning_rate": 0.00017497155858930602,
+ "loss": 1.1214,
+ "mean_token_accuracy": 0.8299670115113258,
+ "num_tokens": 94412.0,
+ "step": 110
+ },
+ {
+ "epoch": 0.39165602383993187,
+ "grad_norm": 0.7486220002174377,
+ "learning_rate": 0.00017383390216154724,
+ "loss": 1.1452,
+ "mean_token_accuracy": 0.8283886179327965,
+ "num_tokens": 98782.0,
+ "step": 115
+ },
+ {
+ "epoch": 0.4086845466155811,
+ "grad_norm": 0.658633828163147,
+ "learning_rate": 0.0001726962457337884,
+ "loss": 1.0415,
+ "mean_token_accuracy": 0.8431179687380791,
+ "num_tokens": 103011.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.4257130693912303,
+ "grad_norm": 0.783794105052948,
+ "learning_rate": 0.0001715585893060296,
+ "loss": 1.1056,
+ "mean_token_accuracy": 0.8254878520965576,
+ "num_tokens": 107402.0,
+ "step": 125
+ },
+ {
+ "epoch": 0.4427415921668795,
+ "grad_norm": 0.7954565286636353,
+ "learning_rate": 0.00017042093287827076,
+ "loss": 1.0518,
+ "mean_token_accuracy": 0.8375606715679169,
+ "num_tokens": 111707.0,
+ "step": 130
+ },
+ {
+ "epoch": 0.45977011494252873,
+ "grad_norm": 0.6913949847221375,
+ "learning_rate": 0.00016928327645051198,
+ "loss": 1.1104,
+ "mean_token_accuracy": 0.8326424166560173,
+ "num_tokens": 115998.0,
+ "step": 135
+ },
+ {
+ "epoch": 0.47679863771817793,
+ "grad_norm": 0.7918037176132202,
+ "learning_rate": 0.00016814562002275313,
+ "loss": 1.0495,
+ "mean_token_accuracy": 0.8390962019562721,
+ "num_tokens": 120271.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.49382716049382713,
+ "grad_norm": 0.7816826701164246,
+ "learning_rate": 0.00016700796359499432,
+ "loss": 1.0463,
+ "mean_token_accuracy": 0.8433194428682327,
+ "num_tokens": 124461.0,
+ "step": 145
+ },
+ {
+ "epoch": 0.5108556832694764,
+ "grad_norm": 0.8069042563438416,
+ "learning_rate": 0.0001658703071672355,
+ "loss": 1.0664,
+ "mean_token_accuracy": 0.8278923153877258,
+ "num_tokens": 128781.0,
+ "step": 150
+ },
+ {
+ "epoch": 0.5278842060451255,
+ "grad_norm": 1.0114731788635254,
+ "learning_rate": 0.0001647326507394767,
+ "loss": 1.1217,
+ "mean_token_accuracy": 0.8267972275614739,
+ "num_tokens": 133167.0,
+ "step": 155
+ },
+ {
+ "epoch": 0.5449127288207748,
+ "grad_norm": 0.7900378704071045,
+ "learning_rate": 0.00016359499431171787,
+ "loss": 0.971,
+ "mean_token_accuracy": 0.8421565622091294,
+ "num_tokens": 137464.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.561941251596424,
+ "grad_norm": 0.8059927821159363,
+ "learning_rate": 0.00016245733788395906,
+ "loss": 1.0457,
+ "mean_token_accuracy": 0.8381335601210594,
+ "num_tokens": 141760.0,
+ "step": 165
+ },
+ {
+ "epoch": 0.5789697743720732,
+ "grad_norm": 0.7589371800422668,
+ "learning_rate": 0.00016131968145620024,
+ "loss": 1.0208,
+ "mean_token_accuracy": 0.8342296928167343,
+ "num_tokens": 146051.0,
+ "step": 170
+ },
+ {
+ "epoch": 0.5959982971477225,
+ "grad_norm": 0.692416250705719,
+ "learning_rate": 0.00016018202502844143,
+ "loss": 0.9837,
+ "mean_token_accuracy": 0.8510025009512902,
+ "num_tokens": 150270.0,
+ "step": 175
+ },
+ {
+ "epoch": 0.6130268199233716,
+ "grad_norm": 0.6662923097610474,
+ "learning_rate": 0.0001590443686006826,
+ "loss": 0.9835,
+ "mean_token_accuracy": 0.8463438332080842,
+ "num_tokens": 154537.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.6300553426990209,
+ "grad_norm": 0.7452691793441772,
+ "learning_rate": 0.0001579067121729238,
+ "loss": 1.0496,
+ "mean_token_accuracy": 0.8375737622380257,
+ "num_tokens": 158810.0,
+ "step": 185
+ },
+ {
+ "epoch": 0.6470838654746701,
+ "grad_norm": 0.809700608253479,
+ "learning_rate": 0.00015676905574516496,
+ "loss": 1.0595,
+ "mean_token_accuracy": 0.8294038504362107,
+ "num_tokens": 163213.0,
+ "step": 190
+ },
+ {
+ "epoch": 0.6641123882503193,
+ "grad_norm": 0.7708745002746582,
+ "learning_rate": 0.00015563139931740617,
+ "loss": 1.0976,
+ "mean_token_accuracy": 0.8289313957095146,
+ "num_tokens": 167607.0,
+ "step": 195
+ },
+ {
+ "epoch": 0.6811409110259685,
+ "grad_norm": 0.6482141613960266,
+ "learning_rate": 0.00015449374288964733,
+ "loss": 1.0701,
+ "mean_token_accuracy": 0.8261386752128601,
+ "num_tokens": 172024.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.6981694338016177,
+ "grad_norm": 0.7164883613586426,
+ "learning_rate": 0.00015335608646188854,
+ "loss": 0.9878,
+ "mean_token_accuracy": 0.8418964132666588,
+ "num_tokens": 176317.0,
+ "step": 205
+ },
+ {
+ "epoch": 0.7151979565772669,
+ "grad_norm": 0.710343599319458,
+ "learning_rate": 0.0001522184300341297,
+ "loss": 0.9306,
+ "mean_token_accuracy": 0.8468034327030182,
+ "num_tokens": 180558.0,
+ "step": 210
+ },
+ {
+ "epoch": 0.7322264793529162,
+ "grad_norm": 0.863784909248352,
+ "learning_rate": 0.00015108077360637088,
+ "loss": 1.0544,
+ "mean_token_accuracy": 0.8359945684671402,
+ "num_tokens": 184885.0,
+ "step": 215
+ },
+ {
+ "epoch": 0.7492550021285653,
+ "grad_norm": 0.8381637930870056,
+ "learning_rate": 0.00014994311717861207,
+ "loss": 1.0522,
+ "mean_token_accuracy": 0.836811026930809,
+ "num_tokens": 189219.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.7662835249042146,
+ "grad_norm": 0.683501124382019,
+ "learning_rate": 0.00014880546075085325,
+ "loss": 0.9427,
+ "mean_token_accuracy": 0.8544979348778725,
+ "num_tokens": 193437.0,
+ "step": 225
+ },
+ {
+ "epoch": 0.7833120476798637,
+ "grad_norm": 0.7609812617301941,
+ "learning_rate": 0.00014766780432309444,
+ "loss": 1.0048,
+ "mean_token_accuracy": 0.8403829500079155,
+ "num_tokens": 197724.0,
+ "step": 230
+ },
+ {
+ "epoch": 0.800340570455513,
+ "grad_norm": 0.8223949074745178,
+ "learning_rate": 0.00014653014789533562,
+ "loss": 1.078,
+ "mean_token_accuracy": 0.8296335831284523,
+ "num_tokens": 202141.0,
+ "step": 235
+ },
+ {
+ "epoch": 0.8173690932311622,
+ "grad_norm": 0.9807024002075195,
+ "learning_rate": 0.0001453924914675768,
+ "loss": 0.9295,
+ "mean_token_accuracy": 0.8495418474078178,
+ "num_tokens": 206333.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.8343976160068114,
+ "grad_norm": 0.7864217162132263,
+ "learning_rate": 0.000144254835039818,
+ "loss": 1.0326,
+ "mean_token_accuracy": 0.8422158002853394,
+ "num_tokens": 210593.0,
+ "step": 245
+ },
+ {
+ "epoch": 0.8514261387824607,
+ "grad_norm": 0.8183476328849792,
+ "learning_rate": 0.00014311717861205915,
+ "loss": 1.0419,
+ "mean_token_accuracy": 0.8332764700055122,
+ "num_tokens": 214925.0,
+ "step": 250
+ },
+ {
+ "epoch": 0.8684546615581098,
+ "grad_norm": 0.7906543612480164,
+ "learning_rate": 0.00014197952218430036,
+ "loss": 0.9278,
+ "mean_token_accuracy": 0.8531344652175903,
+ "num_tokens": 219106.0,
+ "step": 255
+ },
+ {
+ "epoch": 0.885483184333759,
+ "grad_norm": 0.7864625453948975,
+ "learning_rate": 0.00014084186575654152,
+ "loss": 0.9764,
+ "mean_token_accuracy": 0.8394758701324463,
+ "num_tokens": 223398.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.9025117071094083,
+ "grad_norm": 0.7231821417808533,
+ "learning_rate": 0.00013970420932878273,
+ "loss": 1.0357,
+ "mean_token_accuracy": 0.8368565306067467,
+ "num_tokens": 227720.0,
+ "step": 265
+ },
+ {
+ "epoch": 0.9195402298850575,
+ "grad_norm": 0.7288718223571777,
+ "learning_rate": 0.0001385665529010239,
+ "loss": 1.0178,
+ "mean_token_accuracy": 0.842984040081501,
+ "num_tokens": 232021.0,
+ "step": 270
+ },
+ {
+ "epoch": 0.9365687526607067,
+ "grad_norm": 0.7466130256652832,
+ "learning_rate": 0.0001374288964732651,
+ "loss": 0.9974,
+ "mean_token_accuracy": 0.8431279867887497,
+ "num_tokens": 236312.0,
+ "step": 275
+ },
+ {
+ "epoch": 0.9535972754363559,
+ "grad_norm": 0.7876543402671814,
+ "learning_rate": 0.00013629124004550626,
+ "loss": 1.0057,
+ "mean_token_accuracy": 0.8389794036746026,
+ "num_tokens": 240594.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.9706257982120051,
+ "grad_norm": 0.738293468952179,
+ "learning_rate": 0.00013515358361774744,
+ "loss": 0.9129,
+ "mean_token_accuracy": 0.8528255730867386,
+ "num_tokens": 244859.0,
+ "step": 285
+ },
+ {
+ "epoch": 0.9876543209876543,
+ "grad_norm": 0.8145989775657654,
+ "learning_rate": 0.00013401592718998863,
+ "loss": 0.9188,
+ "mean_token_accuracy": 0.8555046319961548,
+ "num_tokens": 249060.0,
+ "step": 290
+ },
+ {
+ "epoch": 1.0046828437633035,
+ "grad_norm": 0.693233072757721,
+ "learning_rate": 0.00013287827076222981,
+ "loss": 1.0648,
+ "mean_token_accuracy": 0.8477524280548095,
+ "num_tokens": 253361.0,
+ "step": 295
+ },
+ {
+ "epoch": 1.0217113665389528,
+ "grad_norm": 0.8171095848083496,
+ "learning_rate": 0.000131740614334471,
+ "loss": 0.883,
+ "mean_token_accuracy": 0.8561580404639244,
+ "num_tokens": 257633.0,
+ "step": 300
+ },
+ {
+ "epoch": 1.038739889314602,
+ "grad_norm": 0.7343988418579102,
+ "learning_rate": 0.00013060295790671218,
+ "loss": 0.8591,
+ "mean_token_accuracy": 0.8583228841423989,
+ "num_tokens": 261975.0,
+ "step": 305
+ },
+ {
+ "epoch": 1.055768412090251,
+ "grad_norm": 0.6689726114273071,
+ "learning_rate": 0.00012946530147895337,
+ "loss": 0.8397,
+ "mean_token_accuracy": 0.8668102487921715,
+ "num_tokens": 266174.0,
+ "step": 310
+ },
+ {
+ "epoch": 1.0727969348659003,
+ "grad_norm": 0.8284767270088196,
+ "learning_rate": 0.00012832764505119455,
+ "loss": 0.9108,
+ "mean_token_accuracy": 0.8551412716507911,
+ "num_tokens": 270416.0,
+ "step": 315
+ },
+ {
+ "epoch": 1.0898254576415496,
+ "grad_norm": 0.7800877690315247,
+ "learning_rate": 0.0001271899886234357,
+ "loss": 0.923,
+ "mean_token_accuracy": 0.8521544948220253,
+ "num_tokens": 274802.0,
+ "step": 320
+ },
+ {
+ "epoch": 1.1068539804171988,
+ "grad_norm": 0.803035318851471,
+ "learning_rate": 0.00012605233219567692,
+ "loss": 0.9009,
+ "mean_token_accuracy": 0.8583568409085274,
+ "num_tokens": 279061.0,
+ "step": 325
+ },
+ {
+ "epoch": 1.123882503192848,
+ "grad_norm": 0.7928335666656494,
+ "learning_rate": 0.00012491467576791808,
+ "loss": 0.8677,
+ "mean_token_accuracy": 0.860838033258915,
+ "num_tokens": 283290.0,
+ "step": 330
+ },
+ {
+ "epoch": 1.1409110259684971,
+ "grad_norm": 0.82757967710495,
+ "learning_rate": 0.0001237770193401593,
+ "loss": 0.9326,
+ "mean_token_accuracy": 0.8526211172342301,
+ "num_tokens": 287627.0,
+ "step": 335
+ },
+ {
+ "epoch": 1.1579395487441464,
+ "grad_norm": 0.8021914958953857,
+ "learning_rate": 0.00012263936291240045,
+ "loss": 0.9066,
+ "mean_token_accuracy": 0.8505649596452713,
+ "num_tokens": 291975.0,
+ "step": 340
+ },
+ {
+ "epoch": 1.1749680715197957,
+ "grad_norm": 0.7565475106239319,
+ "learning_rate": 0.00012150170648464165,
+ "loss": 0.8812,
+ "mean_token_accuracy": 0.8562570214271545,
+ "num_tokens": 296232.0,
+ "step": 345
+ },
+ {
+ "epoch": 1.191996594295445,
+ "grad_norm": 0.8126978278160095,
+ "learning_rate": 0.00012036405005688282,
+ "loss": 0.905,
+ "mean_token_accuracy": 0.8556828230619431,
+ "num_tokens": 300591.0,
+ "step": 350
+ },
+ {
+ "epoch": 1.2090251170710942,
+ "grad_norm": 0.8174765706062317,
+ "learning_rate": 0.000119226393629124,
+ "loss": 0.9861,
+ "mean_token_accuracy": 0.8424012079834938,
+ "num_tokens": 304998.0,
+ "step": 355
+ },
+ {
+ "epoch": 1.2260536398467432,
+ "grad_norm": 0.8921035528182983,
+ "learning_rate": 0.00011808873720136519,
+ "loss": 0.7724,
+ "mean_token_accuracy": 0.8735315829515458,
+ "num_tokens": 309137.0,
+ "step": 360
+ },
+ {
+ "epoch": 1.2430821626223925,
+ "grad_norm": 0.855992317199707,
+ "learning_rate": 0.00011695108077360638,
+ "loss": 0.8922,
+ "mean_token_accuracy": 0.854039640724659,
+ "num_tokens": 313389.0,
+ "step": 365
+ },
+ {
+ "epoch": 1.2601106853980417,
+ "grad_norm": 0.9408860206604004,
+ "learning_rate": 0.00011581342434584756,
+ "loss": 0.9254,
+ "mean_token_accuracy": 0.8507854476571083,
+ "num_tokens": 317743.0,
+ "step": 370
+ },
+ {
+ "epoch": 1.277139208173691,
+ "grad_norm": 0.7847197651863098,
+ "learning_rate": 0.00011467576791808873,
+ "loss": 0.8563,
+ "mean_token_accuracy": 0.869862625002861,
+ "num_tokens": 321873.0,
+ "step": 375
+ },
+ {
+ "epoch": 1.29416773094934,
+ "grad_norm": 0.8556840419769287,
+ "learning_rate": 0.00011353811149032993,
+ "loss": 0.8489,
+ "mean_token_accuracy": 0.8591933220624923,
+ "num_tokens": 326124.0,
+ "step": 380
+ },
+ {
+ "epoch": 1.3111962537249893,
+ "grad_norm": 0.8849514126777649,
+ "learning_rate": 0.0001124004550625711,
+ "loss": 0.8526,
+ "mean_token_accuracy": 0.8600789621472359,
+ "num_tokens": 330405.0,
+ "step": 385
+ },
+ {
+ "epoch": 1.3282247765006385,
+ "grad_norm": 0.8099865913391113,
+ "learning_rate": 0.00011126279863481229,
+ "loss": 0.9309,
+ "mean_token_accuracy": 0.8511071890592575,
+ "num_tokens": 334701.0,
+ "step": 390
+ },
+ {
+ "epoch": 1.3452532992762878,
+ "grad_norm": 0.8668401837348938,
+ "learning_rate": 0.00011012514220705347,
+ "loss": 0.8671,
+ "mean_token_accuracy": 0.8605618432164193,
+ "num_tokens": 338951.0,
+ "step": 395
+ },
+ {
+ "epoch": 1.362281822051937,
+ "grad_norm": 0.8669872283935547,
+ "learning_rate": 0.00010898748577929466,
+ "loss": 0.8796,
+ "mean_token_accuracy": 0.8592276558279991,
+ "num_tokens": 343203.0,
+ "step": 400
+ }
+ ],
+ "logging_steps": 5,
+ "max_steps": 879,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 3,
+ "save_steps": 200,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 3216867264285696.0,
+ "train_batch_size": 1,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/checkpoint-400/training_args.bin b/checkpoint-400/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..b2b3017298d5c921f7f2203bfc0351607fabc713
--- /dev/null
+++ b/checkpoint-400/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:001de43419a04313fd3d652571d90911489fbcebf2f0e7c3f8aa624286dfc855
+size 5624
diff --git a/checkpoint-600/README.md b/checkpoint-600/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..26e95dfdb2ce21d15943da03dc221885e4e0766b
--- /dev/null
+++ b/checkpoint-600/README.md
@@ -0,0 +1,209 @@
+---
+base_model: deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.20.0
\ No newline at end of file
diff --git a/checkpoint-600/adapter_config.json b/checkpoint-600/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..3e6084886e22b204a0c346cc3c9e491f44a217f3
--- /dev/null
+++ b/checkpoint-600/adapter_config.json
@@ -0,0 +1,50 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 32,
+ "lora_bias": false,
+ "lora_dropout": 0.05,
+ "lora_ga_config": null,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "monteclora_config": null,
+ "peft_type": "LORA",
+ "peft_version": "0.20.0",
+ "qalora_group_size": 16,
+ "r": 16,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "q_proj",
+ "up_proj",
+ "down_proj",
+ "k_proj",
+ "o_proj",
+ "v_proj",
+ "gate_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_bdlora": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false,
+ "velora_config": null
+}
\ No newline at end of file
diff --git a/checkpoint-600/adapter_model.safetensors b/checkpoint-600/adapter_model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..b8cd2412f8111d0b36ad4baeab37370ad5cffeb0
--- /dev/null
+++ b/checkpoint-600/adapter_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:9261875dab8ac5b2b5d3e1e5e603a884aec8cded38bbeabcea27b9a5b106e445
+size 73911112
diff --git a/checkpoint-600/optimizer.pt b/checkpoint-600/optimizer.pt
new file mode 100644
index 0000000000000000000000000000000000000000..a52e341c6819e920bb2c72ac16907659368861c1
--- /dev/null
+++ b/checkpoint-600/optimizer.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:3f6730a6a08e8323e2f1997cc701d4bff7ff7099550655e1f07e63309c005255
+size 37969652
diff --git a/checkpoint-600/rng_state.pth b/checkpoint-600/rng_state.pth
new file mode 100644
index 0000000000000000000000000000000000000000..a2a0d3b1f36e3b3d4dded9f74ef08ca37c03a938
--- /dev/null
+++ b/checkpoint-600/rng_state.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:cd31a88e8b6f456ee8b723e824bfcda938831d3f8391867e1379f24a6da62315
+size 14244
diff --git a/checkpoint-600/scheduler.pt b/checkpoint-600/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..064dc5bcca43e6b1737600721158f608c0ab7bea
--- /dev/null
+++ b/checkpoint-600/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:7dd96493eebbb35a30ee240cfe1ad8f98b67771a20ddafde87bd6093f71d27bb
+size 1064
diff --git a/checkpoint-600/special_tokens_map.json b/checkpoint-600/special_tokens_map.json
new file mode 100644
index 0000000000000000000000000000000000000000..d53f816edeeee223cdcd54b743a647b49ee6d5f2
--- /dev/null
+++ b/checkpoint-600/special_tokens_map.json
@@ -0,0 +1,17 @@
+{
+ "bos_token": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "eos_token": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": "<|end▁of▁sentence|>"
+}
diff --git a/checkpoint-600/tokenizer.json b/checkpoint-600/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..1a2db243e47cbc113f6b2ddcc388aeeb8fe1a94c
--- /dev/null
+++ b/checkpoint-600/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e20ddafc659ba90242154b55275402edeca0715e5dbb30f56815a4ce081f4893
+size 11422778
diff --git a/checkpoint-600/tokenizer_config.json b/checkpoint-600/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..8095baa150cba7889d4b1d0f1b6564f886ac4618
--- /dev/null
+++ b/checkpoint-600/tokenizer_config.json
@@ -0,0 +1,194 @@
+{
+ "add_bos_token": true,
+ "add_eos_token": false,
+ "add_prefix_space": null,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|User|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151645": {
+ "content": "<|Assistant|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151646": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|EOT|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151648": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151649": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "bos_token": "<|begin▁of▁sentence|>",
+ "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set ns = namespace(is_first=false, is_tool=false, is_output_first=true, system_prompt='') %}{%- for message in messages %}{%- if message['role'] == 'system' %}{% set ns.system_prompt = message['content'] %}{%- endif %}{%- endfor %}{{bos_token}}{{ns.system_prompt}}{%- for message in messages %}{%- if message['role'] == 'user' %}{%- set ns.is_tool = false -%}{{'<|User|>' + message['content']}}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is none %}{%- set ns.is_tool = false -%}{%- for tool in message['tool_calls']%}{%- if not ns.is_first %}{{'<|Assistant|><|tool▁calls▁begin|><|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{%- set ns.is_first = true -%}{%- else %}{{'\\n' + '<|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{{'<|tool▁calls▁end|><|end▁of▁sentence|>'}}{%- endif %}{%- endfor %}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is not none %}{%- if ns.is_tool %}{{'<|tool▁outputs▁end|>' + message['content'] + '<|end▁of▁sentence|>'}}{%- set ns.is_tool = false -%}{%- else %}{% set content = message['content'] %}{% if '' in content %}{% set content = content.split('')[-1] %}{% endif %}{{'<|Assistant|>' + content + '<|end▁of▁sentence|>'}}{%- endif %}{%- endif %}{%- if message['role'] == 'tool' %}{%- set ns.is_tool = true -%}{%- if ns.is_output_first %}{{'<|tool▁outputs▁begin|><|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- set ns.is_output_first = false %}{%- else %}{{'\\n<|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- endif %}{%- endif %}{%- endfor -%}{% if ns.is_tool %}{{'<|tool▁outputs▁end|>'}}{% endif %}{% if add_generation_prompt and not ns.is_tool %}{{'<|Assistant|>\\n'}}{% endif %}",
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|end▁of▁sentence|>",
+ "legacy": true,
+ "model_max_length": 16384,
+ "pad_token": "<|end▁of▁sentence|>",
+ "sp_model_kwargs": {},
+ "tokenizer_class": "LlamaTokenizer",
+ "unk_token": null,
+ "use_default_system_prompt": false
+}
diff --git a/checkpoint-600/trainer_state.json b/checkpoint-600/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..fc48ad6b1211503ade602ffd4ecda41c9b5397c8
--- /dev/null
+++ b/checkpoint-600/trainer_state.json
@@ -0,0 +1,1113 @@
+{
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.0434227330779056,
+ "eval_steps": 500,
+ "global_step": 600,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "epoch": 0.017028522775649212,
+ "grad_norm": 2.3286359310150146,
+ "learning_rate": 0.0001988623435722412,
+ "loss": 4.1641,
+ "mean_token_accuracy": 0.3866006717085838,
+ "num_tokens": 4326.0,
+ "step": 5
+ },
+ {
+ "epoch": 0.034057045551298425,
+ "grad_norm": 1.4926602840423584,
+ "learning_rate": 0.00019772468714448238,
+ "loss": 2.0591,
+ "mean_token_accuracy": 0.6790341928601265,
+ "num_tokens": 8676.0,
+ "step": 10
+ },
+ {
+ "epoch": 0.05108556832694764,
+ "grad_norm": 1.0835968255996704,
+ "learning_rate": 0.00019658703071672356,
+ "loss": 1.3145,
+ "mean_token_accuracy": 0.8256841972470284,
+ "num_tokens": 12796.0,
+ "step": 15
+ },
+ {
+ "epoch": 0.06811409110259685,
+ "grad_norm": 0.7724414467811584,
+ "learning_rate": 0.00019544937428896475,
+ "loss": 1.3324,
+ "mean_token_accuracy": 0.8117582932114601,
+ "num_tokens": 17119.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.08514261387824607,
+ "grad_norm": 0.785762369632721,
+ "learning_rate": 0.00019431171786120593,
+ "loss": 1.3375,
+ "mean_token_accuracy": 0.8029867172241211,
+ "num_tokens": 21499.0,
+ "step": 25
+ },
+ {
+ "epoch": 0.10217113665389528,
+ "grad_norm": 0.6702725291252136,
+ "learning_rate": 0.00019317406143344712,
+ "loss": 1.2159,
+ "mean_token_accuracy": 0.8230627462267875,
+ "num_tokens": 25785.0,
+ "step": 30
+ },
+ {
+ "epoch": 0.11919965942954448,
+ "grad_norm": 0.6287369728088379,
+ "learning_rate": 0.0001920364050056883,
+ "loss": 1.1634,
+ "mean_token_accuracy": 0.8315445825457572,
+ "num_tokens": 29980.0,
+ "step": 35
+ },
+ {
+ "epoch": 0.1362281822051937,
+ "grad_norm": 0.6573143005371094,
+ "learning_rate": 0.00019089874857792946,
+ "loss": 1.3762,
+ "mean_token_accuracy": 0.7971536681056023,
+ "num_tokens": 34497.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.1532567049808429,
+ "grad_norm": 0.6560688614845276,
+ "learning_rate": 0.00018976109215017067,
+ "loss": 1.1589,
+ "mean_token_accuracy": 0.8251897826790809,
+ "num_tokens": 38800.0,
+ "step": 45
+ },
+ {
+ "epoch": 0.17028522775649213,
+ "grad_norm": 0.6654791831970215,
+ "learning_rate": 0.00018862343572241183,
+ "loss": 1.1498,
+ "mean_token_accuracy": 0.8319168403744698,
+ "num_tokens": 43055.0,
+ "step": 50
+ },
+ {
+ "epoch": 0.18731375053214133,
+ "grad_norm": 0.7387417554855347,
+ "learning_rate": 0.00018748577929465302,
+ "loss": 1.1265,
+ "mean_token_accuracy": 0.8290244281291962,
+ "num_tokens": 47346.0,
+ "step": 55
+ },
+ {
+ "epoch": 0.20434227330779056,
+ "grad_norm": 0.5795997977256775,
+ "learning_rate": 0.0001863481228668942,
+ "loss": 1.0046,
+ "mean_token_accuracy": 0.8534704640507698,
+ "num_tokens": 51485.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.22137079608343976,
+ "grad_norm": 0.6834130883216858,
+ "learning_rate": 0.0001852104664391354,
+ "loss": 1.113,
+ "mean_token_accuracy": 0.8345914751291275,
+ "num_tokens": 55716.0,
+ "step": 65
+ },
+ {
+ "epoch": 0.23839931885908897,
+ "grad_norm": 0.7211284041404724,
+ "learning_rate": 0.00018407281001137657,
+ "loss": 1.2132,
+ "mean_token_accuracy": 0.8207321017980576,
+ "num_tokens": 60030.0,
+ "step": 70
+ },
+ {
+ "epoch": 0.2554278416347382,
+ "grad_norm": 0.6312271356582642,
+ "learning_rate": 0.00018293515358361776,
+ "loss": 1.0987,
+ "mean_token_accuracy": 0.8333725541830063,
+ "num_tokens": 64288.0,
+ "step": 75
+ },
+ {
+ "epoch": 0.2724563644103874,
+ "grad_norm": 0.7119404077529907,
+ "learning_rate": 0.00018179749715585894,
+ "loss": 1.0981,
+ "mean_token_accuracy": 0.8323698997497558,
+ "num_tokens": 68548.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.2894848871860366,
+ "grad_norm": 0.9000201225280762,
+ "learning_rate": 0.00018065984072810013,
+ "loss": 1.146,
+ "mean_token_accuracy": 0.8253335595130921,
+ "num_tokens": 72914.0,
+ "step": 85
+ },
+ {
+ "epoch": 0.3065134099616858,
+ "grad_norm": 0.6050537824630737,
+ "learning_rate": 0.0001795221843003413,
+ "loss": 1.0111,
+ "mean_token_accuracy": 0.842674246430397,
+ "num_tokens": 77168.0,
+ "step": 90
+ },
+ {
+ "epoch": 0.32354193273733506,
+ "grad_norm": 0.684512197971344,
+ "learning_rate": 0.0001783845278725825,
+ "loss": 1.1186,
+ "mean_token_accuracy": 0.8351956441998482,
+ "num_tokens": 81439.0,
+ "step": 95
+ },
+ {
+ "epoch": 0.34057045551298426,
+ "grad_norm": 0.7323129773139954,
+ "learning_rate": 0.00017724687144482368,
+ "loss": 1.1287,
+ "mean_token_accuracy": 0.8245970487594605,
+ "num_tokens": 85773.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.35759897828863346,
+ "grad_norm": 0.7547741532325745,
+ "learning_rate": 0.00017610921501706487,
+ "loss": 1.0868,
+ "mean_token_accuracy": 0.8298466548323631,
+ "num_tokens": 90117.0,
+ "step": 105
+ },
+ {
+ "epoch": 0.37462750106428266,
+ "grad_norm": 0.7113769054412842,
+ "learning_rate": 0.00017497155858930602,
+ "loss": 1.1214,
+ "mean_token_accuracy": 0.8299670115113258,
+ "num_tokens": 94412.0,
+ "step": 110
+ },
+ {
+ "epoch": 0.39165602383993187,
+ "grad_norm": 0.7486220002174377,
+ "learning_rate": 0.00017383390216154724,
+ "loss": 1.1452,
+ "mean_token_accuracy": 0.8283886179327965,
+ "num_tokens": 98782.0,
+ "step": 115
+ },
+ {
+ "epoch": 0.4086845466155811,
+ "grad_norm": 0.658633828163147,
+ "learning_rate": 0.0001726962457337884,
+ "loss": 1.0415,
+ "mean_token_accuracy": 0.8431179687380791,
+ "num_tokens": 103011.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.4257130693912303,
+ "grad_norm": 0.783794105052948,
+ "learning_rate": 0.0001715585893060296,
+ "loss": 1.1056,
+ "mean_token_accuracy": 0.8254878520965576,
+ "num_tokens": 107402.0,
+ "step": 125
+ },
+ {
+ "epoch": 0.4427415921668795,
+ "grad_norm": 0.7954565286636353,
+ "learning_rate": 0.00017042093287827076,
+ "loss": 1.0518,
+ "mean_token_accuracy": 0.8375606715679169,
+ "num_tokens": 111707.0,
+ "step": 130
+ },
+ {
+ "epoch": 0.45977011494252873,
+ "grad_norm": 0.6913949847221375,
+ "learning_rate": 0.00016928327645051198,
+ "loss": 1.1104,
+ "mean_token_accuracy": 0.8326424166560173,
+ "num_tokens": 115998.0,
+ "step": 135
+ },
+ {
+ "epoch": 0.47679863771817793,
+ "grad_norm": 0.7918037176132202,
+ "learning_rate": 0.00016814562002275313,
+ "loss": 1.0495,
+ "mean_token_accuracy": 0.8390962019562721,
+ "num_tokens": 120271.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.49382716049382713,
+ "grad_norm": 0.7816826701164246,
+ "learning_rate": 0.00016700796359499432,
+ "loss": 1.0463,
+ "mean_token_accuracy": 0.8433194428682327,
+ "num_tokens": 124461.0,
+ "step": 145
+ },
+ {
+ "epoch": 0.5108556832694764,
+ "grad_norm": 0.8069042563438416,
+ "learning_rate": 0.0001658703071672355,
+ "loss": 1.0664,
+ "mean_token_accuracy": 0.8278923153877258,
+ "num_tokens": 128781.0,
+ "step": 150
+ },
+ {
+ "epoch": 0.5278842060451255,
+ "grad_norm": 1.0114731788635254,
+ "learning_rate": 0.0001647326507394767,
+ "loss": 1.1217,
+ "mean_token_accuracy": 0.8267972275614739,
+ "num_tokens": 133167.0,
+ "step": 155
+ },
+ {
+ "epoch": 0.5449127288207748,
+ "grad_norm": 0.7900378704071045,
+ "learning_rate": 0.00016359499431171787,
+ "loss": 0.971,
+ "mean_token_accuracy": 0.8421565622091294,
+ "num_tokens": 137464.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.561941251596424,
+ "grad_norm": 0.8059927821159363,
+ "learning_rate": 0.00016245733788395906,
+ "loss": 1.0457,
+ "mean_token_accuracy": 0.8381335601210594,
+ "num_tokens": 141760.0,
+ "step": 165
+ },
+ {
+ "epoch": 0.5789697743720732,
+ "grad_norm": 0.7589371800422668,
+ "learning_rate": 0.00016131968145620024,
+ "loss": 1.0208,
+ "mean_token_accuracy": 0.8342296928167343,
+ "num_tokens": 146051.0,
+ "step": 170
+ },
+ {
+ "epoch": 0.5959982971477225,
+ "grad_norm": 0.692416250705719,
+ "learning_rate": 0.00016018202502844143,
+ "loss": 0.9837,
+ "mean_token_accuracy": 0.8510025009512902,
+ "num_tokens": 150270.0,
+ "step": 175
+ },
+ {
+ "epoch": 0.6130268199233716,
+ "grad_norm": 0.6662923097610474,
+ "learning_rate": 0.0001590443686006826,
+ "loss": 0.9835,
+ "mean_token_accuracy": 0.8463438332080842,
+ "num_tokens": 154537.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.6300553426990209,
+ "grad_norm": 0.7452691793441772,
+ "learning_rate": 0.0001579067121729238,
+ "loss": 1.0496,
+ "mean_token_accuracy": 0.8375737622380257,
+ "num_tokens": 158810.0,
+ "step": 185
+ },
+ {
+ "epoch": 0.6470838654746701,
+ "grad_norm": 0.809700608253479,
+ "learning_rate": 0.00015676905574516496,
+ "loss": 1.0595,
+ "mean_token_accuracy": 0.8294038504362107,
+ "num_tokens": 163213.0,
+ "step": 190
+ },
+ {
+ "epoch": 0.6641123882503193,
+ "grad_norm": 0.7708745002746582,
+ "learning_rate": 0.00015563139931740617,
+ "loss": 1.0976,
+ "mean_token_accuracy": 0.8289313957095146,
+ "num_tokens": 167607.0,
+ "step": 195
+ },
+ {
+ "epoch": 0.6811409110259685,
+ "grad_norm": 0.6482141613960266,
+ "learning_rate": 0.00015449374288964733,
+ "loss": 1.0701,
+ "mean_token_accuracy": 0.8261386752128601,
+ "num_tokens": 172024.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.6981694338016177,
+ "grad_norm": 0.7164883613586426,
+ "learning_rate": 0.00015335608646188854,
+ "loss": 0.9878,
+ "mean_token_accuracy": 0.8418964132666588,
+ "num_tokens": 176317.0,
+ "step": 205
+ },
+ {
+ "epoch": 0.7151979565772669,
+ "grad_norm": 0.710343599319458,
+ "learning_rate": 0.0001522184300341297,
+ "loss": 0.9306,
+ "mean_token_accuracy": 0.8468034327030182,
+ "num_tokens": 180558.0,
+ "step": 210
+ },
+ {
+ "epoch": 0.7322264793529162,
+ "grad_norm": 0.863784909248352,
+ "learning_rate": 0.00015108077360637088,
+ "loss": 1.0544,
+ "mean_token_accuracy": 0.8359945684671402,
+ "num_tokens": 184885.0,
+ "step": 215
+ },
+ {
+ "epoch": 0.7492550021285653,
+ "grad_norm": 0.8381637930870056,
+ "learning_rate": 0.00014994311717861207,
+ "loss": 1.0522,
+ "mean_token_accuracy": 0.836811026930809,
+ "num_tokens": 189219.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.7662835249042146,
+ "grad_norm": 0.683501124382019,
+ "learning_rate": 0.00014880546075085325,
+ "loss": 0.9427,
+ "mean_token_accuracy": 0.8544979348778725,
+ "num_tokens": 193437.0,
+ "step": 225
+ },
+ {
+ "epoch": 0.7833120476798637,
+ "grad_norm": 0.7609812617301941,
+ "learning_rate": 0.00014766780432309444,
+ "loss": 1.0048,
+ "mean_token_accuracy": 0.8403829500079155,
+ "num_tokens": 197724.0,
+ "step": 230
+ },
+ {
+ "epoch": 0.800340570455513,
+ "grad_norm": 0.8223949074745178,
+ "learning_rate": 0.00014653014789533562,
+ "loss": 1.078,
+ "mean_token_accuracy": 0.8296335831284523,
+ "num_tokens": 202141.0,
+ "step": 235
+ },
+ {
+ "epoch": 0.8173690932311622,
+ "grad_norm": 0.9807024002075195,
+ "learning_rate": 0.0001453924914675768,
+ "loss": 0.9295,
+ "mean_token_accuracy": 0.8495418474078178,
+ "num_tokens": 206333.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.8343976160068114,
+ "grad_norm": 0.7864217162132263,
+ "learning_rate": 0.000144254835039818,
+ "loss": 1.0326,
+ "mean_token_accuracy": 0.8422158002853394,
+ "num_tokens": 210593.0,
+ "step": 245
+ },
+ {
+ "epoch": 0.8514261387824607,
+ "grad_norm": 0.8183476328849792,
+ "learning_rate": 0.00014311717861205915,
+ "loss": 1.0419,
+ "mean_token_accuracy": 0.8332764700055122,
+ "num_tokens": 214925.0,
+ "step": 250
+ },
+ {
+ "epoch": 0.8684546615581098,
+ "grad_norm": 0.7906543612480164,
+ "learning_rate": 0.00014197952218430036,
+ "loss": 0.9278,
+ "mean_token_accuracy": 0.8531344652175903,
+ "num_tokens": 219106.0,
+ "step": 255
+ },
+ {
+ "epoch": 0.885483184333759,
+ "grad_norm": 0.7864625453948975,
+ "learning_rate": 0.00014084186575654152,
+ "loss": 0.9764,
+ "mean_token_accuracy": 0.8394758701324463,
+ "num_tokens": 223398.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.9025117071094083,
+ "grad_norm": 0.7231821417808533,
+ "learning_rate": 0.00013970420932878273,
+ "loss": 1.0357,
+ "mean_token_accuracy": 0.8368565306067467,
+ "num_tokens": 227720.0,
+ "step": 265
+ },
+ {
+ "epoch": 0.9195402298850575,
+ "grad_norm": 0.7288718223571777,
+ "learning_rate": 0.0001385665529010239,
+ "loss": 1.0178,
+ "mean_token_accuracy": 0.842984040081501,
+ "num_tokens": 232021.0,
+ "step": 270
+ },
+ {
+ "epoch": 0.9365687526607067,
+ "grad_norm": 0.7466130256652832,
+ "learning_rate": 0.0001374288964732651,
+ "loss": 0.9974,
+ "mean_token_accuracy": 0.8431279867887497,
+ "num_tokens": 236312.0,
+ "step": 275
+ },
+ {
+ "epoch": 0.9535972754363559,
+ "grad_norm": 0.7876543402671814,
+ "learning_rate": 0.00013629124004550626,
+ "loss": 1.0057,
+ "mean_token_accuracy": 0.8389794036746026,
+ "num_tokens": 240594.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.9706257982120051,
+ "grad_norm": 0.738293468952179,
+ "learning_rate": 0.00013515358361774744,
+ "loss": 0.9129,
+ "mean_token_accuracy": 0.8528255730867386,
+ "num_tokens": 244859.0,
+ "step": 285
+ },
+ {
+ "epoch": 0.9876543209876543,
+ "grad_norm": 0.8145989775657654,
+ "learning_rate": 0.00013401592718998863,
+ "loss": 0.9188,
+ "mean_token_accuracy": 0.8555046319961548,
+ "num_tokens": 249060.0,
+ "step": 290
+ },
+ {
+ "epoch": 1.0046828437633035,
+ "grad_norm": 0.693233072757721,
+ "learning_rate": 0.00013287827076222981,
+ "loss": 1.0648,
+ "mean_token_accuracy": 0.8477524280548095,
+ "num_tokens": 253361.0,
+ "step": 295
+ },
+ {
+ "epoch": 1.0217113665389528,
+ "grad_norm": 0.8171095848083496,
+ "learning_rate": 0.000131740614334471,
+ "loss": 0.883,
+ "mean_token_accuracy": 0.8561580404639244,
+ "num_tokens": 257633.0,
+ "step": 300
+ },
+ {
+ "epoch": 1.038739889314602,
+ "grad_norm": 0.7343988418579102,
+ "learning_rate": 0.00013060295790671218,
+ "loss": 0.8591,
+ "mean_token_accuracy": 0.8583228841423989,
+ "num_tokens": 261975.0,
+ "step": 305
+ },
+ {
+ "epoch": 1.055768412090251,
+ "grad_norm": 0.6689726114273071,
+ "learning_rate": 0.00012946530147895337,
+ "loss": 0.8397,
+ "mean_token_accuracy": 0.8668102487921715,
+ "num_tokens": 266174.0,
+ "step": 310
+ },
+ {
+ "epoch": 1.0727969348659003,
+ "grad_norm": 0.8284767270088196,
+ "learning_rate": 0.00012832764505119455,
+ "loss": 0.9108,
+ "mean_token_accuracy": 0.8551412716507911,
+ "num_tokens": 270416.0,
+ "step": 315
+ },
+ {
+ "epoch": 1.0898254576415496,
+ "grad_norm": 0.7800877690315247,
+ "learning_rate": 0.0001271899886234357,
+ "loss": 0.923,
+ "mean_token_accuracy": 0.8521544948220253,
+ "num_tokens": 274802.0,
+ "step": 320
+ },
+ {
+ "epoch": 1.1068539804171988,
+ "grad_norm": 0.803035318851471,
+ "learning_rate": 0.00012605233219567692,
+ "loss": 0.9009,
+ "mean_token_accuracy": 0.8583568409085274,
+ "num_tokens": 279061.0,
+ "step": 325
+ },
+ {
+ "epoch": 1.123882503192848,
+ "grad_norm": 0.7928335666656494,
+ "learning_rate": 0.00012491467576791808,
+ "loss": 0.8677,
+ "mean_token_accuracy": 0.860838033258915,
+ "num_tokens": 283290.0,
+ "step": 330
+ },
+ {
+ "epoch": 1.1409110259684971,
+ "grad_norm": 0.82757967710495,
+ "learning_rate": 0.0001237770193401593,
+ "loss": 0.9326,
+ "mean_token_accuracy": 0.8526211172342301,
+ "num_tokens": 287627.0,
+ "step": 335
+ },
+ {
+ "epoch": 1.1579395487441464,
+ "grad_norm": 0.8021914958953857,
+ "learning_rate": 0.00012263936291240045,
+ "loss": 0.9066,
+ "mean_token_accuracy": 0.8505649596452713,
+ "num_tokens": 291975.0,
+ "step": 340
+ },
+ {
+ "epoch": 1.1749680715197957,
+ "grad_norm": 0.7565475106239319,
+ "learning_rate": 0.00012150170648464165,
+ "loss": 0.8812,
+ "mean_token_accuracy": 0.8562570214271545,
+ "num_tokens": 296232.0,
+ "step": 345
+ },
+ {
+ "epoch": 1.191996594295445,
+ "grad_norm": 0.8126978278160095,
+ "learning_rate": 0.00012036405005688282,
+ "loss": 0.905,
+ "mean_token_accuracy": 0.8556828230619431,
+ "num_tokens": 300591.0,
+ "step": 350
+ },
+ {
+ "epoch": 1.2090251170710942,
+ "grad_norm": 0.8174765706062317,
+ "learning_rate": 0.000119226393629124,
+ "loss": 0.9861,
+ "mean_token_accuracy": 0.8424012079834938,
+ "num_tokens": 304998.0,
+ "step": 355
+ },
+ {
+ "epoch": 1.2260536398467432,
+ "grad_norm": 0.8921035528182983,
+ "learning_rate": 0.00011808873720136519,
+ "loss": 0.7724,
+ "mean_token_accuracy": 0.8735315829515458,
+ "num_tokens": 309137.0,
+ "step": 360
+ },
+ {
+ "epoch": 1.2430821626223925,
+ "grad_norm": 0.855992317199707,
+ "learning_rate": 0.00011695108077360638,
+ "loss": 0.8922,
+ "mean_token_accuracy": 0.854039640724659,
+ "num_tokens": 313389.0,
+ "step": 365
+ },
+ {
+ "epoch": 1.2601106853980417,
+ "grad_norm": 0.9408860206604004,
+ "learning_rate": 0.00011581342434584756,
+ "loss": 0.9254,
+ "mean_token_accuracy": 0.8507854476571083,
+ "num_tokens": 317743.0,
+ "step": 370
+ },
+ {
+ "epoch": 1.277139208173691,
+ "grad_norm": 0.7847197651863098,
+ "learning_rate": 0.00011467576791808873,
+ "loss": 0.8563,
+ "mean_token_accuracy": 0.869862625002861,
+ "num_tokens": 321873.0,
+ "step": 375
+ },
+ {
+ "epoch": 1.29416773094934,
+ "grad_norm": 0.8556840419769287,
+ "learning_rate": 0.00011353811149032993,
+ "loss": 0.8489,
+ "mean_token_accuracy": 0.8591933220624923,
+ "num_tokens": 326124.0,
+ "step": 380
+ },
+ {
+ "epoch": 1.3111962537249893,
+ "grad_norm": 0.8849514126777649,
+ "learning_rate": 0.0001124004550625711,
+ "loss": 0.8526,
+ "mean_token_accuracy": 0.8600789621472359,
+ "num_tokens": 330405.0,
+ "step": 385
+ },
+ {
+ "epoch": 1.3282247765006385,
+ "grad_norm": 0.8099865913391113,
+ "learning_rate": 0.00011126279863481229,
+ "loss": 0.9309,
+ "mean_token_accuracy": 0.8511071890592575,
+ "num_tokens": 334701.0,
+ "step": 390
+ },
+ {
+ "epoch": 1.3452532992762878,
+ "grad_norm": 0.8668401837348938,
+ "learning_rate": 0.00011012514220705347,
+ "loss": 0.8671,
+ "mean_token_accuracy": 0.8605618432164193,
+ "num_tokens": 338951.0,
+ "step": 395
+ },
+ {
+ "epoch": 1.362281822051937,
+ "grad_norm": 0.8669872283935547,
+ "learning_rate": 0.00010898748577929466,
+ "loss": 0.8796,
+ "mean_token_accuracy": 0.8592276558279991,
+ "num_tokens": 343203.0,
+ "step": 400
+ },
+ {
+ "epoch": 1.3793103448275863,
+ "grad_norm": 0.8468757271766663,
+ "learning_rate": 0.00010784982935153584,
+ "loss": 0.8941,
+ "mean_token_accuracy": 0.8553030788898468,
+ "num_tokens": 347460.0,
+ "step": 405
+ },
+ {
+ "epoch": 1.3963388676032356,
+ "grad_norm": 0.8839651346206665,
+ "learning_rate": 0.00010671217292377703,
+ "loss": 0.913,
+ "mean_token_accuracy": 0.8489826336503029,
+ "num_tokens": 351850.0,
+ "step": 410
+ },
+ {
+ "epoch": 1.4133673903788846,
+ "grad_norm": 0.8808367848396301,
+ "learning_rate": 0.00010557451649601821,
+ "loss": 0.8158,
+ "mean_token_accuracy": 0.8628147393465042,
+ "num_tokens": 356104.0,
+ "step": 415
+ },
+ {
+ "epoch": 1.4303959131545338,
+ "grad_norm": 0.9303593039512634,
+ "learning_rate": 0.00010443686006825938,
+ "loss": 0.8737,
+ "mean_token_accuracy": 0.8497098922729492,
+ "num_tokens": 360445.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.447424435930183,
+ "grad_norm": 0.7914776802062988,
+ "learning_rate": 0.00010329920364050057,
+ "loss": 0.9168,
+ "mean_token_accuracy": 0.8531492814421654,
+ "num_tokens": 364778.0,
+ "step": 425
+ },
+ {
+ "epoch": 1.4644529587058321,
+ "grad_norm": 0.8661580085754395,
+ "learning_rate": 0.00010216154721274175,
+ "loss": 0.8335,
+ "mean_token_accuracy": 0.8674297228455543,
+ "num_tokens": 368961.0,
+ "step": 430
+ },
+ {
+ "epoch": 1.4814814814814814,
+ "grad_norm": 0.8548939228057861,
+ "learning_rate": 0.00010102389078498294,
+ "loss": 0.9314,
+ "mean_token_accuracy": 0.8409372463822364,
+ "num_tokens": 373355.0,
+ "step": 435
+ },
+ {
+ "epoch": 1.4985100042571307,
+ "grad_norm": 0.8668932914733887,
+ "learning_rate": 9.988623435722412e-05,
+ "loss": 0.8482,
+ "mean_token_accuracy": 0.8576690852642059,
+ "num_tokens": 377652.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.51553852703278,
+ "grad_norm": 0.8412478566169739,
+ "learning_rate": 9.874857792946531e-05,
+ "loss": 0.8791,
+ "mean_token_accuracy": 0.8531419888138772,
+ "num_tokens": 381969.0,
+ "step": 445
+ },
+ {
+ "epoch": 1.5325670498084292,
+ "grad_norm": 0.8298078179359436,
+ "learning_rate": 9.761092150170649e-05,
+ "loss": 0.7418,
+ "mean_token_accuracy": 0.8757623940706253,
+ "num_tokens": 386149.0,
+ "step": 450
+ },
+ {
+ "epoch": 1.5495955725840784,
+ "grad_norm": 0.8505256772041321,
+ "learning_rate": 9.647326507394768e-05,
+ "loss": 0.8107,
+ "mean_token_accuracy": 0.8660028412938118,
+ "num_tokens": 390316.0,
+ "step": 455
+ },
+ {
+ "epoch": 1.5666240953597277,
+ "grad_norm": 0.72185879945755,
+ "learning_rate": 9.533560864618886e-05,
+ "loss": 0.8601,
+ "mean_token_accuracy": 0.8591737478971482,
+ "num_tokens": 394651.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.5836526181353767,
+ "grad_norm": 1.0382378101348877,
+ "learning_rate": 9.419795221843003e-05,
+ "loss": 0.849,
+ "mean_token_accuracy": 0.8591210901737213,
+ "num_tokens": 398879.0,
+ "step": 465
+ },
+ {
+ "epoch": 1.600681140911026,
+ "grad_norm": 0.7781236171722412,
+ "learning_rate": 9.306029579067122e-05,
+ "loss": 0.8587,
+ "mean_token_accuracy": 0.8554968953132629,
+ "num_tokens": 403154.0,
+ "step": 470
+ },
+ {
+ "epoch": 1.617709663686675,
+ "grad_norm": 0.9941114187240601,
+ "learning_rate": 9.19226393629124e-05,
+ "loss": 1.0077,
+ "mean_token_accuracy": 0.8324473947286606,
+ "num_tokens": 407653.0,
+ "step": 475
+ },
+ {
+ "epoch": 1.6347381864623243,
+ "grad_norm": 0.791912853717804,
+ "learning_rate": 9.078498293515359e-05,
+ "loss": 0.8211,
+ "mean_token_accuracy": 0.8655396267771721,
+ "num_tokens": 411904.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.6517667092379735,
+ "grad_norm": 0.8509976267814636,
+ "learning_rate": 8.964732650739477e-05,
+ "loss": 0.8895,
+ "mean_token_accuracy": 0.8587504833936691,
+ "num_tokens": 416159.0,
+ "step": 485
+ },
+ {
+ "epoch": 1.6687952320136228,
+ "grad_norm": 1.0071176290512085,
+ "learning_rate": 8.850967007963596e-05,
+ "loss": 0.9112,
+ "mean_token_accuracy": 0.8539686873555183,
+ "num_tokens": 420513.0,
+ "step": 490
+ },
+ {
+ "epoch": 1.685823754789272,
+ "grad_norm": 0.8273159861564636,
+ "learning_rate": 8.737201365187714e-05,
+ "loss": 0.8383,
+ "mean_token_accuracy": 0.8577379778027534,
+ "num_tokens": 424759.0,
+ "step": 495
+ },
+ {
+ "epoch": 1.7028522775649213,
+ "grad_norm": 0.8064838647842407,
+ "learning_rate": 8.623435722411833e-05,
+ "loss": 0.8397,
+ "mean_token_accuracy": 0.8636475175619125,
+ "num_tokens": 429018.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.7198808003405706,
+ "grad_norm": 0.7176003456115723,
+ "learning_rate": 8.509670079635951e-05,
+ "loss": 0.7738,
+ "mean_token_accuracy": 0.8699946105480194,
+ "num_tokens": 433124.0,
+ "step": 505
+ },
+ {
+ "epoch": 1.7369093231162198,
+ "grad_norm": 0.8316643834114075,
+ "learning_rate": 8.395904436860069e-05,
+ "loss": 0.9191,
+ "mean_token_accuracy": 0.8493718564510345,
+ "num_tokens": 437449.0,
+ "step": 510
+ },
+ {
+ "epoch": 1.7539378458918689,
+ "grad_norm": 0.9423941373825073,
+ "learning_rate": 8.282138794084187e-05,
+ "loss": 0.8749,
+ "mean_token_accuracy": 0.8558909714221954,
+ "num_tokens": 441753.0,
+ "step": 515
+ },
+ {
+ "epoch": 1.770966368667518,
+ "grad_norm": 0.8593487739562988,
+ "learning_rate": 8.168373151308306e-05,
+ "loss": 0.8463,
+ "mean_token_accuracy": 0.857591399550438,
+ "num_tokens": 446036.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.7879948914431671,
+ "grad_norm": 0.7944974303245544,
+ "learning_rate": 8.054607508532424e-05,
+ "loss": 0.8275,
+ "mean_token_accuracy": 0.859096622467041,
+ "num_tokens": 450298.0,
+ "step": 525
+ },
+ {
+ "epoch": 1.8050234142188164,
+ "grad_norm": 0.7622503042221069,
+ "learning_rate": 7.940841865756543e-05,
+ "loss": 0.8846,
+ "mean_token_accuracy": 0.8580268025398254,
+ "num_tokens": 454595.0,
+ "step": 530
+ },
+ {
+ "epoch": 1.8220519369944657,
+ "grad_norm": 0.8578078746795654,
+ "learning_rate": 7.827076222980661e-05,
+ "loss": 0.7674,
+ "mean_token_accuracy": 0.8716912001371384,
+ "num_tokens": 458807.0,
+ "step": 535
+ },
+ {
+ "epoch": 1.839080459770115,
+ "grad_norm": 1.0383292436599731,
+ "learning_rate": 7.71331058020478e-05,
+ "loss": 0.9129,
+ "mean_token_accuracy": 0.8489386543631554,
+ "num_tokens": 463150.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.8561089825457642,
+ "grad_norm": 0.8726801872253418,
+ "learning_rate": 7.599544937428897e-05,
+ "loss": 0.877,
+ "mean_token_accuracy": 0.8568779289722442,
+ "num_tokens": 467472.0,
+ "step": 545
+ },
+ {
+ "epoch": 1.8731375053214134,
+ "grad_norm": 0.9192221164703369,
+ "learning_rate": 7.485779294653015e-05,
+ "loss": 0.9341,
+ "mean_token_accuracy": 0.8403045237064362,
+ "num_tokens": 471930.0,
+ "step": 550
+ },
+ {
+ "epoch": 1.8901660280970627,
+ "grad_norm": 0.8688830137252808,
+ "learning_rate": 7.372013651877134e-05,
+ "loss": 0.8244,
+ "mean_token_accuracy": 0.8679932355880737,
+ "num_tokens": 476140.0,
+ "step": 555
+ },
+ {
+ "epoch": 1.907194550872712,
+ "grad_norm": 0.8286635279655457,
+ "learning_rate": 7.258248009101252e-05,
+ "loss": 0.8725,
+ "mean_token_accuracy": 0.8549414992332458,
+ "num_tokens": 480474.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.924223073648361,
+ "grad_norm": 0.789902925491333,
+ "learning_rate": 7.14448236632537e-05,
+ "loss": 0.8135,
+ "mean_token_accuracy": 0.8649365425109863,
+ "num_tokens": 484805.0,
+ "step": 565
+ },
+ {
+ "epoch": 1.9412515964240102,
+ "grad_norm": 0.8496629595756531,
+ "learning_rate": 7.030716723549489e-05,
+ "loss": 0.9036,
+ "mean_token_accuracy": 0.8460123494267464,
+ "num_tokens": 489275.0,
+ "step": 570
+ },
+ {
+ "epoch": 1.9582801191996593,
+ "grad_norm": 0.8411655426025391,
+ "learning_rate": 6.916951080773608e-05,
+ "loss": 0.9346,
+ "mean_token_accuracy": 0.8429780200123786,
+ "num_tokens": 493726.0,
+ "step": 575
+ },
+ {
+ "epoch": 1.9753086419753085,
+ "grad_norm": 0.8502522706985474,
+ "learning_rate": 6.803185437997726e-05,
+ "loss": 0.8703,
+ "mean_token_accuracy": 0.8595944106578827,
+ "num_tokens": 498022.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.9923371647509578,
+ "grad_norm": 0.743918776512146,
+ "learning_rate": 6.689419795221843e-05,
+ "loss": 0.8815,
+ "mean_token_accuracy": 0.851164074242115,
+ "num_tokens": 502352.0,
+ "step": 585
+ },
+ {
+ "epoch": 2.009365687526607,
+ "grad_norm": 0.7339876294136047,
+ "learning_rate": 6.575654152445962e-05,
+ "loss": 0.9297,
+ "mean_token_accuracy": 0.8610147342085839,
+ "num_tokens": 506669.0,
+ "step": 590
+ },
+ {
+ "epoch": 2.0263942103022563,
+ "grad_norm": 0.903137743473053,
+ "learning_rate": 6.46188850967008e-05,
+ "loss": 0.7306,
+ "mean_token_accuracy": 0.8799364000558854,
+ "num_tokens": 510931.0,
+ "step": 595
+ },
+ {
+ "epoch": 2.0434227330779056,
+ "grad_norm": 0.8741887807846069,
+ "learning_rate": 6.348122866894199e-05,
+ "loss": 0.777,
+ "mean_token_accuracy": 0.8718036338686943,
+ "num_tokens": 515254.0,
+ "step": 600
+ }
+ ],
+ "logging_steps": 5,
+ "max_steps": 879,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 3,
+ "save_steps": 200,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 4829514093385728.0,
+ "train_batch_size": 1,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/checkpoint-600/training_args.bin b/checkpoint-600/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..b2b3017298d5c921f7f2203bfc0351607fabc713
--- /dev/null
+++ b/checkpoint-600/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:001de43419a04313fd3d652571d90911489fbcebf2f0e7c3f8aa624286dfc855
+size 5624
diff --git a/checkpoint-800/README.md b/checkpoint-800/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..26e95dfdb2ce21d15943da03dc221885e4e0766b
--- /dev/null
+++ b/checkpoint-800/README.md
@@ -0,0 +1,209 @@
+---
+base_model: deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.20.0
\ No newline at end of file
diff --git a/checkpoint-800/adapter_config.json b/checkpoint-800/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..3e6084886e22b204a0c346cc3c9e491f44a217f3
--- /dev/null
+++ b/checkpoint-800/adapter_config.json
@@ -0,0 +1,50 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 32,
+ "lora_bias": false,
+ "lora_dropout": 0.05,
+ "lora_ga_config": null,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "monteclora_config": null,
+ "peft_type": "LORA",
+ "peft_version": "0.20.0",
+ "qalora_group_size": 16,
+ "r": 16,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "q_proj",
+ "up_proj",
+ "down_proj",
+ "k_proj",
+ "o_proj",
+ "v_proj",
+ "gate_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_bdlora": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false,
+ "velora_config": null
+}
\ No newline at end of file
diff --git a/checkpoint-800/adapter_model.safetensors b/checkpoint-800/adapter_model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..6d8f8cdce0b6050b27928e0b5ed39f3a963a8599
--- /dev/null
+++ b/checkpoint-800/adapter_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ea24aeceaec80fb0138939f3558532bc2db231c414389386eb51ff8189f36259
+size 73911112
diff --git a/checkpoint-800/optimizer.pt b/checkpoint-800/optimizer.pt
new file mode 100644
index 0000000000000000000000000000000000000000..eeff8591c6f9f1035769c6e0065675f94f4312f0
--- /dev/null
+++ b/checkpoint-800/optimizer.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:f5c6ab7e0d89ede34156f55c028f335e3537021f90a5e2c16e68c96b6c45f443
+size 37969652
diff --git a/checkpoint-800/rng_state.pth b/checkpoint-800/rng_state.pth
new file mode 100644
index 0000000000000000000000000000000000000000..d8e38cf1c356d82b712ceee53304a1c1d517d978
--- /dev/null
+++ b/checkpoint-800/rng_state.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:576b248a6f84ac7055634ab569d402f9bf88c78821a9ad088c8950d62e42907a
+size 14244
diff --git a/checkpoint-800/scheduler.pt b/checkpoint-800/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..d5f2f02e06ab23f9d7d8ad3ba372f99cc0860116
--- /dev/null
+++ b/checkpoint-800/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:4225c4e9f1ab7f7ed353e670836f9ef1773c433469b40387b8cbe0244cf93748
+size 1064
diff --git a/checkpoint-800/special_tokens_map.json b/checkpoint-800/special_tokens_map.json
new file mode 100644
index 0000000000000000000000000000000000000000..d53f816edeeee223cdcd54b743a647b49ee6d5f2
--- /dev/null
+++ b/checkpoint-800/special_tokens_map.json
@@ -0,0 +1,17 @@
+{
+ "bos_token": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "eos_token": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": "<|end▁of▁sentence|>"
+}
diff --git a/checkpoint-800/tokenizer.json b/checkpoint-800/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..1a2db243e47cbc113f6b2ddcc388aeeb8fe1a94c
--- /dev/null
+++ b/checkpoint-800/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e20ddafc659ba90242154b55275402edeca0715e5dbb30f56815a4ce081f4893
+size 11422778
diff --git a/checkpoint-800/tokenizer_config.json b/checkpoint-800/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..8095baa150cba7889d4b1d0f1b6564f886ac4618
--- /dev/null
+++ b/checkpoint-800/tokenizer_config.json
@@ -0,0 +1,194 @@
+{
+ "add_bos_token": true,
+ "add_eos_token": false,
+ "add_prefix_space": null,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|User|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151645": {
+ "content": "<|Assistant|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151646": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|EOT|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151648": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151649": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "bos_token": "<|begin▁of▁sentence|>",
+ "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set ns = namespace(is_first=false, is_tool=false, is_output_first=true, system_prompt='') %}{%- for message in messages %}{%- if message['role'] == 'system' %}{% set ns.system_prompt = message['content'] %}{%- endif %}{%- endfor %}{{bos_token}}{{ns.system_prompt}}{%- for message in messages %}{%- if message['role'] == 'user' %}{%- set ns.is_tool = false -%}{{'<|User|>' + message['content']}}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is none %}{%- set ns.is_tool = false -%}{%- for tool in message['tool_calls']%}{%- if not ns.is_first %}{{'<|Assistant|><|tool▁calls▁begin|><|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{%- set ns.is_first = true -%}{%- else %}{{'\\n' + '<|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{{'<|tool▁calls▁end|><|end▁of▁sentence|>'}}{%- endif %}{%- endfor %}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is not none %}{%- if ns.is_tool %}{{'<|tool▁outputs▁end|>' + message['content'] + '<|end▁of▁sentence|>'}}{%- set ns.is_tool = false -%}{%- else %}{% set content = message['content'] %}{% if '' in content %}{% set content = content.split('')[-1] %}{% endif %}{{'<|Assistant|>' + content + '<|end▁of▁sentence|>'}}{%- endif %}{%- endif %}{%- if message['role'] == 'tool' %}{%- set ns.is_tool = true -%}{%- if ns.is_output_first %}{{'<|tool▁outputs▁begin|><|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- set ns.is_output_first = false %}{%- else %}{{'\\n<|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- endif %}{%- endif %}{%- endfor -%}{% if ns.is_tool %}{{'<|tool▁outputs▁end|>'}}{% endif %}{% if add_generation_prompt and not ns.is_tool %}{{'<|Assistant|>\\n'}}{% endif %}",
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|end▁of▁sentence|>",
+ "legacy": true,
+ "model_max_length": 16384,
+ "pad_token": "<|end▁of▁sentence|>",
+ "sp_model_kwargs": {},
+ "tokenizer_class": "LlamaTokenizer",
+ "unk_token": null,
+ "use_default_system_prompt": false
+}
diff --git a/checkpoint-800/trainer_state.json b/checkpoint-800/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..c9ba00643194285463f71fefeaf1b32b076ae306
--- /dev/null
+++ b/checkpoint-800/trainer_state.json
@@ -0,0 +1,1473 @@
+{
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.724563644103874,
+ "eval_steps": 500,
+ "global_step": 800,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "epoch": 0.017028522775649212,
+ "grad_norm": 2.3286359310150146,
+ "learning_rate": 0.0001988623435722412,
+ "loss": 4.1641,
+ "mean_token_accuracy": 0.3866006717085838,
+ "num_tokens": 4326.0,
+ "step": 5
+ },
+ {
+ "epoch": 0.034057045551298425,
+ "grad_norm": 1.4926602840423584,
+ "learning_rate": 0.00019772468714448238,
+ "loss": 2.0591,
+ "mean_token_accuracy": 0.6790341928601265,
+ "num_tokens": 8676.0,
+ "step": 10
+ },
+ {
+ "epoch": 0.05108556832694764,
+ "grad_norm": 1.0835968255996704,
+ "learning_rate": 0.00019658703071672356,
+ "loss": 1.3145,
+ "mean_token_accuracy": 0.8256841972470284,
+ "num_tokens": 12796.0,
+ "step": 15
+ },
+ {
+ "epoch": 0.06811409110259685,
+ "grad_norm": 0.7724414467811584,
+ "learning_rate": 0.00019544937428896475,
+ "loss": 1.3324,
+ "mean_token_accuracy": 0.8117582932114601,
+ "num_tokens": 17119.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.08514261387824607,
+ "grad_norm": 0.785762369632721,
+ "learning_rate": 0.00019431171786120593,
+ "loss": 1.3375,
+ "mean_token_accuracy": 0.8029867172241211,
+ "num_tokens": 21499.0,
+ "step": 25
+ },
+ {
+ "epoch": 0.10217113665389528,
+ "grad_norm": 0.6702725291252136,
+ "learning_rate": 0.00019317406143344712,
+ "loss": 1.2159,
+ "mean_token_accuracy": 0.8230627462267875,
+ "num_tokens": 25785.0,
+ "step": 30
+ },
+ {
+ "epoch": 0.11919965942954448,
+ "grad_norm": 0.6287369728088379,
+ "learning_rate": 0.0001920364050056883,
+ "loss": 1.1634,
+ "mean_token_accuracy": 0.8315445825457572,
+ "num_tokens": 29980.0,
+ "step": 35
+ },
+ {
+ "epoch": 0.1362281822051937,
+ "grad_norm": 0.6573143005371094,
+ "learning_rate": 0.00019089874857792946,
+ "loss": 1.3762,
+ "mean_token_accuracy": 0.7971536681056023,
+ "num_tokens": 34497.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.1532567049808429,
+ "grad_norm": 0.6560688614845276,
+ "learning_rate": 0.00018976109215017067,
+ "loss": 1.1589,
+ "mean_token_accuracy": 0.8251897826790809,
+ "num_tokens": 38800.0,
+ "step": 45
+ },
+ {
+ "epoch": 0.17028522775649213,
+ "grad_norm": 0.6654791831970215,
+ "learning_rate": 0.00018862343572241183,
+ "loss": 1.1498,
+ "mean_token_accuracy": 0.8319168403744698,
+ "num_tokens": 43055.0,
+ "step": 50
+ },
+ {
+ "epoch": 0.18731375053214133,
+ "grad_norm": 0.7387417554855347,
+ "learning_rate": 0.00018748577929465302,
+ "loss": 1.1265,
+ "mean_token_accuracy": 0.8290244281291962,
+ "num_tokens": 47346.0,
+ "step": 55
+ },
+ {
+ "epoch": 0.20434227330779056,
+ "grad_norm": 0.5795997977256775,
+ "learning_rate": 0.0001863481228668942,
+ "loss": 1.0046,
+ "mean_token_accuracy": 0.8534704640507698,
+ "num_tokens": 51485.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.22137079608343976,
+ "grad_norm": 0.6834130883216858,
+ "learning_rate": 0.0001852104664391354,
+ "loss": 1.113,
+ "mean_token_accuracy": 0.8345914751291275,
+ "num_tokens": 55716.0,
+ "step": 65
+ },
+ {
+ "epoch": 0.23839931885908897,
+ "grad_norm": 0.7211284041404724,
+ "learning_rate": 0.00018407281001137657,
+ "loss": 1.2132,
+ "mean_token_accuracy": 0.8207321017980576,
+ "num_tokens": 60030.0,
+ "step": 70
+ },
+ {
+ "epoch": 0.2554278416347382,
+ "grad_norm": 0.6312271356582642,
+ "learning_rate": 0.00018293515358361776,
+ "loss": 1.0987,
+ "mean_token_accuracy": 0.8333725541830063,
+ "num_tokens": 64288.0,
+ "step": 75
+ },
+ {
+ "epoch": 0.2724563644103874,
+ "grad_norm": 0.7119404077529907,
+ "learning_rate": 0.00018179749715585894,
+ "loss": 1.0981,
+ "mean_token_accuracy": 0.8323698997497558,
+ "num_tokens": 68548.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.2894848871860366,
+ "grad_norm": 0.9000201225280762,
+ "learning_rate": 0.00018065984072810013,
+ "loss": 1.146,
+ "mean_token_accuracy": 0.8253335595130921,
+ "num_tokens": 72914.0,
+ "step": 85
+ },
+ {
+ "epoch": 0.3065134099616858,
+ "grad_norm": 0.6050537824630737,
+ "learning_rate": 0.0001795221843003413,
+ "loss": 1.0111,
+ "mean_token_accuracy": 0.842674246430397,
+ "num_tokens": 77168.0,
+ "step": 90
+ },
+ {
+ "epoch": 0.32354193273733506,
+ "grad_norm": 0.684512197971344,
+ "learning_rate": 0.0001783845278725825,
+ "loss": 1.1186,
+ "mean_token_accuracy": 0.8351956441998482,
+ "num_tokens": 81439.0,
+ "step": 95
+ },
+ {
+ "epoch": 0.34057045551298426,
+ "grad_norm": 0.7323129773139954,
+ "learning_rate": 0.00017724687144482368,
+ "loss": 1.1287,
+ "mean_token_accuracy": 0.8245970487594605,
+ "num_tokens": 85773.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.35759897828863346,
+ "grad_norm": 0.7547741532325745,
+ "learning_rate": 0.00017610921501706487,
+ "loss": 1.0868,
+ "mean_token_accuracy": 0.8298466548323631,
+ "num_tokens": 90117.0,
+ "step": 105
+ },
+ {
+ "epoch": 0.37462750106428266,
+ "grad_norm": 0.7113769054412842,
+ "learning_rate": 0.00017497155858930602,
+ "loss": 1.1214,
+ "mean_token_accuracy": 0.8299670115113258,
+ "num_tokens": 94412.0,
+ "step": 110
+ },
+ {
+ "epoch": 0.39165602383993187,
+ "grad_norm": 0.7486220002174377,
+ "learning_rate": 0.00017383390216154724,
+ "loss": 1.1452,
+ "mean_token_accuracy": 0.8283886179327965,
+ "num_tokens": 98782.0,
+ "step": 115
+ },
+ {
+ "epoch": 0.4086845466155811,
+ "grad_norm": 0.658633828163147,
+ "learning_rate": 0.0001726962457337884,
+ "loss": 1.0415,
+ "mean_token_accuracy": 0.8431179687380791,
+ "num_tokens": 103011.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.4257130693912303,
+ "grad_norm": 0.783794105052948,
+ "learning_rate": 0.0001715585893060296,
+ "loss": 1.1056,
+ "mean_token_accuracy": 0.8254878520965576,
+ "num_tokens": 107402.0,
+ "step": 125
+ },
+ {
+ "epoch": 0.4427415921668795,
+ "grad_norm": 0.7954565286636353,
+ "learning_rate": 0.00017042093287827076,
+ "loss": 1.0518,
+ "mean_token_accuracy": 0.8375606715679169,
+ "num_tokens": 111707.0,
+ "step": 130
+ },
+ {
+ "epoch": 0.45977011494252873,
+ "grad_norm": 0.6913949847221375,
+ "learning_rate": 0.00016928327645051198,
+ "loss": 1.1104,
+ "mean_token_accuracy": 0.8326424166560173,
+ "num_tokens": 115998.0,
+ "step": 135
+ },
+ {
+ "epoch": 0.47679863771817793,
+ "grad_norm": 0.7918037176132202,
+ "learning_rate": 0.00016814562002275313,
+ "loss": 1.0495,
+ "mean_token_accuracy": 0.8390962019562721,
+ "num_tokens": 120271.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.49382716049382713,
+ "grad_norm": 0.7816826701164246,
+ "learning_rate": 0.00016700796359499432,
+ "loss": 1.0463,
+ "mean_token_accuracy": 0.8433194428682327,
+ "num_tokens": 124461.0,
+ "step": 145
+ },
+ {
+ "epoch": 0.5108556832694764,
+ "grad_norm": 0.8069042563438416,
+ "learning_rate": 0.0001658703071672355,
+ "loss": 1.0664,
+ "mean_token_accuracy": 0.8278923153877258,
+ "num_tokens": 128781.0,
+ "step": 150
+ },
+ {
+ "epoch": 0.5278842060451255,
+ "grad_norm": 1.0114731788635254,
+ "learning_rate": 0.0001647326507394767,
+ "loss": 1.1217,
+ "mean_token_accuracy": 0.8267972275614739,
+ "num_tokens": 133167.0,
+ "step": 155
+ },
+ {
+ "epoch": 0.5449127288207748,
+ "grad_norm": 0.7900378704071045,
+ "learning_rate": 0.00016359499431171787,
+ "loss": 0.971,
+ "mean_token_accuracy": 0.8421565622091294,
+ "num_tokens": 137464.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.561941251596424,
+ "grad_norm": 0.8059927821159363,
+ "learning_rate": 0.00016245733788395906,
+ "loss": 1.0457,
+ "mean_token_accuracy": 0.8381335601210594,
+ "num_tokens": 141760.0,
+ "step": 165
+ },
+ {
+ "epoch": 0.5789697743720732,
+ "grad_norm": 0.7589371800422668,
+ "learning_rate": 0.00016131968145620024,
+ "loss": 1.0208,
+ "mean_token_accuracy": 0.8342296928167343,
+ "num_tokens": 146051.0,
+ "step": 170
+ },
+ {
+ "epoch": 0.5959982971477225,
+ "grad_norm": 0.692416250705719,
+ "learning_rate": 0.00016018202502844143,
+ "loss": 0.9837,
+ "mean_token_accuracy": 0.8510025009512902,
+ "num_tokens": 150270.0,
+ "step": 175
+ },
+ {
+ "epoch": 0.6130268199233716,
+ "grad_norm": 0.6662923097610474,
+ "learning_rate": 0.0001590443686006826,
+ "loss": 0.9835,
+ "mean_token_accuracy": 0.8463438332080842,
+ "num_tokens": 154537.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.6300553426990209,
+ "grad_norm": 0.7452691793441772,
+ "learning_rate": 0.0001579067121729238,
+ "loss": 1.0496,
+ "mean_token_accuracy": 0.8375737622380257,
+ "num_tokens": 158810.0,
+ "step": 185
+ },
+ {
+ "epoch": 0.6470838654746701,
+ "grad_norm": 0.809700608253479,
+ "learning_rate": 0.00015676905574516496,
+ "loss": 1.0595,
+ "mean_token_accuracy": 0.8294038504362107,
+ "num_tokens": 163213.0,
+ "step": 190
+ },
+ {
+ "epoch": 0.6641123882503193,
+ "grad_norm": 0.7708745002746582,
+ "learning_rate": 0.00015563139931740617,
+ "loss": 1.0976,
+ "mean_token_accuracy": 0.8289313957095146,
+ "num_tokens": 167607.0,
+ "step": 195
+ },
+ {
+ "epoch": 0.6811409110259685,
+ "grad_norm": 0.6482141613960266,
+ "learning_rate": 0.00015449374288964733,
+ "loss": 1.0701,
+ "mean_token_accuracy": 0.8261386752128601,
+ "num_tokens": 172024.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.6981694338016177,
+ "grad_norm": 0.7164883613586426,
+ "learning_rate": 0.00015335608646188854,
+ "loss": 0.9878,
+ "mean_token_accuracy": 0.8418964132666588,
+ "num_tokens": 176317.0,
+ "step": 205
+ },
+ {
+ "epoch": 0.7151979565772669,
+ "grad_norm": 0.710343599319458,
+ "learning_rate": 0.0001522184300341297,
+ "loss": 0.9306,
+ "mean_token_accuracy": 0.8468034327030182,
+ "num_tokens": 180558.0,
+ "step": 210
+ },
+ {
+ "epoch": 0.7322264793529162,
+ "grad_norm": 0.863784909248352,
+ "learning_rate": 0.00015108077360637088,
+ "loss": 1.0544,
+ "mean_token_accuracy": 0.8359945684671402,
+ "num_tokens": 184885.0,
+ "step": 215
+ },
+ {
+ "epoch": 0.7492550021285653,
+ "grad_norm": 0.8381637930870056,
+ "learning_rate": 0.00014994311717861207,
+ "loss": 1.0522,
+ "mean_token_accuracy": 0.836811026930809,
+ "num_tokens": 189219.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.7662835249042146,
+ "grad_norm": 0.683501124382019,
+ "learning_rate": 0.00014880546075085325,
+ "loss": 0.9427,
+ "mean_token_accuracy": 0.8544979348778725,
+ "num_tokens": 193437.0,
+ "step": 225
+ },
+ {
+ "epoch": 0.7833120476798637,
+ "grad_norm": 0.7609812617301941,
+ "learning_rate": 0.00014766780432309444,
+ "loss": 1.0048,
+ "mean_token_accuracy": 0.8403829500079155,
+ "num_tokens": 197724.0,
+ "step": 230
+ },
+ {
+ "epoch": 0.800340570455513,
+ "grad_norm": 0.8223949074745178,
+ "learning_rate": 0.00014653014789533562,
+ "loss": 1.078,
+ "mean_token_accuracy": 0.8296335831284523,
+ "num_tokens": 202141.0,
+ "step": 235
+ },
+ {
+ "epoch": 0.8173690932311622,
+ "grad_norm": 0.9807024002075195,
+ "learning_rate": 0.0001453924914675768,
+ "loss": 0.9295,
+ "mean_token_accuracy": 0.8495418474078178,
+ "num_tokens": 206333.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.8343976160068114,
+ "grad_norm": 0.7864217162132263,
+ "learning_rate": 0.000144254835039818,
+ "loss": 1.0326,
+ "mean_token_accuracy": 0.8422158002853394,
+ "num_tokens": 210593.0,
+ "step": 245
+ },
+ {
+ "epoch": 0.8514261387824607,
+ "grad_norm": 0.8183476328849792,
+ "learning_rate": 0.00014311717861205915,
+ "loss": 1.0419,
+ "mean_token_accuracy": 0.8332764700055122,
+ "num_tokens": 214925.0,
+ "step": 250
+ },
+ {
+ "epoch": 0.8684546615581098,
+ "grad_norm": 0.7906543612480164,
+ "learning_rate": 0.00014197952218430036,
+ "loss": 0.9278,
+ "mean_token_accuracy": 0.8531344652175903,
+ "num_tokens": 219106.0,
+ "step": 255
+ },
+ {
+ "epoch": 0.885483184333759,
+ "grad_norm": 0.7864625453948975,
+ "learning_rate": 0.00014084186575654152,
+ "loss": 0.9764,
+ "mean_token_accuracy": 0.8394758701324463,
+ "num_tokens": 223398.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.9025117071094083,
+ "grad_norm": 0.7231821417808533,
+ "learning_rate": 0.00013970420932878273,
+ "loss": 1.0357,
+ "mean_token_accuracy": 0.8368565306067467,
+ "num_tokens": 227720.0,
+ "step": 265
+ },
+ {
+ "epoch": 0.9195402298850575,
+ "grad_norm": 0.7288718223571777,
+ "learning_rate": 0.0001385665529010239,
+ "loss": 1.0178,
+ "mean_token_accuracy": 0.842984040081501,
+ "num_tokens": 232021.0,
+ "step": 270
+ },
+ {
+ "epoch": 0.9365687526607067,
+ "grad_norm": 0.7466130256652832,
+ "learning_rate": 0.0001374288964732651,
+ "loss": 0.9974,
+ "mean_token_accuracy": 0.8431279867887497,
+ "num_tokens": 236312.0,
+ "step": 275
+ },
+ {
+ "epoch": 0.9535972754363559,
+ "grad_norm": 0.7876543402671814,
+ "learning_rate": 0.00013629124004550626,
+ "loss": 1.0057,
+ "mean_token_accuracy": 0.8389794036746026,
+ "num_tokens": 240594.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.9706257982120051,
+ "grad_norm": 0.738293468952179,
+ "learning_rate": 0.00013515358361774744,
+ "loss": 0.9129,
+ "mean_token_accuracy": 0.8528255730867386,
+ "num_tokens": 244859.0,
+ "step": 285
+ },
+ {
+ "epoch": 0.9876543209876543,
+ "grad_norm": 0.8145989775657654,
+ "learning_rate": 0.00013401592718998863,
+ "loss": 0.9188,
+ "mean_token_accuracy": 0.8555046319961548,
+ "num_tokens": 249060.0,
+ "step": 290
+ },
+ {
+ "epoch": 1.0046828437633035,
+ "grad_norm": 0.693233072757721,
+ "learning_rate": 0.00013287827076222981,
+ "loss": 1.0648,
+ "mean_token_accuracy": 0.8477524280548095,
+ "num_tokens": 253361.0,
+ "step": 295
+ },
+ {
+ "epoch": 1.0217113665389528,
+ "grad_norm": 0.8171095848083496,
+ "learning_rate": 0.000131740614334471,
+ "loss": 0.883,
+ "mean_token_accuracy": 0.8561580404639244,
+ "num_tokens": 257633.0,
+ "step": 300
+ },
+ {
+ "epoch": 1.038739889314602,
+ "grad_norm": 0.7343988418579102,
+ "learning_rate": 0.00013060295790671218,
+ "loss": 0.8591,
+ "mean_token_accuracy": 0.8583228841423989,
+ "num_tokens": 261975.0,
+ "step": 305
+ },
+ {
+ "epoch": 1.055768412090251,
+ "grad_norm": 0.6689726114273071,
+ "learning_rate": 0.00012946530147895337,
+ "loss": 0.8397,
+ "mean_token_accuracy": 0.8668102487921715,
+ "num_tokens": 266174.0,
+ "step": 310
+ },
+ {
+ "epoch": 1.0727969348659003,
+ "grad_norm": 0.8284767270088196,
+ "learning_rate": 0.00012832764505119455,
+ "loss": 0.9108,
+ "mean_token_accuracy": 0.8551412716507911,
+ "num_tokens": 270416.0,
+ "step": 315
+ },
+ {
+ "epoch": 1.0898254576415496,
+ "grad_norm": 0.7800877690315247,
+ "learning_rate": 0.0001271899886234357,
+ "loss": 0.923,
+ "mean_token_accuracy": 0.8521544948220253,
+ "num_tokens": 274802.0,
+ "step": 320
+ },
+ {
+ "epoch": 1.1068539804171988,
+ "grad_norm": 0.803035318851471,
+ "learning_rate": 0.00012605233219567692,
+ "loss": 0.9009,
+ "mean_token_accuracy": 0.8583568409085274,
+ "num_tokens": 279061.0,
+ "step": 325
+ },
+ {
+ "epoch": 1.123882503192848,
+ "grad_norm": 0.7928335666656494,
+ "learning_rate": 0.00012491467576791808,
+ "loss": 0.8677,
+ "mean_token_accuracy": 0.860838033258915,
+ "num_tokens": 283290.0,
+ "step": 330
+ },
+ {
+ "epoch": 1.1409110259684971,
+ "grad_norm": 0.82757967710495,
+ "learning_rate": 0.0001237770193401593,
+ "loss": 0.9326,
+ "mean_token_accuracy": 0.8526211172342301,
+ "num_tokens": 287627.0,
+ "step": 335
+ },
+ {
+ "epoch": 1.1579395487441464,
+ "grad_norm": 0.8021914958953857,
+ "learning_rate": 0.00012263936291240045,
+ "loss": 0.9066,
+ "mean_token_accuracy": 0.8505649596452713,
+ "num_tokens": 291975.0,
+ "step": 340
+ },
+ {
+ "epoch": 1.1749680715197957,
+ "grad_norm": 0.7565475106239319,
+ "learning_rate": 0.00012150170648464165,
+ "loss": 0.8812,
+ "mean_token_accuracy": 0.8562570214271545,
+ "num_tokens": 296232.0,
+ "step": 345
+ },
+ {
+ "epoch": 1.191996594295445,
+ "grad_norm": 0.8126978278160095,
+ "learning_rate": 0.00012036405005688282,
+ "loss": 0.905,
+ "mean_token_accuracy": 0.8556828230619431,
+ "num_tokens": 300591.0,
+ "step": 350
+ },
+ {
+ "epoch": 1.2090251170710942,
+ "grad_norm": 0.8174765706062317,
+ "learning_rate": 0.000119226393629124,
+ "loss": 0.9861,
+ "mean_token_accuracy": 0.8424012079834938,
+ "num_tokens": 304998.0,
+ "step": 355
+ },
+ {
+ "epoch": 1.2260536398467432,
+ "grad_norm": 0.8921035528182983,
+ "learning_rate": 0.00011808873720136519,
+ "loss": 0.7724,
+ "mean_token_accuracy": 0.8735315829515458,
+ "num_tokens": 309137.0,
+ "step": 360
+ },
+ {
+ "epoch": 1.2430821626223925,
+ "grad_norm": 0.855992317199707,
+ "learning_rate": 0.00011695108077360638,
+ "loss": 0.8922,
+ "mean_token_accuracy": 0.854039640724659,
+ "num_tokens": 313389.0,
+ "step": 365
+ },
+ {
+ "epoch": 1.2601106853980417,
+ "grad_norm": 0.9408860206604004,
+ "learning_rate": 0.00011581342434584756,
+ "loss": 0.9254,
+ "mean_token_accuracy": 0.8507854476571083,
+ "num_tokens": 317743.0,
+ "step": 370
+ },
+ {
+ "epoch": 1.277139208173691,
+ "grad_norm": 0.7847197651863098,
+ "learning_rate": 0.00011467576791808873,
+ "loss": 0.8563,
+ "mean_token_accuracy": 0.869862625002861,
+ "num_tokens": 321873.0,
+ "step": 375
+ },
+ {
+ "epoch": 1.29416773094934,
+ "grad_norm": 0.8556840419769287,
+ "learning_rate": 0.00011353811149032993,
+ "loss": 0.8489,
+ "mean_token_accuracy": 0.8591933220624923,
+ "num_tokens": 326124.0,
+ "step": 380
+ },
+ {
+ "epoch": 1.3111962537249893,
+ "grad_norm": 0.8849514126777649,
+ "learning_rate": 0.0001124004550625711,
+ "loss": 0.8526,
+ "mean_token_accuracy": 0.8600789621472359,
+ "num_tokens": 330405.0,
+ "step": 385
+ },
+ {
+ "epoch": 1.3282247765006385,
+ "grad_norm": 0.8099865913391113,
+ "learning_rate": 0.00011126279863481229,
+ "loss": 0.9309,
+ "mean_token_accuracy": 0.8511071890592575,
+ "num_tokens": 334701.0,
+ "step": 390
+ },
+ {
+ "epoch": 1.3452532992762878,
+ "grad_norm": 0.8668401837348938,
+ "learning_rate": 0.00011012514220705347,
+ "loss": 0.8671,
+ "mean_token_accuracy": 0.8605618432164193,
+ "num_tokens": 338951.0,
+ "step": 395
+ },
+ {
+ "epoch": 1.362281822051937,
+ "grad_norm": 0.8669872283935547,
+ "learning_rate": 0.00010898748577929466,
+ "loss": 0.8796,
+ "mean_token_accuracy": 0.8592276558279991,
+ "num_tokens": 343203.0,
+ "step": 400
+ },
+ {
+ "epoch": 1.3793103448275863,
+ "grad_norm": 0.8468757271766663,
+ "learning_rate": 0.00010784982935153584,
+ "loss": 0.8941,
+ "mean_token_accuracy": 0.8553030788898468,
+ "num_tokens": 347460.0,
+ "step": 405
+ },
+ {
+ "epoch": 1.3963388676032356,
+ "grad_norm": 0.8839651346206665,
+ "learning_rate": 0.00010671217292377703,
+ "loss": 0.913,
+ "mean_token_accuracy": 0.8489826336503029,
+ "num_tokens": 351850.0,
+ "step": 410
+ },
+ {
+ "epoch": 1.4133673903788846,
+ "grad_norm": 0.8808367848396301,
+ "learning_rate": 0.00010557451649601821,
+ "loss": 0.8158,
+ "mean_token_accuracy": 0.8628147393465042,
+ "num_tokens": 356104.0,
+ "step": 415
+ },
+ {
+ "epoch": 1.4303959131545338,
+ "grad_norm": 0.9303593039512634,
+ "learning_rate": 0.00010443686006825938,
+ "loss": 0.8737,
+ "mean_token_accuracy": 0.8497098922729492,
+ "num_tokens": 360445.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.447424435930183,
+ "grad_norm": 0.7914776802062988,
+ "learning_rate": 0.00010329920364050057,
+ "loss": 0.9168,
+ "mean_token_accuracy": 0.8531492814421654,
+ "num_tokens": 364778.0,
+ "step": 425
+ },
+ {
+ "epoch": 1.4644529587058321,
+ "grad_norm": 0.8661580085754395,
+ "learning_rate": 0.00010216154721274175,
+ "loss": 0.8335,
+ "mean_token_accuracy": 0.8674297228455543,
+ "num_tokens": 368961.0,
+ "step": 430
+ },
+ {
+ "epoch": 1.4814814814814814,
+ "grad_norm": 0.8548939228057861,
+ "learning_rate": 0.00010102389078498294,
+ "loss": 0.9314,
+ "mean_token_accuracy": 0.8409372463822364,
+ "num_tokens": 373355.0,
+ "step": 435
+ },
+ {
+ "epoch": 1.4985100042571307,
+ "grad_norm": 0.8668932914733887,
+ "learning_rate": 9.988623435722412e-05,
+ "loss": 0.8482,
+ "mean_token_accuracy": 0.8576690852642059,
+ "num_tokens": 377652.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.51553852703278,
+ "grad_norm": 0.8412478566169739,
+ "learning_rate": 9.874857792946531e-05,
+ "loss": 0.8791,
+ "mean_token_accuracy": 0.8531419888138772,
+ "num_tokens": 381969.0,
+ "step": 445
+ },
+ {
+ "epoch": 1.5325670498084292,
+ "grad_norm": 0.8298078179359436,
+ "learning_rate": 9.761092150170649e-05,
+ "loss": 0.7418,
+ "mean_token_accuracy": 0.8757623940706253,
+ "num_tokens": 386149.0,
+ "step": 450
+ },
+ {
+ "epoch": 1.5495955725840784,
+ "grad_norm": 0.8505256772041321,
+ "learning_rate": 9.647326507394768e-05,
+ "loss": 0.8107,
+ "mean_token_accuracy": 0.8660028412938118,
+ "num_tokens": 390316.0,
+ "step": 455
+ },
+ {
+ "epoch": 1.5666240953597277,
+ "grad_norm": 0.72185879945755,
+ "learning_rate": 9.533560864618886e-05,
+ "loss": 0.8601,
+ "mean_token_accuracy": 0.8591737478971482,
+ "num_tokens": 394651.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.5836526181353767,
+ "grad_norm": 1.0382378101348877,
+ "learning_rate": 9.419795221843003e-05,
+ "loss": 0.849,
+ "mean_token_accuracy": 0.8591210901737213,
+ "num_tokens": 398879.0,
+ "step": 465
+ },
+ {
+ "epoch": 1.600681140911026,
+ "grad_norm": 0.7781236171722412,
+ "learning_rate": 9.306029579067122e-05,
+ "loss": 0.8587,
+ "mean_token_accuracy": 0.8554968953132629,
+ "num_tokens": 403154.0,
+ "step": 470
+ },
+ {
+ "epoch": 1.617709663686675,
+ "grad_norm": 0.9941114187240601,
+ "learning_rate": 9.19226393629124e-05,
+ "loss": 1.0077,
+ "mean_token_accuracy": 0.8324473947286606,
+ "num_tokens": 407653.0,
+ "step": 475
+ },
+ {
+ "epoch": 1.6347381864623243,
+ "grad_norm": 0.791912853717804,
+ "learning_rate": 9.078498293515359e-05,
+ "loss": 0.8211,
+ "mean_token_accuracy": 0.8655396267771721,
+ "num_tokens": 411904.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.6517667092379735,
+ "grad_norm": 0.8509976267814636,
+ "learning_rate": 8.964732650739477e-05,
+ "loss": 0.8895,
+ "mean_token_accuracy": 0.8587504833936691,
+ "num_tokens": 416159.0,
+ "step": 485
+ },
+ {
+ "epoch": 1.6687952320136228,
+ "grad_norm": 1.0071176290512085,
+ "learning_rate": 8.850967007963596e-05,
+ "loss": 0.9112,
+ "mean_token_accuracy": 0.8539686873555183,
+ "num_tokens": 420513.0,
+ "step": 490
+ },
+ {
+ "epoch": 1.685823754789272,
+ "grad_norm": 0.8273159861564636,
+ "learning_rate": 8.737201365187714e-05,
+ "loss": 0.8383,
+ "mean_token_accuracy": 0.8577379778027534,
+ "num_tokens": 424759.0,
+ "step": 495
+ },
+ {
+ "epoch": 1.7028522775649213,
+ "grad_norm": 0.8064838647842407,
+ "learning_rate": 8.623435722411833e-05,
+ "loss": 0.8397,
+ "mean_token_accuracy": 0.8636475175619125,
+ "num_tokens": 429018.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.7198808003405706,
+ "grad_norm": 0.7176003456115723,
+ "learning_rate": 8.509670079635951e-05,
+ "loss": 0.7738,
+ "mean_token_accuracy": 0.8699946105480194,
+ "num_tokens": 433124.0,
+ "step": 505
+ },
+ {
+ "epoch": 1.7369093231162198,
+ "grad_norm": 0.8316643834114075,
+ "learning_rate": 8.395904436860069e-05,
+ "loss": 0.9191,
+ "mean_token_accuracy": 0.8493718564510345,
+ "num_tokens": 437449.0,
+ "step": 510
+ },
+ {
+ "epoch": 1.7539378458918689,
+ "grad_norm": 0.9423941373825073,
+ "learning_rate": 8.282138794084187e-05,
+ "loss": 0.8749,
+ "mean_token_accuracy": 0.8558909714221954,
+ "num_tokens": 441753.0,
+ "step": 515
+ },
+ {
+ "epoch": 1.770966368667518,
+ "grad_norm": 0.8593487739562988,
+ "learning_rate": 8.168373151308306e-05,
+ "loss": 0.8463,
+ "mean_token_accuracy": 0.857591399550438,
+ "num_tokens": 446036.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.7879948914431671,
+ "grad_norm": 0.7944974303245544,
+ "learning_rate": 8.054607508532424e-05,
+ "loss": 0.8275,
+ "mean_token_accuracy": 0.859096622467041,
+ "num_tokens": 450298.0,
+ "step": 525
+ },
+ {
+ "epoch": 1.8050234142188164,
+ "grad_norm": 0.7622503042221069,
+ "learning_rate": 7.940841865756543e-05,
+ "loss": 0.8846,
+ "mean_token_accuracy": 0.8580268025398254,
+ "num_tokens": 454595.0,
+ "step": 530
+ },
+ {
+ "epoch": 1.8220519369944657,
+ "grad_norm": 0.8578078746795654,
+ "learning_rate": 7.827076222980661e-05,
+ "loss": 0.7674,
+ "mean_token_accuracy": 0.8716912001371384,
+ "num_tokens": 458807.0,
+ "step": 535
+ },
+ {
+ "epoch": 1.839080459770115,
+ "grad_norm": 1.0383292436599731,
+ "learning_rate": 7.71331058020478e-05,
+ "loss": 0.9129,
+ "mean_token_accuracy": 0.8489386543631554,
+ "num_tokens": 463150.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.8561089825457642,
+ "grad_norm": 0.8726801872253418,
+ "learning_rate": 7.599544937428897e-05,
+ "loss": 0.877,
+ "mean_token_accuracy": 0.8568779289722442,
+ "num_tokens": 467472.0,
+ "step": 545
+ },
+ {
+ "epoch": 1.8731375053214134,
+ "grad_norm": 0.9192221164703369,
+ "learning_rate": 7.485779294653015e-05,
+ "loss": 0.9341,
+ "mean_token_accuracy": 0.8403045237064362,
+ "num_tokens": 471930.0,
+ "step": 550
+ },
+ {
+ "epoch": 1.8901660280970627,
+ "grad_norm": 0.8688830137252808,
+ "learning_rate": 7.372013651877134e-05,
+ "loss": 0.8244,
+ "mean_token_accuracy": 0.8679932355880737,
+ "num_tokens": 476140.0,
+ "step": 555
+ },
+ {
+ "epoch": 1.907194550872712,
+ "grad_norm": 0.8286635279655457,
+ "learning_rate": 7.258248009101252e-05,
+ "loss": 0.8725,
+ "mean_token_accuracy": 0.8549414992332458,
+ "num_tokens": 480474.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.924223073648361,
+ "grad_norm": 0.789902925491333,
+ "learning_rate": 7.14448236632537e-05,
+ "loss": 0.8135,
+ "mean_token_accuracy": 0.8649365425109863,
+ "num_tokens": 484805.0,
+ "step": 565
+ },
+ {
+ "epoch": 1.9412515964240102,
+ "grad_norm": 0.8496629595756531,
+ "learning_rate": 7.030716723549489e-05,
+ "loss": 0.9036,
+ "mean_token_accuracy": 0.8460123494267464,
+ "num_tokens": 489275.0,
+ "step": 570
+ },
+ {
+ "epoch": 1.9582801191996593,
+ "grad_norm": 0.8411655426025391,
+ "learning_rate": 6.916951080773608e-05,
+ "loss": 0.9346,
+ "mean_token_accuracy": 0.8429780200123786,
+ "num_tokens": 493726.0,
+ "step": 575
+ },
+ {
+ "epoch": 1.9753086419753085,
+ "grad_norm": 0.8502522706985474,
+ "learning_rate": 6.803185437997726e-05,
+ "loss": 0.8703,
+ "mean_token_accuracy": 0.8595944106578827,
+ "num_tokens": 498022.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.9923371647509578,
+ "grad_norm": 0.743918776512146,
+ "learning_rate": 6.689419795221843e-05,
+ "loss": 0.8815,
+ "mean_token_accuracy": 0.851164074242115,
+ "num_tokens": 502352.0,
+ "step": 585
+ },
+ {
+ "epoch": 2.009365687526607,
+ "grad_norm": 0.7339876294136047,
+ "learning_rate": 6.575654152445962e-05,
+ "loss": 0.9297,
+ "mean_token_accuracy": 0.8610147342085839,
+ "num_tokens": 506669.0,
+ "step": 590
+ },
+ {
+ "epoch": 2.0263942103022563,
+ "grad_norm": 0.903137743473053,
+ "learning_rate": 6.46188850967008e-05,
+ "loss": 0.7306,
+ "mean_token_accuracy": 0.8799364000558854,
+ "num_tokens": 510931.0,
+ "step": 595
+ },
+ {
+ "epoch": 2.0434227330779056,
+ "grad_norm": 0.8741887807846069,
+ "learning_rate": 6.348122866894199e-05,
+ "loss": 0.777,
+ "mean_token_accuracy": 0.8718036338686943,
+ "num_tokens": 515254.0,
+ "step": 600
+ },
+ {
+ "epoch": 2.060451255853555,
+ "grad_norm": 0.9856182932853699,
+ "learning_rate": 6.234357224118317e-05,
+ "loss": 0.6852,
+ "mean_token_accuracy": 0.8851086810231209,
+ "num_tokens": 519444.0,
+ "step": 605
+ },
+ {
+ "epoch": 2.077479778629204,
+ "grad_norm": 0.7548404335975647,
+ "learning_rate": 6.120591581342436e-05,
+ "loss": 0.7239,
+ "mean_token_accuracy": 0.8775098115205765,
+ "num_tokens": 523786.0,
+ "step": 610
+ },
+ {
+ "epoch": 2.0945083014048533,
+ "grad_norm": 1.0486595630645752,
+ "learning_rate": 6.0068259385665536e-05,
+ "loss": 0.7704,
+ "mean_token_accuracy": 0.8707917019724846,
+ "num_tokens": 528181.0,
+ "step": 615
+ },
+ {
+ "epoch": 2.111536824180502,
+ "grad_norm": 0.8551440238952637,
+ "learning_rate": 5.8930602957906714e-05,
+ "loss": 0.7298,
+ "mean_token_accuracy": 0.8771380126476288,
+ "num_tokens": 532472.0,
+ "step": 620
+ },
+ {
+ "epoch": 2.1285653469561514,
+ "grad_norm": 0.7993748784065247,
+ "learning_rate": 5.77929465301479e-05,
+ "loss": 0.7342,
+ "mean_token_accuracy": 0.8784463226795196,
+ "num_tokens": 536780.0,
+ "step": 625
+ },
+ {
+ "epoch": 2.1455938697318007,
+ "grad_norm": 0.9535342454910278,
+ "learning_rate": 5.665529010238908e-05,
+ "loss": 0.7448,
+ "mean_token_accuracy": 0.8769229754805565,
+ "num_tokens": 541096.0,
+ "step": 630
+ },
+ {
+ "epoch": 2.16262239250745,
+ "grad_norm": 0.8289098739624023,
+ "learning_rate": 5.551763367463026e-05,
+ "loss": 0.6921,
+ "mean_token_accuracy": 0.8816722989082336,
+ "num_tokens": 545212.0,
+ "step": 635
+ },
+ {
+ "epoch": 2.179650915283099,
+ "grad_norm": 1.0842015743255615,
+ "learning_rate": 5.437997724687145e-05,
+ "loss": 0.7519,
+ "mean_token_accuracy": 0.87905133664608,
+ "num_tokens": 549486.0,
+ "step": 640
+ },
+ {
+ "epoch": 2.1966794380587484,
+ "grad_norm": 0.9770705699920654,
+ "learning_rate": 5.324232081911263e-05,
+ "loss": 0.7565,
+ "mean_token_accuracy": 0.8737751096487045,
+ "num_tokens": 553849.0,
+ "step": 645
+ },
+ {
+ "epoch": 2.2137079608343977,
+ "grad_norm": 0.9087614417076111,
+ "learning_rate": 5.210466439135382e-05,
+ "loss": 0.7573,
+ "mean_token_accuracy": 0.8769190922379494,
+ "num_tokens": 558157.0,
+ "step": 650
+ },
+ {
+ "epoch": 2.230736483610047,
+ "grad_norm": 0.9485377073287964,
+ "learning_rate": 5.0967007963594995e-05,
+ "loss": 0.7951,
+ "mean_token_accuracy": 0.8717585399746894,
+ "num_tokens": 562499.0,
+ "step": 655
+ },
+ {
+ "epoch": 2.247765006385696,
+ "grad_norm": 0.901766300201416,
+ "learning_rate": 4.982935153583618e-05,
+ "loss": 0.7584,
+ "mean_token_accuracy": 0.8740618869662284,
+ "num_tokens": 566735.0,
+ "step": 660
+ },
+ {
+ "epoch": 2.264793529161345,
+ "grad_norm": 0.9577491879463196,
+ "learning_rate": 4.8691695108077365e-05,
+ "loss": 0.8409,
+ "mean_token_accuracy": 0.8705617383122444,
+ "num_tokens": 571024.0,
+ "step": 665
+ },
+ {
+ "epoch": 2.2818220519369943,
+ "grad_norm": 0.791725218296051,
+ "learning_rate": 4.755403868031855e-05,
+ "loss": 0.6348,
+ "mean_token_accuracy": 0.8875991255044937,
+ "num_tokens": 575196.0,
+ "step": 670
+ },
+ {
+ "epoch": 2.2988505747126435,
+ "grad_norm": 1.0129467248916626,
+ "learning_rate": 4.641638225255973e-05,
+ "loss": 0.7094,
+ "mean_token_accuracy": 0.8820217370986938,
+ "num_tokens": 579384.0,
+ "step": 675
+ },
+ {
+ "epoch": 2.315879097488293,
+ "grad_norm": 0.9562749266624451,
+ "learning_rate": 4.527872582480091e-05,
+ "loss": 0.7119,
+ "mean_token_accuracy": 0.8796836137771606,
+ "num_tokens": 583637.0,
+ "step": 680
+ },
+ {
+ "epoch": 2.332907620263942,
+ "grad_norm": 0.8766334056854248,
+ "learning_rate": 4.41410693970421e-05,
+ "loss": 0.779,
+ "mean_token_accuracy": 0.8700046718120575,
+ "num_tokens": 588005.0,
+ "step": 685
+ },
+ {
+ "epoch": 2.3499361430395913,
+ "grad_norm": 0.9728025794029236,
+ "learning_rate": 4.300341296928328e-05,
+ "loss": 0.8319,
+ "mean_token_accuracy": 0.8586345180869103,
+ "num_tokens": 592448.0,
+ "step": 690
+ },
+ {
+ "epoch": 2.3669646658152406,
+ "grad_norm": 1.0943338871002197,
+ "learning_rate": 4.186575654152446e-05,
+ "loss": 0.7845,
+ "mean_token_accuracy": 0.8698052436113357,
+ "num_tokens": 596703.0,
+ "step": 695
+ },
+ {
+ "epoch": 2.38399318859089,
+ "grad_norm": 1.1211864948272705,
+ "learning_rate": 4.0728100113765646e-05,
+ "loss": 0.7837,
+ "mean_token_accuracy": 0.8664575144648552,
+ "num_tokens": 601127.0,
+ "step": 700
+ },
+ {
+ "epoch": 2.401021711366539,
+ "grad_norm": 0.9164478182792664,
+ "learning_rate": 3.959044368600683e-05,
+ "loss": 0.708,
+ "mean_token_accuracy": 0.8818950295448303,
+ "num_tokens": 605371.0,
+ "step": 705
+ },
+ {
+ "epoch": 2.4180502341421883,
+ "grad_norm": 1.0944688320159912,
+ "learning_rate": 3.8452787258248016e-05,
+ "loss": 0.8541,
+ "mean_token_accuracy": 0.8556552082300186,
+ "num_tokens": 609890.0,
+ "step": 710
+ },
+ {
+ "epoch": 2.4350787569178376,
+ "grad_norm": 0.8398585319519043,
+ "learning_rate": 3.7315130830489194e-05,
+ "loss": 0.7117,
+ "mean_token_accuracy": 0.882653883099556,
+ "num_tokens": 614025.0,
+ "step": 715
+ },
+ {
+ "epoch": 2.4521072796934864,
+ "grad_norm": 0.9557759165763855,
+ "learning_rate": 3.617747440273038e-05,
+ "loss": 0.7401,
+ "mean_token_accuracy": 0.8780117958784104,
+ "num_tokens": 618268.0,
+ "step": 720
+ },
+ {
+ "epoch": 2.4691358024691357,
+ "grad_norm": 0.7890902757644653,
+ "learning_rate": 3.5039817974971564e-05,
+ "loss": 0.7193,
+ "mean_token_accuracy": 0.8795603841543198,
+ "num_tokens": 622542.0,
+ "step": 725
+ },
+ {
+ "epoch": 2.486164325244785,
+ "grad_norm": 1.0514216423034668,
+ "learning_rate": 3.390216154721274e-05,
+ "loss": 0.6987,
+ "mean_token_accuracy": 0.8816746294498443,
+ "num_tokens": 626771.0,
+ "step": 730
+ },
+ {
+ "epoch": 2.503192848020434,
+ "grad_norm": 1.0042310953140259,
+ "learning_rate": 3.276450511945393e-05,
+ "loss": 0.7099,
+ "mean_token_accuracy": 0.8860125571489335,
+ "num_tokens": 630981.0,
+ "step": 735
+ },
+ {
+ "epoch": 2.5202213707960834,
+ "grad_norm": 1.0508288145065308,
+ "learning_rate": 3.162684869169511e-05,
+ "loss": 0.7424,
+ "mean_token_accuracy": 0.8739517882466317,
+ "num_tokens": 635240.0,
+ "step": 740
+ },
+ {
+ "epoch": 2.5372498935717327,
+ "grad_norm": 1.0945532321929932,
+ "learning_rate": 3.0489192263936294e-05,
+ "loss": 0.8181,
+ "mean_token_accuracy": 0.8624349996447563,
+ "num_tokens": 639694.0,
+ "step": 745
+ },
+ {
+ "epoch": 2.554278416347382,
+ "grad_norm": 0.9198687076568604,
+ "learning_rate": 2.9351535836177476e-05,
+ "loss": 0.688,
+ "mean_token_accuracy": 0.880143529176712,
+ "num_tokens": 643984.0,
+ "step": 750
+ },
+ {
+ "epoch": 2.571306939123031,
+ "grad_norm": 1.0412315130233765,
+ "learning_rate": 2.8213879408418657e-05,
+ "loss": 0.6844,
+ "mean_token_accuracy": 0.8923282608389854,
+ "num_tokens": 648166.0,
+ "step": 755
+ },
+ {
+ "epoch": 2.58833546189868,
+ "grad_norm": 0.9161568284034729,
+ "learning_rate": 2.7076222980659842e-05,
+ "loss": 0.7436,
+ "mean_token_accuracy": 0.8677403450012207,
+ "num_tokens": 652487.0,
+ "step": 760
+ },
+ {
+ "epoch": 2.6053639846743293,
+ "grad_norm": 0.7734108567237854,
+ "learning_rate": 2.5938566552901024e-05,
+ "loss": 0.6938,
+ "mean_token_accuracy": 0.8824578642845153,
+ "num_tokens": 656735.0,
+ "step": 765
+ },
+ {
+ "epoch": 2.6223925074499785,
+ "grad_norm": 1.2506450414657593,
+ "learning_rate": 2.480091012514221e-05,
+ "loss": 0.7896,
+ "mean_token_accuracy": 0.8708192393183708,
+ "num_tokens": 661125.0,
+ "step": 770
+ },
+ {
+ "epoch": 2.639421030225628,
+ "grad_norm": 0.9822338223457336,
+ "learning_rate": 2.366325369738339e-05,
+ "loss": 0.7611,
+ "mean_token_accuracy": 0.8697439581155777,
+ "num_tokens": 665455.0,
+ "step": 775
+ },
+ {
+ "epoch": 2.656449553001277,
+ "grad_norm": 1.0660203695297241,
+ "learning_rate": 2.2525597269624575e-05,
+ "loss": 0.8025,
+ "mean_token_accuracy": 0.867020557820797,
+ "num_tokens": 669868.0,
+ "step": 780
+ },
+ {
+ "epoch": 2.6734780757769263,
+ "grad_norm": 1.049364686012268,
+ "learning_rate": 2.138794084186576e-05,
+ "loss": 0.7601,
+ "mean_token_accuracy": 0.8773441627621651,
+ "num_tokens": 674152.0,
+ "step": 785
+ },
+ {
+ "epoch": 2.6905065985525756,
+ "grad_norm": 0.9868401288986206,
+ "learning_rate": 2.025028441410694e-05,
+ "loss": 0.7507,
+ "mean_token_accuracy": 0.8820523858070374,
+ "num_tokens": 678390.0,
+ "step": 790
+ },
+ {
+ "epoch": 2.707535121328225,
+ "grad_norm": 0.9983195662498474,
+ "learning_rate": 1.9112627986348127e-05,
+ "loss": 0.7143,
+ "mean_token_accuracy": 0.8788602381944657,
+ "num_tokens": 682664.0,
+ "step": 795
+ },
+ {
+ "epoch": 2.724563644103874,
+ "grad_norm": 0.8293647170066833,
+ "learning_rate": 1.7974971558589308e-05,
+ "loss": 0.7131,
+ "mean_token_accuracy": 0.8797033429145813,
+ "num_tokens": 686921.0,
+ "step": 800
+ }
+ ],
+ "logging_steps": 5,
+ "max_steps": 879,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 3,
+ "save_steps": 200,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 6438561661903872.0,
+ "train_batch_size": 1,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/checkpoint-800/training_args.bin b/checkpoint-800/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..b2b3017298d5c921f7f2203bfc0351607fabc713
--- /dev/null
+++ b/checkpoint-800/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:001de43419a04313fd3d652571d90911489fbcebf2f0e7c3f8aa624286dfc855
+size 5624
diff --git a/checkpoint-879/README.md b/checkpoint-879/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..26e95dfdb2ce21d15943da03dc221885e4e0766b
--- /dev/null
+++ b/checkpoint-879/README.md
@@ -0,0 +1,209 @@
+---
+base_model: deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.20.0
\ No newline at end of file
diff --git a/checkpoint-879/adapter_config.json b/checkpoint-879/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..3e6084886e22b204a0c346cc3c9e491f44a217f3
--- /dev/null
+++ b/checkpoint-879/adapter_config.json
@@ -0,0 +1,50 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 32,
+ "lora_bias": false,
+ "lora_dropout": 0.05,
+ "lora_ga_config": null,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "monteclora_config": null,
+ "peft_type": "LORA",
+ "peft_version": "0.20.0",
+ "qalora_group_size": 16,
+ "r": 16,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "q_proj",
+ "up_proj",
+ "down_proj",
+ "k_proj",
+ "o_proj",
+ "v_proj",
+ "gate_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_bdlora": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false,
+ "velora_config": null
+}
\ No newline at end of file
diff --git a/checkpoint-879/adapter_model.safetensors b/checkpoint-879/adapter_model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..d1f76a1750f9a8eefc9bbc81dc76e88088c50bd3
--- /dev/null
+++ b/checkpoint-879/adapter_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8de8bf2fd18381ef12444c3a4498a621e7212eb593668a78afcdd21768f5b0fa
+size 73911112
diff --git a/checkpoint-879/optimizer.pt b/checkpoint-879/optimizer.pt
new file mode 100644
index 0000000000000000000000000000000000000000..7603a24f4cc676c58382e21848a0eb7b378f53ee
--- /dev/null
+++ b/checkpoint-879/optimizer.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:7112c180dfcc9727d06dec69ad4ec3ec7aa6bda54613c104d71d52ad4468442b
+size 37969652
diff --git a/checkpoint-879/rng_state.pth b/checkpoint-879/rng_state.pth
new file mode 100644
index 0000000000000000000000000000000000000000..f56f60ebe66886d6bace8e57faef21edd8a54466
--- /dev/null
+++ b/checkpoint-879/rng_state.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:bb5ec38d8e3b8dca60a295bedaac5e6f87b8d7b20bc01d5a63fceb3777fddab4
+size 14244
diff --git a/checkpoint-879/scheduler.pt b/checkpoint-879/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..4018abeef069931aa48f67f7f46d955c6306e836
--- /dev/null
+++ b/checkpoint-879/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:a0e6f0af26f3b4982a424dd9de3d6bfa562672950d695d78c84ab95ef5228378
+size 1064
diff --git a/checkpoint-879/special_tokens_map.json b/checkpoint-879/special_tokens_map.json
new file mode 100644
index 0000000000000000000000000000000000000000..d53f816edeeee223cdcd54b743a647b49ee6d5f2
--- /dev/null
+++ b/checkpoint-879/special_tokens_map.json
@@ -0,0 +1,17 @@
+{
+ "bos_token": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "eos_token": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": "<|end▁of▁sentence|>"
+}
diff --git a/checkpoint-879/tokenizer.json b/checkpoint-879/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..1a2db243e47cbc113f6b2ddcc388aeeb8fe1a94c
--- /dev/null
+++ b/checkpoint-879/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e20ddafc659ba90242154b55275402edeca0715e5dbb30f56815a4ce081f4893
+size 11422778
diff --git a/checkpoint-879/tokenizer_config.json b/checkpoint-879/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..8095baa150cba7889d4b1d0f1b6564f886ac4618
--- /dev/null
+++ b/checkpoint-879/tokenizer_config.json
@@ -0,0 +1,194 @@
+{
+ "add_bos_token": true,
+ "add_eos_token": false,
+ "add_prefix_space": null,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|User|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151645": {
+ "content": "<|Assistant|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151646": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|EOT|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151648": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151649": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "bos_token": "<|begin▁of▁sentence|>",
+ "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set ns = namespace(is_first=false, is_tool=false, is_output_first=true, system_prompt='') %}{%- for message in messages %}{%- if message['role'] == 'system' %}{% set ns.system_prompt = message['content'] %}{%- endif %}{%- endfor %}{{bos_token}}{{ns.system_prompt}}{%- for message in messages %}{%- if message['role'] == 'user' %}{%- set ns.is_tool = false -%}{{'<|User|>' + message['content']}}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is none %}{%- set ns.is_tool = false -%}{%- for tool in message['tool_calls']%}{%- if not ns.is_first %}{{'<|Assistant|><|tool▁calls▁begin|><|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{%- set ns.is_first = true -%}{%- else %}{{'\\n' + '<|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{{'<|tool▁calls▁end|><|end▁of▁sentence|>'}}{%- endif %}{%- endfor %}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is not none %}{%- if ns.is_tool %}{{'<|tool▁outputs▁end|>' + message['content'] + '<|end▁of▁sentence|>'}}{%- set ns.is_tool = false -%}{%- else %}{% set content = message['content'] %}{% if '' in content %}{% set content = content.split('')[-1] %}{% endif %}{{'<|Assistant|>' + content + '<|end▁of▁sentence|>'}}{%- endif %}{%- endif %}{%- if message['role'] == 'tool' %}{%- set ns.is_tool = true -%}{%- if ns.is_output_first %}{{'<|tool▁outputs▁begin|><|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- set ns.is_output_first = false %}{%- else %}{{'\\n<|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- endif %}{%- endif %}{%- endfor -%}{% if ns.is_tool %}{{'<|tool▁outputs▁end|>'}}{% endif %}{% if add_generation_prompt and not ns.is_tool %}{{'<|Assistant|>\\n'}}{% endif %}",
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|end▁of▁sentence|>",
+ "legacy": true,
+ "model_max_length": 16384,
+ "pad_token": "<|end▁of▁sentence|>",
+ "sp_model_kwargs": {},
+ "tokenizer_class": "LlamaTokenizer",
+ "unk_token": null,
+ "use_default_system_prompt": false
+}
diff --git a/checkpoint-879/trainer_state.json b/checkpoint-879/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..5f15a3ceefa84b24cd522bb44445a3d14f48c771
--- /dev/null
+++ b/checkpoint-879/trainer_state.json
@@ -0,0 +1,1608 @@
+{
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.9936143039591316,
+ "eval_steps": 500,
+ "global_step": 879,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "epoch": 0.017028522775649212,
+ "grad_norm": 2.3286359310150146,
+ "learning_rate": 0.0001988623435722412,
+ "loss": 4.1641,
+ "mean_token_accuracy": 0.3866006717085838,
+ "num_tokens": 4326.0,
+ "step": 5
+ },
+ {
+ "epoch": 0.034057045551298425,
+ "grad_norm": 1.4926602840423584,
+ "learning_rate": 0.00019772468714448238,
+ "loss": 2.0591,
+ "mean_token_accuracy": 0.6790341928601265,
+ "num_tokens": 8676.0,
+ "step": 10
+ },
+ {
+ "epoch": 0.05108556832694764,
+ "grad_norm": 1.0835968255996704,
+ "learning_rate": 0.00019658703071672356,
+ "loss": 1.3145,
+ "mean_token_accuracy": 0.8256841972470284,
+ "num_tokens": 12796.0,
+ "step": 15
+ },
+ {
+ "epoch": 0.06811409110259685,
+ "grad_norm": 0.7724414467811584,
+ "learning_rate": 0.00019544937428896475,
+ "loss": 1.3324,
+ "mean_token_accuracy": 0.8117582932114601,
+ "num_tokens": 17119.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.08514261387824607,
+ "grad_norm": 0.785762369632721,
+ "learning_rate": 0.00019431171786120593,
+ "loss": 1.3375,
+ "mean_token_accuracy": 0.8029867172241211,
+ "num_tokens": 21499.0,
+ "step": 25
+ },
+ {
+ "epoch": 0.10217113665389528,
+ "grad_norm": 0.6702725291252136,
+ "learning_rate": 0.00019317406143344712,
+ "loss": 1.2159,
+ "mean_token_accuracy": 0.8230627462267875,
+ "num_tokens": 25785.0,
+ "step": 30
+ },
+ {
+ "epoch": 0.11919965942954448,
+ "grad_norm": 0.6287369728088379,
+ "learning_rate": 0.0001920364050056883,
+ "loss": 1.1634,
+ "mean_token_accuracy": 0.8315445825457572,
+ "num_tokens": 29980.0,
+ "step": 35
+ },
+ {
+ "epoch": 0.1362281822051937,
+ "grad_norm": 0.6573143005371094,
+ "learning_rate": 0.00019089874857792946,
+ "loss": 1.3762,
+ "mean_token_accuracy": 0.7971536681056023,
+ "num_tokens": 34497.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.1532567049808429,
+ "grad_norm": 0.6560688614845276,
+ "learning_rate": 0.00018976109215017067,
+ "loss": 1.1589,
+ "mean_token_accuracy": 0.8251897826790809,
+ "num_tokens": 38800.0,
+ "step": 45
+ },
+ {
+ "epoch": 0.17028522775649213,
+ "grad_norm": 0.6654791831970215,
+ "learning_rate": 0.00018862343572241183,
+ "loss": 1.1498,
+ "mean_token_accuracy": 0.8319168403744698,
+ "num_tokens": 43055.0,
+ "step": 50
+ },
+ {
+ "epoch": 0.18731375053214133,
+ "grad_norm": 0.7387417554855347,
+ "learning_rate": 0.00018748577929465302,
+ "loss": 1.1265,
+ "mean_token_accuracy": 0.8290244281291962,
+ "num_tokens": 47346.0,
+ "step": 55
+ },
+ {
+ "epoch": 0.20434227330779056,
+ "grad_norm": 0.5795997977256775,
+ "learning_rate": 0.0001863481228668942,
+ "loss": 1.0046,
+ "mean_token_accuracy": 0.8534704640507698,
+ "num_tokens": 51485.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.22137079608343976,
+ "grad_norm": 0.6834130883216858,
+ "learning_rate": 0.0001852104664391354,
+ "loss": 1.113,
+ "mean_token_accuracy": 0.8345914751291275,
+ "num_tokens": 55716.0,
+ "step": 65
+ },
+ {
+ "epoch": 0.23839931885908897,
+ "grad_norm": 0.7211284041404724,
+ "learning_rate": 0.00018407281001137657,
+ "loss": 1.2132,
+ "mean_token_accuracy": 0.8207321017980576,
+ "num_tokens": 60030.0,
+ "step": 70
+ },
+ {
+ "epoch": 0.2554278416347382,
+ "grad_norm": 0.6312271356582642,
+ "learning_rate": 0.00018293515358361776,
+ "loss": 1.0987,
+ "mean_token_accuracy": 0.8333725541830063,
+ "num_tokens": 64288.0,
+ "step": 75
+ },
+ {
+ "epoch": 0.2724563644103874,
+ "grad_norm": 0.7119404077529907,
+ "learning_rate": 0.00018179749715585894,
+ "loss": 1.0981,
+ "mean_token_accuracy": 0.8323698997497558,
+ "num_tokens": 68548.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.2894848871860366,
+ "grad_norm": 0.9000201225280762,
+ "learning_rate": 0.00018065984072810013,
+ "loss": 1.146,
+ "mean_token_accuracy": 0.8253335595130921,
+ "num_tokens": 72914.0,
+ "step": 85
+ },
+ {
+ "epoch": 0.3065134099616858,
+ "grad_norm": 0.6050537824630737,
+ "learning_rate": 0.0001795221843003413,
+ "loss": 1.0111,
+ "mean_token_accuracy": 0.842674246430397,
+ "num_tokens": 77168.0,
+ "step": 90
+ },
+ {
+ "epoch": 0.32354193273733506,
+ "grad_norm": 0.684512197971344,
+ "learning_rate": 0.0001783845278725825,
+ "loss": 1.1186,
+ "mean_token_accuracy": 0.8351956441998482,
+ "num_tokens": 81439.0,
+ "step": 95
+ },
+ {
+ "epoch": 0.34057045551298426,
+ "grad_norm": 0.7323129773139954,
+ "learning_rate": 0.00017724687144482368,
+ "loss": 1.1287,
+ "mean_token_accuracy": 0.8245970487594605,
+ "num_tokens": 85773.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.35759897828863346,
+ "grad_norm": 0.7547741532325745,
+ "learning_rate": 0.00017610921501706487,
+ "loss": 1.0868,
+ "mean_token_accuracy": 0.8298466548323631,
+ "num_tokens": 90117.0,
+ "step": 105
+ },
+ {
+ "epoch": 0.37462750106428266,
+ "grad_norm": 0.7113769054412842,
+ "learning_rate": 0.00017497155858930602,
+ "loss": 1.1214,
+ "mean_token_accuracy": 0.8299670115113258,
+ "num_tokens": 94412.0,
+ "step": 110
+ },
+ {
+ "epoch": 0.39165602383993187,
+ "grad_norm": 0.7486220002174377,
+ "learning_rate": 0.00017383390216154724,
+ "loss": 1.1452,
+ "mean_token_accuracy": 0.8283886179327965,
+ "num_tokens": 98782.0,
+ "step": 115
+ },
+ {
+ "epoch": 0.4086845466155811,
+ "grad_norm": 0.658633828163147,
+ "learning_rate": 0.0001726962457337884,
+ "loss": 1.0415,
+ "mean_token_accuracy": 0.8431179687380791,
+ "num_tokens": 103011.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.4257130693912303,
+ "grad_norm": 0.783794105052948,
+ "learning_rate": 0.0001715585893060296,
+ "loss": 1.1056,
+ "mean_token_accuracy": 0.8254878520965576,
+ "num_tokens": 107402.0,
+ "step": 125
+ },
+ {
+ "epoch": 0.4427415921668795,
+ "grad_norm": 0.7954565286636353,
+ "learning_rate": 0.00017042093287827076,
+ "loss": 1.0518,
+ "mean_token_accuracy": 0.8375606715679169,
+ "num_tokens": 111707.0,
+ "step": 130
+ },
+ {
+ "epoch": 0.45977011494252873,
+ "grad_norm": 0.6913949847221375,
+ "learning_rate": 0.00016928327645051198,
+ "loss": 1.1104,
+ "mean_token_accuracy": 0.8326424166560173,
+ "num_tokens": 115998.0,
+ "step": 135
+ },
+ {
+ "epoch": 0.47679863771817793,
+ "grad_norm": 0.7918037176132202,
+ "learning_rate": 0.00016814562002275313,
+ "loss": 1.0495,
+ "mean_token_accuracy": 0.8390962019562721,
+ "num_tokens": 120271.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.49382716049382713,
+ "grad_norm": 0.7816826701164246,
+ "learning_rate": 0.00016700796359499432,
+ "loss": 1.0463,
+ "mean_token_accuracy": 0.8433194428682327,
+ "num_tokens": 124461.0,
+ "step": 145
+ },
+ {
+ "epoch": 0.5108556832694764,
+ "grad_norm": 0.8069042563438416,
+ "learning_rate": 0.0001658703071672355,
+ "loss": 1.0664,
+ "mean_token_accuracy": 0.8278923153877258,
+ "num_tokens": 128781.0,
+ "step": 150
+ },
+ {
+ "epoch": 0.5278842060451255,
+ "grad_norm": 1.0114731788635254,
+ "learning_rate": 0.0001647326507394767,
+ "loss": 1.1217,
+ "mean_token_accuracy": 0.8267972275614739,
+ "num_tokens": 133167.0,
+ "step": 155
+ },
+ {
+ "epoch": 0.5449127288207748,
+ "grad_norm": 0.7900378704071045,
+ "learning_rate": 0.00016359499431171787,
+ "loss": 0.971,
+ "mean_token_accuracy": 0.8421565622091294,
+ "num_tokens": 137464.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.561941251596424,
+ "grad_norm": 0.8059927821159363,
+ "learning_rate": 0.00016245733788395906,
+ "loss": 1.0457,
+ "mean_token_accuracy": 0.8381335601210594,
+ "num_tokens": 141760.0,
+ "step": 165
+ },
+ {
+ "epoch": 0.5789697743720732,
+ "grad_norm": 0.7589371800422668,
+ "learning_rate": 0.00016131968145620024,
+ "loss": 1.0208,
+ "mean_token_accuracy": 0.8342296928167343,
+ "num_tokens": 146051.0,
+ "step": 170
+ },
+ {
+ "epoch": 0.5959982971477225,
+ "grad_norm": 0.692416250705719,
+ "learning_rate": 0.00016018202502844143,
+ "loss": 0.9837,
+ "mean_token_accuracy": 0.8510025009512902,
+ "num_tokens": 150270.0,
+ "step": 175
+ },
+ {
+ "epoch": 0.6130268199233716,
+ "grad_norm": 0.6662923097610474,
+ "learning_rate": 0.0001590443686006826,
+ "loss": 0.9835,
+ "mean_token_accuracy": 0.8463438332080842,
+ "num_tokens": 154537.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.6300553426990209,
+ "grad_norm": 0.7452691793441772,
+ "learning_rate": 0.0001579067121729238,
+ "loss": 1.0496,
+ "mean_token_accuracy": 0.8375737622380257,
+ "num_tokens": 158810.0,
+ "step": 185
+ },
+ {
+ "epoch": 0.6470838654746701,
+ "grad_norm": 0.809700608253479,
+ "learning_rate": 0.00015676905574516496,
+ "loss": 1.0595,
+ "mean_token_accuracy": 0.8294038504362107,
+ "num_tokens": 163213.0,
+ "step": 190
+ },
+ {
+ "epoch": 0.6641123882503193,
+ "grad_norm": 0.7708745002746582,
+ "learning_rate": 0.00015563139931740617,
+ "loss": 1.0976,
+ "mean_token_accuracy": 0.8289313957095146,
+ "num_tokens": 167607.0,
+ "step": 195
+ },
+ {
+ "epoch": 0.6811409110259685,
+ "grad_norm": 0.6482141613960266,
+ "learning_rate": 0.00015449374288964733,
+ "loss": 1.0701,
+ "mean_token_accuracy": 0.8261386752128601,
+ "num_tokens": 172024.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.6981694338016177,
+ "grad_norm": 0.7164883613586426,
+ "learning_rate": 0.00015335608646188854,
+ "loss": 0.9878,
+ "mean_token_accuracy": 0.8418964132666588,
+ "num_tokens": 176317.0,
+ "step": 205
+ },
+ {
+ "epoch": 0.7151979565772669,
+ "grad_norm": 0.710343599319458,
+ "learning_rate": 0.0001522184300341297,
+ "loss": 0.9306,
+ "mean_token_accuracy": 0.8468034327030182,
+ "num_tokens": 180558.0,
+ "step": 210
+ },
+ {
+ "epoch": 0.7322264793529162,
+ "grad_norm": 0.863784909248352,
+ "learning_rate": 0.00015108077360637088,
+ "loss": 1.0544,
+ "mean_token_accuracy": 0.8359945684671402,
+ "num_tokens": 184885.0,
+ "step": 215
+ },
+ {
+ "epoch": 0.7492550021285653,
+ "grad_norm": 0.8381637930870056,
+ "learning_rate": 0.00014994311717861207,
+ "loss": 1.0522,
+ "mean_token_accuracy": 0.836811026930809,
+ "num_tokens": 189219.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.7662835249042146,
+ "grad_norm": 0.683501124382019,
+ "learning_rate": 0.00014880546075085325,
+ "loss": 0.9427,
+ "mean_token_accuracy": 0.8544979348778725,
+ "num_tokens": 193437.0,
+ "step": 225
+ },
+ {
+ "epoch": 0.7833120476798637,
+ "grad_norm": 0.7609812617301941,
+ "learning_rate": 0.00014766780432309444,
+ "loss": 1.0048,
+ "mean_token_accuracy": 0.8403829500079155,
+ "num_tokens": 197724.0,
+ "step": 230
+ },
+ {
+ "epoch": 0.800340570455513,
+ "grad_norm": 0.8223949074745178,
+ "learning_rate": 0.00014653014789533562,
+ "loss": 1.078,
+ "mean_token_accuracy": 0.8296335831284523,
+ "num_tokens": 202141.0,
+ "step": 235
+ },
+ {
+ "epoch": 0.8173690932311622,
+ "grad_norm": 0.9807024002075195,
+ "learning_rate": 0.0001453924914675768,
+ "loss": 0.9295,
+ "mean_token_accuracy": 0.8495418474078178,
+ "num_tokens": 206333.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.8343976160068114,
+ "grad_norm": 0.7864217162132263,
+ "learning_rate": 0.000144254835039818,
+ "loss": 1.0326,
+ "mean_token_accuracy": 0.8422158002853394,
+ "num_tokens": 210593.0,
+ "step": 245
+ },
+ {
+ "epoch": 0.8514261387824607,
+ "grad_norm": 0.8183476328849792,
+ "learning_rate": 0.00014311717861205915,
+ "loss": 1.0419,
+ "mean_token_accuracy": 0.8332764700055122,
+ "num_tokens": 214925.0,
+ "step": 250
+ },
+ {
+ "epoch": 0.8684546615581098,
+ "grad_norm": 0.7906543612480164,
+ "learning_rate": 0.00014197952218430036,
+ "loss": 0.9278,
+ "mean_token_accuracy": 0.8531344652175903,
+ "num_tokens": 219106.0,
+ "step": 255
+ },
+ {
+ "epoch": 0.885483184333759,
+ "grad_norm": 0.7864625453948975,
+ "learning_rate": 0.00014084186575654152,
+ "loss": 0.9764,
+ "mean_token_accuracy": 0.8394758701324463,
+ "num_tokens": 223398.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.9025117071094083,
+ "grad_norm": 0.7231821417808533,
+ "learning_rate": 0.00013970420932878273,
+ "loss": 1.0357,
+ "mean_token_accuracy": 0.8368565306067467,
+ "num_tokens": 227720.0,
+ "step": 265
+ },
+ {
+ "epoch": 0.9195402298850575,
+ "grad_norm": 0.7288718223571777,
+ "learning_rate": 0.0001385665529010239,
+ "loss": 1.0178,
+ "mean_token_accuracy": 0.842984040081501,
+ "num_tokens": 232021.0,
+ "step": 270
+ },
+ {
+ "epoch": 0.9365687526607067,
+ "grad_norm": 0.7466130256652832,
+ "learning_rate": 0.0001374288964732651,
+ "loss": 0.9974,
+ "mean_token_accuracy": 0.8431279867887497,
+ "num_tokens": 236312.0,
+ "step": 275
+ },
+ {
+ "epoch": 0.9535972754363559,
+ "grad_norm": 0.7876543402671814,
+ "learning_rate": 0.00013629124004550626,
+ "loss": 1.0057,
+ "mean_token_accuracy": 0.8389794036746026,
+ "num_tokens": 240594.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.9706257982120051,
+ "grad_norm": 0.738293468952179,
+ "learning_rate": 0.00013515358361774744,
+ "loss": 0.9129,
+ "mean_token_accuracy": 0.8528255730867386,
+ "num_tokens": 244859.0,
+ "step": 285
+ },
+ {
+ "epoch": 0.9876543209876543,
+ "grad_norm": 0.8145989775657654,
+ "learning_rate": 0.00013401592718998863,
+ "loss": 0.9188,
+ "mean_token_accuracy": 0.8555046319961548,
+ "num_tokens": 249060.0,
+ "step": 290
+ },
+ {
+ "epoch": 1.0046828437633035,
+ "grad_norm": 0.693233072757721,
+ "learning_rate": 0.00013287827076222981,
+ "loss": 1.0648,
+ "mean_token_accuracy": 0.8477524280548095,
+ "num_tokens": 253361.0,
+ "step": 295
+ },
+ {
+ "epoch": 1.0217113665389528,
+ "grad_norm": 0.8171095848083496,
+ "learning_rate": 0.000131740614334471,
+ "loss": 0.883,
+ "mean_token_accuracy": 0.8561580404639244,
+ "num_tokens": 257633.0,
+ "step": 300
+ },
+ {
+ "epoch": 1.038739889314602,
+ "grad_norm": 0.7343988418579102,
+ "learning_rate": 0.00013060295790671218,
+ "loss": 0.8591,
+ "mean_token_accuracy": 0.8583228841423989,
+ "num_tokens": 261975.0,
+ "step": 305
+ },
+ {
+ "epoch": 1.055768412090251,
+ "grad_norm": 0.6689726114273071,
+ "learning_rate": 0.00012946530147895337,
+ "loss": 0.8397,
+ "mean_token_accuracy": 0.8668102487921715,
+ "num_tokens": 266174.0,
+ "step": 310
+ },
+ {
+ "epoch": 1.0727969348659003,
+ "grad_norm": 0.8284767270088196,
+ "learning_rate": 0.00012832764505119455,
+ "loss": 0.9108,
+ "mean_token_accuracy": 0.8551412716507911,
+ "num_tokens": 270416.0,
+ "step": 315
+ },
+ {
+ "epoch": 1.0898254576415496,
+ "grad_norm": 0.7800877690315247,
+ "learning_rate": 0.0001271899886234357,
+ "loss": 0.923,
+ "mean_token_accuracy": 0.8521544948220253,
+ "num_tokens": 274802.0,
+ "step": 320
+ },
+ {
+ "epoch": 1.1068539804171988,
+ "grad_norm": 0.803035318851471,
+ "learning_rate": 0.00012605233219567692,
+ "loss": 0.9009,
+ "mean_token_accuracy": 0.8583568409085274,
+ "num_tokens": 279061.0,
+ "step": 325
+ },
+ {
+ "epoch": 1.123882503192848,
+ "grad_norm": 0.7928335666656494,
+ "learning_rate": 0.00012491467576791808,
+ "loss": 0.8677,
+ "mean_token_accuracy": 0.860838033258915,
+ "num_tokens": 283290.0,
+ "step": 330
+ },
+ {
+ "epoch": 1.1409110259684971,
+ "grad_norm": 0.82757967710495,
+ "learning_rate": 0.0001237770193401593,
+ "loss": 0.9326,
+ "mean_token_accuracy": 0.8526211172342301,
+ "num_tokens": 287627.0,
+ "step": 335
+ },
+ {
+ "epoch": 1.1579395487441464,
+ "grad_norm": 0.8021914958953857,
+ "learning_rate": 0.00012263936291240045,
+ "loss": 0.9066,
+ "mean_token_accuracy": 0.8505649596452713,
+ "num_tokens": 291975.0,
+ "step": 340
+ },
+ {
+ "epoch": 1.1749680715197957,
+ "grad_norm": 0.7565475106239319,
+ "learning_rate": 0.00012150170648464165,
+ "loss": 0.8812,
+ "mean_token_accuracy": 0.8562570214271545,
+ "num_tokens": 296232.0,
+ "step": 345
+ },
+ {
+ "epoch": 1.191996594295445,
+ "grad_norm": 0.8126978278160095,
+ "learning_rate": 0.00012036405005688282,
+ "loss": 0.905,
+ "mean_token_accuracy": 0.8556828230619431,
+ "num_tokens": 300591.0,
+ "step": 350
+ },
+ {
+ "epoch": 1.2090251170710942,
+ "grad_norm": 0.8174765706062317,
+ "learning_rate": 0.000119226393629124,
+ "loss": 0.9861,
+ "mean_token_accuracy": 0.8424012079834938,
+ "num_tokens": 304998.0,
+ "step": 355
+ },
+ {
+ "epoch": 1.2260536398467432,
+ "grad_norm": 0.8921035528182983,
+ "learning_rate": 0.00011808873720136519,
+ "loss": 0.7724,
+ "mean_token_accuracy": 0.8735315829515458,
+ "num_tokens": 309137.0,
+ "step": 360
+ },
+ {
+ "epoch": 1.2430821626223925,
+ "grad_norm": 0.855992317199707,
+ "learning_rate": 0.00011695108077360638,
+ "loss": 0.8922,
+ "mean_token_accuracy": 0.854039640724659,
+ "num_tokens": 313389.0,
+ "step": 365
+ },
+ {
+ "epoch": 1.2601106853980417,
+ "grad_norm": 0.9408860206604004,
+ "learning_rate": 0.00011581342434584756,
+ "loss": 0.9254,
+ "mean_token_accuracy": 0.8507854476571083,
+ "num_tokens": 317743.0,
+ "step": 370
+ },
+ {
+ "epoch": 1.277139208173691,
+ "grad_norm": 0.7847197651863098,
+ "learning_rate": 0.00011467576791808873,
+ "loss": 0.8563,
+ "mean_token_accuracy": 0.869862625002861,
+ "num_tokens": 321873.0,
+ "step": 375
+ },
+ {
+ "epoch": 1.29416773094934,
+ "grad_norm": 0.8556840419769287,
+ "learning_rate": 0.00011353811149032993,
+ "loss": 0.8489,
+ "mean_token_accuracy": 0.8591933220624923,
+ "num_tokens": 326124.0,
+ "step": 380
+ },
+ {
+ "epoch": 1.3111962537249893,
+ "grad_norm": 0.8849514126777649,
+ "learning_rate": 0.0001124004550625711,
+ "loss": 0.8526,
+ "mean_token_accuracy": 0.8600789621472359,
+ "num_tokens": 330405.0,
+ "step": 385
+ },
+ {
+ "epoch": 1.3282247765006385,
+ "grad_norm": 0.8099865913391113,
+ "learning_rate": 0.00011126279863481229,
+ "loss": 0.9309,
+ "mean_token_accuracy": 0.8511071890592575,
+ "num_tokens": 334701.0,
+ "step": 390
+ },
+ {
+ "epoch": 1.3452532992762878,
+ "grad_norm": 0.8668401837348938,
+ "learning_rate": 0.00011012514220705347,
+ "loss": 0.8671,
+ "mean_token_accuracy": 0.8605618432164193,
+ "num_tokens": 338951.0,
+ "step": 395
+ },
+ {
+ "epoch": 1.362281822051937,
+ "grad_norm": 0.8669872283935547,
+ "learning_rate": 0.00010898748577929466,
+ "loss": 0.8796,
+ "mean_token_accuracy": 0.8592276558279991,
+ "num_tokens": 343203.0,
+ "step": 400
+ },
+ {
+ "epoch": 1.3793103448275863,
+ "grad_norm": 0.8468757271766663,
+ "learning_rate": 0.00010784982935153584,
+ "loss": 0.8941,
+ "mean_token_accuracy": 0.8553030788898468,
+ "num_tokens": 347460.0,
+ "step": 405
+ },
+ {
+ "epoch": 1.3963388676032356,
+ "grad_norm": 0.8839651346206665,
+ "learning_rate": 0.00010671217292377703,
+ "loss": 0.913,
+ "mean_token_accuracy": 0.8489826336503029,
+ "num_tokens": 351850.0,
+ "step": 410
+ },
+ {
+ "epoch": 1.4133673903788846,
+ "grad_norm": 0.8808367848396301,
+ "learning_rate": 0.00010557451649601821,
+ "loss": 0.8158,
+ "mean_token_accuracy": 0.8628147393465042,
+ "num_tokens": 356104.0,
+ "step": 415
+ },
+ {
+ "epoch": 1.4303959131545338,
+ "grad_norm": 0.9303593039512634,
+ "learning_rate": 0.00010443686006825938,
+ "loss": 0.8737,
+ "mean_token_accuracy": 0.8497098922729492,
+ "num_tokens": 360445.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.447424435930183,
+ "grad_norm": 0.7914776802062988,
+ "learning_rate": 0.00010329920364050057,
+ "loss": 0.9168,
+ "mean_token_accuracy": 0.8531492814421654,
+ "num_tokens": 364778.0,
+ "step": 425
+ },
+ {
+ "epoch": 1.4644529587058321,
+ "grad_norm": 0.8661580085754395,
+ "learning_rate": 0.00010216154721274175,
+ "loss": 0.8335,
+ "mean_token_accuracy": 0.8674297228455543,
+ "num_tokens": 368961.0,
+ "step": 430
+ },
+ {
+ "epoch": 1.4814814814814814,
+ "grad_norm": 0.8548939228057861,
+ "learning_rate": 0.00010102389078498294,
+ "loss": 0.9314,
+ "mean_token_accuracy": 0.8409372463822364,
+ "num_tokens": 373355.0,
+ "step": 435
+ },
+ {
+ "epoch": 1.4985100042571307,
+ "grad_norm": 0.8668932914733887,
+ "learning_rate": 9.988623435722412e-05,
+ "loss": 0.8482,
+ "mean_token_accuracy": 0.8576690852642059,
+ "num_tokens": 377652.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.51553852703278,
+ "grad_norm": 0.8412478566169739,
+ "learning_rate": 9.874857792946531e-05,
+ "loss": 0.8791,
+ "mean_token_accuracy": 0.8531419888138772,
+ "num_tokens": 381969.0,
+ "step": 445
+ },
+ {
+ "epoch": 1.5325670498084292,
+ "grad_norm": 0.8298078179359436,
+ "learning_rate": 9.761092150170649e-05,
+ "loss": 0.7418,
+ "mean_token_accuracy": 0.8757623940706253,
+ "num_tokens": 386149.0,
+ "step": 450
+ },
+ {
+ "epoch": 1.5495955725840784,
+ "grad_norm": 0.8505256772041321,
+ "learning_rate": 9.647326507394768e-05,
+ "loss": 0.8107,
+ "mean_token_accuracy": 0.8660028412938118,
+ "num_tokens": 390316.0,
+ "step": 455
+ },
+ {
+ "epoch": 1.5666240953597277,
+ "grad_norm": 0.72185879945755,
+ "learning_rate": 9.533560864618886e-05,
+ "loss": 0.8601,
+ "mean_token_accuracy": 0.8591737478971482,
+ "num_tokens": 394651.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.5836526181353767,
+ "grad_norm": 1.0382378101348877,
+ "learning_rate": 9.419795221843003e-05,
+ "loss": 0.849,
+ "mean_token_accuracy": 0.8591210901737213,
+ "num_tokens": 398879.0,
+ "step": 465
+ },
+ {
+ "epoch": 1.600681140911026,
+ "grad_norm": 0.7781236171722412,
+ "learning_rate": 9.306029579067122e-05,
+ "loss": 0.8587,
+ "mean_token_accuracy": 0.8554968953132629,
+ "num_tokens": 403154.0,
+ "step": 470
+ },
+ {
+ "epoch": 1.617709663686675,
+ "grad_norm": 0.9941114187240601,
+ "learning_rate": 9.19226393629124e-05,
+ "loss": 1.0077,
+ "mean_token_accuracy": 0.8324473947286606,
+ "num_tokens": 407653.0,
+ "step": 475
+ },
+ {
+ "epoch": 1.6347381864623243,
+ "grad_norm": 0.791912853717804,
+ "learning_rate": 9.078498293515359e-05,
+ "loss": 0.8211,
+ "mean_token_accuracy": 0.8655396267771721,
+ "num_tokens": 411904.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.6517667092379735,
+ "grad_norm": 0.8509976267814636,
+ "learning_rate": 8.964732650739477e-05,
+ "loss": 0.8895,
+ "mean_token_accuracy": 0.8587504833936691,
+ "num_tokens": 416159.0,
+ "step": 485
+ },
+ {
+ "epoch": 1.6687952320136228,
+ "grad_norm": 1.0071176290512085,
+ "learning_rate": 8.850967007963596e-05,
+ "loss": 0.9112,
+ "mean_token_accuracy": 0.8539686873555183,
+ "num_tokens": 420513.0,
+ "step": 490
+ },
+ {
+ "epoch": 1.685823754789272,
+ "grad_norm": 0.8273159861564636,
+ "learning_rate": 8.737201365187714e-05,
+ "loss": 0.8383,
+ "mean_token_accuracy": 0.8577379778027534,
+ "num_tokens": 424759.0,
+ "step": 495
+ },
+ {
+ "epoch": 1.7028522775649213,
+ "grad_norm": 0.8064838647842407,
+ "learning_rate": 8.623435722411833e-05,
+ "loss": 0.8397,
+ "mean_token_accuracy": 0.8636475175619125,
+ "num_tokens": 429018.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.7198808003405706,
+ "grad_norm": 0.7176003456115723,
+ "learning_rate": 8.509670079635951e-05,
+ "loss": 0.7738,
+ "mean_token_accuracy": 0.8699946105480194,
+ "num_tokens": 433124.0,
+ "step": 505
+ },
+ {
+ "epoch": 1.7369093231162198,
+ "grad_norm": 0.8316643834114075,
+ "learning_rate": 8.395904436860069e-05,
+ "loss": 0.9191,
+ "mean_token_accuracy": 0.8493718564510345,
+ "num_tokens": 437449.0,
+ "step": 510
+ },
+ {
+ "epoch": 1.7539378458918689,
+ "grad_norm": 0.9423941373825073,
+ "learning_rate": 8.282138794084187e-05,
+ "loss": 0.8749,
+ "mean_token_accuracy": 0.8558909714221954,
+ "num_tokens": 441753.0,
+ "step": 515
+ },
+ {
+ "epoch": 1.770966368667518,
+ "grad_norm": 0.8593487739562988,
+ "learning_rate": 8.168373151308306e-05,
+ "loss": 0.8463,
+ "mean_token_accuracy": 0.857591399550438,
+ "num_tokens": 446036.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.7879948914431671,
+ "grad_norm": 0.7944974303245544,
+ "learning_rate": 8.054607508532424e-05,
+ "loss": 0.8275,
+ "mean_token_accuracy": 0.859096622467041,
+ "num_tokens": 450298.0,
+ "step": 525
+ },
+ {
+ "epoch": 1.8050234142188164,
+ "grad_norm": 0.7622503042221069,
+ "learning_rate": 7.940841865756543e-05,
+ "loss": 0.8846,
+ "mean_token_accuracy": 0.8580268025398254,
+ "num_tokens": 454595.0,
+ "step": 530
+ },
+ {
+ "epoch": 1.8220519369944657,
+ "grad_norm": 0.8578078746795654,
+ "learning_rate": 7.827076222980661e-05,
+ "loss": 0.7674,
+ "mean_token_accuracy": 0.8716912001371384,
+ "num_tokens": 458807.0,
+ "step": 535
+ },
+ {
+ "epoch": 1.839080459770115,
+ "grad_norm": 1.0383292436599731,
+ "learning_rate": 7.71331058020478e-05,
+ "loss": 0.9129,
+ "mean_token_accuracy": 0.8489386543631554,
+ "num_tokens": 463150.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.8561089825457642,
+ "grad_norm": 0.8726801872253418,
+ "learning_rate": 7.599544937428897e-05,
+ "loss": 0.877,
+ "mean_token_accuracy": 0.8568779289722442,
+ "num_tokens": 467472.0,
+ "step": 545
+ },
+ {
+ "epoch": 1.8731375053214134,
+ "grad_norm": 0.9192221164703369,
+ "learning_rate": 7.485779294653015e-05,
+ "loss": 0.9341,
+ "mean_token_accuracy": 0.8403045237064362,
+ "num_tokens": 471930.0,
+ "step": 550
+ },
+ {
+ "epoch": 1.8901660280970627,
+ "grad_norm": 0.8688830137252808,
+ "learning_rate": 7.372013651877134e-05,
+ "loss": 0.8244,
+ "mean_token_accuracy": 0.8679932355880737,
+ "num_tokens": 476140.0,
+ "step": 555
+ },
+ {
+ "epoch": 1.907194550872712,
+ "grad_norm": 0.8286635279655457,
+ "learning_rate": 7.258248009101252e-05,
+ "loss": 0.8725,
+ "mean_token_accuracy": 0.8549414992332458,
+ "num_tokens": 480474.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.924223073648361,
+ "grad_norm": 0.789902925491333,
+ "learning_rate": 7.14448236632537e-05,
+ "loss": 0.8135,
+ "mean_token_accuracy": 0.8649365425109863,
+ "num_tokens": 484805.0,
+ "step": 565
+ },
+ {
+ "epoch": 1.9412515964240102,
+ "grad_norm": 0.8496629595756531,
+ "learning_rate": 7.030716723549489e-05,
+ "loss": 0.9036,
+ "mean_token_accuracy": 0.8460123494267464,
+ "num_tokens": 489275.0,
+ "step": 570
+ },
+ {
+ "epoch": 1.9582801191996593,
+ "grad_norm": 0.8411655426025391,
+ "learning_rate": 6.916951080773608e-05,
+ "loss": 0.9346,
+ "mean_token_accuracy": 0.8429780200123786,
+ "num_tokens": 493726.0,
+ "step": 575
+ },
+ {
+ "epoch": 1.9753086419753085,
+ "grad_norm": 0.8502522706985474,
+ "learning_rate": 6.803185437997726e-05,
+ "loss": 0.8703,
+ "mean_token_accuracy": 0.8595944106578827,
+ "num_tokens": 498022.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.9923371647509578,
+ "grad_norm": 0.743918776512146,
+ "learning_rate": 6.689419795221843e-05,
+ "loss": 0.8815,
+ "mean_token_accuracy": 0.851164074242115,
+ "num_tokens": 502352.0,
+ "step": 585
+ },
+ {
+ "epoch": 2.009365687526607,
+ "grad_norm": 0.7339876294136047,
+ "learning_rate": 6.575654152445962e-05,
+ "loss": 0.9297,
+ "mean_token_accuracy": 0.8610147342085839,
+ "num_tokens": 506669.0,
+ "step": 590
+ },
+ {
+ "epoch": 2.0263942103022563,
+ "grad_norm": 0.903137743473053,
+ "learning_rate": 6.46188850967008e-05,
+ "loss": 0.7306,
+ "mean_token_accuracy": 0.8799364000558854,
+ "num_tokens": 510931.0,
+ "step": 595
+ },
+ {
+ "epoch": 2.0434227330779056,
+ "grad_norm": 0.8741887807846069,
+ "learning_rate": 6.348122866894199e-05,
+ "loss": 0.777,
+ "mean_token_accuracy": 0.8718036338686943,
+ "num_tokens": 515254.0,
+ "step": 600
+ },
+ {
+ "epoch": 2.060451255853555,
+ "grad_norm": 0.9856182932853699,
+ "learning_rate": 6.234357224118317e-05,
+ "loss": 0.6852,
+ "mean_token_accuracy": 0.8851086810231209,
+ "num_tokens": 519444.0,
+ "step": 605
+ },
+ {
+ "epoch": 2.077479778629204,
+ "grad_norm": 0.7548404335975647,
+ "learning_rate": 6.120591581342436e-05,
+ "loss": 0.7239,
+ "mean_token_accuracy": 0.8775098115205765,
+ "num_tokens": 523786.0,
+ "step": 610
+ },
+ {
+ "epoch": 2.0945083014048533,
+ "grad_norm": 1.0486595630645752,
+ "learning_rate": 6.0068259385665536e-05,
+ "loss": 0.7704,
+ "mean_token_accuracy": 0.8707917019724846,
+ "num_tokens": 528181.0,
+ "step": 615
+ },
+ {
+ "epoch": 2.111536824180502,
+ "grad_norm": 0.8551440238952637,
+ "learning_rate": 5.8930602957906714e-05,
+ "loss": 0.7298,
+ "mean_token_accuracy": 0.8771380126476288,
+ "num_tokens": 532472.0,
+ "step": 620
+ },
+ {
+ "epoch": 2.1285653469561514,
+ "grad_norm": 0.7993748784065247,
+ "learning_rate": 5.77929465301479e-05,
+ "loss": 0.7342,
+ "mean_token_accuracy": 0.8784463226795196,
+ "num_tokens": 536780.0,
+ "step": 625
+ },
+ {
+ "epoch": 2.1455938697318007,
+ "grad_norm": 0.9535342454910278,
+ "learning_rate": 5.665529010238908e-05,
+ "loss": 0.7448,
+ "mean_token_accuracy": 0.8769229754805565,
+ "num_tokens": 541096.0,
+ "step": 630
+ },
+ {
+ "epoch": 2.16262239250745,
+ "grad_norm": 0.8289098739624023,
+ "learning_rate": 5.551763367463026e-05,
+ "loss": 0.6921,
+ "mean_token_accuracy": 0.8816722989082336,
+ "num_tokens": 545212.0,
+ "step": 635
+ },
+ {
+ "epoch": 2.179650915283099,
+ "grad_norm": 1.0842015743255615,
+ "learning_rate": 5.437997724687145e-05,
+ "loss": 0.7519,
+ "mean_token_accuracy": 0.87905133664608,
+ "num_tokens": 549486.0,
+ "step": 640
+ },
+ {
+ "epoch": 2.1966794380587484,
+ "grad_norm": 0.9770705699920654,
+ "learning_rate": 5.324232081911263e-05,
+ "loss": 0.7565,
+ "mean_token_accuracy": 0.8737751096487045,
+ "num_tokens": 553849.0,
+ "step": 645
+ },
+ {
+ "epoch": 2.2137079608343977,
+ "grad_norm": 0.9087614417076111,
+ "learning_rate": 5.210466439135382e-05,
+ "loss": 0.7573,
+ "mean_token_accuracy": 0.8769190922379494,
+ "num_tokens": 558157.0,
+ "step": 650
+ },
+ {
+ "epoch": 2.230736483610047,
+ "grad_norm": 0.9485377073287964,
+ "learning_rate": 5.0967007963594995e-05,
+ "loss": 0.7951,
+ "mean_token_accuracy": 0.8717585399746894,
+ "num_tokens": 562499.0,
+ "step": 655
+ },
+ {
+ "epoch": 2.247765006385696,
+ "grad_norm": 0.901766300201416,
+ "learning_rate": 4.982935153583618e-05,
+ "loss": 0.7584,
+ "mean_token_accuracy": 0.8740618869662284,
+ "num_tokens": 566735.0,
+ "step": 660
+ },
+ {
+ "epoch": 2.264793529161345,
+ "grad_norm": 0.9577491879463196,
+ "learning_rate": 4.8691695108077365e-05,
+ "loss": 0.8409,
+ "mean_token_accuracy": 0.8705617383122444,
+ "num_tokens": 571024.0,
+ "step": 665
+ },
+ {
+ "epoch": 2.2818220519369943,
+ "grad_norm": 0.791725218296051,
+ "learning_rate": 4.755403868031855e-05,
+ "loss": 0.6348,
+ "mean_token_accuracy": 0.8875991255044937,
+ "num_tokens": 575196.0,
+ "step": 670
+ },
+ {
+ "epoch": 2.2988505747126435,
+ "grad_norm": 1.0129467248916626,
+ "learning_rate": 4.641638225255973e-05,
+ "loss": 0.7094,
+ "mean_token_accuracy": 0.8820217370986938,
+ "num_tokens": 579384.0,
+ "step": 675
+ },
+ {
+ "epoch": 2.315879097488293,
+ "grad_norm": 0.9562749266624451,
+ "learning_rate": 4.527872582480091e-05,
+ "loss": 0.7119,
+ "mean_token_accuracy": 0.8796836137771606,
+ "num_tokens": 583637.0,
+ "step": 680
+ },
+ {
+ "epoch": 2.332907620263942,
+ "grad_norm": 0.8766334056854248,
+ "learning_rate": 4.41410693970421e-05,
+ "loss": 0.779,
+ "mean_token_accuracy": 0.8700046718120575,
+ "num_tokens": 588005.0,
+ "step": 685
+ },
+ {
+ "epoch": 2.3499361430395913,
+ "grad_norm": 0.9728025794029236,
+ "learning_rate": 4.300341296928328e-05,
+ "loss": 0.8319,
+ "mean_token_accuracy": 0.8586345180869103,
+ "num_tokens": 592448.0,
+ "step": 690
+ },
+ {
+ "epoch": 2.3669646658152406,
+ "grad_norm": 1.0943338871002197,
+ "learning_rate": 4.186575654152446e-05,
+ "loss": 0.7845,
+ "mean_token_accuracy": 0.8698052436113357,
+ "num_tokens": 596703.0,
+ "step": 695
+ },
+ {
+ "epoch": 2.38399318859089,
+ "grad_norm": 1.1211864948272705,
+ "learning_rate": 4.0728100113765646e-05,
+ "loss": 0.7837,
+ "mean_token_accuracy": 0.8664575144648552,
+ "num_tokens": 601127.0,
+ "step": 700
+ },
+ {
+ "epoch": 2.401021711366539,
+ "grad_norm": 0.9164478182792664,
+ "learning_rate": 3.959044368600683e-05,
+ "loss": 0.708,
+ "mean_token_accuracy": 0.8818950295448303,
+ "num_tokens": 605371.0,
+ "step": 705
+ },
+ {
+ "epoch": 2.4180502341421883,
+ "grad_norm": 1.0944688320159912,
+ "learning_rate": 3.8452787258248016e-05,
+ "loss": 0.8541,
+ "mean_token_accuracy": 0.8556552082300186,
+ "num_tokens": 609890.0,
+ "step": 710
+ },
+ {
+ "epoch": 2.4350787569178376,
+ "grad_norm": 0.8398585319519043,
+ "learning_rate": 3.7315130830489194e-05,
+ "loss": 0.7117,
+ "mean_token_accuracy": 0.882653883099556,
+ "num_tokens": 614025.0,
+ "step": 715
+ },
+ {
+ "epoch": 2.4521072796934864,
+ "grad_norm": 0.9557759165763855,
+ "learning_rate": 3.617747440273038e-05,
+ "loss": 0.7401,
+ "mean_token_accuracy": 0.8780117958784104,
+ "num_tokens": 618268.0,
+ "step": 720
+ },
+ {
+ "epoch": 2.4691358024691357,
+ "grad_norm": 0.7890902757644653,
+ "learning_rate": 3.5039817974971564e-05,
+ "loss": 0.7193,
+ "mean_token_accuracy": 0.8795603841543198,
+ "num_tokens": 622542.0,
+ "step": 725
+ },
+ {
+ "epoch": 2.486164325244785,
+ "grad_norm": 1.0514216423034668,
+ "learning_rate": 3.390216154721274e-05,
+ "loss": 0.6987,
+ "mean_token_accuracy": 0.8816746294498443,
+ "num_tokens": 626771.0,
+ "step": 730
+ },
+ {
+ "epoch": 2.503192848020434,
+ "grad_norm": 1.0042310953140259,
+ "learning_rate": 3.276450511945393e-05,
+ "loss": 0.7099,
+ "mean_token_accuracy": 0.8860125571489335,
+ "num_tokens": 630981.0,
+ "step": 735
+ },
+ {
+ "epoch": 2.5202213707960834,
+ "grad_norm": 1.0508288145065308,
+ "learning_rate": 3.162684869169511e-05,
+ "loss": 0.7424,
+ "mean_token_accuracy": 0.8739517882466317,
+ "num_tokens": 635240.0,
+ "step": 740
+ },
+ {
+ "epoch": 2.5372498935717327,
+ "grad_norm": 1.0945532321929932,
+ "learning_rate": 3.0489192263936294e-05,
+ "loss": 0.8181,
+ "mean_token_accuracy": 0.8624349996447563,
+ "num_tokens": 639694.0,
+ "step": 745
+ },
+ {
+ "epoch": 2.554278416347382,
+ "grad_norm": 0.9198687076568604,
+ "learning_rate": 2.9351535836177476e-05,
+ "loss": 0.688,
+ "mean_token_accuracy": 0.880143529176712,
+ "num_tokens": 643984.0,
+ "step": 750
+ },
+ {
+ "epoch": 2.571306939123031,
+ "grad_norm": 1.0412315130233765,
+ "learning_rate": 2.8213879408418657e-05,
+ "loss": 0.6844,
+ "mean_token_accuracy": 0.8923282608389854,
+ "num_tokens": 648166.0,
+ "step": 755
+ },
+ {
+ "epoch": 2.58833546189868,
+ "grad_norm": 0.9161568284034729,
+ "learning_rate": 2.7076222980659842e-05,
+ "loss": 0.7436,
+ "mean_token_accuracy": 0.8677403450012207,
+ "num_tokens": 652487.0,
+ "step": 760
+ },
+ {
+ "epoch": 2.6053639846743293,
+ "grad_norm": 0.7734108567237854,
+ "learning_rate": 2.5938566552901024e-05,
+ "loss": 0.6938,
+ "mean_token_accuracy": 0.8824578642845153,
+ "num_tokens": 656735.0,
+ "step": 765
+ },
+ {
+ "epoch": 2.6223925074499785,
+ "grad_norm": 1.2506450414657593,
+ "learning_rate": 2.480091012514221e-05,
+ "loss": 0.7896,
+ "mean_token_accuracy": 0.8708192393183708,
+ "num_tokens": 661125.0,
+ "step": 770
+ },
+ {
+ "epoch": 2.639421030225628,
+ "grad_norm": 0.9822338223457336,
+ "learning_rate": 2.366325369738339e-05,
+ "loss": 0.7611,
+ "mean_token_accuracy": 0.8697439581155777,
+ "num_tokens": 665455.0,
+ "step": 775
+ },
+ {
+ "epoch": 2.656449553001277,
+ "grad_norm": 1.0660203695297241,
+ "learning_rate": 2.2525597269624575e-05,
+ "loss": 0.8025,
+ "mean_token_accuracy": 0.867020557820797,
+ "num_tokens": 669868.0,
+ "step": 780
+ },
+ {
+ "epoch": 2.6734780757769263,
+ "grad_norm": 1.049364686012268,
+ "learning_rate": 2.138794084186576e-05,
+ "loss": 0.7601,
+ "mean_token_accuracy": 0.8773441627621651,
+ "num_tokens": 674152.0,
+ "step": 785
+ },
+ {
+ "epoch": 2.6905065985525756,
+ "grad_norm": 0.9868401288986206,
+ "learning_rate": 2.025028441410694e-05,
+ "loss": 0.7507,
+ "mean_token_accuracy": 0.8820523858070374,
+ "num_tokens": 678390.0,
+ "step": 790
+ },
+ {
+ "epoch": 2.707535121328225,
+ "grad_norm": 0.9983195662498474,
+ "learning_rate": 1.9112627986348127e-05,
+ "loss": 0.7143,
+ "mean_token_accuracy": 0.8788602381944657,
+ "num_tokens": 682664.0,
+ "step": 795
+ },
+ {
+ "epoch": 2.724563644103874,
+ "grad_norm": 0.8293647170066833,
+ "learning_rate": 1.7974971558589308e-05,
+ "loss": 0.7131,
+ "mean_token_accuracy": 0.8797033429145813,
+ "num_tokens": 686921.0,
+ "step": 800
+ },
+ {
+ "epoch": 2.7415921668795233,
+ "grad_norm": 0.8374283313751221,
+ "learning_rate": 1.683731513083049e-05,
+ "loss": 0.7023,
+ "mean_token_accuracy": 0.8815864950418473,
+ "num_tokens": 691141.0,
+ "step": 805
+ },
+ {
+ "epoch": 2.7586206896551726,
+ "grad_norm": 1.1833642721176147,
+ "learning_rate": 1.5699658703071675e-05,
+ "loss": 0.7153,
+ "mean_token_accuracy": 0.8766167342662812,
+ "num_tokens": 695461.0,
+ "step": 810
+ },
+ {
+ "epoch": 2.775649212430822,
+ "grad_norm": 0.9933969974517822,
+ "learning_rate": 1.4562002275312856e-05,
+ "loss": 0.7103,
+ "mean_token_accuracy": 0.8720713123679161,
+ "num_tokens": 699846.0,
+ "step": 815
+ },
+ {
+ "epoch": 2.792677735206471,
+ "grad_norm": 1.03058660030365,
+ "learning_rate": 1.342434584755404e-05,
+ "loss": 0.727,
+ "mean_token_accuracy": 0.8794147193431854,
+ "num_tokens": 704078.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.80970625798212,
+ "grad_norm": 1.0636446475982666,
+ "learning_rate": 1.2286689419795223e-05,
+ "loss": 0.7732,
+ "mean_token_accuracy": 0.876405943930149,
+ "num_tokens": 708363.0,
+ "step": 825
+ },
+ {
+ "epoch": 2.826734780757769,
+ "grad_norm": 1.2969962358474731,
+ "learning_rate": 1.1149032992036406e-05,
+ "loss": 0.7986,
+ "mean_token_accuracy": 0.865952019393444,
+ "num_tokens": 712643.0,
+ "step": 830
+ },
+ {
+ "epoch": 2.8437633035334184,
+ "grad_norm": 1.1317204236984253,
+ "learning_rate": 1.001137656427759e-05,
+ "loss": 0.8033,
+ "mean_token_accuracy": 0.8667902007699013,
+ "num_tokens": 717007.0,
+ "step": 835
+ },
+ {
+ "epoch": 2.8607918263090677,
+ "grad_norm": 0.8838286399841309,
+ "learning_rate": 8.873720136518773e-06,
+ "loss": 0.7001,
+ "mean_token_accuracy": 0.8767543002963066,
+ "num_tokens": 721206.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.877820349084717,
+ "grad_norm": 1.0453882217407227,
+ "learning_rate": 7.736063708759956e-06,
+ "loss": 0.7162,
+ "mean_token_accuracy": 0.8807593688368798,
+ "num_tokens": 725437.0,
+ "step": 845
+ },
+ {
+ "epoch": 2.894848871860366,
+ "grad_norm": 1.126804232597351,
+ "learning_rate": 6.598407281001138e-06,
+ "loss": 0.7815,
+ "mean_token_accuracy": 0.8717166781425476,
+ "num_tokens": 729740.0,
+ "step": 850
+ },
+ {
+ "epoch": 2.9118773946360155,
+ "grad_norm": 1.0228568315505981,
+ "learning_rate": 5.4607508532423215e-06,
+ "loss": 0.7388,
+ "mean_token_accuracy": 0.8761330127716065,
+ "num_tokens": 733931.0,
+ "step": 855
+ },
+ {
+ "epoch": 2.9289059174116643,
+ "grad_norm": 1.0373413562774658,
+ "learning_rate": 4.323094425483505e-06,
+ "loss": 0.7575,
+ "mean_token_accuracy": 0.878994283080101,
+ "num_tokens": 738251.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.9459344401873135,
+ "grad_norm": 0.9353616237640381,
+ "learning_rate": 3.185437997724687e-06,
+ "loss": 0.7245,
+ "mean_token_accuracy": 0.8769467875361443,
+ "num_tokens": 742581.0,
+ "step": 865
+ },
+ {
+ "epoch": 2.962962962962963,
+ "grad_norm": 0.9781903028488159,
+ "learning_rate": 2.0477815699658705e-06,
+ "loss": 0.7348,
+ "mean_token_accuracy": 0.8666362032294274,
+ "num_tokens": 747002.0,
+ "step": 870
+ },
+ {
+ "epoch": 2.979991485738612,
+ "grad_norm": 1.0084859132766724,
+ "learning_rate": 9.101251422070535e-07,
+ "loss": 0.8021,
+ "mean_token_accuracy": 0.8707229614257812,
+ "num_tokens": 751326.0,
+ "step": 875
+ }
+ ],
+ "logging_steps": 5,
+ "max_steps": 879,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 3,
+ "save_steps": 200,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": true
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 7075152758102016.0,
+ "train_batch_size": 1,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/checkpoint-879/training_args.bin b/checkpoint-879/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..b2b3017298d5c921f7f2203bfc0351607fabc713
--- /dev/null
+++ b/checkpoint-879/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:001de43419a04313fd3d652571d90911489fbcebf2f0e7c3f8aa624286dfc855
+size 5624
diff --git a/special_tokens_map.json b/special_tokens_map.json
new file mode 100644
index 0000000000000000000000000000000000000000..d53f816edeeee223cdcd54b743a647b49ee6d5f2
--- /dev/null
+++ b/special_tokens_map.json
@@ -0,0 +1,17 @@
+{
+ "bos_token": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "eos_token": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": "<|end▁of▁sentence|>"
+}
diff --git a/tokenizer.json b/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..1a2db243e47cbc113f6b2ddcc388aeeb8fe1a94c
--- /dev/null
+++ b/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e20ddafc659ba90242154b55275402edeca0715e5dbb30f56815a4ce081f4893
+size 11422778
diff --git a/tokenizer_config.json b/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..8095baa150cba7889d4b1d0f1b6564f886ac4618
--- /dev/null
+++ b/tokenizer_config.json
@@ -0,0 +1,194 @@
+{
+ "add_bos_token": true,
+ "add_eos_token": false,
+ "add_prefix_space": null,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|end▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|User|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151645": {
+ "content": "<|Assistant|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151646": {
+ "content": "<|begin▁of▁sentence|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|EOT|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151648": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151649": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "bos_token": "<|begin▁of▁sentence|>",
+ "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set ns = namespace(is_first=false, is_tool=false, is_output_first=true, system_prompt='') %}{%- for message in messages %}{%- if message['role'] == 'system' %}{% set ns.system_prompt = message['content'] %}{%- endif %}{%- endfor %}{{bos_token}}{{ns.system_prompt}}{%- for message in messages %}{%- if message['role'] == 'user' %}{%- set ns.is_tool = false -%}{{'<|User|>' + message['content']}}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is none %}{%- set ns.is_tool = false -%}{%- for tool in message['tool_calls']%}{%- if not ns.is_first %}{{'<|Assistant|><|tool▁calls▁begin|><|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{%- set ns.is_first = true -%}{%- else %}{{'\\n' + '<|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\\n' + '```json' + '\\n' + tool['function']['arguments'] + '\\n' + '```' + '<|tool▁call▁end|>'}}{{'<|tool▁calls▁end|><|end▁of▁sentence|>'}}{%- endif %}{%- endfor %}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is not none %}{%- if ns.is_tool %}{{'<|tool▁outputs▁end|>' + message['content'] + '<|end▁of▁sentence|>'}}{%- set ns.is_tool = false -%}{%- else %}{% set content = message['content'] %}{% if '' in content %}{% set content = content.split('')[-1] %}{% endif %}{{'<|Assistant|>' + content + '<|end▁of▁sentence|>'}}{%- endif %}{%- endif %}{%- if message['role'] == 'tool' %}{%- set ns.is_tool = true -%}{%- if ns.is_output_first %}{{'<|tool▁outputs▁begin|><|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- set ns.is_output_first = false %}{%- else %}{{'\\n<|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- endif %}{%- endif %}{%- endfor -%}{% if ns.is_tool %}{{'<|tool▁outputs▁end|>'}}{% endif %}{% if add_generation_prompt and not ns.is_tool %}{{'<|Assistant|>\\n'}}{% endif %}",
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|end▁of▁sentence|>",
+ "legacy": true,
+ "model_max_length": 16384,
+ "pad_token": "<|end▁of▁sentence|>",
+ "sp_model_kwargs": {},
+ "tokenizer_class": "LlamaTokenizer",
+ "unk_token": null,
+ "use_default_system_prompt": false
+}