step 3200 | val_ppl=11.88
Browse files- README.md +3 -3
- model.safetensors +1 -1
- resume/ckpt.pt +1 -1
- resume/latest_step.txt +1 -1
- training_meta.json +5 -5
README.md
CHANGED
|
@@ -25,9 +25,9 @@ Small language model (9.9M parameters) trained from scratch.
|
|
| 25 |
| Total parameters | 9.853M |
|
| 26 |
|
| 27 |
## Training
|
| 28 |
-
- Tokens seen:
|
| 29 |
-
- Val loss: 2.
|
| 30 |
-
- Val PPL:
|
| 31 |
|
| 32 |
## Usage
|
| 33 |
```python
|
|
|
|
| 25 |
| Total parameters | 9.853M |
|
| 26 |
|
| 27 |
## Training
|
| 28 |
+
- Tokens seen: 3,352,166,400
|
| 29 |
+
- Val loss: 2.4750
|
| 30 |
+
- Val PPL: 11.88
|
| 31 |
|
| 32 |
## Usage
|
| 33 |
```python
|
model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 39421616
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5c2ecf240f59ef5bb582242b08f1eebf095d8c945a7d01f4ac6535ec190ad990
|
| 3 |
size 39421616
|
resume/ckpt.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 119812327
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:2dce5b25f1680e6920a5e01a353e7c3f60aa9a3d1f50a681f21aaf0971f9d494
|
| 3 |
size 119812327
|
resume/latest_step.txt
CHANGED
|
@@ -1 +1 @@
|
|
| 1 |
-
|
|
|
|
| 1 |
+
3200
|
training_meta.json
CHANGED
|
@@ -1,8 +1,8 @@
|
|
| 1 |
{
|
| 2 |
-
"step":
|
| 3 |
-
"val_loss": 2.
|
| 4 |
-
"val_ppl":
|
| 5 |
"params_M": 9.853,
|
| 6 |
-
"pushed_at": "2026-06-
|
| 7 |
-
"tokens_seen":
|
| 8 |
}
|
|
|
|
| 1 |
{
|
| 2 |
+
"step": 3200,
|
| 3 |
+
"val_loss": 2.4750425384521484,
|
| 4 |
+
"val_ppl": 11.882212553279116,
|
| 5 |
"params_M": 9.853,
|
| 6 |
+
"pushed_at": "2026-06-17T22:32:27.223238",
|
| 7 |
+
"tokens_seen": 3352166400
|
| 8 |
}
|