step 4000 | val_ppl=11.43
Browse files- README.md +3 -3
- model.safetensors +1 -1
- resume/ckpt.pt +1 -1
- resume/latest_step.txt +1 -1
- training_meta.json +5 -5
README.md
CHANGED
|
@@ -25,9 +25,9 @@ Small language model (9.9M parameters) trained from scratch.
|
|
| 25 |
| Total parameters | 9.853M |
|
| 26 |
|
| 27 |
## Training
|
| 28 |
-
- Tokens seen:
|
| 29 |
-
- Val loss: 2.
|
| 30 |
-
- Val PPL: 11.
|
| 31 |
|
| 32 |
## Usage
|
| 33 |
```python
|
|
|
|
| 25 |
| Total parameters | 9.853M |
|
| 26 |
|
| 27 |
## Training
|
| 28 |
+
- Tokens seen: 4,190,208,000
|
| 29 |
+
- Val loss: 2.4361
|
| 30 |
+
- Val PPL: 11.43
|
| 31 |
|
| 32 |
## Usage
|
| 33 |
```python
|
model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 39421616
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3a623c1f904bdb9f46ed0718c33f1996a9db6692de446fea9b322554bff206d3
|
| 3 |
size 39421616
|
resume/ckpt.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 119812327
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:445874cf6b1f4aafe7ac6cc1436c8664c25eae2577357c64d852ca181d1add5e
|
| 3 |
size 119812327
|
resume/latest_step.txt
CHANGED
|
@@ -1 +1 @@
|
|
| 1 |
-
|
|
|
|
| 1 |
+
4000
|
training_meta.json
CHANGED
|
@@ -1,8 +1,8 @@
|
|
| 1 |
{
|
| 2 |
-
"step":
|
| 3 |
-
"val_loss": 2.
|
| 4 |
-
"val_ppl": 11.
|
| 5 |
"params_M": 9.853,
|
| 6 |
-
"pushed_at": "2026-06-
|
| 7 |
-
"tokens_seen":
|
| 8 |
}
|
|
|
|
| 1 |
{
|
| 2 |
+
"step": 4000,
|
| 3 |
+
"val_loss": 2.4361114742279053,
|
| 4 |
+
"val_ppl": 11.428514155678789,
|
| 5 |
"params_M": 9.853,
|
| 6 |
+
"pushed_at": "2026-06-18T02:22:12.443456",
|
| 7 |
+
"tokens_seen": 4190208000
|
| 8 |
}
|