Maggio33 commited on
Commit
c45bc6f
·
verified ·
1 Parent(s): cdf504e

card: dolozona niezalezna weryfikacja SlayerLab (repro 1:1 bench_pl + kontekst 110M-v3), tresc autorki nietknieta

Browse files
Files changed (1) hide show
  1. README.md +21 -0
README.md CHANGED
@@ -190,3 +190,24 @@ Bazuje na [nanoGPT](https://github.com/karpathy/nanoGPT) (MIT, Andrej Karpathy).
190
  url = {https://huggingface.co/KateMajzel/GoLLeM-45M-PL}
191
  }
192
  ```
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
190
  url = {https://huggingface.co/KateMajzel/GoLLeM-45M-PL}
191
  }
192
  ```
193
+
194
+ ---
195
+
196
+ ## Weryfikacja niezależna (SlayerLab, 2026-08-30)
197
+
198
+ Zespół SlayerLab odtworzył wyniki z tej karty **niezależnie**, używając oryginalnego
199
+ harnessu autorki (`bench_pl.py` z [`KateMajzel/gollem-pl`](https://github.com/KateMajzel/gollem-pl),
200
+ domain-PMI, `--n 400 --seed 42`, bez modyfikacji):
201
+
202
+ | zadanie | karta (autorka) | nasza reprodukcja |
203
+ |---|---|---|
204
+ | PolEmo2-IN (acc PMI) | 47,2% | **47,2%** |
205
+ | 8Tags (acc PMI) | 31,5% | **31,5%** |
206
+
207
+ Zgodność 1:1 — wyniki w pełni reprodukowalne.
208
+
209
+ Dla kontekstu, na tym samym harnessie nasz model
210
+ [`SlayerLab/GoLLeM-110M-PL-v3`](https://huggingface.co/SlayerLab/GoLLeM-110M-PL-v3) (110M)
211
+ osiąga polemo2 56,5% / 8tags 37,2% (acc PMI) — zgodnie z oczekiwaniem dla większej skali.
212
+ Uwaga autorki pozostaje w mocy: modele tej wielkości bywają blisko poziomu losowego na
213
+ raw-acc, a sygnał wyciąga dopiero normalizacja PMI.