Ys — Le silence sous les eaux
Personne ne voit encore Ys.
La mer est calme. Le ciel gris. Rien ne dépasse de l’horizon. Très loin sous la surface, une cité dort encore. Puis, dans l’obscurité, une première lumière s’allume.
Ys est né.
Ce dépôt est le premier modèle de la série Ys, nommée d’après la légendaire cité bretonne. Son identifiant Hugging Face est AmauryLC/ys.
Présentation
Ys est un petit modèle de langage autorégressif entraîné à partir de zéro sur un corpus majoritairement francophone. Il prédit la suite d’un texte. Il n’a pas été ajusté pour suivre des instructions et ne constitue pas un assistant conversationnel.
Caractéristiques
| Propriété | Valeur |
|---|---|
| Paramètres | 49 470 720 |
| Couches Transformer | 6 |
| Dimension cachée | 384 |
| Têtes d’attention | 6 |
| Longueur de contexte | 512 tokens |
| Tokenizer | GPT-2 BPE via tiktoken |
| Vocabulaire effectif | 50 257 tokens (poids rembourrés à 50 304) |
| Précision d’entraînement | FP32 |
| Entraînement | 1 époque, 1 343 mises à jour |
Entraînement et données
Le run a demandé 50 millions de tokens au total : 49,5 millions pour l’entraînement et 0,5 million pour la validation. Le compteur du run rapporte 49 496 064 tokens vus pendant l’optimisation.
Le mélange d’entraînement est composé de :
- 75 % de FineWeb-2, sous-ensemble français, révision
af9c13333eb981300149d5ca60a8e9d659b276b9; - 20 % de Wikipédia française, sous-ensemble
20231101.fr, révisionb04c8d1ceb2f5cd4588862100d08de323dccfbaa; - 5 % de French-PD-Books, révision
21abfb3f646a0f1846175c63709913a51abc9bcb.
Les révisions sont indiquées pour rendre la provenance vérifiable. Les conditions d’utilisation des corpus sources peuvent différer.
Résultat de validation du run
- Perte finale : 3,447
- Perplexité : 31,41
Ces valeurs proviennent de l’évaluation interne de ce run et ne sont pas des scores de benchmark comparables entre modèles ou jeux de données.
Utilisation
Télécharge les fichiers du dépôt, puis lance le script fourni :
hf download AmauryLC/ys --local-dir ys
cd ys
python -m pip install -r requirements.txt
python generate.py --prompt "Il était une fois"
Le script utilise le modèle PyTorch personnalisé de ce dépôt, les poids model.safetensors et le tokenizer GPT-2 de tiktoken. La première utilisation de tiktoken peut télécharger ses fichiers de tokenizer dans son cache local.
Usages prévus
- Expérimentation et apprentissage autour du pré-entraînement d’un petit GPT ;
- continuation de textes en français ;
- comparaison avec les prochains modèles de la série Ys.
Limites
Ys est un modèle expérimental de petite taille, entraîné sur un corpus limité et en une seule époque. Il peut produire du texte incohérent, répéter des passages, inventer des faits ou refléter des biais présents dans ses données. Il n’a pas fait l’objet d’une évaluation humaine ou d’un benchmark externe et ne convient pas aux décisions importantes.
La fenêtre de contexte est de 512 tokens. Le tokenizer GPT-2 n’a pas été conçu spécialement pour le français.
Licence
Les poids du modèle sont distribués sous licence Apache License 2.0.
Les fichiers de code d’architecture dérivés de LLMs-from-scratch conservent leurs avis de copyright et leur licence d’origine, reproduits dans UPSTREAM-CODE-LICENSE.txt.
Les jeux de données utilisés pour l’entraînement restent soumis à leurs licences et conditions d’utilisation respectives. La licence Apache 2.0 applicable aux poids du modèle ne modifie pas les droits ou obligations associés aux données sources.
- Downloads last month
- -

