Ys — Le silence sous les eaux

Une première lumière dans la cité engloutie d’Ys

Personne ne voit encore Ys.

La mer est calme. Le ciel gris. Rien ne dépasse de l’horizon. Très loin sous la surface, une cité dort encore. Puis, dans l’obscurité, une première lumière s’allume.

Ys est né.

Ce dépôt est le premier modèle de la série Ys, nommée d’après la légendaire cité bretonne. Son identifiant Hugging Face est AmauryLC/ys.

Présentation

Ys est un petit modèle de langage autorégressif entraîné à partir de zéro sur un corpus majoritairement francophone. Il prédit la suite d’un texte. Il n’a pas été ajusté pour suivre des instructions et ne constitue pas un assistant conversationnel.

Caractéristiques

Propriété Valeur
Paramètres 49 470 720
Couches Transformer 6
Dimension cachée 384
Têtes d’attention 6
Longueur de contexte 512 tokens
Tokenizer GPT-2 BPE via tiktoken
Vocabulaire effectif 50 257 tokens (poids rembourrés à 50 304)
Précision d’entraînement FP32
Entraînement 1 époque, 1 343 mises à jour

Entraînement et données

Le run a demandé 50 millions de tokens au total : 49,5 millions pour l’entraînement et 0,5 million pour la validation. Le compteur du run rapporte 49 496 064 tokens vus pendant l’optimisation.

Le mélange d’entraînement est composé de :

Les révisions sont indiquées pour rendre la provenance vérifiable. Les conditions d’utilisation des corpus sources peuvent différer.

Résultat de validation du run

  • Perte finale : 3,447
  • Perplexité : 31,41

Ces valeurs proviennent de l’évaluation interne de ce run et ne sont pas des scores de benchmark comparables entre modèles ou jeux de données.

Courbe de perte de l’entraînement

Utilisation

Télécharge les fichiers du dépôt, puis lance le script fourni :

hf download AmauryLC/ys --local-dir ys
cd ys
python -m pip install -r requirements.txt
python generate.py --prompt "Il était une fois"

Le script utilise le modèle PyTorch personnalisé de ce dépôt, les poids model.safetensors et le tokenizer GPT-2 de tiktoken. La première utilisation de tiktoken peut télécharger ses fichiers de tokenizer dans son cache local.

Usages prévus

  • Expérimentation et apprentissage autour du pré-entraînement d’un petit GPT ;
  • continuation de textes en français ;
  • comparaison avec les prochains modèles de la série Ys.

Limites

Ys est un modèle expérimental de petite taille, entraîné sur un corpus limité et en une seule époque. Il peut produire du texte incohérent, répéter des passages, inventer des faits ou refléter des biais présents dans ses données. Il n’a pas fait l’objet d’une évaluation humaine ou d’un benchmark externe et ne convient pas aux décisions importantes.

La fenêtre de contexte est de 512 tokens. Le tokenizer GPT-2 n’a pas été conçu spécialement pour le français.

Licence

Les poids du modèle sont distribués sous licence Apache License 2.0.

Les fichiers de code d’architecture dérivés de LLMs-from-scratch conservent leurs avis de copyright et leur licence d’origine, reproduits dans UPSTREAM-CODE-LICENSE.txt.

Les jeux de données utilisés pour l’entraînement restent soumis à leurs licences et conditions d’utilisation respectives. La licence Apache 2.0 applicable aux poids du modèle ne modifie pas les droits ou obligations associés aux données sources.

Downloads last month
-
Safetensors
Model size
49.5M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Datasets used to train AmauryLC/ys