CNN/DailyMail ModernBERT Pointwise Run
- model_size:
base - model_name:
answerdotai/ModernBERT-base - resolved_model_name:
/lustre/fsmisc/dataset/HuggingFace_Models/answerdotai/ModernBERT-base - target_mode:
model_balanced - target_field:
salience_score_model_balanced - input_field:
model_input_text - train_file:
data/CNN_DM/representative_subset/salience_generation/recovery_f2_all6/sentence_scorer_data/modernbert_pointwise/train.jsonl - dev_file:
data/CNN_DM/representative_subset/salience_generation/recovery_f2_all6/sentence_scorer_data/modernbert_pointwise/dev.jsonl - train_rows:
59643 - dev_rows:
6793 - train_articles:
1000 - dev_articles:
200 - max_length:
4096 - learning_rate:
2e-05 - weight_decay:
0.01 - num_train_epochs:
3.0 - warmup_ratio:
0.06 - per_device_train_batch_size:
2 - per_device_eval_batch_size:
2 - gradient_accumulation_steps:
8 - effective_train_batch_size:
16 - eval_strategy:
epoch - save_strategy:
epoch - early_stopping_patience:
2 - bf16:
True - fp16:
False - gradient_checkpointing:
True
Eval Metrics
- epoch:
3.0 - eval_article_ndcg_at_3:
0.9055421605026681 - eval_article_ndcg_at_5:
0.8978525730107749 - eval_article_spearman:
0.7319277523759264 - eval_loss:
0.02754737250506878 - eval_mae:
0.12368558347225189 - eval_pearson:
0.8236426997589091 - eval_rmse:
0.16597401714640134 - eval_runtime:
80.6871 - eval_samples_per_second:
84.189 - eval_spearman:
0.8201133644491532 - eval_steps_per_second:
42.101