LLM Training Datasets Collection A collection of datasets for training LLMs. • 132 items • Updated 9 days ago • 45
DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data Paper • 2608.13517 • Published 13 days ago • 32
Dynamic Multi-Byte Prediction With Hierarchical Language Models Paper • 2608.15454 • Published 10 days ago • 19
Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See Paper • 2608.17744 • Published 7 days ago • 14
LLMs Get Smarter from Targeted Synthetic Multilingual Data Paper • 2608.15964 • Published 10 days ago • 5
Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference Paper • 2608.20210 • Published 6 days ago • 7
FwPKM Collection Checkpoints for Fast-weight Product Key Memory (https://arxiv.org/abs/2601.00671) • 8 items • Updated 29 days ago • 2
IMU-1: Sample-Efficient Pre-training of Small Language Models Paper • 2602.02522 • Published Jan 25 • 9
Darwin Family: MRI-Trust-Weighted Evolutionary Merging for Training-Free Scaling of Language-Model Reasoning Paper • 2605.14386 • Published May 14 • 69
Jackrong/Qwen3.5-2B-Claude-4.6-Opus-Reasoning-Distilled-GGUF Text Generation • 2B • Updated Jul 4 • 14.7k • 186
Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled Image-Text-to-Text • 28B • Updated Jul 7 • 29.3k • • 2.94k
Late-to-Early Training: LET LLMs Learn Earlier, So Faster and Better Paper • 2602.05393 • Published Feb 5 • 9