view article Article Ultra-Long Sequence Parallelism: Ulysses + Ring-Attention Technical Principles and Implementation exploding-gradients • Sep 16, 2025 • 22
Running 4.04k The Ultra-Scale Playbook 🌌 4.04k The ultimate guide to training LLM on large GPU Clusters
LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day Paper • 2306.00890 • Published Jun 1, 2023 • 14