Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards Paper • 2306.04488 • Published Jun 7, 2023 • 2