Building Bridges: A Dataset for Evaluating Gender-Fair Machine Translation into German Paper • 2406.06131 • Published Jun 10, 2024
Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding Paper • 2506.06275 • Published Jun 6, 2025
Ouvia: A User-centered Framework for Measuring Usability of Speech Translation in Real-World Communication Scenarios Paper • 2606.06177 • Published Jun 4
AMALIA Technical Report: A Fully Open Source Large Language Model for European Portuguese Paper • 2603.26511 • Published Mar 27
CHARM: Calibrating Reward Models With Chatbot Arena Scores Paper • 2504.10045 • Published Apr 14, 2025
XL-Instruct: Synthetic Data for Cross-Lingual Open-Ended Generation Paper • 2503.22973 • Published Mar 29, 2025
DocHPLT: A Massively Multilingual Document-Level Translation Dataset Paper • 2508.13079 • Published Aug 18, 2025 • 1
MatheMagic: Generating Dynamic Mathematics Benchmarks Robust to Memorization Paper • 2510.05962 • Published Oct 7, 2025
HPLT 3.0: Very Large-Scale Multilingual Resources for LLM and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models Paper • 2511.01066 • Published Nov 2, 2025 • 3
Reinforcement Learning Elicits Contextual Learning of Unseen Language Translation Paper • 2606.06428 • Published Jun 4 • 25
Combining On-Policy Optimization and Distillation for Long-Context Reasoning in Large Language Models Paper • 2605.12227 • Published May 12 • 1
BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation Paper • 2604.09497 • Published Apr 10 • 29
BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation Paper • 2604.09497 • Published Apr 10 • 29
BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation Paper • 2604.09497 • Published Apr 10 • 29
BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs Paper • 2604.02045 • Published Apr 2 • 39