Léo Martin
leo-mart
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a dataset about 12 hours ago
Anthropic/hh-rlhf liked a dataset about 12 hours ago
Dahoas/full-hh-rlhf upvoted a paper about 12 hours ago
Scaling Automatic Research Agents via World ModelsOrganizations
None yet