Ian Cole
codingiancole
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a model about 6 hours ago
OpenAssistant/oasst-rlhf-2-llama-30b-7k-steps-xor liked a model about 6 hours ago
zhiqings/LLaVA-RLHF-13b-v1.5-336 liked a model about 6 hours ago
openbmb/RLHF-VOrganizations
None yet