Training language models to follow instructions with human feedbackLong Ouyang, Ryan Lowe, Carroll L. Wainwright et al.|arXiv (Cornell University)|2022Cited by 4.3k
Multi-Goal Reinforcement Learning: Challenging Robotics Environments and\n Request for ResearchMatthias Plappert, Wojciech Zaremba, Marcin Andrychowicz et al.|arXiv (Cornell University)|2018Cited by 165