Enhancing Reinforcement Learning with Dense Rewards from Language Model CriticMeng Cao, Lei Meng, Nevan Wichers et al.|Unknown|2024Cited by 9
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text GenerationMeng Cao, Lei Meng, Lei Shu et al.|arXiv (Cornell University)|2024Cited by 0