Relative importance sampling for off-policy actor-critic in deep reinforcement learningMahammad Humayoo, Xueqi Cheng, Shuwei Qiu et al.|Scientific Reports|2025Cited by 3
Segmenting Action-Value Functions over Time Scales in SARSA via TD(Δ)Mahammad Humayoo, Xueqi Cheng, Gengzhong Zheng et al.|Algorithms|2025Cited by 1