背景与痛点:连续动作空间的挑战 在强化学习中,连续动作空间问题一直是个棘手的问题。与离散动作空间不同,连续动作…
背景痛点 在强化学习中,处理连续动作空间一直是个棘手的问题。传统的策略梯度方法 (Policy Gradien…