Reinforcement Learning (RL) trains agents via reward signals. Proximal Policy Optimization (PPO) and Soft Actor-Critic (SAC) are popular for continuous control tasks.
Key Uses:
Robotic manipulation, drone navigation, and quadruped locomotion.
Hacks:
Use domain randomization during simulation training for better sim-to-real transfer. Apply Hindsight Experience Replay (HER) for sparse reward problems. Curriculum learning to gradually increase task difficulty. Combine with imitation learning (behaviour cloning) for sample efficiency.
References:
Schulman, J., et al. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347.
