CARREGANDO O RADAR…
Nonparametric Variance-Penalized Actor-Critic: Statistical Inference for Risk-Sensitive Reinforcement Learning | Radar arXiv · portela.dev