The following pages link to (Q3093234):
Displaying 20 items.
- Adaptive playouts for online learning of policies during Monte Carlo tree search (Q307776) (← links)
- Learning to control a structured-prediction decoder for detection of HTTP-layer DDoS attackers (Q331696) (← links)
- Analysis and improvement of policy gradient estimation (Q448295) (← links)
- The factored policy-gradient planner (Q835832) (← links)
- Natural actor-critic algorithms (Q1049136) (← links)
- Importance sampling in reinforcement learning with an estimated behavior policy (Q2051319) (← links)
- TD-regularized actor-critic methods (Q2320580) (← links)
- Optimised graded metamaterials for mechanical energy confinement and amplification via reinforcement learning (Q2692865) (← links)
- Using Gaussian processes for variance reduction in policy gradient algorithms (Q2908998) (← links)
- (Q4617639) (← links)
- (Q4969241) (← links)
- Reinforcement Learning in Sparse-Reward Environments With Hindsight Policy Gradients (Q5004371) (← links)
- Global Convergence of Policy Gradient Methods to (Almost) Locally Optimal Policies (Q5139670) (← links)
- Deep Reinforcement Learning: A State-of-the-Art Walkthrough (Q5145831) (← links)
- Efficient Sample Reuse in Policy Gradients with Parameter-Based Exploration (Q5378202) (← links)
- On-line policy gradient estimation with multi-step sampling (Q5962027) (← links)
- Optimistic reinforcement learning by forward Kullback-Leibler divergence optimization (Q6077011) (← links)
- Personalized dynamic treatment regimes in continuous time: a Bayesian approach for optimizing clinical decisions with timing (Q6121782) (← links)
- A Bayesian decision framework for optimizing sequential combination antiretroviral therapy in people with HIV (Q6138619) (← links)
- Leveraging randomized smoothing for optimal control of nonsmooth dynamical systems (Q6551655) (← links)