The following pages link to (Q4533362):
Displaying 42 items.
- A stochastic policy search model for matching behavior (Q350884) (← links)
- Finding optimal memoryless policies of POMDPs under the expected average reward criterion (Q418072) (← links)
- Parameterized Markov decision process and its application to service rate control (Q492972) (← links)
- Hessian matrix distribution for Bayesian policy gradient reinforcement learning (Q545311) (← links)
- Simulation-based optimization of Markov decision processes: an empirical process theory approach (Q608432) (← links)
- A unified approach to Markov decision problems and performance sensitivity analysis with discounted and average criteria: multichain cases (Q705478) (← links)
- Policy gradient in Lipschitz Markov decision processes (Q747252) (← links)
- The factored policy-gradient planner (Q835832) (← links)
- A policy gradient method for semi-Markov decision processes with application to call admission control (Q859693) (← links)
- Synaptic dynamics: linear model and adaptation algorithm (Q889273) (← links)
- Reinforcement learning algorithms with function approximation: recent advances and applications (Q903601) (← links)
- Natural actor-critic algorithms (Q1049136) (← links)
- Estimation and approximation bounds for gradient-based reinforcement learning (Q1604222) (← links)
- An incremental off-policy search in a model-free Markov decision process using a single sample path (Q1621868) (← links)
- Variance-constrained actor-critic algorithms for discounted and average reward MDPs (Q1689603) (← links)
- Asymptotic bias of stochastic gradient search (Q1704136) (← links)
- Basic ideas for event-based optimization of Markov systems (Q1773104) (← links)
- Finding intrinsic rewards by embodied evolution and constrained reinforcement learning (Q1932114) (← links)
- Dealing with multiple experts and non-stationarity in inverse reinforcement learning: an application to real-life problems (Q2071401) (← links)
- Risk-averse policy optimization via risk-neutral policy optimization (Q2082514) (← links)
- Multi-agent reinforcement learning: a selective overview of theories and algorithms (Q2094040) (← links)
- Model-based reinforcement learning with dimension reduction (Q2281680) (← links)
- Adaptive critic design with graph Laplacian for online learning control of nonlinear systems (Q2795795) (← links)
- Transient-State Natural Gas Transmission in Gunbarrel Pipeline Networks (Q3386792) (← links)
- (Q4533363) (← links)
- Risk-Constrained Reinforcement Learning with Percentile Risk Criteria (Q4558492) (← links)
- Infinite Time Horizon Maximum Causal Entropy Inverse Reinforcement Learning (Q4682336) (← links)
- (Q5054599) (← links)
- (Q5054628) (← links)
- Efficiently Breaking the Curse of Horizon in Off-Policy Evaluation with Double Reinforcement Learning (Q5060503) (← links)
- Queueing Network Controls via Deep Reinforcement Learning (Q5084497) (← links)
- Risk-Sensitive Reinforcement Learning via Policy Gradient Search (Q5102286) (← links)
- A novel online gait optimization approach for biped robots with point-feet (Q5107987) (← links)
- Global Convergence of Policy Gradient Methods to (Almost) Locally Optimal Policies (Q5139670) (← links)
- Policy Gradient Approach of Event‐Based Optimization and Its Online Implementation (Q5177188) (← links)
- On-line policy gradient estimation with multi-step sampling (Q5962027) (← links)
- Smoothing policies and safe policy gradients (Q6097096) (← links)
- Variational actor-critic algorithms, (Q6102338) (← links)
- Geometry and convergence of natural policy gradient methods (Q6138809) (← links)
- L2SR: learning to sample and reconstruct for accelerated MRI via reinforcement learning (Q6557672) (← links)
- Reinforcement learning (Q6602227) (← links)
- Finite-time analysis of natural actor-critic for POMDPs (Q6633040) (← links)