Pages that link to "Item:Q2253434"
From MaRDI portal
The following pages link to A basic formula for performance gradient estimation of semi-Markov decision processes (Q2253434):
Displaying 8 items.
- A unified approach to time-aggregated Markov decision processes (Q259403) (← links)
- A reinforcement-learning approach for admission control in distributed network service systems (Q266057) (← links)
- Modeling and optimization control of a demand-driven, conveyor-serviced production station (Q319221) (← links)
- Event-based optimization approach for solving stochastic decision problems with probabilistic constraint (Q828677) (← links)
- A policy gradient method for semi-Markov decision processes with application to call admission control (Q859693) (← links)
- The risk probability criterion for discounted continuous-time Markov decision processes (Q1686855) (← links)
- A Jackson network model and threshold policy for joint optimization of energy and delay in multi-hop wireless networks (Q2630224) (← links)
- On-line policy gradient estimation with multi-step sampling (Q5962027) (← links)