Pages that link to "Item:Q2753225"
From MaRDI portal
The following pages link to Learning algorithms for Markov decision processes with average cost (Q2753225):
Displaying 34 items.
- Multiscale Q-learning with linear function approximation (Q312650) (← links)
- Q-learning and policy iteration algorithms for stochastic shortest path problems (Q378731) (← links)
- Analyzing anonymity attacks through noisy channels (Q498398) (← links)
- Natural actor-critic algorithms (Q1049136) (← links)
- Reinforcement learning for long-run average cost. (Q1427588) (← links)
- Approachability in Stackelberg stochastic games with vector costs (Q1707454) (← links)
- Solutions of the average cost optimality equation for Markov decision processes with weakly continuous kernel: the fixed-point approach revisited (Q1748297) (← links)
- Q-learning for Markov decision processes with a satisfiability criterion (Q1749413) (← links)
- A reinforcement learning algorithm based on policy iteration for average reward: Empirical results with yield management and convergence analysis (Q1771225) (← links)
- Average cost temporal-difference learning (Q1805802) (← links)
- \(L^\ast\)-based learning of Markov decision processes (extended version) (Q1982638) (← links)
- Fundamental design principles for reinforcement learning algorithms (Q2094028) (← links)
- Batch policy learning in average reward Markov decision processes (Q2112817) (← links)
- Whittle index based Q-learning for restless bandits with average reward (Q2116660) (← links)
- A sojourn-based approach to semi-Markov reinforcement learning (Q2149523) (← links)
- Deep reinforcement learning for wireless sensor scheduling in cyber-physical systems (Q2173933) (← links)
- Fitted Q-iteration by functional networks for control problems (Q2293779) (← links)
- Learning dynamic prices in electronic retail markets with customer segmentation (Q2507374) (← links)
- Dynamic pricing models for electronic business (Q2571441) (← links)
- Reinforcement learning based algorithms for average cost Markov decision processes (Q2643632) (← links)
- Relative value iteration algorithm with soft state aggregation (Q2705757) (← links)
- Empirical dynamic programming (Q2806811) (← links)
- Q-learning and enhanced policy iteration in discounted dynamic programming (Q2884305) (← links)
- Opportunistic Transmission over Randomly Varying Channels (Q3616977) (← links)
- Look-ahead control of conveyor-serviced production station by using potential-based online policy iteration (Q3654586) (← links)
- Learning algorithms for Markov decision processes (Q3768706) (← links)
- Risk-Sensitive Reinforcement Learning via Policy Gradient Search (Q5102286) (← links)
- Variance-penalized Markov decision processes: dynamic programming and reinforcement learning techniques (Q5166474) (← links)
- Optimal Distributed Uplink Channel Allocation: A Constrained MDP Formulation (Q5198538) (← links)
- A perturbation approach to approximate value iteration for average cost Markov decision processes with Borel spaces and bounded costs (Q5227201) (← links)
- Approximation of average cost Markov decision processes using empirical distributions and concentration inequalities (Q5265786) (← links)
- Empirical Q-Value Iteration (Q5856670) (← links)
- Optimal sensor scheduling for remote state estimation with limited bandwidth: a deep reinforcement learning approach (Q6154482) (← links)
- Stochastic Fixed-Point Iterations for Nonexpansive Maps: Convergence and Error Bounds (Q6180255) (← links)