Pages that link to "Item:Q4339383"
From MaRDI portal
The following pages link to Optimal Adaptive Policies for Markov Decision Processes (Q4339383):
Displaying 38 items.
- Infomax strategies for an optimal balance between exploration and exploitation (Q310029) (← links)
- Perspectives of approximate dynamic programming (Q333093) (← links)
- Kullback-Leibler upper confidence bounds for optimal sequential allocation (Q366995) (← links)
- Adaptive aggregation for reinforcement learning in average reward Markov decision processes (Q378753) (← links)
- Asymptotically optimal Bayesian sequential change detection and identification rules (Q378756) (← links)
- On optimal bidding in sequential procurement auctions (Q453039) (← links)
- On optimal bidding and inventory control in sequential procurement auctions: the multi period case (Q490174) (← links)
- Boundary crossing probabilities for general exponential families (Q722599) (← links)
- A perpetual search for talents across overlapping generations: a learning process (Q898767) (← links)
- Online regret bounds for Markov decision processes with deterministic transitions (Q982638) (← links)
- A unified approach to adaptive control of average reward Markov decision processes (Q1095048) (← links)
- On confidence intervals from simulation of finite Markov chains (Q1374692) (← links)
- Optimal adaptive policies for sequential allocation problems (Q1922542) (← links)
- On bidding for a fixed number of items in a sequence of auctions (Q1926913) (← links)
- Adaptive policies for stochastic systems under a randomized discounted cost criterion (Q1959062) (← links)
- Robust control of the multi-armed bandit problem (Q2095215) (← links)
- Dynamic pricing with finite price sets: a non-parametric approach (Q2238754) (← links)
- Managing mobile production-inventory systems influenced by a modulation process (Q2241563) (← links)
- Comparison of policy functions from the optimal learning and adaptive control frameworks (Q2355208) (← links)
- On the evaluation of bidding strategies in sequential auctions (Q2670436) (← links)
- (Q3148802) (← links)
- Comparing Policies in Markov Decision Processes: Mandl's Lemma Revisited (Q3200907) (← links)
- Dynamic Pricing and Learning with Finite Inventories (Q3465597) (← links)
- Online Regret Bounds for Markov Decision Processes with Deterministic Transitions (Q3529915) (← links)
- Adaptive policy-iteration and policy-value-iteration for discounted Markov decision processes (Q3984139) (← links)
- Suboptimal Policies, with Bounds, for Parameter Adaptive Decision Processes (Q4202459) (← links)
- (Q4558474) (← links)
- Temporal concatenation for Markov decision processes (Q5051192) (← links)
- Dynamic Inventory and Price Controls Involving Unknown Demand on Discrete Nonperishable Items (Q5144768) (← links)
- Optimal Online Learning for Nonlinear Belief Models Using Discrete Priors (Q5144779) (← links)
- Adaptive Policies for Sequential Sampling under Incomplete Information and a Cost Constraint (Q5261007) (← links)
- An Adaptive Sampling Algorithm for Solving Markov Decision Processes (Q5322077) (← links)
- MULTI-ARMED BANDITS UNDER GENERAL DEPRECIATION AND COMMITMENT (Q5358026) (← links)
- ASYMPTOTICALLY OPTIMAL MULTI-ARMED BANDIT POLICIES UNDER A COST CONSTRAINT (Q5358116) (← links)
- Bayesian sequential optimal experimental design for nonlinear models using policy gradient reinforcement learning (Q6084438) (← links)
- Convergence rate analysis for optimal computing budget allocation algorithms (Q6110297) (← links)
- Logarithmic regret bounds for continuous-time average-reward Markov decision processes (Q6608781) (← links)
- Data-driven rules for multidimensional reflection problems (Q6645137) (← links)