Pages that link to "Item:Q1604817"
From MaRDI portal
The following pages link to Near-optimal reinforcement learning in polynomial time (Q1604817):
Displaying 39 items.
- Knows what it knows: a framework for self-aware learning (Q413843) (← links)
- Near-optimal PAC bounds for discounted MDPs (Q465258) (← links)
- Reinforcement learning: exploration-exploitation dilemma in multi-agent foraging task (Q505118) (← links)
- Reducing reinforcement learning to KWIK online regression (Q616761) (← links)
- An analysis of model-based interval estimation for Markov decision processes (Q959899) (← links)
- Online regret bounds for Markov decision processes with deterministic transitions (Q982638) (← links)
- No regrets about no-regret (Q1028930) (← links)
- Convergence results for single-step on-policy reinforcement-learning algorithms (Q1568533) (← links)
- A near-optimal polynomial time algorithm for learning in certain classes of stochastic games (Q1583226) (← links)
- Efficient exploration through active learning for value function approximation in reinforcement learning (Q1784573) (← links)
- Adaptive-resolution reinforcement learning with polynomial exploration in deterministic domains (Q1959632) (← links)
- Deep reinforcement learning with temporal logics (Q1996007) (← links)
- Inverse reinforcement learning in contextual MDPs (Q2071371) (← links)
- Computer science and decision theory (Q2271874) (← links)
- Controller exploitation-exploration reinforcement learning architecture for computing near-optimal policies (Q2318167) (← links)
- An information-theoretic analysis of return maximization in reinforcement learning (Q2375396) (← links)
- Relational reinforcement learning with guided demonstrations (Q2407440) (← links)
- Bayesian optimistic Kullback-Leibler exploration (Q2425228) (← links)
- Efficient PAC learning for episodic tasks with acyclic state spaces (Q2465672) (← links)
- An \(\mathrm{AO}^{*}\) based exact algorithm for the Canadian traveler problem (Q2806869) (← links)
- Near-optimal regret bounds for reinforcement learning (Q2896090) (← links)
- Solving for Best Responses and Equilibria in Extensive-Form Games with Reinforcement Learning Methods (Q3299845) (← links)
- Online Regret Bounds for Markov Decision Processes with Deterministic Transitions (Q3529915) (← links)
- (Q4636970) (← links)
- (Q4636987) (← links)
- Bayesian Exploration for Approximate Dynamic Programming (Q4971589) (← links)
- (Q4998915) (← links)
- (Q4999029) (← links)
- (Q5053336) (← links)
- (Q5214215) (← links)
- (Q5715663) (← links)
- Robust Control for Dynamical Systems with Non-Gaussian Noise via Formal Abstractions (Q5881801) (← links)
- Explicit explore, exploit, or escape \((E^4)\): near-optimal safety-constrained reinforcement learning in polynomial time (Q6106432) (← links)
- Identity concealment games: how I learned to stop revealing and love the coincidences (Q6119741) (← links)
- Certified reinforcement learning with logic guidance (Q6136089) (← links)
- Recent advances in reinforcement learning in finance (Q6146668) (← links)
- Exploiting action impact regularity and exogenous state variables for offline reinforcement learning (Q6488780) (← links)
- A Hierarchical Expected Improvement Method for Bayesian Optimization (Q6567955) (← links)
- TSEC: A Framework for Online Experimentation under Experimental Constraints (Q6631092) (← links)