Anti-Concentrated Confidence Bonuses for Scalable Exploration

International Conference on Learning Representations 2022 Intrinsic rewards play a central role in handling the exploration-exploitation trade-off when designing sequential decision-making algorithms, in both foundational theory and state-of-the-art deep reinforcement learning. The LinUCB algorithm,...

Ausführliche Beschreibung

Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Ash, Jordan T, Zhang, Cyril, Goel, Surbhi, Krishnamurthy, Akshay, Kakade, Sham
Format: Artikel
Sprache:eng
Schlagworte:
Online-Zugang:Volltext bestellen
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!