-
106
pages
-
English
-
Documents
-
2010
Description
Technische Universit¨ at Munc¨ henFakult¨ at fur¨ InformatikLehrstuhl VI: Echtzeitsysteme und RobotikA Study in Direct Policy SearchDani¨el Pieter WierstraVollstandiger¨ Abdruck der von der Fakult¨ at fur¨ Informatik der TechnischenUniversit¨ at Munc¨ hen zur Erlangung des akademischen Grades einesDoktors der Naturwissenschaften (Dr. rer. nat.)genehmigten Dissertation.Vorsitzender: Univ.-Prof. B. Brugge,¨ Ph.DPrufer¨ der Dissertation: 1. Univ.-Prof. Dr. H. J. Schmidhuber2. Dr. H.-J. BungartzDie Dissertation wurde am 22.12.2009 bei der Technischen Universit¨ at Munc¨ heneingereicht und durch die Fakult¨ at fur¨ Informatik am 30.03.2010 angenom-men.AbstractReinforcement learning in partially observable environments constitutes animportant and challenging problem. Since many value function-based meth-ods have been shown to perform poorly and even to diverge in non-Markoviansettings, direct policy search methods may hold more promise. The aim ofthis thesis is to advance the state-of-the-art in direct policy search and blackbox optimization.
-
Publié par
-
Publié le
01 janvier 2010
-
Langue
English
-
Poids de l'ouvrage
36 Mo