-
10
pages
-
Français
-
Documents
Description
Une approche modifiée deλ-Policy IterationChristophe Thiéry, Bruno ScherrerLORIA - INRIA LorraineCampus Scientifique BP 23954506 Vandoeuvre-lès-Nancy CEDEXchristophe.thiery@loria.frhttp://www.loria.fr/∼thierychRésumé : Dans le cadre du contrôle optimal stochastique, nous proposons une manière modifiée demettre en oeuvre l’algorithmeλ-Policy Iteration (Bertsekas & Tsitsiklis, 1996), une méthode qui géné-ralise Value Iteration et Policy Iteration en introduisant un paramètreλ. Nous montrons que cette versionmodifiée, qui est analogue à Modified Policy Iteration, généralise tous ces algorithmes et converge versla fonction de valeur optimale. En nous appuyant sur des arguments analytiques et expérimentaux, nousmettons en évidence le fait que lorsque l’algorithme est appliqué de manière exacte, le paramètreλ nepermet pas d’améliorer la vitesse de convergence de manière significative.Mots-clés : Contrôle optimal stochastique, Apprentissage par renforcement, Programmation dyna-mique, Processus Décisionnels de Markov, Modifiedλ-Policy IterationIntroductionBertsekas & Tsitsiklis (1996) ont proposé l’algorithme λ-Policy Iteration, une méthode qui généraliseles deux algorithmes classiques de la programmation dynamique, Value Iteration et Policy Iteration, enajoutant un paramètreλ∈ [0,1]. Dans cet article, nous étudions la version exacte de cet algorithme, mêmesi c’est surtout dans un contexte d’approximation qu’il révèle son potentiel. En nous inspirant de ...
-
Publié par
-
Langue
Français