Bruno Scherrer, Chercheur. Equipe LARSEN, INRIA (Institut National De Recherche en Informatique et Automatique).
Adresse électronique : Prénom.Nom@inria.fr, Bureau : C126
Adresse postale : Centre de recherche Inria Nancy - Grand Est, 615 rue du Jardin Botanique, 54600 Villers-lès-Nancy, FRANCE.

Raphaël Boige, Amine Boumaza, BSAlphaBeta is not as good as you think: a simple class of synthetic games for a better analysis of deterministic game-solving algorithmsThe Thirty-ninth Annual Conference on Neural Information Processing Systems [article]
Nino Vieillard, Tadashi Kozuno, BS, Olivier Pietquin, Rémi Munos, Matthieu GeistLeverage the Average: an Analysis of KL Regularization in Reinforcement LearningNeurIPS - 34th Conference on Neural Information Processing Systems [article]
BSSimulations de carrières et retraites à points dans 3 cadres macro-économiques: modèle du gouvernement Philippe (âge-pivot bloqué), modèle du gouvernement Philippe corrigé (âge-pivot glissant), modèle Destinie2 (avec revalorisation de la fonction publique) [article]
Nino Vieillard, BS, Olivier Pietquin, Matthieu GeistMomentum in Reinforcement LearningAISTATS 2020 - 23rd International Conference on Artificial Intelligence and Statistics [article]
Romain Postoyan, Mathieu Granzotto, Lucian Buşoniu, BS, Dragan Nešić, Jamal DaafouzStability guarantees for nonlinear discrete-time systems controlled by approximate value iteration58th IEEE Conference on Decision and Control, CDC 2019 [article]
Yonathan Efroni, Gal Dalal, BS, Shie MannorHow to Combine Tree-Search Methods in Reinforcement LearningAAAI 19 - Thirty-Third AAAI Conference on Artificial Intelligence [article]
Matthieu Geist, BS, Olivier PietquinA Theory of Regularized Markov Decision ProcessesICML 2019 - Thirty-sixth International Conference on Machine Learning [article]
Yonathan Efroni, Gal Dalal, BS, Shie MannorBeyond the one-step greedy approach in reinforcement learningICML 2018 - 35th International Conference on Machine Learning [article]
Matthieu Geist, BSAnderson acceleration for reinforcement learningEWRL 2018 - 4th European workshop on Reinforcement Learning [article]
Yonathan Efroni, Gal Dalal, BS, Shie MannorMultiple-step greedy policies in online and approximate reinforcement learningNeurIPS 2018 - Thirty-second Conference on Neural Information Processing Systems [article]
Yonathan Efroni, Gal Dalal, BS, Shie MannorConvergence of Online and Approximate Multiple-Step Lookahead Policy IterationEWRL 2018 - 14th European workshop on Reinforcement Learning [article]
BSImproved and generalized upper bounds on the complexity of policy iterationMathematics of Operations Research [article]
Julien Pérolat, Bilal Piot, Matthieu Geist, BS, Olivier PietquinSoftened approximate policy iteration for Markov gamesICML 2016 - 33rd International Conference on Machine Learning [article]
Julien Pérolat, Bilal Piot, BS, Olivier PietquinOn the Use of Non-Stationary Strategies for Solving Two-Player Zero-Sum Markov Games19th International Conference on Artificial Intelligence and Statistics (AISTATS 2016) [article]
BSContributions algorithmiques au contrôle optimal stochastique à temps discret et horizon infiniHabilitation à diriger des recherches, Université de Lorraine [article]
Boris Lesner, BSNon-stationary approximate modified policy iterationICML 2015 [article]
BS, Matthieu GeistRecherche locale de politique dans un espace convexeRevue des Sciences et Technologies de l'Information - Série RIA : Revue d'Intelligence Artificielle [article]
BS, Mohammad Ghavamzadeh, Victor Gabillon, Boris Lesner, Matthieu GeistApproximate modified policy iteration and its application to the game of TetrisJournal of Machine Learning Research [article]
Julien Perolat, BS, Bilal Piot, Olivier PietquinApproximate dynamic programming for two-player zero-sum Markov gamesInternational Conference on Machine Learning (ICML 2015) [article]
Manel Tagorti, BSOn the rate of convergence and error bounds for LSTD(λ)ICML 2015 [article]
BS, Matthieu GeistQuand l'optimalité locale implique une garantie globale : recherche locale de politique dans un espace convexe et algorithme d'itération sur les politiques conservatif vu comme une montée de gradient fonctionnel9èmes Journées Francophones de Planification, Décision et Apprentissage (JFPDA'14) [article]
BS, Matthieu GeistLocal Policy Search in a Convex Space and Conservative Policy Iteration as Boosted Policy SearchECML [article]
BSApproximate Policy Iteration Schemes: A ComparisonICML - 31st International Conference on Machine Learning - 2014 [article]
Matthieu Geist, BSOff-policy Learning with Eligibility Traces: A SurveyJournal of Machine Learning Research [article]
Eugene A. Feinberg, Jefferson Huang, BSModified policy iteration algorithms are not strongly polynomial for discounted dynamic programmingOperations Research Letters [article]
Manel Tagorti, BSVitesse de convergence et borne d'erreur pour l'algorithme LSTD(λ)JFPDA - 9èmes Journées Francophones sur la Planification, la Décision et l'Apprentissage pour la conduite de systèmes [article]
BSUne étude comparative de quelques schémas d'approximation de type iterations sur les politiques [article]
BSOn the Performance Bounds of some Policy Search Dynamic Programming Algorithms [article]
Alain Dutech, BS, Christophe ThiéryLa carotte et le bâton… et TetrisImages des mathématiques [article]
BSQuelques majorants de la complexité d'itérations sur les politiquesJFPDA - 8èmes Journées Francophones sur la Planification, la Décision et l'Apprentissage pour la conduite de systèmes - 2013 [article]
BSImproved and Generalized Upper Bounds on the Complexity of Policy IterationNeural Information Processing Systems (NIPS) 2013 [article]
Matthieu Geist, BSOff-policy Learning with Eligibility Traces: A Survey [article]
Victor Gabillon, Mohammad Ghavamzadeh, BSApproximate Dynamic Programming Finally Performs Well in the Game of TetrisNeural Information Processing Systems (NIPS) 2013 [article]
BS, Matthieu GeistPolicy Search: Any Local Optimum Enjoys a Global Performance Guarantee [article]
BSPerformance Bounds for Lambda Policy Iteration and Application to the Game of TetrisJournal of Machine Learning Research [article]
Manel Tagorti, BS, Olivier Buffet, Joerg HoffmannAbstraction Pathologies In Markov Decision ProcessesICAPS'13 workshop on Heuristics and Search for Domain-independent Planning (HSDIP) [article]
BS, Boris LesnerSur l'utilisation de politiques non-stationnaires pour les processus de décision Markoviens à horizon infiniJFPDA - 8èmes Journées Francophones sur la Planification, la Décision et l'Apprentissage pour la conduite de systèmes - 2013 [article]
Boris Lesner, BSTight Performance Bounds for Approximate Modified Policy Iteration with Non-Stationary Policies [article]
Matthieu Geist, BS, Alessandro Lazaric, Mohammad GhavamzadehUn sélecteur de Dantzig pour l'apprentissage par différences temporellesJournées Francophones sur la planification, la décision et l'apprentissage pour le contrôle des systèmes - JFPDA 2012 [article]
BSOn the Use of Non-Stationary Policies for Infinite-Horizon Discounted Markov Decision Processes [article]
BS, Victor Gabillon, Mohammad Ghavamzadeh, Matthieu GeistApproximations de l'Algorithme Itérations sur les Politiques ModifiéJournées Francophones sur la planification, la décision et l'apprentissage pour le contrôle des systèmes - JFPDA 2012 [article]
BS, Boris LesnerOn the Use of Non-Stationary Policies for Stationary Infinite-Horizon Markov Decision ProcessesNIPS 2012 - Neural Information Processing Systems [article]
BS, Mohammad Ghavamzadeh, Victor Gabillon, Matthieu GeistApproximate Modified Policy Iteration29th International Conference on Machine Learning - ICML 2012 [article]
Matthieu Geist, BS, Alessandro Lazaric, Mohammad GhavamzadehA Dantzig Selector Approach to Temporal Difference LearningICML-12 [article]
Matthieu Geist, BSl1-penalized projected Bellman residualEuropean Wrokshop on Reinforcement Learning (EWRL 11) [article]
BS, Matthieu GeistRecursive Least-Squares Learning with Eligibility TracesEuropean Wrokshop on Reinforcement Learning (EWRL 11) [article]
Victor Gabillon, Alessandro Lazaric, Mohammad Ghavamzadeh, BSClassification-based Policy Iteration with a CriticInternational Conference on Machine Learning (ICML) [article]
BSPerformance Bounds for Lambda Policy Iteration and Application to the Game of Tetris [article]
BS, Matthieu GeistMoindres carrés récursifs pour l'évaluation off-policy d'une politique avec traces d'éligibilité6ème Journées Francophones de Planification, Décision et Apprentissage pour la conduite de systèmes - JFPDA 2011 [article]
Victor Gabillon, Alessandro Lazaric, Mohammad Ghavamzadeh, BSClassification-based Policy Iteration with a Critic [article]
Christophe Thiery, BSLeast-Squares λ Policy Iteration: Bias-Variance Trade-off in Control ProblemsInternational Conference on Machine Learning [article]
BSShould one compute the Temporal Difference fix point or minimize the Bellman Residual? The unified oblique projection view27th International Conference on Machine Learning - ICML 2010 [article]
Christophe Thiery, BSLeast-Squares λ Policy Iteration : optimisme et compromis biais-variance pour le contrôle optimalJournées Francophones de Planification, Décision et Apprentissage pour la conduite de systèmes [article]
Alain Dutech, BSPartially Observable Markov Decision ProcessesISTE Ltd and John Wiley & Sons Inc [article]
BS, Christophe ThieryPerformance bound for Approximate Optimistic Policy Iteration [article]
Christophe Thiery, BSImprovements on Learning Tetris with Cross EntropyInternational Computer Games Association Journal [article]
Christophe Thiery, BSUne approche modifiée de Lambda-Policy IterationJournées Francophones Planification Décision Apprentissage [article]
Christophe Thiery, BSConstruction d'un joueur artificiel pour TetrisRevue des Sciences et Technologies de l'Information - Série RIA : Revue d'Intelligence Artificielle [article]
Christophe Thiery, BSBuilding Controllers for TetrisInternational Computer Games Association Journal [article]
Marek Petrik, BSBiasing Approximate Dynamic Programming with a Lower Discount FactorTwenty-Second Annual Conference on Neural Information Processing Systems -NIPS 2008 [article]
Bernard Girau, Amine Boumaza, BS, Cesar Torres-HuitzilBlock-synchronous harmonic control for scalable trajectory planningI-Tech Publications [article]
Alain Dutech, BSProcessus décisionnels de Markov partiellement observablesLavoisier - Hermes Science Publications [article]
Amine Boumaza, BSAnalyse d'un algorithme d'intelligence en essaim pour le fourragementRevue des Sciences et Technologies de l'Information - Série RIA : Revue d'Intelligence Artificielle [article]
BS, Shie MannorError Reducing Sampling in Reinforcement LearningNIPS-08 Workshop on Model Uncertainty and Risk in Reinforcement Learning [article]
Cesar Torres-Huitzil, Bernard Girau, Amine Boumaza, BSEmbedded harmonic control for trajectory planning in large environmentsInternational Conference on ReConFigurable Computing and FPGAs - ReConFig 08 [article]
Amine Boumaza, BSOptimal control subsumes harmonic controlIEEE International Conference on Robotics and Automation - ICRA 07 [article]
Amine Boumaza, BSConvergence and Rate of Convergence of a Foraging Ant ModelIEEE Congress on Evolutionary Computation - IEEE CEC 2007 [article]
Amine Boumaza, BSConvergence and rate of convergence of a simple ant modelInternational Conference on Autonomous Agents and Multiagent Systems - AAMAS'07 [article]
BSUne condition suffisante pour l'implémentation connexionniste asynchrone1ère Conférence Francophone Neurosciences Computationnelles - NeuroComp [article]
Amine Boumaza, BSOptimal control subsumes harmonic control [article]
BSAsynchronous Neurocomputing for optimal control and reinforcement learning with large state spacesNeurocomputing [article]
Amine Boumaza, BSNavigation, fonctions harmoniques et contrôle optimal stochastiqueCinquièmes Journées Nationales sur Processus Décisionnel de Markov et Intelligence Artificielle - PDMIA 2005 [article]
BSApproche connexionniste du contrôle optimalJEDAI - Journal électronique d'intelligence artificielle [article]
BS, Shie MannorError reducing sampling in reinforcement learning [article]
BSModular self-organization [article]
BSParallel asynchronous distributed computations of optimal control in large state space Markov Decision Processes11th European Symposium on Artificial Neural Networks - ESANN'03 [article]
BSApprentissage de représentation et auto-organisation modulaire pour un agent autonomeThèse de l'Université Henri Poincaré - Nancy 1 [article]
Iadine Chadès, BS, François CharpilletPlanning Cooperative Homogeneous Multiagent System Using Markov Decision Processes5th International Conference on Enterprise Information Systems - ICEIS 2003 [article]
BSModular self-organization for a long-living autonomous agentEighteenth International Joint Conference on Artificial Intelligence - IJCAI'03 [article]
BSA connectionist architecture that adpats its representation to complex tasksInternational Joint Conference on Neural Networks - IJCNN 2002 [article]
BS, François CharpilletCooperative Co-learning: A Model-based Approach for Solving Multi Agent Reinforcement Problems14th IEEE International Conference on Tools with Artificial Intelligence - ICTAI 2002 [article]
Iadine Chadès, BS, François CharpilletA Heuristic Approach for Solving Decentralized-POMDP : Assessment on the Pursuit ProblemACM Symposium on Applied Computing - SAC'2002 [article]
BS, François CharpilletCoevolutive Planning In Markov Decision ProcessesFirst International Joint Conference on Autonomous Agents and Multiagent Systems - AAMAS 2002 [article]
Alain Dutech, BSLearning to use contextual information for solving POMDPEuropean Workshop on Reinforcement Learning - EWRL-5 [article]
BSAuto-organisation modulaire d'une architecture intelligenteValgo numéro 01-02, La revue en ligne de l'Association des Connexionnistes en THèse [article]
BS, Frédéric Alexandre, François Charpillet, Stéphane VialleModélisation stochastique d'une population de neurones, méta-apprentissage dans un problème de classificationNeurosciences et sciences de l'ingénieur [article]