Comment une IA apprend-elle à jouer ? Le principe de l'apprentissage par renforcement
En 2016, un programme informatique a battu le champion du monde de Go — un jeu dont la complexité dépasse celle des échecs par plusieurs ordres de grandeur. Ce programme n'avait pas été programmé avec des règles explicites. Il avait appris , par essais et erreurs, exactement comme un enfant qui touche une plaque chaude et décide de ne plus recommencer. Cette méthode s'appelle l'apprentissage par renforcement, et elle est au cœur de certaines des avancées les plus spectaculaires de l'intelligence artificielle moderne. Photo by Jona on Unsplash Qu'est-ce que l'apprentissage par renforcement exactement ? La logique de la récompense et de la punition L'apprentissage par renforcement (souvent abrégé RL, pour Reinforcement Learning ) repose sur une idée simple : un agent — le programme — interagit avec un environnement, prend des décisions, et reçoit en retour un signal de récompense ou de pénalité. L'objectif est d...