masinõppe meetod, kus arvutisüsteem (agent) õpib tundmatus keskkonnas iseseisvalt tegutsema katse-eksituse meetodil, saades oma tegevuse tulemustele tagasisidet kas preemia või karistusena, et tuletada optimaalne käitumisstrateegia (põhimõte) pikaajalise positiivse kogutagasiside maksimeerimiseks