Разностное обучение по времени
Алгоритм TD(λ)
Обобщение методов TD, которое взвешивает n-кортежи будущих вознаграждений в соответствии с фактором следа элигибильности λ, позволяя непрерывный компромисс между TD(0) и Монте-Карло.
← Назад