Новая работа лауреата премии Тьюринга Саттона: Использование формулы 1967 года для устранения важного недостатка потокового обучения с подкреплением
В декабре 2024 года исследователи из Университета Альберты столкнулись с проблемой «потокового барьера» в глубоком обучении с подкреплением: при обучении в потоковом режиме (без буфера воспроизведения и с размером пакета, равным 1) обучение становилось нестабильным. Год спустя, команда с участием лауреата премии Тьюринга Ричарда Саттона предложила решение — метод «интенциональных обновлений» (Intentional Updates).
Идея, восходящая к алгоритму NLMS 1967 года, заключается в том, чтобы напрямую задавать желаемое изменение выхода функции (например, уменьшение ошибки прогноза на фиксированный процент), а затем вычислять необходимый размер шага обновления параметров, а не наоборот. Этот подход обеспечивает стабильное влияние каждого обновления на результат.
Метод был применён как к обучению ценности (Intentional TD/Q), так и к обучению политики (Intentional Policy Gradient), сочетаясь с такими техниками, как RMSProp и следы пригодности. В экспериментах на задачах непрерывного (MuJoCo) и дискретного (Atari) управления алгоритмы показали производительность, сопоставимую с современными методами (SAC, DQN), использующими большие буферы, но при значительно меньших вычислительных затратах и с лучшей устойчивостью.
Хотя метод демонстрирует высокую эффективность и робастность, авторы отмечают потенциальную проблему смещения в обновлениях политики и необходимость дальнейшей работы для её устранения. «Интенциональные обновления» представляют собой значительный шаг в сторону создания ИИ, способного к непрерывному и эффективному онлайн-обучению, аналогичному естественному обучению живых существ.
marsbit05/10 06:32