Dlaczego uczenie przez wzmacnianie ma problemy z kodem
Uczenie przez wzmacnianie, w skrócie RL, wykazało obiecujące wyniki w takich dziedzinach jak gry i robotyka. Jednak jeśli chodzi o optymalizację kodu — sprawienie, by działał szybciej lub zużywał mniej pamięci — RL często napotyka ścianę. Badacze Meta wyjaśniają, że problem leży w sposobie, w jaki agenci RL eksplorują możliwe zmiany w kodzie. Przestrzeń poszukiwań jest ogromna, a małe zmiany mogą mieć nieprzewidywalny wpływ na wydajność. Tradycyjne sygnały nagrody nie dają agentowi wystarczających wskazówek, aby konsekwentnie znajdować efektywne rozwiązania.
Proponowane rozwiązanie
Artykuł przedstawia nową metodę mającą na celu przezwyciężenie tych przeszkód. Zamiast polegać wyłącznie na metodzie prób i błędów, podejście to wprowadza ustrukturyzowany sposób kierowania agentem RL w stronę lepszych transformacji kodu. Badacze opisują technikę łączącą wyuczone heurystyki z bardziej ukierunkowan




