Loading market data...

Badacze Meta proponują naprawę uczenia przez wzmacnianie w optymalizacji kodu

Badacze Meta proponują naprawę uczenia przez wzmacnianie w optymalizacji kodu

Dlaczego uczenie przez wzmacnianie ma problemy z kodem

Uczenie przez wzmacnianie, w skrócie RL, wykazało obiecujące wyniki w takich dziedzinach jak gry i robotyka. Jednak jeśli chodzi o optymalizację kodu — sprawienie, by działał szybciej lub zużywał mniej pamięci — RL często napotyka ścianę. Badacze Meta wyjaśniają, że problem leży w sposobie, w jaki agenci RL eksplorują możliwe zmiany w kodzie. Przestrzeń poszukiwań jest ogromna, a małe zmiany mogą mieć nieprzewidywalny wpływ na wydajność. Tradycyjne sygnały nagrody nie dają agentowi wystarczających wskazówek, aby konsekwentnie znajdować efektywne rozwiązania.

Proponowane rozwiązanie

Artykuł przedstawia nową metodę mającą na celu przezwyciężenie tych przeszkód. Zamiast polegać wyłącznie na metodzie prób i błędów, podejście to wprowadza ustrukturyzowany sposób kierowania agentem RL w stronę lepszych transformacji kodu. Badacze opisują technikę łączącą wyuczone heurystyki z bardziej ukierunkowan