Meta đã công bố một bài báo mới xác định lý do vì sao học tăng cường thường thất bại trong tối ưu hóa mã và đưa ra phương pháp khắc phục những hạn chế đó. Công trình này có thể thay đổi cách phát triển phần mềm bằng cách làm cho việc cải thiện mã tự động trở nên đáng tin cậy hơn.
Vì sao học tăng cường gặp khó khăn với mã
Học tăng cường, hay RL, đã cho thấy tiềm năng trong các lĩnh vực như chơi game và robot. Nhưng khi tối ưu hóa mã — làm cho mã chạy nhanh hơn hoặc sử dụng ít bộ nhớ hơn — RL thường gặp phải rào cản. Các nhà nghiên cứu của Meta giải thích rằng vấn đề nằm ở cách các tác tử RL khám phá các thay đổi mã có thể. Không gian tìm kiếm là rất lớn, và những thay đổi nhỏ có thể có tác động không thể đoán trước đến hiệu suất. Tín hiệu phần thưởng truyền thống không cung cấp cho




