ReSPO: Tối ưu hóa chính sách theo dõi được thay đổi để giảm đói theo cấp trong học tập ngoài chính sách
ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning
Đoạn trích bài viết
Học tập tăng cường từ phần thưởng có thể xác minh (RLVR) thường sử dụng lại các triển khai trong nhiều cập nhật chính sách, làm tăng sự không phù hợp giữa chính sách hiện tại và chính sách tạo dữ liệu.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.