Lợi nhuận và sự sụp đổ trong việc cất cất trên chính sách: Một viễn cảnh học tập tăng cường
Gains and Collapse in On-Policy Distillation:A Reinforcement Learning Perspective
Đoạn trích bài viết
Việc chưng cất trên chính sách (OPD) đã trở thành một phương pháp tiếp cận quan trọng cho mô hình ngôn ngữ sau huấn luyện. Tuy nhiên, mặc dù tăng hiệu suất, OPD cũng có thể sụp đổ thành quá lâu và lặp đi lặp lại, và cơ chế cơ bản của những kết quả khác nhau này vẫn chưa được hiểu rõ.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.