iADD: Cải thiện sự sắp xếp và đa dạng trong tối ưu hóa chính sách truyền thông
iADD: Improving Alignment and Diversity in Diffusion Policy Optimization
Đoạn trích bài viết
Việc tăng cường học tập dựa trên huấn luyện sau các mô hình phân tán, chẳng hạn như Denoising Diffusion Policy Optimization (DDPO), tối ưu hóa một quá trình phân tán ngược dưới chức năng phần thưởng. Tuy nhiên, các cách tiếp cận hiện tại để tối ưu hóa phần thưởng làm như vậy với chi phí của sự đa dạng và chất lượng.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.