Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes
Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes
Đoạn trích bài viết
Tự chưng cất trên chính sách gần đây đã nổi lên như một cách tiếp cận hiệu quả để cải thiện lý luận mô hình ngôn ngữ bằng cách giám sát sinh viên có phiên bản đóng băng hoặc EMA của bản thân mà nhận được thông tin đặc quyền. Tuy nhiên, ứng dụng của nó đối với các mô hình ngôn ngữ lớn đa phương thức (MLLMs) vẫn còn rộng rãi.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.