ai·radar
Bản tin sáng Tra cứu

Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

Đoạn trích bài viết

Tự chưng cất trên chính sách gần đây đã nổi lên như một cách tiếp cận hiệu quả để cải thiện lý luận mô hình ngôn ngữ bằng cách giám sát sinh viên có phiên bản đóng băng hoặc EMA của bản thân mà nhận được thông tin đặc quyền. Tuy nhiên, ứng dụng của nó đối với các mô hình ngôn ngữ lớn đa phương thức (MLLMs) vẫn còn rộng rãi.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc