SlimWise: Tháo gỡ chuyên gia cắt qua prefill và giải mã cho hiệu quả MoE phục vụ
SlimWise: Decoupling Expert Pruning Across Prefill and Decode for Efficient MoE Serving
Đoạn trích bài viết
Các mô hình hỗn hợp các chuyên gia (MoE) kích hoạt ít chuyên gia mỗi token, nhưng việc giải mã hàng loạt có thể truy cập gần như toàn bộ hồ sơ chuyên gia, làm cho lưu lượng chuyên gia trọng số trở thành một nút thắt lớn.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.