ai·radar
Bản tin sáng Tra cứu

SlimWise: Tháo gỡ chuyên gia cắt qua prefill và giải mã cho hiệu quả MoE phục vụ

SlimWise: Decoupling Expert Pruning Across Prefill and Decode for Efficient MoE Serving

Đoạn trích bài viết

Các mô hình hỗn hợp các chuyên gia (MoE) kích hoạt ít chuyên gia mỗi token, nhưng việc giải mã hàng loạt có thể truy cập gần như toàn bộ hồ sơ chuyên gia, làm cho lưu lượng chuyên gia trọng số trở thành một nút thắt lớn.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc