ai·radar
Bản tin sáng Tra cứu

Làm thế nào để Loop MoE: Thẳng các chuyên gia, giải phóng sự chú ý

How to Loop MoE: Flatten the Experts, Untie the Attention

Đoạn trích bài viết

Looped Transformers sử dụng lại một khối lớp nhiều lần: bằng cách chi tiêu thêm tính toán, họ đẩy một mô hình có kích thước cố định hơn nữa, và do đó sử dụng các tham số của nó đầy đủ hơn; trong khi các mô hình hỗn hợp chuyên gia (MoE) hiếm có chỉ kích hoạt một vài trong nhiều chuyên gia cho mỗi token.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc