Một khối, nhiều độ sâu: Recurrent Vision Transformers với Depth-Programmed Experts
One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts
Đoạn trích bài viết
Trong công trình này, chúng tôi chứng minh rằng một khối Transformer đơn lẻ, khi được áp dụng lặp lại định kỳ, có thể đạt độ chính xác ngang ngửa với bộ mã hóa thị giác đủ độ sâu ở mức FLOP suy luận tương đương mà không cần chắt lọc đặc trưng trung gian.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.