SpecFold: Gập sự dư thừa đa nhánh để giải mã suy đoán nhanh hơn trong các mô hình ngôn ngữ khuếch tán
SpecFold: Folding Multi-Branch Redundancy for Faster Speculative Decoding in Diffusion Language Models
Đoạn trích bài viết
Các mô hình ngôn ngữ lớn khuếch tán (DLLM) tạo văn bản thông qua quá trình khử nhiễu khối lặp đi lặp lại, và việc giải mã suy đoán đa nhánh đẩy nhanh quá trình này bằng cách xác minh một nhánh chính cùng với nhiều nhánh phác thảo trong một lượt chuyển tiếp duy nhất.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.