SemanTok: Các token ngữ nghĩa dự đoán cho việc tạo ra video tự động hiệu quả
SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation
Đoạn trích bài viết
Các mô hình thế giới dựa trên video gần đây kết hợp khả năng mở rộng của dự đoán tự động (AR) với chất lượng thị giác của mô hình phổ biến. Sự lựa chọn của tokeniser cảnh là tối quan trọng cho hiệu suất tối ưu của mỗi trong số này, cả về độ trung thành và ngữ nghĩa.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.