ai·radar
Bản tin sáng Tra cứu

SemanTok: Các token ngữ nghĩa dự đoán cho việc tạo ra video tự động hiệu quả

SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

Đoạn trích bài viết

Các mô hình thế giới dựa trên video gần đây kết hợp khả năng mở rộng của dự đoán tự động (AR) với chất lượng thị giác của mô hình phổ biến. Sự lựa chọn của tokeniser cảnh là tối quan trọng cho hiệu suất tối ưu của mỗi trong số này, cả về độ trung thành và ngữ nghĩa.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc