OmniCapBench: Một khuôn khổ đánh giá có cấu trúc sâu để ghi chú âm thanh và hình ảnh tinh tế
OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning
Đoạn trích bài viết
Các mô hình ngôn ngữ lớn đa phương tiện (MLLM) đang phát triển nhanh chóng hướng tới lý luận âm thanh - thị giác liên tục, tạo ra nhu cầu cấp thiết cho các đánh giá cho thấy giới hạn khả năng của họ.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.