ai·radar
Bản tin sáng Tra cứu

OmniCapBench: Một khuôn khổ đánh giá có cấu trúc sâu để ghi chú âm thanh và hình ảnh tinh tế

OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning

Đoạn trích bài viết

Các mô hình ngôn ngữ lớn đa phương tiện (MLLM) đang phát triển nhanh chóng hướng tới lý luận âm thanh - thị giác liên tục, tạo ra nhu cầu cấp thiết cho các đánh giá cho thấy giới hạn khả năng của họ.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc