ai·radar
Bản tin sáng Tra cứu

Việc xác định nguồn không phải là kiểm tra độ phù hợp: đo lường giới hạn phân loại dữ liệu tổng hợp

Source Identification Is Not Fitness Testing: Measuring the Limits of Synthetic-Data Attribution

Đoạn trích bài viết

Việc huấn luyện lặp đi lặp lại về dữ liệu được tạo ra bởi mô hình có thể làm suy giảm mô hình sau này. Một câu trả lời có thể là sử dụng nguồn gốc khi quyết định các ví dụ được tạo ra để sử dụng lại. Chúng tôi kiểm tra cả độ đáng tin cậy mà nguồn gốc có thể được phục hồi và liệu nó có giúp xác định dữ liệu huấn luyện tốt hơn hay không.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc