Việc xác định nguồn không phải là kiểm tra độ phù hợp: đo lường giới hạn phân loại dữ liệu tổng hợp
Source Identification Is Not Fitness Testing: Measuring the Limits of Synthetic-Data Attribution
Đoạn trích bài viết
Việc huấn luyện lặp đi lặp lại về dữ liệu được tạo ra bởi mô hình có thể làm suy giảm mô hình sau này. Một câu trả lời có thể là sử dụng nguồn gốc khi quyết định các ví dụ được tạo ra để sử dụng lại. Chúng tôi kiểm tra cả độ đáng tin cậy mà nguồn gốc có thể được phục hồi và liệu nó có giúp xác định dữ liệu huấn luyện tốt hơn hay không.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.