Làm cho LLM nói những gì họ nghĩ: đo lường và cải thiện sự phù hợp của sự giải thích của CoT
Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment
Đoạn trích bài viết
Các dấu vết chuỗi suy nghĩ (CoT) thường phục vụ như một đại diện cho cách các mô hình ngôn ngữ lớn (LLM) đến với câu trả lời của họ. Tuy nhiên, bằng chứng ngày càng tăng cho thấy rằng CoT của các mô hình thường không phản ánh tính toán nội bộ của họ và có thể được thay đổi mà không ảnh hưởng đến câu trả lời cuối cùng của họ.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.