ai·radar
Bản tin sáng Tra cứu

Làm cho LLM nói những gì họ nghĩ: đo lường và cải thiện sự phù hợp của sự giải thích của CoT

Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment

Đoạn trích bài viết

Các dấu vết chuỗi suy nghĩ (CoT) thường phục vụ như một đại diện cho cách các mô hình ngôn ngữ lớn (LLM) đến với câu trả lời của họ. Tuy nhiên, bằng chứng ngày càng tăng cho thấy rằng CoT của các mô hình thường không phản ánh tính toán nội bộ của họ và có thể được thay đổi mà không ảnh hưởng đến câu trả lời cuối cùng của họ.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc