Từ Pareto đến Ưu tiên: Scaling thời gian thử nghiệm cá nhân thông qua phát hiện chính sách agent bị giảm giá
From Pareto to Preference: Personalized Test-Time Scaling via Amortized Agentic Policy Discovery
Đoạn trích bài viết
Scaling thời gian thử nghiệm (TTS) cải thiện khả năng lý luận của các mô hình ngôn ngữ lớn bằng cách phân bổ tính toán suy luận bổ sung.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.