ai·radar
Bản tin sáng Tra cứu

Từ Pareto đến Ưu tiên: Scaling thời gian thử nghiệm cá nhân thông qua phát hiện chính sách agent bị giảm giá

From Pareto to Preference: Personalized Test-Time Scaling via Amortized Agentic Policy Discovery

Đoạn trích bài viết

Scaling thời gian thử nghiệm (TTS) cải thiện khả năng lý luận của các mô hình ngôn ngữ lớn bằng cách phân bổ tính toán suy luận bổ sung.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc