ai·radar
Bản tin sáng Tra cứu

LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches

LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches

Đoạn trích bài viết

Học tập tăng cường (RL) đã nâng cao đáng kể khả năng của các mô hình ngôn ngữ lớn (LLM), nhưng nhu cầu bộ nhớ của nó vẫn là một rào cản để áp dụng rộng hơn. Chúng tôi giới thiệu LoGRA, một cách tiếp cận cho RL sau huấn luyện làm giảm trí nhớ bằng cách giữ lại các tín hiệu học tập hữu ích trong bản phác thảo gradient hạng thấp.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc