LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches
LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches
Đoạn trích bài viết
Học tập tăng cường (RL) đã nâng cao đáng kể khả năng của các mô hình ngôn ngữ lớn (LLM), nhưng nhu cầu bộ nhớ của nó vẫn là một rào cản để áp dụng rộng hơn. Chúng tôi giới thiệu LoGRA, một cách tiếp cận cho RL sau huấn luyện làm giảm trí nhớ bằng cách giữ lại các tín hiệu học tập hữu ích trong bản phác thảo gradient hạng thấp.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.