AIPython★ 442
chi2liu/ABC-GRPO
ABC-GRPO: ВСЕКВАДРАНТНОЕ ОГРАНИЧЕНИЕ GRPO
ABC-GRPO реализует метод все‑квадрантного ограниченного клиппинга для GRPO, улучшая стабильность обучения больших языковых моделей. Код основан на статье arXiv:2601.03895 и написан на Python. Проект уже собрал 442 звезды на GitHub.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Реализует все‑квадрантное ограниченное клиппинг GRPO для стабильного RLHF.
- Обеспечивает улучшенную стабильность обучения больших языковых моделей.
- Предоставляет готовый Python‑модуль с примером интеграции в HuggingFace Transformers.
- Включает скрипты для воспроизведения экспериментов из arXiv:2601.03895
#grpo#llm#reinforcement-learning#rlhf
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram