AIPython★ 581
redai-studio/Relax
РЕЛАКС: АСИНХРОННЫЙ RL ДЛЯ МУЛЬТИМОДАЛЬНОЙ ОБУЧЕНИЕ
Relax — асинхронный движок reinforcement learning для масштабированного пост‑обучения агентов. Поддерживает распределённое обучение, мультиагентные сценарии и работу с различными модальностями через GRPO.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Асинхронно обучает агентов с применением GRPO для ускорения сходимости.
- Обеспечивает масштабируемое распределённое обучение на многих узлах с отказоустойчивостью.
- Позволяет только агентам сотрудничать в тексте, изображении и аудио.
- Выполняет пост‑обучение моделей LLM, сохраняя знания и адаптируя.
#agentic-rl#distributed-training#grpo#multi-agent#multimodal#post-training#ray-serve#reinforcement-learning#rlhf
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram