AIPython★ 215
jsdhwfmax/EvalForge
EVALFORGE — ОЦЕНКА LLM В CI
EvalForge — инструмент для оценки LLM в CI/CD. Предоставляет независимые от оценщика доказательства, гейты регрессии базовых линий и отчёты JSON, JUnit, SARIF. Интегрируется с GitHub Actions.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Evaluator-neutral evidence для LLM оценки
- Baseline regression gates в CI пайплайне
- Отчёты JSON, JUnit, SARIF для CI
- Интеграция с GitHub Actions из коробки
#ai-evaluation#github-actions#junit#llm-evaluation#mlops#python#quality-gates#rag#sarif#testing
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram