R_REDDYX.XYZ
AIPython215

jsdhwfmax/EvalForge

EVALFORGE — ОЦЕНКА LLM В CI

EvalForge — инструмент для оценки LLM в CI/CD. Предоставляет независимые от оценщика доказательства, гейты регрессии базовых линий и отчёты JSON, JUnit, SARIF. Интегрируется с GitHub Actions.

// КЛЮЧЕВЫЕ ОСОБЕННОСТИ

  • Evaluator-neutral evidence для LLM оценки
  • Baseline regression gates в CI пайплайне
  • Отчёты JSON, JUnit, SARIF для CI
  • Интеграция с GitHub Actions из коробки
#ai-evaluation#github-actions#junit#llm-evaluation#mlops#python#quality-gates#rag#sarif#testing
Открыть на GitHub →

Новые репозитории каждые 30 минут

REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.

Подписаться в Telegram
← Весь каталог

// ПОХОЖИЕ РЕПОЗИТОРИИ

Claw Code: Быстрый код192068Автоматизация процессов n8n187437DeepSeek Плагин Фреймворк186631Оптимизация агентского ИИ186627AutoGPT: AI-агент184170Всё для Claude Code179304

← ВЕСЬ КАТАЛОГ

jsdhwfmax/EvalForge — EVALFORGE — ОЦЕНКА LLM В CI | REDDYX…