AIPython★ 231
microsoft/SWE-bench-Live
SWE-BENCH LIVE: ОЦЕНКА LLM В КОДИНГЕ
SWE-bench Live — бенчмарк для оценки AI-агентов в решении реальных задач из GitHub. Автоматическая верификация кода и сравнение любых моделей.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Оценивает AI на реальных задачах из GitHub-репозиториев
- Автоматически проверяет корректность решений по тестам
- API для тестирования любой LLM через OpenAI-совместимый интерфейс
- Коммиты в репозиторий для каждого пройденного теста
#benchmark#llm#swe
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram