R_REDDYX.XYZ
AIPython231

microsoft/SWE-bench-Live

SWE-BENCH LIVE: ОЦЕНКА LLM В КОДИНГЕ

SWE-bench Live — бенчмарк для оценки AI-агентов в решении реальных задач из GitHub. Автоматическая верификация кода и сравнение любых моделей.

// КЛЮЧЕВЫЕ ОСОБЕННОСТИ

  • Оценивает AI на реальных задачах из GitHub-репозиториев
  • Автоматически проверяет корректность решений по тестам
  • API для тестирования любой LLM через OpenAI-совместимый интерфейс
  • Коммиты в репозиторий для каждого пройденного теста
#benchmark#llm#swe
Открыть на GitHub →

Новые репозитории каждые 30 минут

REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.

Подписаться в Telegram
← Весь каталог

// ПОХОЖИЕ РЕПОЗИТОРИИ

Claw Code: Быстрый код192068Автоматизация процессов n8n187437DeepSeek Плагин Фреймворк186631Оптимизация агентского ИИ186627AutoGPT: AI-агент184170Всё для Claude Code179304

← ВЕСЬ КАТАЛОГ

microsoft/SWE-bench-Live — SWE-BENCH LIVE: ОЦЕНКА LLM В…