AIPython★ 283
eth-sri/matharena
ОЦЕНКА LLM НА МАТЕМАТИЧЕСКИХ ОЛИМПИАДАХ
matharena оценивает LLMs на свежих задачах математических олимпиад. Загружает проблемы, запускает модели через API и считает точность решений в JSON.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Автоматически собирает задачи с последних IMO, Putnam, AMC через API или веб-скрейпинг.
- Запускает LLM (OpenAI, Claude, локальные HF) и сохраняет ответы в структурированном JSON.
- Сравнивает ответы с эталонами, считая точность, частичную правильность и время выполнения.
- Позволяет менять модели и задачи через CLI‑config или env‑переменные.
#evaluating-models#llm
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram