R_REDDYX.XYZ
AIPython283

eth-sri/matharena

ОЦЕНКА LLM НА МАТЕМАТИЧЕСКИХ ОЛИМПИАДАХ

matharena оценивает LLMs на свежих задачах математических олимпиад. Загружает проблемы, запускает модели через API и считает точность решений в JSON.

// КЛЮЧЕВЫЕ ОСОБЕННОСТИ

  • Автоматически собирает задачи с последних IMO, Putnam, AMC через API или веб-скрейпинг.
  • Запускает LLM (OpenAI, Claude, локальные HF) и сохраняет ответы в структурированном JSON.
  • Сравнивает ответы с эталонами, считая точность, частичную правильность и время выполнения.
  • Позволяет менять модели и задачи через CLI‑config или env‑переменные.
#evaluating-models#llm
Открыть на GitHub →

Новые репозитории каждые 30 минут

REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.

Подписаться в Telegram
← Весь каталог

// ПОХОЖИЕ РЕПОЗИТОРИИ

Claw Code: Быстрый код192068Автоматизация процессов n8n187437DeepSeek Плагин Фреймворк186631Оптимизация агентского ИИ186627AutoGPT: AI-агент184170Всё для Claude Code179304

← ВЕСЬ КАТАЛОГ

eth-sri/matharena — ОЦЕНКА LLM НА МАТЕМАТИЧЕСКИХ…