R_REDDYX.XYZ
AIOpenEdge ABL328

avifenesh/memra-archive-20260901

MEMRA ARCHIVE CUDA INFERENCE

Rust + CUDA inference engine for RTX PRO 6000 Blackwell and RTX 5090. Serves safetensors and GGUF via OpenAI‑compatible API with per‑device tuned defaults and speculative decode byte‑identical to plain decode. Hosted at inference.tiyuvta.ai.

// КЛЮЧЕВЫЕ ОСОБЕННОСТИ

  • Запускает модели safetensors и GGUF на RTX PRO 6000 Blackwell и RTX 5090 через CUDA ядра.
  • Предоставляет OpenAI‑совместимый API для генерации текста с задержкой ниже 10 мс на токен.
  • Автоматически настраивает ядра под каждое устройство (per‑device tuned defaults).
  • Спеkulative декодирование выдаёт байт‑идентичный результат обычному декоду.
#blackwell#cuda#gemma#gguf#gpu-kernels#inference-engine#llm#llm-inference#llm-serving#moe#nvfp4#openai-api
Открыть на GitHub →

Новые репозитории каждые 30 минут

REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.

Подписаться в Telegram
← Весь каталог

// ПОХОЖИЕ РЕПОЗИТОРИИ

Claw Code: Быстрый код192068Автоматизация процессов n8n187437DeepSeek Плагин Фреймворк186631Оптимизация агентского ИИ186627AutoGPT: AI-агент184170Всё для Claude Code179304

← ВЕСЬ КАТАЛОГ

avifenesh/memra-archive-20260901 — MEMRA ARCHIVE CUDA…