AIOpenEdge ABL★ 328
avifenesh/memra-archive-20260901
MEMRA ARCHIVE CUDA INFERENCE
Rust + CUDA inference engine for RTX PRO 6000 Blackwell and RTX 5090. Serves safetensors and GGUF via OpenAI‑compatible API with per‑device tuned defaults and speculative decode byte‑identical to plain decode. Hosted at inference.tiyuvta.ai.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Запускает модели safetensors и GGUF на RTX PRO 6000 Blackwell и RTX 5090 через CUDA ядра.
- Предоставляет OpenAI‑совместимый API для генерации текста с задержкой ниже 10 мс на токен.
- Автоматически настраивает ядра под каждое устройство (per‑device tuned defaults).
- Спеkulative декодирование выдаёт байт‑идентичный результат обычному декоду.
#blackwell#cuda#gemma#gguf#gpu-kernels#inference-engine#llm#llm-inference#llm-serving#moe#nvfp4#openai-api
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram