AIPython★ 465
syv-ai/qwen38-27b-rtx3090
Qwen3‑27B на RTX 3090
Проект демонстрирует запуск модели Qwen3‑27B (Qwen3.8) на одной видеокарте RTX 3090 через vLLM, обеспечивая высокую пропускную способность и поддержку длинного контекста.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Запуск Qwen3‑27B на одной RTX 3090 с vLLM и int8 tensor‑core GEMMs
- Пропускная способность ~1 000 токен/с при 64 одновременных запросах
- Контекст до 262 k токенов с int4 LM head и split‑KV проверкой внимания
- Патчи, скрипты реквантизации и бенчмарки для лёгкого воспроизведения
#kv-cache#llm-inference#local-llm#quantization#qwen#qwen3#rtx-3090#speculative-decoding#vllm
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram