AIPython★ 38
weicj/vLLM-2080Ti-Definitive
vLLM для RTX 2080Ti
Оптимизированный runtime vLLM для двух видеокарт RTX 2080 Ti 22 ГБ с NVLink, позволяющий запускать модели 27 млрд и 31 млрд параметров локально с throughput >100 токенов/сек и контекстом до 262 К токенов.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Поддержка двух видеокарт RTX 2080 Ti 22 ГБ через NVLink для объединения памяти и вычислительной мощности.
- Запуск локальной инференс-модели 27B/31B с пропускной способностью >100 токенов/сек на один запрос.
- Нативный контекст до 262K токенов без сегментации, обеспечивающий работу с длинными промптами.
- Оптимизированное ядро vLLM с kernel fusion и поддержкой int8/float16 для максимальной производительности.
Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram