R_REDDYX.XYZ
AIGo202

defilantech/LLMKube

LLMKUBE: LLM В KUBERNETES

LLMKube - оператор Kubernetes для LLM‑инференса на смешанном GPU‑флоте: NVIDIA CUDA, AMD Vulkan, Apple Silicon Metal. Поддерживает llama.cpp, vLLM, TGI, mlx-server, мульти‑GPU шардинг, кэш моделей и OpenAI‑совместимые API.

// КЛЮЧЕВЫЕ ОСОБЕННОСТИ

  • Запускает LLM‑инференс на NVIDIA, AMD и Apple GPU через оператор Kubernetes.
  • Поддерживает рантаймы llama.cpp, vLLM, TGI и mlx-server с выбором под нагрузку.
  • Обеспечивает мульти‑GPU шардинг моделей и автоматическое кэширование GGUF‑файлов.
  • Дает OpenAI‑совместимые REST endpoints, совместимые с клиентами chat.completions.
#ai#apple-silicon#autoscaling#edge-computing#gguf#gpu#homelab#inference#kubernetes#kubernetes-operator#llama-cpp#llm
Открыть на GitHub →

Новые репозитории каждые 30 минут

REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.

Подписаться в Telegram
← Весь каталог

// ПОХОЖИЕ РЕПОЗИТОРИИ

Claw Code: Быстрый код192068Автоматизация процессов n8n187437DeepSeek Плагин Фреймворк186631Оптимизация агентского ИИ186627AutoGPT: AI-агент184170Всё для Claude Code179304

← ВЕСЬ КАТАЛОГ

defilantech/LLMKube — LLMKUBE: LLM В KUBERNETES | REDDYX AI