AIGo★ 202
defilantech/LLMKube
LLMKUBE: LLM В KUBERNETES
LLMKube - оператор Kubernetes для LLM‑инференса на смешанном GPU‑флоте: NVIDIA CUDA, AMD Vulkan, Apple Silicon Metal. Поддерживает llama.cpp, vLLM, TGI, mlx-server, мульти‑GPU шардинг, кэш моделей и OpenAI‑совместимые API.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Запускает LLM‑инференс на NVIDIA, AMD и Apple GPU через оператор Kubernetes.
- Поддерживает рантаймы llama.cpp, vLLM, TGI и mlx-server с выбором под нагрузку.
- Обеспечивает мульти‑GPU шардинг моделей и автоматическое кэширование GGUF‑файлов.
- Дает OpenAI‑совместимые REST endpoints, совместимые с клиентами chat.completions.
#ai#apple-silicon#autoscaling#edge-computing#gguf#gpu#homelab#inference#kubernetes#kubernetes-operator#llama-cpp#llm
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram