ПОЧЕМУ АРЕНДА, А НЕ ПОКУПКА
Считаем на пальцах. H100 SXM в 2026 стоит около 25-30k$ за карту, а полноценная 8-GPU нода с NVLink, быстрым сетевым стораджем и охлаждением — это уже сотни тысяч долларов капзатрат плюс электричество, стойка, обслуживание. Карта морально устаревает за 2-3 года: Blackwell (B200) уже в проде, GB200-стойки развёрнуты у крупных облаков, на горизонте следующее поколение.
Аренда GPU снимает три боли сразу: нулевой капекс, эластичность (взял 64 карты на выходные под большой прогон — вернул), и доступ к железу, которое иначе ждёшь месяцами. Покупка оправдана только при постоянной загрузке 24/7 годами — тогда точка окупаемости где-то за 12-18 месяцев непрерывного использования. Если ваши GPU простаивают хоть треть времени, облако выгоднее математически.
ТИПЫ ПРОВАЙДЕРОВ: КТО ЕСТЬ КТО
Рынок аренды видеокарт в 2026 делится на три чётких лагеря, и путать их — типичная ошибка новичка, которая стоит денег.
- Гиперскейлеры (AWS, GCP, Azure) — максимальная надёжность, интеграция с остальной инфраструктурой, enterprise-SLA. Платите за это премию 2-4x. Оправдано, когда GPU — часть большого продакшн-стека.
- Специализированные GPU-облака (Lambda, CoreWeave, Crusoe, Nebius) — заточены именно под ML. Быстрый InfiniBand между нодами, готовые образы с CUDA/PyTorch, вменяемые цены. Золотая середина для серьёзного обучения модели.
- Маркетплейсы и децентрализованные сети (Vast.ai, RunPod, TensorDock, io.net) — агрегируют чужое железо, включая карты частников и дата-центров второго эшелона. Самые низкие цены, но выше вариативность качества и меньше гарантий.
Свежие релизы новых провайдеров и инструментов вокруг ML-инфраструктуры отслеживаются в каталоге REDDYX — рынок в 2026 меняется каждую неделю.
СРАВНЕНИЕ ЦЕН НА H100 И НЕ ТОЛЬКО
Ниже ориентировочные цены за один GPU-час по состоянию на 2026 год. Это усреднённые значения по замерам сообщества и публичным прайсам — спот и региональные тарифы гуляют, всегда проверяйте на дату аренды. Цены на GPU на маркетплейсах меняются буквально по часам в зависимости от спроса.
| Провайдер | Тип | H100 (on-demand, $/час) | A100 80GB ($/час) | Спот/дешёвый режим |
|---|---|---|---|---|
| AWS (p5) | Гиперскейлер | ~$12-13 (в пересчёте с 8x-ноды) | ~$5-7 | Spot -60-70% |
| GCP (a3) | Гиперскейлер | ~$11-12 | ~$4-6 | Preemptible |
| Azure (ND) | Гиперскейлер | ~$11-13 | ~$5-6 | Spot |
| Lambda | GPU-облако | ~$2.5-3.5 | ~$1.3-1.8 | Reserved дешевле |
| CoreWeave | GPU-облако | ~$3-5 | ~$2 | Reserved |
| RunPod | Маркетплейс | ~$2-3 | ~$1.2-1.7 | Community -30% |
| Vast.ai | Маркетплейс | ~$1.5-2.5 | ~$0.8-1.4 | Interruptible -50% |
Вывод простой: за один и тот же H100 у AWS on-demand вы отдаёте примерно вчетверо больше, чем на Vast.ai. Разница не в кремнии — карта та же самая. Разница в SLA, сети между нодами, поддержке и стабильности. Для одиночного файн-тюна вам эта премия не нужна.
СКОРОСТЬ: ЧТО РЕАЛЬНО ВЛИЯЕТ
Цена за час — половина уравнения. Считать надо стоимость завершённого прогона, а не часа. Медленная нода за $2 может выйти дороже быстрой за $3.
Что убивает throughput
- Межнодовая сеть. При мульти-GPU обучении на 8+ картах узкое место — не сами GPU, а InfiniBand между нодами. У гиперскейлеров и Lambda/CoreWeave это 3200 Gbps NDR InfiniBand. На дешёвом маркетплейсе часто обычный 10-25 Gbps Ethernet — распределённый прогон встаёт колом.
- Storage I/O. Если датасет читается с медленного диска, дорогие H100 простаивают в ожидании данных. Нужен локальный NVMe или быстрый сетевой параллельный сторадж.
- Троттлинг и шеринг. На маркетплейсах хост может делить PCIe или CPU между арендаторами. Замеряйте сами.
Практическое правило 2026: для single-node (до 8 GPU на одной машине с NVLink) берите маркетплейс смело — сеть между нодами не задействована. Для распределённого обучения модели на десятках карт платите за настоящий InfiniBand у Lambda/CoreWeave/гиперскейлера, иначе деньги за GPU-часы сгорят на коммуникации.
КАК ЗАМЕРИТЬ РЕАЛЬНЫЙ THROUGHPUT
Не верьте маркетинговым TFLOPS. Перед тем как гонять многочасовой прогон, за пару минут проверьте, что арендованная карта выдаёт ожидаемое. Вот минимальный скрипт: он греет GPU матричным умножением в bf16 и считает достигнутые TFLOPS.
import torch, time
assert torch.cuda.is_available(), "CUDA не видна"
dev = "cuda"
n = 8192 # размер квадратной матрицы
a = torch.randn(n, n, device=dev, dtype=torch.bfloat16)
b = torch.randn(n, n, device=dev, dtype=torch.bfloat16)
# прогрев
for _ in range(10):
c = a @ b
torch.cuda.synchronize()
iters = 100
t0 = time.perf_counter()
for _ in range(iters):
c = a @ b
torch.cuda.synchronize()
dt = time.perf_counter() - t0
# 2*n^3 флопов на одно матричное умножение
flops = 2 * (n ** 3) * iters
tflops = flops / dt / 1e12
print(f"{torch.cuda.get_device_name(0)}: {tflops:.1f} TFLOPS bf16")
print(f"VRAM: {torch.cuda.get_device_properties(0).total_memory/1e9:.0f} GB")
Здоровый H100 SXM на bf16 матрицах должен показывать сотни TFLOPS. Если видите цифру в разы ниже паспортной — карта троттлит, делится с соседом или что-то не так с драйвером. Лучше узнать это сразу, чем через 6 часов прогона. Дополнительно прогоните проверку сети, если планируете мульти-нод:
# проверка InfiniBand / скорости интерконнекта
ib_write_bw -d mlx5_0 --report_gbits # на паре нод
# и NCCL all-reduce тест как ближе к реальности
nccl-tests/build/all_reduce_perf -b 8 -e 1G -f 2 -g 8
СТРАТЕГИЯ ЭКОНОМИИ: КАК ПЛАТИТЬ МЕНЬШЕ
Несколько приёмов, которые реально режут счёт за облако, проверены на практике.
- Спот/interruptible с чекпоинтами. Прерываемые инстансы дешевле on-demand на 50-70%. Пишите чекпоинт каждые N шагов, тогда прерывание стоит вам минуты, а не всего прогона.
- Правильная точность. bf16/fp8 вместо fp32 — это и быстрее, и меньше VRAM, значит можно взять карту помельче. На Blackwell fp8-обучение даёт ощутимый прирост throughput.
- Не переплачивать за VRAM. Для LoRA/QLoRA файн-тюна средней модели часто хватает одной A100 40GB или даже 4090/L40S за копейки, а не кластера H100.
- Reserved для постоянной нагрузки. Если крутите инференс 24/7 — годовой reserved у Lambda режет цену почти вдвое против on-demand.
- Гасить инстанс. Банально, но топ причина слитых бюджетов — забытая работающая нода на выходных. Ставьте авто-shutdown по простою.
ЧТО ВЫБРАТЬ ПОД ЗАДАЧУ
Короткая матрица решений на 2026 год:
- Учусь / пет-проект / эксперименты: Vast.ai или RunPod Community, спот-режим, одна карта. Дёшево, быстро поднять.
- Серьёзный файн-тюн одной модели (single-node 8x): RunPod Secure Cloud или Lambda on-demand. Стабильно, NVLink на месте.
- Претрейн / распределённое обучение (десятки-сотни GPU): Lambda, CoreWeave, Nebius или гиперскейлер с InfiniBand и reserved-контрактом.
- Продакшн-инференс с SLA: гиперскейлер или Lambda reserved, ближе к вашим пользователям по региону.
Частые вопросы
Сколько стоит арендовать H100 в 2026?
На специализированных GPU-облаках и маркетплейсах — примерно $1.5-3.5 за GPU-час on-demand, спот-режим ещё дешевле. У гиперскейлеров (AWS, GCP, Azure) тот же H100 обходится в $11-13 за час из-за премии за SLA и сеть. Точная цена зависит от региона, объёма и типа контракта.
Выгоднее купить свою GPU или арендовать?
Покупка окупается только при почти круглосуточной загрузке в течение 12-18 месяцев и дольше. Если карта простаивает хотя бы треть времени, аренда в облаке дешевле за счёт нулевого капекса и отсутствия расходов на электричество, охлаждение и обслуживание. Для большинства команд и одиночных разработчиков аренда выгоднее.
Можно ли обучать модель на дешёвом спот-инстансе?
Да, если реализованы чекпоинты. Прерываемые (спот/interruptible) инстансы стоят на 50-70% дешевле, а прерывание при регулярном сохранении состояния стоит лишь минуты потерянного прогресса, а не всего прогона. Для распределённого обучения на многих нодах спот рискованнее — там важна стабильность кластера.
Какая карта нужна для файн-тюна LLM?
Для LoRA/QLoRA средних моделей часто достаточно одной A100 40GB, L40S или даже RTX 4090 при работе в 4-bit. Полный файн-тюн крупных моделей требует H100 80GB и мульти-GPU ноды с NVLink. Считайте по объёму VRAM под веса, оптимизатор и активации, а не по названию карты.
GPU-рынок в 2026 движется быстрее, чем успевают устаревать прайс-листы: новые провайдеры, поколения карт и инструменты для обучения модели появляются постоянно. Если хотите ловить это в реальном времени, а не читать посмертные обзоры — загляните в Telegram-канал REDDYX AI — новые репозитории каждые 30-60 минут.