ПОЧЕМУ WHISPER ВСЁ ЕЩЁ ЭТАЛОН
Прошло больше трёх лет с релиза Whisper, и на русскоязычном материале он до сих пор бьёт большинство открытых моделей. Причина простая: обучали на огромном мультиязычном корпусе, и русский попал в жирный сегмент. Модель нормально держит акценты, фоновый шум, переключение язык-в-язык (когда посреди речи влетает английский термин) и не разваливается на длинных записях.
Ключевое, что надо понимать в 2026: оригинальный репозиторий openai/whisper — это референс, а не продакшн. Он написан на чистом PyTorch, жрёт память и работает медленно. В реальных пайплайнах его заменили обёртки, которые дают тот же результат в разы быстрее. Свежие форки и релизы движков распознавания речи регулярно всплывают в каталоге REDDYX — оттуда удобно ловить новые чекпоинты и квантизации.
ЛИНЕЙКА МОДЕЛЕЙ: ОТ TINY ДО LARGE-V3
Whisper — это не одна модель, а семейство размеров. Выбор влияет и на качество, и на то, влезет ли всё в вашу видеокарту.
- tiny / base — для черновой расшифровки и realtime на CPU. На русском заметно косячат с терминами и именами.
- small — золотая середина для заметок и черновиков субтитров. Летает даже на среднем GPU.
- medium — рабочая лошадка. Точность уже приличная, ресурсы умеренные.
- large-v3 — максимум качества на русском. Лучше всех держит редкие слова, аббревиатуры, шумную запись. Требует ~10 ГБ VRAM в fp16 (меньше при int8-квантизации).
- large-v3-turbo — облегчённый декодер: почти то же качество, но кратно быстрее. Для большинства задач транскрибации на русском это сейчас дефолтный выбор.
Практика: если у вас не диктофонная запись переговоров с юридическими последствиями, а обычный подкаст или созвон — turbo закрывает 90% сценариев. large-v3 в полном виде берут, когда цена ошибки высокая.
FASTER-WHISPER И WHISPERX: ЧЕМ ЗАМЕНИЛИ ОРИГИНАЛ
faster-whisper
Реализация на движке CTranslate2. Даёт примерно тот же текст, что оригинал, но в несколько раз быстрее и с меньшим потреблением памяти за счёт int8/fp16-квантизации. Это де-факто стандарт для локального STT в 2026. Работает и на GPU, и на CPU — на CPU разница с оригиналом особенно драматичная.
WhisperX
Надстройка поверх faster-whisper, которая решает две боли Whisper: кривые таймкоды и отсутствие разделения по спикерам. WhisperX делает выравнивание на уровне слов (word-level timestamps) через отдельную фонетическую модель и подключает диаризацию. Если вам нужны точные субтитры или расшифровка интервью «кто что сказал» — берите его.
Важная деталь про русский: word-alignment в WhisperX опирается на wav2vec2-модель, и для русского качество выравнивания слегка хуже, чем для английского, но на практике для субтитров годится.
КОД: ЛОКАЛЬНАЯ ТРАНСКРИБАЦИЯ ЗА 15 СТРОК
Рабочий пример на faster-whisper. Ставится в одну команду, гоняет русский из коробки.
pip install faster-whisper
# transcribe.py
from faster_whisper import WhisperModel
# int8 на CPU или float16 на GPU (device="cuda")
model = WhisperModel("large-v3", device="cpu", compute_type="int8")
segments, info = model.transcribe(
"meeting.mp3",
language="ru", # не даём автодетекту ошибаться
vad_filter=True, # режем тишину — быстрее и чище
beam_size=5,
)
print(f"Язык: {info.language} ({info.language_probability:.2f})")
for seg in segments:
print(f"[{seg.start:6.1f} -> {seg.end:6.1f}] {seg.text}")
Два параметра, которые реально влияют на результат на русском: language="ru" (иначе на коротких или шумных кусках автодетект иногда путает язык) и vad_filter=True (VAD выкидывает паузы, что и ускоряет, и убирает галлюцинации Whisper на тишине — известная проблема, когда модель на молчании выдумывает фразы типа «Спасибо за просмотр»).
АЛЬТЕРНАТИВЫ WHISPER В 2026
Whisper не монополист. Под конкретные задачи другие движки объективно лучше.
NVIDIA NeMo / Canary / Parakeet
Семейство моделей NVIDIA заточено под скорость и низкую задержку. Parakeet и Canary показывают отличную точность и очень высокую пропускную способность на GPU. Русский поддержан в мультиязычных вариантах, хотя основной упор у NVIDIA исторически на английский — проверяйте на своих данных.
Vosk
Оффлайн-движок на Kaldi, который бежит вообще без GPU — хоть на Raspberry Pi, хоть в мобилке. Русская модель есть и работает достойно для команд, диктовки и realtime. Точность на грязной длинной речи ниже Whisper, но по требованиям к железу он вне конкуренции.
GigaAM и отечественные модели
Для чисто русского контента стоит смотреть на модели, которые обучали именно на русском корпусе (например, линейка от Сбера). На доменной русской речи узкоспециализированная модель иногда обходит мультиязычный Whisper.
Облачные API
Deepgram, AssemblyAI, Google STT, а также Whisper через OpenAI API. Плюс — ноль возни с инфраструктурой и диаризация из коробки. Минус — цена на объёме и то, что аудио уходит на чужой сервер (для конфиденциальных созвонов это стоп-фактор).
СРАВНЕНИЕ ДВИЖКОВ РАСПОЗНАВАНИЯ РЕЧИ
Оценки ниже — обобщённые, по замерам сообщества и практике; точные цифры сильно зависят от железа, аудио и настроек. Берите как ориентир, а не как абсолют.
| Движок | Русский | Скорость | Железо | Таймкоды/спикеры | Когда брать |
|---|---|---|---|---|---|
| faster-whisper (large-v3) | Отличный | Высокая | GPU/CPU | Сегментные | Дефолт для локали |
| WhisperX | Отличный | Высокая | GPU | По словам + диаризация | Субтитры, интервью |
| openai/whisper (ориг.) | Отличный | Низкая | GPU/CPU | Сегментные | Референс, эксперименты |
| NVIDIA Parakeet/Canary | Хороший | Очень высокая | GPU | Есть | Realtime, потоки |
| Vosk | Средний | Средняя | CPU/edge | Есть | Оффлайн, слабое железо |
| Облачные API | Отличный | Высокая | Нет (SaaS) | Есть | Без инфры, MVP |
ПРАКТИЧЕСКИЕ ГРАБЛИ НА РУССКОМ
За годы эксплуатации Whisper на русскоязычном материале накопился список повторяющихся проблем и лечения:
- Галлюцинации на тишине. Модель на паузах выдумывает текст. Лечится VAD-фильтром и нарезкой по речи.
- Путаница языка. На коротких клипах автодетект уводит в украинский или болгарский. Жёстко задавайте
language="ru". - Английские термины. «Kubernetes» превращается в «кубернетис». Помогает промпт-контекст (
initial_promptс правильным написанием терминов). - Числа и даты. Whisper пишет прописью или цифрами непредсказуемо. Нормализуйте постобработкой.
- Пунктуация. На русском ставится неровно. Для чистого текста прогоняйте через отдельную модель восстановления пунктуации.
Мини-хак с промптом:
segments, info = model.transcribe(
"devtalk.wav",
language="ru",
initial_prompt="Обсуждаем Kubernetes, Docker, CI/CD, PostgreSQL и Redis.",
vad_filter=True,
)
initial_prompt подсказывает модели ожидаемую лексику и заметно снижает искажение технических терминов — дешёвый способ поднять качество без дообучения.
КАК ВЫБРАТЬ ПОД ЗАДАЧУ
- Подкасты, лекции, созвоны локально → faster-whisper large-v3-turbo,
language="ru", VAD. - Субтитры с таймкодами и спикерами → WhisperX + диаризация.
- Realtime / голосовой ассистент → Vosk (edge) или NVIDIA streaming-модели (GPU).
- Быстрый MVP без своей инфры → облачное STT API.
- Конфиденциальные данные → только локально, faster-whisper на своём железе.
Новые квантизации, форки и обёртки под эти движки выходят чуть ли не еженедельно — держать руку на пульсе проще через каталог REDDYX, где релизы STT-инструментов отслеживаются автоматически.
Частые вопросы
Какая модель Whisper лучше всего работает с русским языком?
large-v3 даёт максимальное качество на русском, включая шумную речь и редкие слова. Для большинства задач достаточно large-v3-turbo — он почти не уступает в точности, но работает кратно быстрее. Запускать стоит через faster-whisper, а не оригинальный репозиторий.
Чем faster-whisper отличается от обычного Whisper?
Это реализация той же модели на движке CTranslate2 с int8/fp16-квантизацией. Текст на выходе практически идентичный, но скорость в несколько раз выше и памяти нужно меньше. В 2026 это стандарт для локальной транскрибации.
Можно ли транскрибировать русский без видеокарты?
Да. faster-whisper с compute_type="int8" работает на CPU — модели small и medium дают разумную скорость. Для realtime без GPU лучше подходит Vosk: он специально заточен под слабое железо и edge-устройства.
Как убрать выдуманные фразы на паузах?
Это классическая галлюцинация Whisper на тишине. Включите VAD-фильтр (vad_filter=True), который вырезает участки без речи. Дополнительно помогает жёстко указывать язык и задавать initial_prompt с ожидаемой лексикой.
Если тема локального AI и open-source инструментов вам близка — каждые 30-60 минут новые репозитории (STT, LLM, генерация речи и не только) прилетают в Telegram-канал REDDYX AI — новые репозитории каждые 30-60 минут.