ПОЧЕМУ ВООБЩЕ ЕСТЬ ПРОБЛЕМА С РУССКИМ
Русский — язык с богатой морфологией: падежи, роды, виды глагола, свободный порядок слов. LLM, обученная в основном на английском корпусе, спотыкается не на смысле, а на форме. Классический симптом — модель понимает вопрос, но выдаёт согласование уровня «три большие дома» или калькированные обороты вроде «сделать смысл» вместо «иметь смысл».
Второй слой проблемы — токенизация. Кириллица в BPE-токенайзерах старого поколения жралась по 2-3 токена на слово, что удорожало запросы и резало контекст. К 2026 большинство фронтир-моделей перешли на токенайзеры, где русский стоит примерно 1.3-1.7 токена на слово — всё ещё дороже английского, но терпимо.
Третий слой — фактология и локальный контекст: законы РФ, топонимы, культурные реалии, актуальные события. Тут западные модели часто плывут, а специализированные русскоязычные — в своей стихии.
КАК Я ТЕСТИРОВАЛ
Синтетические бенчмарки типа MMLU переводятся на русский криво и меряют не то. Поэтому я гонял модели на пяти категориях практических задач, близких к тому, что реально делают разработчики:
- Грамматика и стиль — переписать канцелярит в человеческий текст, поймать ошибки согласования.
- Суммаризация — сжать статью на 3000 слов до 5 тезисов без галлюцинаций.
- Извлечение данных (JSON) — вытащить структуру из неструктурированного русского текста.
- Код + комментарии на русском — генерация функции с осмысленными русскими докстрингами.
- Локальные знания — вопросы по российскому праву, географии, недавним событиям.
Оценка — вручную, слепым сравнением, по шкале 1-10. Ни один автоматический judge я не доверял: LLM-судья сам плывёт на русском и завышает оценки многословным ответам. Свежие релизы моделей и оберток я отслеживаю в каталоге REDDYX — там видно, кто выкатил новую версию буквально на этой неделе.
РЕЗУЛЬТАТЫ: СВОДНАЯ ТАБЛИЦА
Цифры — усреднённые субъективные оценки по моему прогону, а не абсолютная истина. По замерам сообщества (Ru-MMLU-подобные наборы, MERA) расклад примерно совпадает.
| Модель | Грамматика | Суммаризация | JSON-извлечение | Локальные знания | Цена (относит.) | Данные в РФ |
|---|---|---|---|---|---|---|
| Claude (Opus/Sonnet) | 9.5 | 9.5 | 9.5 | 7.0 | Высокая | Нет |
| GPT (флагман) | 9.0 | 9.0 | 9.0 | 7.5 | Высокая | Нет |
| DeepSeek | 8.5 | 8.5 | 9.0 | 6.5 | Очень низкая | Нет |
| YandexGPT | 8.5 | 8.0 | 7.5 | 9.5 | Средняя | Да |
| GigaChat (Сбер) | 8.0 | 7.5 | 7.0 | 9.0 | Средняя | Да |
| Qwen (открытая) | 8.0 | 8.0 | 8.5 | 6.0 | Низкая (self-host) | Локально |
ГРАММАТИКА И СТИЛЬ: ГДЕ ЛОМАЕТСЯ
На чистой грамотности разрыв минимален. Claude и GPT практически не делают ошибок согласования даже в длинных придаточных. DeepSeek иногда роняет вид глагола в сложных временных конструкциях. YandexGPT ожидаемо силён — модель много видела живого русского, а не переводного.
Интересный момент: западные модели пишут «правильно, но не по-русски». Стилистически это чуть переводной текст — длинные периоды, избыток отглагольных существительных. YandexGPT и GigaChat звучат естественнее в разговорном регистре, зато иногда уходят в казённость.
Типичная ловушка
Просите переписать «Осуществление контроля за выполнением мероприятий возлагается на...» — фронтир-модели дают грамотный, но всё ещё бюрократический вариант. YandexGPT чаще догадывается, что от него хотят живой язык, и режет канцелярит агрессивнее.
ИЗВЛЕЧЕНИЕ ДАННЫХ И КОД
Тут западные модели уверенно впереди. Structured output, строгий JSON по схеме, tool calling — экосистема отлажена. YandexGPT и GigaChat умеют function calling, но капризнее: чаще ломают схему, добавляют лишние поля, оборачивают JSON в markdown-блок, когда просишь чистый объект.
Вот минимальный прогон, которым можно проверить любую модель на своей задаче извлечения. Пример под OpenAI-совместимый эндпоинт (его отдают почти все, включая прокси к DeepSeek и локальный Qwen через vLLM):
import json
from openai import OpenAI
client = OpenAI(base_url="https://api.example.com/v1", api_key="...")
PROMPT = """Извлеки данные из текста строго в JSON.
Схема: {"name": str, "city": str, "age": int|null}
Верни ТОЛЬКО валидный JSON без markdown.
Текст: Меня зовут Пётр, живу в Нижнем Новгороде, мне 34."""
resp = client.chat.completions.create(
model="your-model-id",
messages=[{"role": "user", "content": PROMPT}],
temperature=0,
)
raw = resp.choices[0].message.content.strip()
# частая беда рус-моделей — обёртка ```json ... ```
if raw.startswith("```"):
raw = raw.split("```")[1].removeprefix("json").strip()
data = json.loads(raw)
assert data["city"] == "Нижнем Новгороде" or data["city"] == "Нижний Новгород"
print(data)
Обратите внимание на строку с зачисткой markdown — это не паранойя, а реальный костыль, который до сих пор нужен для GigaChat и части открытых моделей. Claude и GPT при явной инструкции отдают чистый JSON стабильно.
ЛОКАЛЬНЫЕ ЗНАНИЯ И 152-ФЗ
Здесь расклад переворачивается. Спросите про порядок подачи документов в конкретное ведомство, актуальные ставки или региональные реалии — YandexGPT и GigaChat отвечают предметнее, потому что дообучены на релевантном корпусе. Западные модели либо аккуратно уклоняются, либо галлюцинируют устаревшими данными.
Но главный аргумент за российские модели часто не качество, а комплаенс. Если у вас персональные данные и требования по локализации (152-ФЗ), отправлять их в зарубежный API — юридический риск. YandexGPT и GigaChat держат данные в РФ и дают договоры под госзаказ. Для многих корпоративных проектов это решает вопрос выбора ещё до всяких бенчмарков.
- Нужен максимум качества, данные не чувствительные — Claude или GPT.
- Персональные данные / госзаказ — YandexGPT или GigaChat, без вариантов.
- Экономия на объёме — DeepSeek или self-host Qwen.
- Полная приватность / офлайн — открытая модель на своём железе.
ЦЕНА И ТОКЕНИЗАЦИЯ РУССКОГО
Экономика сильно зависит от того, сколько токенов модель тратит на кириллицу. Прикинуть можно так:
# bash: грубая оценка стоимости на русском тексте
# считаем, что рус-слово ~ 1.5 токена в современном токенайзере
WORDS=$(wc -w < article_ru.txt)
TOKENS=$(( WORDS * 3 / 2 ))
echo "Примерно $TOKENS входных токенов"
# при цене X$/1M токенов:
python3 -c "print(f'{$TOKENS/1_000_000 * 3.0:.4f} USD при 3\$/1M')"
DeepSeek на порядок дешевле флагманов при сопоставимом русском. Открытый Qwen на своём GPU — почти бесплатен на инференсе, но платите за железо и DevOps. YandexGPT и GigaChat — средний ценовой сегмент, но с рублёвой оплатой и без валютной возни, что для российского юрлица иногда важнее самой цены.
ИТОГ: ЧТО БРАТЬ В 2026
Универсального ответа нет — есть три сценария:
- Продукт для широкой аудитории, качество важнее всего — берите Claude или топовый GPT, они пишут по-русски почти безупречно.
- Российское юрлицо, персданные, интеграция с локальными сервисами — YandexGPT или GigaChat закрывают комплаенс и знают местный контекст.
- Большие объёмы или полная приватность — DeepSeek по API либо Qwen на self-host дают лучшее соотношение цены и качества.
Разрыв в качестве русского между лагерями за последний год схлопнулся до долей балла. Реальный выбор в 2026 определяется не грамматикой, а тремя вещами: где лежат ваши данные, сколько вы готовы платить и нужны ли вам локальные знания.
Частые вопросы
Какая LLM лучше всего понимает русский язык в 2026?
По чистому качеству письменного русского лидируют фронтир-модели Claude и GPT — минимум ошибок согласования и стиля. Но по локальным знаниям и естественности разговорного русского YandexGPT часто не уступает, а по комплаенсу превосходит.
YandexGPT или GigaChat — что выбрать?
YandexGPT в моих тестах стабильнее по грамматике, суммаризации и function calling. GigaChat чуть слабее по structured output, но конкурентен по локальным знаниям и удобен, если вы уже в экосистеме Сбера. Обе держат данные в РФ.
Можно ли использовать зарубежные LLM с персональными данными?
Юридически рискованно из-за требований локализации (152-ФЗ). Если в запросах есть персональные данные российских граждан, безопаснее YandexGPT, GigaChat или self-host открытой модели на своём сервере в РФ.
Сколько токенов тратит русский текст по сравнению с английским?
В современных токенайзерах 2026 года русское слово стоит примерно 1.3-1.7 токена против ~1 у английского. Это дороже, но заметно лучше, чем 2-3 токена в моделях прошлых поколений.
Гоняю новые модели на русском по мере релизов и выкладываю живые прогоны, а не пресс-релизы. Если хотите ловить свежие репозитории и инструменты раньше остальных — залетайте в Telegram-канал REDDYX AI — новые репозитории каждые 30-60 минут.