ПОЧЕМУ ВООБЩЕ НЕСКОЛЬКО LLM
Одна модель с большим контекстным окном в 2026-м умеет почти всё: держит сотни тысяч токенов, вызывает инструменты, рассуждает шагами. Логичный вопрос — зачем плодить агентов, если можно засунуть всё в один промпт. Ответ прагматичный: единый промпт деградирует по мере роста задачи. Модель теряет фокус в середине контекста (эффект lost-in-the-middle никуда не делся), смешивает роли, и один плохой шаг тянет за собой весь ответ.
Мультиагентная система разбивает проблему на изолированные зоны ответственности. У каждого агента свой системный промпт, свой набор инструментов, свой узкий контекст. Планировщик не думает про синтаксис SQL, а исполнитель не занимается декомпозицией. Это то же самое, что микросервисы против монолита — только вместо HTTP между сервисами ходят сообщения на естественном языке.
Практическое правило простое: если задачу естественно описать фразой «сначала кто-то делает А, потом другой проверяет Б, а третий собирает В» — это кандидат на мультиагент. Если задача монолитная («перефразируй абзац») — один вызов дешевле и быстрее.
КОГДА МУЛЬТИАГЕНТ РЕАЛЬНО ВЫИГРЫВАЕТ
По наблюдениям сообщества и внутренним замерам команд, разница проявляется на конкретных классах задач:
- Глубокий ресёрч. Один агент-оркестратор раздаёт подзапросы нескольким исполнителям, те параллельно шерстят источники, критик отсеивает мусор. Параллелизм тут даёт не только качество, но и реальное сокращение wall-clock времени.
- Разбор больших кодовых баз. Агент по безопасности, агент по стилю, агент по тестам — каждый смотрит своим взглядом. Одна модель в одном проходе такую многогранность держит хуже.
- Пайплайны генерация-критика-правка. Разделение «писателя» и «редактора» на два разных агента с разными промптами стабильно поднимает качество против self-critique в одном контексте.
- Смешанные модели по цене. Дешёвая быстрая модель разбирает рутину, дорогая reasoning-модель подключается только на сложных ветках. Экономия на масштабе ощутимая.
А вот где мультиагент проигрывает: короткие детерминированные задачи, жёсткие требования по латентности (чат в реальном времени), и всё, где ошибка одного агента каскадом ломает остальных без внятного контроля.
АРХИТЕКТУРЫ ОРКЕСТРАЦИИ
Оркестрация — это то, как агенты передают друг другу управление и данные. Три базовых паттерна покрывают 90% реальных систем.
1. Supervisor (центральный оркестратор)
Один агент-руководитель решает, кого звать следующим. Остальные — исполнители, которые возвращают результат наверх. Плюс: прозрачно, легко дебажить, легко ставить лимиты. Минус: супервайзер становится бутылочным горлышком и точкой отказа.
2. Sequential / pipeline
Агенты выстроены в цепочку, выход одного — вход следующего. Идеально для ETL-подобных задач: извлечь → структурировать → проверить → отформатировать. Предсказуемо по стоимости, тривиально тестируется.
3. Network / group chat
Агенты общаются в общем «чате», сами решают когда вступить. Максимальная гибкость, но и максимальный риск зациклиться и сжечь бюджет. Именно этот паттерн лежит в основе AutoGen. Без жёсткого лимита на число раундов запускать в прод опасно.
Отдельно стоит держать в голове механику handoff — явную передачу управления с сохранением контекста. Свежие релизы фреймворков и новые паттерны оркестрации удобно отслеживать в каталоге REDDYX, где новинки размечены по категориям.
CREWAI ПРОТИВ AUTOGEN: ЧТО ВЫБРАТЬ
Два самых обсуждаемых фреймворка занимают разные ниши. CrewAI строится вокруг метафоры «команда с ролями и задачами» — декларативно и понятно. AutoGen (проект Microsoft) построен вокруг диалога между агентами — более низкоуровнево и гибко, но требует больше дисциплины.
| Критерий | CrewAI | AutoGen |
|---|---|---|
| Ментальная модель | Роли + задачи + процесс | Агенты в диалоге / group chat |
| Порог входа | Низкий, читается как конфиг | Средний, больше кода и контроля |
| Основной паттерн | Sequential / hierarchical | Conversational / network |
| Гибкость протокола диалога | Ограниченная | Высокая |
| Контроль стоимости из коробки | Проще ограничить | Нужно явно лимитировать раунды |
| Когда брать | Чёткий процесс с ролями | Открытый диалог, исследование |
Помимо этих двоих, в 2026-м серьёзную долю забрали LangGraph (граф состояний вместо ролей, максимальный контроль потока) и нативные agent-SDK от вендоров моделей. Если нужен строгий детерминированный граф с ветвлениями и циклами — смотри в сторону графовых фреймворков, а не ролевых.
МИНИМАЛЬНЫЙ РАБОЧИЙ ПРИМЕР НА CREWAI
Ниже — компактный, но реальный скелет команды из двух агентов: ресёрчер собирает факты, редактор превращает их в связный текст. Sequential-процесс, никакой магии.
from crewai import Agent, Task, Crew, Process
researcher = Agent(
role="Аналитик",
goal="Собрать факты по теме {topic} и выделить 5 ключевых пунктов",
backstory="Дотошный ресёрчер, проверяет каждое утверждение.",
llm="gpt-4o-mini", # дешёвая модель на рутину
verbose=True,
)
editor = Agent(
role="Редактор",
goal="Написать связный технический абзац из фактов",
backstory="Пишет сухо и по делу, без воды.",
llm="claude-sonnet", # модель посильнее на финал
verbose=True,
)
research_task = Task(
description="Изучи тему {topic}. Выдай маркированный список фактов.",
expected_output="5 проверенных пунктов",
agent=researcher,
)
write_task = Task(
description="Из фактов выше собери абзац на 120 слов.",
expected_output="Готовый абзац",
agent=editor,
context=[research_task], # получает выход первого агента
)
crew = Crew(
agents=[researcher, editor],
tasks=[research_task, write_task],
process=Process.sequential,
)
result = crew.kickoff(inputs={"topic": "мультиагентные системы"})
print(result)
Ключевая деталь — context=[research_task]: именно так второй агент получает результат первого без ручного склеивания промптов. И обрати внимание на разные llm у агентов — это тот самый приём микса моделей по цене.
ЦЕНА ГИБКОСТИ: ЛАТЕНТНОСТЬ И ТОКЕНЫ
Главная ловушка новичка — думать, что мультиагент «просто лучше». За архитектуру платишь, и платишь ощутимо.
- Токены множатся. Каждая передача между агентами тащит контекст заново. Система из 4 агентов легко расходует в 3-5 раз больше токенов, чем один умный вызов на ту же задачу.
- Латентность складывается. В sequential-цепочке задержки суммируются. Пять агентов по 3 секунды — это 15 секунд ответа, что неприемлемо для интерактива.
- Отладка усложняется. Ошибка на шаге 2 проявляется на шаге 5. Без нормальной трассировки (LangSmith, встроенные логи фреймворка) отладка превращается в археологию.
- Каскад галлюцинаций. Если первый агент выдумал факт, вся цепочка добросовестно строит на нём выводы. Критик-агент обязателен, а не опционален.
Отсюда практика: параллель вместо цепочки где возможно (латентность не суммируется, а идёт по максимуму одной ветки), агрессивное кэширование системных промптов, жёсткие лимиты на число раундов и токенов на агента.
ПРАКТИЧЕСКИЙ ЧЕК-ЛИСТ ПЕРЕД ЗАПУСКОМ В ПРОД
- Есть ли у задачи естественное разделение ролей? Если нет — не городи агентов.
- Проставлены ли hard-лимиты: max раундов, max токенов, таймауты на агента.
- Настроена ли трассировка каждого шага (кто что сказал, сколько токенов).
- Есть ли агент-валидатор или детерминированная проверка выхода.
- Просчитана ли стоимость одного полного прогона — и умножена на ожидаемый трафик.
- Что происходит при отказе одного агента: фолбэк, ретрай, деградация.
Если на большинство пунктов ответ «нет» — начни с одной LLM и хороших промптов. Мультиагент оправдан там, где одиночная модель уже уперлась в потолок качества.
Частые вопросы
Что такое мультиагентная система на LLM простыми словами?
Это несколько LLM-агентов с разными ролями и промптами, которые обмениваются сообщениями и совместно решают задачу. Один планирует, другой исполняет, третий проверяет — как команда специалистов вместо одного универсала.
CrewAI или AutoGen — что выбрать новичку?
Для чёткого процесса с ролями и низкого порога входа берите CrewAI: он читается почти как конфигурация. Для открытого диалога между агентами и максимального контроля протокола — AutoGen. Для строгих графов состояний с ветвлениями смотрите LangGraph.
Мультиагент всегда точнее одной модели?
Нет. Выигрыш есть на задачах с разделением ролей и параллелизмом (ресёрч, аудит кода, длинные пайплайны). На коротких монолитных задачах одна LLM быстрее, дешевле и часто не хуже по качеству.
Насколько дороже обходится мультиагентная оркестрация?
Обычно в 3-5 раз больше токенов против одиночного вызова, потому что контекст пересылается между агентами повторно. Снижают цену микс дешёвых и дорогих моделей, кэш системных промптов и лимиты на раунды.
Мультиагенты — самая быстро мутирующая часть экосистемы: фреймворки, паттерны handoff и agent-SDK выходят почти еженедельно, и вчерашний «стандарт» устаревает за месяц. Чтобы не пропустить рабочие релизы, подпишись на Telegram-канал REDDYX AI — новые репозитории каждые 30-60 минут.