R_REDDYX.XYZ
AIPython967

mbzuai-oryx/groundingLMM

ГРОУНДИНГ LMM: ВИЖИ И ПОНИМАЙ

CVPR 2024 🔥 Grounding Large Multimodal Model (GLaMM) – первая модель, генерирующая ответы на естественном языке, связанные с масками сегментации объектов. Она сочетает понимание сцены и точные текстовые объяснения.

// КЛЮЧЕВЫЕ ОСОБЕННОСТИ

  • Генерирует ответы на языке, привязанные к маскам объектов на изображении.
  • Выполняет сегментацию объектов по тексту и возвращает маску вместе с описанием.
  • Поддерживает совместное reasoning vision‑language для ответа на сложные вопросы о сцене.
  • Предлагает простой Python‑API для интеграции GLaMM в любые мультимедиа‑приложения.
#foundation-models#llm-agent#lmm#vision-and-language#vision-language-model
Открыть на GitHub →

Новые репозитории каждые 30 минут

REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.

Подписаться в Telegram
← Весь каталог

// ПОХОЖИЕ РЕПОЗИТОРИИ

Claw Code: Быстрый код192068Автоматизация процессов n8n187437DeepSeek Плагин Фреймворк186631Оптимизация агентского ИИ186627AutoGPT: AI-агент184170Всё для Claude Code179304

← ВЕСЬ КАТАЛОГ

mbzuai-oryx/groundingLMM — ГРОУНДИНГ LMM: ВИЖИ И ПОНИМАЙ |…