AIPython★ 967
mbzuai-oryx/groundingLMM
ГРОУНДИНГ LMM: ВИЖИ И ПОНИМАЙ
CVPR 2024 🔥 Grounding Large Multimodal Model (GLaMM) – первая модель, генерирующая ответы на естественном языке, связанные с масками сегментации объектов. Она сочетает понимание сцены и точные текстовые объяснения.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Генерирует ответы на языке, привязанные к маскам объектов на изображении.
- Выполняет сегментацию объектов по тексту и возвращает маску вместе с описанием.
- Поддерживает совместное reasoning vision‑language для ответа на сложные вопросы о сцене.
- Предлагает простой Python‑API для интеграции GLaMM в любые мультимедиа‑приложения.
#foundation-models#llm-agent#lmm#vision-and-language#vision-language-model
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram