AIPython★ 293
mbzuai-oryx/VideoGPT-plus
VIDEOGPT-ПЛЮС: ПРОДВИНУТОЕ ВИДЕО ПОНИМАНИЕ
Официальный репозиторий статьи VideoGPT+: объединяет image и video энкодеры для улучшенного понимания видеоконтента. Позволяет извлекать семантические признаки, генерировать описания и отвечать на вопросы по видео с помощью GPT-4o.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Извлекает joint image‑video признаки через dual‑encoder для точного видео поиска.
- Генерирует описания видео на естественном языке на основе извлеченных признаков с GPT-4o.
- Отвечает на сложные вопросы по видеоконтенту, используя контекст из кадров и текста.
- Поддерживает fine‑tuning на своих данных для задач видео‑понимания.
#chatbot#clip#dual-encoder#gpt4#gpt4o#image-encoder#llama3#llava#multimodal#phi-3-mini#vicuna#video-chatbot
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram