AIPython★ 588
OpenMOSS/MOSS-VL
MOSS-VL: 11B МОДЕЛЬ ДЛЯ ВИДЕО
Открытая серия моделей MOSS-VL объёмом 11 миллиардов параметров предназначена для понимания длинных и потоковых видео в реальном времени. Поддерживает мультимодальный вход и эффективную потоковую обработку.
// КЛЮЧЕВЫЕ ОСОБЕННОСТИ
- Обрабатывает видео длительностью до нескольких часов без потери контекста.
- Выполняет потоковый анализ видео в реальном времени с низкой задержкой.
- Понимает связь между видеокадрами и текстом, поддерживая мультимодальные запросы.
- Открытые веса позволяют дообучать модель под конкретные задачи видеоанализа.
#llms#long-video-understanding#multimodal#multimodal-ai#real-time-ai#streaming-video#video-question-answering#video-understanding#video-understanding-vlm#vision#vision-language#vision-language-model
Открыть на GitHub →Новые репозитории каждые 30 минут
REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.
Подписаться в Telegram