R_REDDYX.XYZ
AIPython655

OpenMOSS/MOSS-Audio

MOSS-AUDIO: МОДЕЛЬ ДЛЯ АНАЛИЗА ЗВУКА

MOSS-Audio — открытая модель на Python для генерации подписей к аудио, ответов на вопросы о звуке и рассуждений о речи, окружении и музыке. За 655 звёзд на GitHub она поддерживает аудио-капционирование, аудио-VQA и мультимодального понимания.

// КЛЮЧЕВЫЕ ОСОБЕННОСТИ

  • Генерирует подписи к аудио: речь, окружающие звуки и музыка.
  • Отвечает на вопросы о содержании аудио через аудио‑VQA (речь, шум, музыка).
  • Выполняет рассуждения о речи, окружении и музыке для глубокого понимания.
  • Поддерживает задачи аудио‑капционирования, аудио‑VQA и мультимодального понимания.
#audio-captioning#audio-question-answering#audio-understanding#multimodal#music#speech
Открыть на GitHub →

Новые репозитории каждые 30 минут

REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.

Подписаться в Telegram
← Весь каталог

// ПОХОЖИЕ РЕПОЗИТОРИИ

Claw Code: Быстрый код192068Автоматизация процессов n8n187437DeepSeek Плагин Фреймворк186631Оптимизация агентского ИИ186627AutoGPT: AI-агент184170Всё для Claude Code179304

← ВЕСЬ КАТАЛОГ

OpenMOSS/MOSS-Audio — MOSS-AUDIO: МОДЕЛЬ ДЛЯ АНАЛИЗА ЗВУКА…