R_REDDYX.XYZ
AIPython1,524

emcf/thepipe

THEPIPE: ДАННЫЕ ИЗ ДОКУМЕНТОВ БЫСТРО

ThePipe использует vision‑language модели для извлечения чистых данных из PDF, Word и PowerPoint. Автоматически распознаёт таблицы, текст и изображения, преобразуя их в готовые структуры.

// КЛЮЧЕВЫЕ ОСОБЕННОСТИ

  • Извлекает таблицы и текст из сканированных PDF с точностью >95% via VLM.
  • Преобразует сложные Word‑документы в структурированный JSON, сохраняя стили и метаданные.
  • Обрабатывает пакеты PowerPoint‑файлов, извлекая текст с слайдов и подписи к изображениям.
  • Предоставляет REST API и Python SDK для интеграции в пайплайны ETL и RAG.
#document-ai#large-language-models#microsoft-word#multimodal#pdf#powerpoint#python#scanned-pdf#scrapers#scraping#unstructured-data#vision-language-model
Открыть на GitHub →

Новые репозитории каждые 30 минут

REDDYX AI сканирует GitHub 24/7 и присылает лучшие AI/ML/Web3 проекты в Telegram.

Подписаться в Telegram
← Весь каталог

// ПОХОЖИЕ РЕПОЗИТОРИИ

Claw Code: Быстрый код192068Автоматизация процессов n8n187437DeepSeek Плагин Фреймворк186631Оптимизация агентского ИИ186627AutoGPT: AI-агент184170Всё для Claude Code179304

← ВЕСЬ КАТАЛОГ

emcf/thepipe — THEPIPE: ДАННЫЕ ИЗ ДОКУМЕНТОВ БЫСТРО |…