«Диасофт» создал сервис интеллектуального парсинга документов
Продукт позволяет автоматически обрабатывать неструктурированные данные из файлов разных форматов для аналитики и применения в ИИ-сценариях
Компания «Диасофт» расширила возможности решения «Фабрика данных» (Digital Q.DataFactory), добавив в него новый продукт — «Сервис интеллектуального парсинга документов». Он предназначен для автоматической обработки неструктурированных данных из файлов разных форматов и их подготовки для аналитики и ИИ-сценариев.
Сервис работает через единый HTTP API и принимает PDF, DOCX, PPTX, XLSX, HTML, изображения и аудиофайлы, преобразуя их в структурированные данные в форматах JSON, Markdown и HTML без потери смысла. В него также встроены OCR-алгоритмы для распознавания сканов, изображений и рукописного текста на любых языках, а также технологии ASR для автоматической расшифровки аудио с разделением по спикерам, временными метками и знаками препинания. Кроме того, система определяет структуру документа и извлекает таблицы, что важно для поисковых систем и ИИ-ассистентов.
В компании отмечают, что продукт помогает работать с большими массивами «грязных» данных, которые без предварительной подготовки сложно использовать в LLM- и RAG-проектах. Решение также снижает зависимость от зарубежных библиотек и упрощает разработку собственных конвейеров конвертации.
Сервис создан на микросервисной архитектуре, поддерживает контейнерное развертывание у заказчика и может масштабироваться при росте нагрузки.
Источник: Диасофт