STORM Parse

    RAG에 최적화된 데이터 파싱 엔진
    STORM Parse는 비정형 데이터를 분석하고, 문맥과 구조를 파악하여 AI가 활용 가능한 형태로 자동 정제해주는 Sionic AI의 핵심 기술입니다.
    STORM PARSE 체험해보기

    KEY POINT

    다양한 확장자 지원 및 형식별 최적 처리

    PDF, DOCX, PPTX, XLSX, HWP, JPG, PNG 등 다양한 확장자를 지원하며, 파일 유형별 구조와 특성에 맞춘 최적화된 방식으로 처리합니다.

    레이아웃 기반의 고성능 파싱

    Sionic AI의 VLM은 문서 내 시각 정보의 배치·계층·연결성을 통합적으로 분석해 정밀하게 인식합니다.

    RAG 특화 형태로 자동 변환

    텍스트와 시각 정보를 의미 단위로 해석한 뒤, LLM에 최적화된 자연어 문장 형태로 정제합니다.

    다국어 문서 처리

    글로벌 환경의 문서 처리를 위한 다국어 인식 기능을 제공하며, 언어와 무관하게 일관된 품질의 결과를 만들어냅니다.

    STORM PARSE PERFORMANCE

    원본 문서원본 문서
    파싱된 결과파싱된 결과
    Sionic AI STORM Parse오픈소스 파싱 엔진
    처리 방식2-Pass 구조로 레이아웃 분석과 의미 보존을 분리 수행하여 정보 누락 없이 정제된 결과 생성단일 단계 처리 방식으로 단순 텍스트 추출 또는 이미지 패턴 매칭
    이미지 처리이미지화된 텍스트·도형·구조 정보 통합 인식이미지화된 텍스트·도형·구조 정보 인식 제한적
    표/테이블 처리셀 병합·병렬구조·계층 정보까지 파악, 실제 의미 단위로 재구성셀 구분은 일부 가능하나 구조적 의미 인식은 어려워 계층 정보 손실 발생
    차트/그래프 처리수치·항목 간 관계·도식의 맥락까지 해석하여 설명 생성 가능OCR 수준의 단순 텍스트 추출
    RAG 시스템 활용성의미 기반 자연어 정제 결과를 제공, LLM 및 검색 시스템에서 높은 정답률 실현단편적인 정보로 인해 RAG와의 연계 불완전, 응답 오류 발생 가능성 큼

    STORM Parse 2-pass 파싱 구조

    복잡한 문서도, 표와 그래프도 AI가 이해할 수 있도록 스톰 파스는 기업의 데이터 처리 장벽을 해소합니다

    정보를 누락 없이 추출하는 기초 처리 단계

    Step 1정보를 누락 없이 추출하는 기초 처리 단계

    문서 내 정보 요소 식별

    • 다양한 문서 포맷 처리 가능 (PDF, DOCX, PPTX, XLSX, HWP 등)
    • 문서의 레이아웃, 계층 관계, 시각적 배치 판별
    • 텍스트, 표, 이미지, 차트 등 비정형 요소의 구분
    의미 해석을 위한 심화 처리 단계

    Step 2의미 해석을 위한 심화 처리 단계

    시각 정보의 의미론적 변환

    • 추출된 요소들을 VLM을 활용해 항목 간의 연관성 파악
    • 서로 연결된 정보를 자연어 형태로 정리
    • RAG 시스템이 활용할 수 있는 형태로 최종 변환