STORM Parse
RAG에 최적화된 데이터 파싱 엔진
STORM Parse는 비정형 데이터를 분석하고, 문맥과 구조를 파악하여 AI가 활용 가능한 형태로 자동 정제해주는
Sionic AI의 핵심 기술입니다.
STORM PARSE 체험해보기KEY POINT
다양한 확장자 지원 및 형식별 최적 처리
PDF, DOCX, PPTX, XLSX, HWP, JPG, PNG 등 다양한 확장자를 지원하며, 파일 유형별 구조와 특성에 맞춘 최적화된 방식으로 처리합니다.
레이아웃 기반의 고성능 파싱
Sionic AI의 VLM은 문서 내 시각 정보의 배치·계층·연결성을 통합적으로 분석해 정밀하게 인식합니다.
RAG 특화 형태로 자동 변환
텍스트와 시각 정보를 의미 단위로 해석한 뒤, LLM에 최적화된 자연어 문장 형태로 정제합니다.
다국어 문서 처리
글로벌 환경의 문서 처리를 위한 다국어 인식 기능을 제공하며, 언어와 무관하게 일관된 품질의 결과를 만들어냅니다.
STORM PARSE PERFORMANCE
원본 문서

파싱된 결과

| Sionic AI STORM Parse | 오픈소스 파싱 엔진 | |
|---|---|---|
| 처리 방식 | 2-Pass 구조로 레이아웃 분석과 의미 보존을 분리 수행하여 정보 누락 없이 정제된 결과 생성 | 단일 단계 처리 방식으로 단순 텍스트 추출 또는 이미지 패턴 매칭 |
| 이미지 처리 | 이미지화된 텍스트·도형·구조 정보 통합 인식 | 이미지화된 텍스트·도형·구조 정보 인식 제한적 |
| 표/테이블 처리 | 셀 병합·병렬구조·계층 정보까지 파악, 실제 의미 단위로 재구성 | 셀 구분은 일부 가능하나 구조적 의미 인식은 어려워 계층 정보 손실 발생 |
| 차트/그래프 처리 | 수치·항목 간 관계·도식의 맥락까지 해석하여 설명 생성 가능 | OCR 수준의 단순 텍스트 추출 |
| RAG 시스템 활용성 | 의미 기반 자연어 정제 결과를 제공, LLM 및 검색 시스템에서 높은 정답률 실현 | 단편적인 정보로 인해 RAG와의 연계 불완전, 응답 오류 발생 가능성 큼 |
STORM Parse 2-pass 파싱 구조
복잡한 문서도, 표와 그래프도 AI가 이해할 수 있도록 스톰 파스는 기업의 데이터 처리 장벽을 해소합니다

Step 1정보를 누락 없이 추출하는 기초 처리 단계
문서 내 정보 요소 식별
- 다양한 문서 포맷 처리 가능 (PDF, DOCX, PPTX, XLSX, HWP 등)
- 문서의 레이아웃, 계층 관계, 시각적 배치 판별
- 텍스트, 표, 이미지, 차트 등 비정형 요소의 구분

Step 2의미 해석을 위한 심화 처리 단계
시각 정보의 의미론적 변환
- 추출된 요소들을 VLM을 활용해 항목 간의 연관성 파악
- 서로 연결된 정보를 자연어 형태로 정리
- RAG 시스템이 활용할 수 있는 형태로 최종 변환