
| 기업 문서를 활용한 RAG(Retrieval-Augmented Generation, 검색 증강 생성) 도입이 확산되고 있지만, 정작 표·차트·조직도·스캔 문서가 한 페이지에 뒤섞인 한국 기업 특유의 다중모달 문서를 다루는 파싱 단계에서는 여전히 많은 시행착오를 겪고 있습니다. 공개 벤치마크에서는 높은 점수를 기록한 오픈소스 Visual Parser조차 실제 한국 기업 문서 앞에서는 성능이 급격히 떨어지는데, 그 원인은 언어 차이가 아니라 도메인/기업마다 다른 '문서 패턴'에 있습니다. 이 글에서는 문서 파서가 어떻게 발전해왔는지 살펴보고, 한국 기업 문서에 특화된 LG CNS Visual Parser의 개발 전략과 성능, 그리고 Agentic Parsing으로 확장되는 방향까지 짚어보겠습니다. |
RAG (Retrieval-Augmented Generation, 검색 증강 생성)은 기업이 내부 지식을 인공지능과 연결하는 가장 보편적인 방식으로 자리 잡았습니다. 아래 그림처럼 여러 부서에서 문서를 모으고(Data Collection), 이를 구성요소로 분리·구조화한 뒤(Parser), 데이터 적재·검색·응답으로 이어지는(RAG Pipeline) 흐름은 이제 하나의 정형화된 파이프라인이 되었습니다.

<사내 문서의 Visual Parser 기반 RAG 데이터 Flow>
그러나 실제 기업 현장에서 RAG는 여전히 실패하는 경우가 있습니다. 잘 정제된 데이터에서는 RAG가 충분히 잘 작동하지만, 문제는 그 '잘 정제된 데이터'를 만드는 파싱 단계에 여전히 많은 노력과 번거로움이 따른다는 점입니다. 한국 기업의 자료는 표, 차트, 조직도, 스캔 문서가 한 페이지에 뒤섞인 다중모달(Multimodal) 형태입니다. 사람은 이러한 시각적 자료를 쉽게 읽어내지만, 기계는 페이지를 위에서 아래로 훑어 텍스트 한 줄로 늘어놓습니다. 그 과정에서 표 구조와 숫자, 계층, 각주가 어긋나기 쉽습니다.

<잘못된 파싱으로 표의 헤더 연결 관계 “A부서-2분기”가 어긋난 사례>
이처럼 데이터가 잘못 배치되면 AI의 답변에도 오류가 발생합니다. 위 예시 사례에서 사람은 원본 문서를 직접 확인해 “A부서 2분기 매출액”이 24.3억 원임을 쉽게 파악할 수 있습니다. 그러나 AI는 잘못 파싱된 결과를 바탕으로 답변하기 때문에, 예시 하단부의 표에서 헤더 “A부서”와 “2분기”의 연결이 어긋나 해당 질의에 대한 값을 정확히 특정하지 못합니다. 이 사례에서 알 수 있듯이 문서의 정확한 파싱은 RAG 기반 답변의 품질에 직접적인 영향을 미치며, 기업 내부 지식을 AI와 연결하기 위한 필수 요소입니다.

<파서 엔진-Rule, OCR, VLM 기반-에 따른 문서 추출 방식 차이>
문서 파싱 기술은 크게 규칙(Rule) 기반, 광학 문자 인식(Optical Character Recognition, OCR) 기반, 시각-언어 모델(Vision-Language Model, VLM) 기반으로 발전해왔습니다. 세 방식의 차이는 문서에서 무엇을 어떻게 읽어내는가에 있습니다.
Rule 기반 파싱은 문서 파일에 이미 저장된 정보를 규칙에 따라 그대로 꺼내 쓰는 방식입니다. PDF, DOCX, HTML 같은 디지털 문서에는 텍스트 레이어와 메타데이터가 포함되어 있어, 별도의 시각적 인식 과정 없이 직접 읽어낼 수 있습니다. Rule 기반 파싱은 이러한 정보에 담긴 글자의 좌표, 폰트 크기, 굵기 등을 활용해 제목, 본문, 목록과 같은 기본 구조를 규칙으로 분류합니다. 별도의 모델 호출이 필요하지 않아 처리 속도가 빠르고 비용이 적다는 장점이 있습니다. 다만 표의 각 셀을 서로 연결된 구조가 아닌 개별 텍스트 조각으로 처리하기 때문에 표 구조를 이해하는 데는 한계가 있습니다. 텍스트 레이어가 없는 스캔 이미지도 적용할 수 없습니다.
OCR 기반 파싱은 스캔 문서나 이미지처럼 텍스트 레이어가 없는 문서를 처리하기 위해 등장했습니다. 일반적으로 레이아웃 검출 모델이 제목, 표, 본문 영역을 나누고, OCR 엔진이 각 영역의 글자를 문자 시퀀스로 변환합니다. 그러나 OCR 엔진은 글자의 시각적 표현이 어떤 의미를 담고 있는지까지는 이해하지 못합니다. 굵게 표시된 숫자나 취소선이 적용된 문자는 일반 문자와 동일하게 처리되고, 첨자나 각주도 위치 정보가 사라질 수 있습니다. 표의 경우는 별도의 모델이 행과 열, 병합 구조를 예측한 뒤 OCR 결과를 셀에 배치하는 방식으로 복원합니다. 따라서 레이아웃 검출, 문자 인식, 표 구조 생성 중 한 단계에서 오류가 발생하면 이후 결과에도 영향을 미칩니다.
VLM 기반 파싱은 이미지와 언어를 함께 이해하여 문서의 다양한 시각적 정보를 텍스트로 추출하는 최근의 접근 방식입니다. PaddleOCR-VL1)이나 GLM-OCR2)처럼 레이아웃을 먼저 검출한 뒤 영역별로 VLM이 내용을 인식하는 2단계 방식도 있고, dots.ocr3)나 DeepSeek-OCR4)처럼 페이지 전체를 하나의 입력으로 처리하는 end-to-end 방식도 등장하고 있습니다. VLM 기반 파싱은 인식 단계에서 문서의 구조와 의미를 함께 판단하기 때문에, 표의 행과 열, 병합 관계, 수식의 LaTeX 구조, 문단의 읽기 순서 등을 분석해 HTML이나 Markdown과 같은 구조화된 결과로 출력할 수 있습니다.
이러한 VLM의 능력은 차트에서 표로 변환하는 과정(Chart to Markdown)에서 특히 잘 드러납니다. OCR은 차트 안의 축 라벨이나 범례처럼 실제 문자로 존재하는 정보만 인식할 수 있습니다. 반면 VLM은 막대의 높이, 선의 변화, 축의 눈금과 범례를 종합해 원본 이미지에 문자로 적혀 있지 않은 값까지 표 형태로 재구성할 수 있습니다. 이는 단순히 글자를 옮겨 적는 것을 넘어, 시각 정보를 해석해 새로운 정형 데이터를 만들어내는 과정입니다.
문서 이미지를 직접 이해하는 VLM 기반 파서(Visual Parser)는 표의 행·열 병합 구조와 문단의 읽기 순서를 문맥에 따라 판단할 수 있습니다. 최신 오픈소스 Visual parser들이 다양하게 출시되고 있고, 이미 공개 벤치마크에서 뛰어난 성능을 보여줍니다. PaddleOCR-VL-1.6 파서는 파서 평가 벤치마크인 OmniDocBench5) v1.6에서 96%대 점수를 기록했고, 실제로 일반적인 보고서나 정형화된 형태의 표를 입력했을 때의 결과물도 대체로 만족스러웠습니다. 그러나 이러한 높은 성능이 실제 현장에서는 재현되지 않았습니다. 벤치마크 점수는 높더라도 한국 기업 자료에 적용하면 성능이 급격히 저하되는, 지표와 현장의 괴리를 확인했습니다.

지표와 현장 격차의 원인은 단순한 언어 차이가 아니라 ‘문서 패턴’의 차이에 있었습니다. 대부분의 오픈소스 모델은 영문 논문이나 웹 문서 중심으로 구축된 공개 벤치마크(Benchmark)를 기준으로 평가됩니다. 그러나 문서 패턴은 도메인에 따라 달라집니다. 포스터·안내문·공지처럼 정해진 양식 없이 정보가 자유롭게 배치된 일반 문서가 있는가 하면, 리포트·약관·공시처럼 표·차트·각주가 촘촘하게 얽힌 문서도 있습니다. 재무제표와 주석처럼 수치와 다단계 표가 문서의 핵심을 이루는 재무 문서도 있으며, 공공·의료·법률 분야에서는 각 영역의 고유한 작성 관행이 적용됩니다.

<일반/금융/재무 도메인의 현장 문서 예시>
* 실제 문서를 기반으로 AI로 재가공 된 이미지입니다.
문서의 도메인이 달라지면 표의 형태와 정보의 배치, 내용을 읽고 해석하는 순서도 함께 달라집니다. 기업 자료는 이처럼 다양한 도메인의 문서를 포괄하며, 일반적인 Visual Parser가 학습한 문서 형식과는 다른 구조적 특성을 갖습니다. 이러한 문서를 데이터로 변환하려면 텍스트뿐 아니라 문서의 값과 구조를 함께 보존해야 합니다. 따라서 해당 문서 형식을 이해할 수 있는 파서가 필요하며, 한국 기업 문서를 학습한 시각 기반 파서의 확보는 기업 문서 RAG 구축의 핵심 요소 중 하나입니다.
LG CNS는 이러한 현장 문서의 구조적 다양성을 분석하는 과정에서, 오픈소스만으로는 한국 기업 자료의 특성을 충분히 반영하기 어렵고 현장에 특화된 Visual Parser를 별도로 학습할 필요가 있다는 점을 인식했습니다. 이에 한국 기업 문서를 기반으로 학습 데이터를 구축하고, 앞서 살펴본 다양한 문서 구조를 인식하도록 파서를 학습시켰습니다. 이를 통해 기존 파서가 놓치기 쉬웠던 구조 정보를 보다 충실하게 보존하면서 데이터를 구축하고, 한국 기업 문서 구조에 최적화된 RAG 도구를 구현하기 위한 핵심 기반을 마련했습니다.

<3-step의 파서 모델 학습 과정>
LG CNS는 특정 현장의 문서를 잘 이해하면서도 기존 모델의 폭넓은 활용 능력을 유지하기 위해 단계적으로 학습을 진행했습니다. 먼저 한국 기업 문서의 유형과 구조를 반영해 구축한 학습 데이터와 일반 문서를 함께 사용해 모델을 미세조정(SFT)했습니다. 기업 문서만 집중적으로 학습하면 기존에 습득한 일반 지식을 잃을 수 있기 때문에, 이를 방지하기 위해 범용 문서도 함께 활용한 것입니다.
그 다음에는 미세조정한 모델과 기존 모델을 병합(Model Merging)했습니다. 이를 통해 기존 모델의 범용적인 능력은 유지하면서 기업 현장 문서를 이해하는 능력을 높였습니다. 마지막으로 일반적인 학습만으로는 개선하기 어려운 복잡한 표나 특수한 문서 구조를 별도로 모아 강화학습을 적용했습니다. 그 결과 문서 구조를 파악하고 내용을 정확하게 추출하는 능력을 더욱 향상시킬 수 있었습니다. 즉, LG CNS는 모델 미세조정 → 모델 병합 → 어려운 사례 중심의 강화학습이라는 3단계 전략을 통해 범용성과 현장 특화 성능을 동시에 확보했습니다.
이렇게 학습한 모델은 실제 문서에서 무엇을 달라지게 할까요? LG CNS 자체학습 모델이 한국 기업 문서의 구조를 실제로 어떻게 추출하는지, 네 가지 사례를 통해 살펴보겠습니다. 비교 대상은 문서 파싱 분야의 대표적 공개 벤치마크인 OmniDocBench에서 최고 성능(State-of-the-art, SOTA, 2026-09-03 기준)을 기록한 오픈 파서 PaddleOCR-VL-1.6입니다.

<사례 1: 표 내부 주석>
첫 번째 사례는 표 안에 세부 정보 및 주석이 섞인 실적 보고서입니다. 오픈파서는 주석을 누락하거나, 올바른 셀이 아닌 별도의 셀에 배치하는 경향이 있습니다. 반면 자체학습 모델은 각 주석을 해당하는 셀에 정확히 매핑하여 추출합니다.

<사례 2: 표 외부 열>
두 번째 사례는 표 오른쪽 테두리 밖에 “인원” 이라는 별도 열이 주석으로 붙어 있는 문서입니다. 오픈파서는 이 외부 정보를 표의 일부로 인식하지 못하여 파싱 결과에서 누락했습니다. 반면 자체학습 모델은 해당 정보를 추가 열로 판단해 본 표와 함께 추출하는 것을 확인할 수 있습니다.

<사례 3: 표 내부에 중첩된 표 구조>
세 번째 사례는 셀 안에 또 다른 표가 들어 있는 중첩 구조의 예산현황표입니다. 오픈파서는 내부 표를 별개의 구조로 인식하지 못해 바깥 표의 셀 값과 뒤섞어 출력합니다. 반면 자체학습 모델은 셀 내부의 하위 표를 독립된 데이터 구조로 인식하고, 바깥 표와 구분된 계층 구조로 보존합니다.

<사례 4: ㄱ자 형태의 병합셀>
마지막으로 열의 위치가 계층 관계를 결정하는 ㄱ자형 병합 구조를 살펴보겠습니다. HTML의 표 문법은 실제로는 ㄱ자 형태의 병합을 지원하지 않습니다. 그래서 오픈파서는 "산업계"와 그 하위 항목인 "대기업", "중견기업"을 같은 층위의 항목으로 처리합니다. 반면 자체학습 모델은 상하위 관계를 정확히 파악해, 추출된 표에서도 원본의 계층 구조를 그대로 유지합니다.

이러한 차이는 한국어 현장 문서로 구성한 자체 정량 평가에서도 확인할 수 있습니다. 이 평가셋의 종합 성능에서 자체학습 모델은 SOTA 오픈파서(PaddleOCR-VL-1.6)을 웃돕니다. 특히 오픈 파서는 재무 도메인의 표인식에서 성능이 크게 떨어지는데, 재무 자료가 병합 셀, 주석, 표 외부 정보를 가장 복잡하게 쓰는 문서 유형이기 때문입니다. 반면 자체학습 모델은 바로 이 영역에서 가장 큰 폭으로 개선됐습니다. 위 네 사례에서 본 '문서 패턴'을 학습한 효과가 지표에서도 가장 뚜렷하게 나타난 지점입니다.
이러한 추출 능력은 단순히 파싱 정확도 지표의 개선에 머물지 않습니다. 표의 구조를 정확히 보존해야 AI가 "어느 부문의 어떤 항목이 얼마인지"를 특정할 수 있고, 주석까지 올바르게 인용하여 답변의 근거를 추적할 수 있습니다. 파싱 품질이 RAG 답변 품질의 상한선을 결정한다는 점에서, 파서의 개선은 곧 답변 품질의 개선으로 이어집니다.
실무 관점에서 가장 큰 변화는 문서 포맷과 템플릿별 전처리, 추출 로직을 개발해야 하는 부담이 줄어든다는 점입니다. 기존에는 기업이 보유한 문서 유형마다 표의 구조와 배치, 각주와 단위 표기 등을 분석한 뒤, 이에 맞는 전처리 방식과 데이터 추출 로직을 별도로 설계, 구현해야 했습니다. 문서 유형이 다양하고 자료가 수만 건에 이르면 이러한 개발과 유지보수에 상당한 시간과 인력이 필요합니다. 문서 구조를 이해하는 파서는 다양한 문서의 공통적인 구조적 특성을 자동으로 파악하고 데이터화함으로써, 템플릿별 전처리 및 추출 로직 개발에 필요한 부담과 시간을 크게 줄여줍니다.
결국 한국 기업 문서에 특화된 비주얼 파서는 RAG 도입에 필요한 문서 전처리와 개발 부담을 낮추는 역할을 합니다. 기업은 문서 포맷과 템플릿별로 별도의 추출 로직을 구축하는 데 드는 시간과 노력을 줄이면서, 기존 업무 자료를 RAG에 활용할 수 있습니다. 또한 구조가 복잡해 그동안 적용이 어려웠던 재무·금융 분야까지 활용 범위를 확장할 수 있습니다. 이는 RAG를 잘 정제된 문서에만 적용할 수 있는 기술에서 벗어나, 별도의 정제 부담이 큰 실제 현장의 업무 문서에도 적용할 수 있는 기술로 확장하는 기반이 됩니다.

<콘텐츠 특성에 따라 최적의 파싱 전략을 선택·조합하는 Agentic Parser 구조>
Visual Parser가 다뤄야 할 대상은 표에 머물지 않습니다. 실제 업무 문서에는 차트, 다이어그램, 이미지처럼 의미가 시각적으로 표현된 정보가 함께 존재하며, 각각의 특성에 맞는 방식으로 재구성되어야 합니다. 표는 행·열과 병합 관계를 보존한 구조화 데이터로, 다이어그램은 객체 간 관계와 흐름으로, 이미지는 그 안에 담긴 핵심 의미로 변환할 수 있어야 합니다. 문서 파싱은 이제 텍스트와 표를 정확하게 복원하는 단계를 넘어, 다양한 시각 정보를 의미 있는 데이터로 바꾸는 단계로 확장되고 있습니다.
이때 중요한 것은 모든 콘텐츠를 동일한 방식으로 처리하는 것이 아니라, 문서와 페이지의 특성에 맞는 파싱 전략을 선택하는 것입니다. 단순한 텍스트 페이지와 복잡한 재무제표, 시각 정보가 중심인 차트나 다이어그램을 모두 같은 고비용 모델로 처리하면 정확도와 비용을 동시에 최적화하기 어렵습니다. 문서의 구조와 콘텐츠 유형을 먼저 파악한 뒤, 각각에 적합한 처리 방식을 적용해야 합니다.
이러한 판단과 선택을 자동화하는 개념이 에이전트 기반 파싱(Agentic Parsing)입니다. Agentic Parser는 간단한 문서를 Rule 기반 Parser로 빠르게 처리하고, 문자 인식이 필요한 영역에는 OCR을, 복잡한 구조나 시각적 해석이 필요한 영역에는 VLM을 선택적으로 적용합니다. 또한 하나의 문서 안에서도 표·본문·차트·이미지의 종류와 난이도에 따라 서로 다른 파싱 전략을 조합할 수 있습니다.
향후에는 이러한 파싱 전략의 선택과 결과 검증, 오류 보정까지 자동으로 수행하는 지능형 Agentic Parser로 발전시킬 계획입니다. 궁극적으로 문서 파서의 경쟁력은 하나의 거대한 모델에만 있는 것이 아니라, 다양한 기술을 문서의 특성에 맞게 조율하는 능력에 있습니다. 향후에는 한국 기업 문서의 다양한 형식과 특성을 반영한 지능형 파싱 체계를 고도화해, 복잡한 업무 문서를 별도의 수작업을 최소화하면서 AI가 활용할 수 있는 구조화된 지식으로 전환하는 방향으로 발전해 나갈 것입니다.
A1. RAG를 구축했는데 답변 품질이 기대에 못 미친다면 임베딩 모델이나 검색 알고리즘만이 아니라 문서 파싱 결과를 함께 확인하는 것이 좋습니다. 원문의 표 구조나 각주 연결이 소실된 상태로 데이터베이스가 구축되었다면, 이후 단계를 개선해도 답변 품질은 회복되지 않습니다. 실제로 문서 몇 건을 추출해 원본과 나란히 비교해 보면 항목과 숫자가 어긋났는지, 계층이 사라졌는지 바로 확인할 수 있습니다.
A2. 기존 OCR과 비주얼 파서(Visual Parser)가 다른 점은 OCR은 이미지의 글자를 문자 시퀀스로 변환하는 데 그치지만, 비주얼 파서는 문서 영역을 보고 구조와 의미를 함께 판단합니다. 예를 들어 표가 몇 행 몇 열로 병합되어 있는지, 문단을 어떤 순서로 읽어야 하는지를 맥락적으로 해석해 HTML이나 마크다운 같은 구조화된 형태로 출력합니다. 원본에 숫자가 적혀 있지 않은 차트를 막대 높이와 축 눈금으로부터 표로 복원하는 작업은 OCR 기반 파이프라인으로는 불가능한 영역입니다.
A3. 공개 벤치마크 점수와 실제 사내 문서에서의 성능은 다를 수 있습니다. 주요 파서들은 영문 논문, 웹 문서 중심으로 구축된 벤치마크로 학습·평가되어 있어, 한국식 보고 양식이나 다단 병합 표, 결재란이 포함된 문서에서는 성능이 떨어질 수 있습니다. 도입 전 실제 사용할 문서로 자체 평가세트를 구성해 검증하는 절차를 권장합니다.
A4. 일반적인 Rule 기반 또는 OCR 기반 파싱만으로는 표 및 차트 구조가 훼손될 수 있습니다. 복잡한 형태의 표와 차트의 시각 정보를 이해하는 Visual Parser를 활용하면 구조화된 데이터로 변환해낼 수 있습니다. 이를 통해 표와 차트가 많은 문서에서도 RAG 품질을 높일 수 있습니다.
2) GLM-OCR
3) dots.ocr
4) Deepseek-OCR
5) OmniDocBench

본 콘텐츠는 저작권법에 의해 보호받는 저작물로 LG CNS에 저작권이 있습니다.
사전 동의 없이 2차 가공 및 영리적인 이용을 금합니다.
기업명을 두 글자 이상 입력해주세요.
소식을 받아 보시려면 마케팅 정보 활용과 마케팅 정보 수신에 모두 동의해 주셔야 합니다.
제출이 완료되었습니다.
제출이 완료되었습니다.
확인 버튼을 누르시면 자사 홈페이지 홈화면으로 이동됩니다.
요청하신 자료가 이메일로 발송되었습니다.
구독 설정이 저장되었습니다.
잘못된 접근입니다. 정상적인 경로를 통해 다시 시도해 주세요.
검색 중 오류가 발생했습니다. 다시 시도해주세요.
제출에 실패하였습니다.
다시 시도해주세요.
사업자등록번호는 10자리를 입력해주세요.
지원하지 않는 파일 형식입니다.
10MB 이하의 파일만 업로드하실 수 있으며, 최대 10개까지 첨부 가능합니다.
10MB 이하의 파일만 업로드하실 수 있습니다.
파일은 최대 10개까지만 첨부하실 수 있습니다.
업로드 중 오류가 발생했습니다. 다시 시도해 주세요.
파일을 교체하시겠습니까?