
RAG 성능이 모델보다 문서 상태에서 먼저 갈리는 이유
GPU를 늘렸는데도 벡터화가 며칠씩 걸리고,
검색은 되는데 답이 자꾸 빗나가는 경우가 있습니다.
이때 먼저 의심해야 할 것은 모델 파라미터보다
입력 문서의 상태입니다.
RAG는 문서를 읽고, 쪼개고, 임베딩하고,
다시 찾는 과정 전체가 연결돼 있어서
초입 데이터가 지저분하면 뒤 단계가 모두 흔들립니다.
특히 PDF는 텍스트만 담긴 파일이 아닙니다.
본문, 표, 머리글, 바닥글, 스캔 이미지, 숨은 레이어,
메타데이터가 한데 섞여 있습니다.
파서가 이 구조를 안정적으로 풀지 못하면
읽는 순서가 어긋나고, 표 셀 관계가 무너지고,
이미지 안 글자가 OCR 과정에서 틀어집니다.
그 상태로 청킹과 임베딩이 이어지면 검색 정확도가
떨어지는 쪽이 더 자연스럽습니다.
문제가 생기는 지점은 둘입니다.
하나는 속도이고, 다른 하나는 순도입니다.
속도 측면에서는 데이터 로딩 병목이 자주 숨어 있습니다.
NVIDIA는 기존 데이터 로더를 감싸는 방식으로
데이터 로딩 병목을 탐지하는 가이드를 따로 두고 있고,
AWS도 딥러닝 학습에서 비싼 GPU가 CPU 기반
전처리 때문에 덜 쓰이는 문제가 흔하다고 설명합니다.
즉, 연산 장비가 부족해서가 아니라 데이터를
제때 먹이지 못해서 느린 경우가 적지 않습니다.
정확도 측면에서는 OCR과 파싱 품질이 중요합니다.
IBM은 OCR을 이미지 속 문자를 기계가 읽을 수 있는
텍스트로 바꾸는 과정이라고 설명하는데, 이 변환은
원본이 흐리거나 노이즈가 많을수록 불안정해집니다.
스캔 PDF나 이미지형 문서는 이 단계에서
이미 오염이 시작될 수 있습니다.
결국 RAG의 본질은
'문서를 얼마나 많이 넣었는가'가 아니라
'문서를 얼마나 읽기 좋은 상태로 바꿨는가'에 가깝습니다.
그래서 문서 전처리는 저장공간 절약용 부가 작업이
아니라 검색 품질을 정하는 첫 번째 설계 항목입니다.

PDF를 가볍게 만든다고 다 같은 결과가 아닌 이유
문서 경량화는 크게 두 갈래로 나뉩니다.
하나는 ZIP처럼 파일을 묶거나 다시 풀어야 하는
일반 압축입니다.
다른 하나는 PDF 자체를 바로 읽을 수 있는
상태로 두면서 내부 이미지와 노이즈를 다듬는
콘텐츠 용량 최적화입니다.
일반 압축은 검색 증강 생성 파이프라인에
바로 넣기에는 치명적인 약점이 있습니다.
압축 해제, 임시 저장, 재색인 같은 과정이 추가되기 때문입니다.
규정집 수만 권이나 일 단위 대량 유입 환경에서는
이 작은 단계가 누적 병목으로 바뀝니다.
반면 콘텐츠 용량 최적화는 원본 확장자와 문서 형식을
유지한 채 물리적 크기만 줄이는 데 초점이 있습니다.
파이프라인을 다시 짜지 않고도 기존 파서, 임베딩,
인덱싱 흐름에 바로 태울 수 있어 I/O 부하를
근본적으로 덜어냅니다.
여기서 중요한 것은 '얼마나 줄였는가'보다
'무엇을 건드리지 않았는가'입니다.
기존 JPEG 계열 압축이나 단순 인코딩은
이미지 안 글자 주변에 미세한 노이즈를 만듭니다.
사람 눈에는 비슷해 보여도 OCR이나 비전 모델은
경계선 변형에 민감하게 반응하여 오독을 일으킵니다.
텍스트 레이어, 문서 구조, 메타데이터가
완벽히 유지돼야 이후 검색 품질이 흔들리지 않습니다.
용량만 줄이고 가독성이 무너지면 검색 정확도를
제물로 바친 것이나 다름없습니다.
AI 친화적 문서는 어떻게 점검해야 할까
실무에서는 '용량이 큰 PDF'보다
'읽기 어려운 PDF'가 더 큰 문제입니다.
점검 기준은 네 가지면 충분합니다.
첫째, 텍스트 레이어가 살아 있는가.
둘째, 표와 다단 편집 등 문서 구조가 보존되는가.
셋째, 메타데이터와 문서 속성이 유지되는가.
넷째, 대량의 문서가 유입될 때 I/O 및 파싱 지연 없이 빠르게 처리되는가.
이 기준을 바탕으로 자가 진단을 해보세요.
현재 벡터화 시간이 느린 이유가
GPU 연산 때문인가요,
아니면 문서 전처리 대기 시간 때문인가요?
추출된 원문 자체가 깨져 있나요?
여기에 '그렇다'가 나온다면
콘텐츠 용량 최적화를 검토해야 합니다.

RAG 검색 품질과 속도를 동시에 잡는 해답, '파일프레소'
이 지점에서 RAG 파이프라인의 문서 병목을
근본적으로 해결할 대안으로
'파일프레소(Filepresso)'를 주목할 필요가 있습니다.
파일프레소는 PDF, DOC, HWPX 같은
업무용 문서부터 이미지, 영상에 이르기까지
원본의 포맷과 메타데이터를 그대로 유지한 채
물리적 용량만 획기적으로 줄여주는
콘텐츠 용량 최적화 솔루션입니다.
파일프레소가 RAG 시스템에 최적화된 이유는 명확합니다.
첫째, 완벽한 구조 보존과 가독성 유지입니다.
파일프레소는 타사 대비 높은 PSNR(화질 평가 지수)을
기록하여 텍스트 주변의 붉은 노이즈를 억제합니다.
즉, OCR 인식률과 파싱 안정성을 유지하면서
입력 데이터를 최대 90%까지 가볍게 만듭니다.
둘째, 파이프라인 즉시 연동입니다.
일반 압축과 달리 '해제' 공정이 없으므로,
기존 EDMS나 RAG 파이프라인에 전혀 손을 대지 않고
문서를 바로 읽힐 수 있어 운영 비용과 대기 시간을
획기적으로 낮춥니다.
실무 관점에서 '문서를 다시 포장하지 않고
바로 읽게 두는 가장 진보된 경량화'인 셈입니다.
파일프레소의 기술력은 대규모 문서와 이미지가 섞인
엔터프라이즈 환경에서 이미 입증되었습니다.
메리츠화재는 2천만 개의 이미지 용량을 81% 절감했고,
서울특별시는 홈페이지 내 이미지 및 동영상 용량을
평균 73% 줄였습니다.
행정안전부 안전신문고역시 평균 70%의 용량을
줄이면서도 오히려 차량 번호판 식별력(가독성)을
개선하는 성과를 거두었습니다.
이는 '원본 해석력 유지'와 '부피 감소'가
동시에 달성될 때 RAG 및 AI 파이프라인의
실질적인 운영 지표가 얼마나 개선될 수 있는지
보여주는 증거입니다.
망분리 환경, 폐쇄망 구축, 대량 문서 색인,
그리고 검색 신뢰도 이슈가 걸려 있는 조직이라면
파일프레소 도입 검토의 우선순위는 더욱 올라갑니다.
제품의 진가는 PoC(기술 검증)에서 즉각 드러납니다.
사내 RAG가 지금 느리고 엉뚱한 답을 내놓는 이유가
모델이 아니라 '문서 상태'에 있다고 의심된다면,
파일프레소로 최적화하여 전후를 비교해 보세요.
벡터화 소요 시간 단축, 검색 응답 속도 향상,
그리고 RAG 오답률 감소라는 세 가지 지표가 동시에
개선되는 것을 확인할 수 있을 것입니다.
콘텐츠 용량 최적화 솔루션, 파일프레소에 대해
궁금한 점이 있으시면
[email protected] 로 언제든 문의주세요💙
