- 들어가며
- 이 글이 순위를 매기지 않는 이유
- 문서 이해에서 지금 실제로 어려운 것
- 읽을 만한 기술 리포트 열 편
- OCR-free Document Understanding Transformer (Donut)
- Nougat: Neural Optical Understanding for Academic Documents
- General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
- olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models
- DeepSeek-OCR: Contexts Optical Compression
- DeepSeek-OCR 2: Visual Causal Flow
- GLM-OCR Technical Report
- Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
- MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
- OCRBench v2
- 저자들이 스스로 밝힌 한계
- 실무자는 무엇부터 읽어야 하나
- 확인 방법과 시점
- 직접 해보기
- 참고 자료
들어가며
시리즈 2편은 OCR과 문서 이해입니다. 이 영역은 이상하게도 "이미 풀린 문제"로 취급받으면서 실무에서는 계속 사람을 괴롭힙니다. RAG 파이프라인을 만들어 본 사람이라면 검색 품질이 임베딩이 아니라 PDF 파서에서 무너지는 경험을 한 번쯤 했을 겁니다.
논문 정보는 2026-08-12에 원문에서 직접 확인했습니다. 이 분야는 빠르게 바뀌므로 최신 상태는 직접 확인하세요.
이 글이 순위를 매기지 않는 이유
문서 파싱 점수는 특히 위험합니다. 같은 이름의 벤치마크라도 버전이 올라가면 문서 구성과 채점 규칙이 바뀝니다. 표 구조 복원을 어떻게 정규화하느냐, 읽기 순서를 얼마나 엄격히 볼 것이냐에 따라 같은 모델의 점수가 몇 점씩 움직입니다.
그래서 여기서는 "누가 몇 점"이 아니라 각 리포트가 어떤 실패 유형을 겨냥했는지를 읽습니다. 인용한 수치는 전부 저자 자체 측정이며 독립 평가가 아닙니다.
문서 이해에서 지금 실제로 어려운 것
[문서 파싱이 무너지는 지점]
레이아웃 : 다단 편집, 각주, 캡션이 본문 순서를 흐트러뜨림
표 : 병합 셀과 중첩 헤더의 구조 복원
수식 : 이미지에서 마크업으로 되돌리기
순서 : 사람이 읽는 순서를 기계가 복원하기
비용 : 페이지 단위 비용이 곧 코퍼스 규모의 상한선
최근 리포트들의 공통 관심사는 마지막 줄입니다. 정확도를 조금 올리는 것보다 페이지당 비용을 한 자릿수 줄이는 편이 데이터셋 규모를 바꾸기 때문입니다.
읽을 만한 기술 리포트 열 편
OCR-free Document Understanding Transformer (Donut)
arxiv.org/abs/2111.15664 — 2021-11-30 등록, v5는 2022-10-06. 저장소는 clovaai입니다.
OCR 엔진을 파이프라인에서 아예 빼자는 제안입니다. 초록이 드는 이유가 지금도 유효합니다. OCR 비용, 언어와 문서 유형에 따른 경직성, 그리고 OCR 오류가 뒤 단계로 전파되는 문제입니다. 저자들은 이 방향의 첫걸음이라고 스스로 위치를 잡습니다.
Nougat: Neural Optical Understanding for Academic Documents
arxiv.org/abs/2308.13418 — 2023-08-25 등록.
학술 PDF를 마크업으로 되돌리는 비전 트랜스포머입니다. 초록의 문제 제기가 핵심입니다. PDF는 의미 정보를 잃어버리며 특히 수식에서 손실이 큽니다. 수식이 많은 코퍼스를 다룬다면 이 지점을 먼저 이해해야 합니다.
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
arxiv.org/abs/2409.01704 — 2024-09-03 등록.
"문자"의 정의를 넓힌 것이 이 리포트의 기여입니다. 평문뿐 아니라 수식과 분자식, 표, 차트, 악보, 도형까지 하나의 5.8억 파라미터 모델이 처리한다고 밝힙니다. 좌표나 색으로 영역을 지정하는 대화형 인식, 동적 해상도, 다중 페이지도 함께 지원합니다.
olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models
arxiv.org/abs/2502.18443 — 2025-02-25 등록, v3는 2025-07-02.
10만 개 이상 PDF에서 뽑은 26만 페이지로 7B 비전 언어 모델을 파인튜닝한 오픈소스 툴킷입니다. 여기서 중요한 숫자는 정확도가 아니라 비용입니다. 100만 페이지 변환에 약 176달러로, 상용 API 대비 자릿수가 다르다고 보고합니다. 함께 공개한 olmOCR-Bench는 PDF 1,400건 규모입니다.
DeepSeek-OCR: Contexts Optical Compression
arxiv.org/abs/2510.18234 — 2025-10-21 등록.
문제 설정이 특이합니다. OCR을 텍스트 추출이 아니라 컨텍스트 압축 수단으로 봅니다. 압축비 10배 미만에서 OCR 정확도 97%, 20배에서도 약 60%를 유지한다고 보고하고, A100 40G 한 장으로 하루 20만 페이지 이상 학습 데이터를 만들 수 있다고 밝힙니다. 저자들은 이 작업을 타당성을 확인하는 초기 조사라고 스스로 규정합니다.
DeepSeek-OCR 2: Visual Causal Flow
arxiv.org/abs/2601.20552 — 2026-01-28 등록.
후속 리포트는 시각 토큰의 순서를 건드립니다. 기존 비전 언어 모델이 토큰을 래스터 스캔 순서로 고정해 넣는 것이 사람의 시선 이동과 어긋난다는 문제 제기입니다. DeepEncoder V2가 언어 모델에 넘기기 전에 시각 토큰을 의미에 맞춰 재배열하며, 2차원 이미지 이해를 1차원 인과 구조 두 개의 연쇄로 풀 수 있는지 묻습니다.
GLM-OCR Technical Report
arxiv.org/abs/2603.10910 — 2026-03-11 등록, v2는 2026-03-16.
0.4B CogViT 인코더와 0.5B GLM 디코더를 합친 0.9B 규모입니다. 디코딩 가속을 위한 다중 토큰 예측과, 레이아웃 분석 뒤 영역별 인식을 병렬로 돌리는 2단 파이프라인이 핵심입니다. 엣지와 대규모 배치 양쪽을 겨냥한다고 밝힙니다.
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
arxiv.org/abs/2603.13398 — 2026-03-11 등록.
4B 비전 언어 모델 하나로 파싱과 레이아웃 분석과 이해를 묶습니다. 흥미로운 장치는 Layout-as-Thought로, 특수 토큰으로 촉발되는 선택적 사고 단계에서 구조화된 레이아웃 표현을 먼저 만든 뒤 최종 출력을 냅니다. 저자들이 명시한 문제의식이 좋습니다. 종단간 OCR로 가면 명시적 레이아웃 분석 능력을 잃는다는 것입니다. 보고 수치는 OmniDocBench v1.5에서 93.12, olmOCR-Bench에서 79.8이며 모두 자체 측정입니다.
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
arxiv.org/abs/2604.04771 — 2026-04-06 등록, v2는 2026-04-09.
이 리포트의 관찰이 이 영역 전체에 대한 진단입니다. 구조가 다른 모델들이 같은 어려운 샘플에서 똑같이 실패한다는 것, 즉 병목이 아키텍처가 아니라 데이터라는 주장입니다. 1.2B 구조를 그대로 두고 학습 데이터를 1천만 미만에서 6,550만으로 늘리고, 모델 간 합의로 라벨 신뢰도를 올리고, 어려운 샘플을 반복 정제했습니다. OmniDocBench v1.6에서 95.69를 보고합니다. 선행 리포트인 MinerU(arxiv.org/abs/2409.18839)도 함께 보면 좋습니다.
HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
arxiv.org/abs/2607.04884 — 2026-07-06 등록, v2는 2026-08-06.
경량 모델의 지연을 정면으로 다룹니다. 트랜스포머 추론 6.37배, vLLM 환경에서 2.14배 가속을 보고하며, 문서 파싱과 텍스트 스포팅, 정보 추출, 이미지 번역, 다중 이미지 이해를 한 모델에 묶습니다. 데이터 구축을 에이전트로 자동화한 Agentic Data Flow도 함께 소개합니다.
OCRBench v2
arxiv.org/abs/2501.00321 — 2024-12-31 등록, v2는 2025-06-05.
이 목록에서 모델이 아닌 유일한 항목이고, 어쩌면 가장 먼저 읽어야 할 항목입니다. 31개 시나리오, 사람이 검증한 1만 개 문답, 비공개 테스트셋 1,500장으로 구성됩니다. 저자들의 결론이 냉정합니다. 대부분의 대형 멀티모달 모델이 100점 만점에 50점 미만이며, 희소 텍스트 인식과 세밀 지각, 레이아웃 지각, 복합 요소 파싱, 논리 추론에서 무너진다고 보고합니다.
저자들이 스스로 밝힌 한계
- DeepSeek-OCR 초록은 이 작업이 타당성 확인 단계의 초기 조사라고 명시합니다. 압축비별 정확도 수치를 제품 사양처럼 읽으면 안 됩니다.
- Qianfan-OCR 초록은 종단간 방식이 명시적 레이아웃 분석 능력을 잃는다는 점을 문제로 인정하고 그 보완책을 제시합니다.
- HunyuanOCR-1.5는 고문자 OCR과 저자원 다국어 파싱 같은 롱테일 능력을 개선 대상으로 언급합니다.
- MinerU2.5-Pro는 데이터 공학에 집중한 결과이며, 구조적 제약을 다뤘다고 주장하지 않습니다.
- OCRBench v2가 보고한 낮은 점수는 이 영역이 해결되지 않았다는 저자들의 직접적인 진술입니다.
실무자는 무엇부터 읽어야 하나
파이프라인을 처음 만든다면 OCRBench v2를 먼저 읽으세요. 어떤 실패가 남아 있는지 알고 시작하는 것과 모르고 시작하는 것은 다릅니다.
대량 코퍼스를 만들어야 한다면 olmOCR과 MinerU2.5-Pro입니다. 전자는 페이지당 비용의 관점, 후자는 데이터 품질의 관점을 줍니다.
지연이 제약이라면 GLM-OCR과 HunyuanOCR-1.5를 보세요. 두 리포트 모두 정확도가 아니라 디코딩 속도를 1급 목표로 놓습니다.
컨텍스트 비용이 고민이라면 DeepSeek-OCR 계열이 재미있습니다. 텍스트를 이미지로 압축해 컨텍스트를 절약한다는 발상 자체가 다른 문제 정의입니다.
확인 방법과 시점
이 글의 열 편은 모두 2026-08-12에 arXiv 초록 페이지를 직접 열어 확인했습니다. 열지 못한 후보는 인용하지 않았습니다. 벤치마크 수치는 전부 저자 보고이며, 평가 하네스와 프롬프트가 달라지면 값이 달라집니다.
직접 해보기
- 이미지에서 텍스트 추출 (OCR) — 브라우저에서 바로 돌아가는 OCR입니다. 손글씨나 표가 있는 이미지를 넣어 보면 리포트들이 말하는 실패 유형을 몸으로 알게 됩니다.
- ML 학습 데이터 탐색기 — 문서 이해 모델이 어떤 형태의 데이터를 먹는지 예시로 확인할 수 있습니다.
시리즈 이전 편: 텍스트 LLM 기술 리포트, 무엇을 읽을 것인가
시리즈 다음 편: 비디오 생성·이해 기술 리포트, 무엇을 읽을 것인가
참고 자료
- OCR-free Document Understanding Transformer (arXiv 2111.15664): arxiv.org/abs/2111.15664
- Nougat: Neural Optical Understanding for Academic Documents (arXiv 2308.13418): arxiv.org/abs/2308.13418
- General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model (arXiv 2409.01704): arxiv.org/abs/2409.01704
- MinerU: An Open-Source Solution for Precise Document Content Extraction (arXiv 2409.18839): arxiv.org/abs/2409.18839
- OCRBench v2 (arXiv 2501.00321): arxiv.org/abs/2501.00321
- olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models (arXiv 2502.18443): arxiv.org/abs/2502.18443
- DeepSeek-OCR: Contexts Optical Compression (arXiv 2510.18234): arxiv.org/abs/2510.18234
- DeepSeek-OCR 2: Visual Causal Flow (arXiv 2601.20552): arxiv.org/abs/2601.20552
- GLM-OCR Technical Report (arXiv 2603.10910): arxiv.org/abs/2603.10910
- Qianfan-OCR: A Unified End-to-End Model for Document Intelligence (arXiv 2603.13398): arxiv.org/abs/2603.13398
- MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale (arXiv 2604.04771): arxiv.org/abs/2604.04771
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better (arXiv 2607.04884): arxiv.org/abs/2607.04884
현재 단락 (1/59)
시리즈 2편은 OCR과 문서 이해입니다. 이 영역은 이상하게도 "이미 풀린 문제"로 취급받으면서 실무에서는 계속 사람을 괴롭힙니다. RAG 파이프라인을 만들어 본 사람이라면 검색 ...