
(출처: arXiv:2609.36136, Figure 1)
Xiaomi-OCR-0 Technical Report
저자: Xin Chen, Anan Du, Feng Feng, Pei Fu, Jian Luan, Longwei Xu, Shaojie Zhang, Hang Li, Heng Qu, Cheng Tan (SeerRay Team)
공개일: 2026년 9월 28일 (arXiv v1, cs.CV)
arXiv: https://arxiv.org/abs/2609.36136
코드: https://github.com/SeerRay-Lab/Xiaomi-OCR-0
모델: https://huggingface.co/SeerRay-Lab/Xiaomi-OCR-0 (Apache-2.0)
데모: https://huggingface.co/spaces/SeerRay-Lab/Xiaomi-OCR-0
분류:OCRDocument ParsingVision-Language ModelReinforcement Learning
한 줄 요약: 0.8B라는 작은 몸집으로 문서 파싱과 문서 이해를 동시에 잡아낸 기술 보고서이며, 그 비결은 "렌더링해서 눈으로 검증하는" 자동 데이터 엔진과 파싱·이해를 함께 돌리는 혼합 강화학습이다.
소형 OCR 전용 비전-언어 모델(VLM)은 강력한 문서 파싱 성능을 보이지만, 값비싼 지도(supervision)에 의존하고 주로 시각-텍스트 재구성에만 초점을 맞추는 경우가 많다. 우리는 문서 파싱과 OCR 중심 이해를 위한 통합 0.8B 모델 Xiaomi-OCR-0를 제안한다. 우리는 전문가 합의(expert consensus), 렌더링 기반 검증(render-based verification), 표적 합성(targeted synthesis)을 결합한 자동 데이터 엔진을 사용해 약 1억 7천만 샘플 규모의 OCR 중심 코퍼스를 구축한다. Qwen3.5-0.8B에서 출발하여, 우리의 점진적 학습 레시피는 Q-Mask 기반 텍스트 앵커링, 지속 사전학습, 그리고 혼합 과제 강화학습(Mix-RL)을 결합한다. Xiaomi-OCR-0는 Real5-OmniDocBench에서 95.24, OmniDocBench v1.6에서 96.83, Wild-OmniDocBench에서 87.94를 달성하며, 5종의 OCR 중심 VQA 벤치마크에서 평균 83.2점에 도달한다. 또한 어블레이션 실험은 파싱 학습이 충분히 이루어진 뒤에는 OCR 중심 이해 지도가 문서 파싱에도 추가적인 이득을 제공함을 보여준다.
초록이 말하는 바는 세 가지다. 첫째, 기존 소형 OCR 모델들은 "이미지의 글자를 다시 텍스트로 옮기는" 재구성 과제에 최적화되어 있고 그 라벨을 얻는 비용이 크다. 둘째, 이 논문은 사람의 라벨링 대신 여러 전문 모델의 합의와 렌더링 기반 자동 검증으로 대규모 코퍼스를 만들고, 위치 정보까지 함께 학습시키는 3단계 레시피로 0.8B 모델을 끌어올렸다. 셋째, 파싱과 이해를 섞어 학습하는 것이 늘 좋은 것은 아니며 순서와 타이밍이 중요하다는 실험적 관찰을 덧붙인다.
문서를 다루는 실무에서 필요한 작업은 보통 두 갈래로 나뉜다. 하나는 파싱이다. PDF나 스캔 이미지를 받아 제목·본문·표·수식·읽기 순서를 구조화된 마크업으로 복원하는 일로, RAG 파이프라인의 전처리 단계가 대표적이다. 다른 하나는 이해다. "이 영수증의 총액은 얼마인가", "이 차트에서 가장 높은 막대는 어느 분기인가"처럼 문서를 읽고 질문에 답하거나 필드를 뽑아내는 일이다.
문제는 이 둘이 보통 다른 모델로 운영된다는 점이다. 파싱은 OCR 전용 소형 모델이, 이해는 범용 VLM이 맡는다. 모델 두 벌을 서빙해야 하고, 파싱 결과가 틀리면 이해 단계가 그 오류를 그대로 물려받는다. 하나의 작은 모델이 두 일을 모두 해내면 서빙 비용과 오류 전파가 동시에 줄어든다.
그런데 통합은 쉽지 않다. 파싱은 이미지를 빠짐없이 글자 단위로 옮기는 정밀한 전사 능력을 요구하고, 이해는 맥락을 잡아 추론하는 의미 파악 능력을 요구한다. 작은 모델에서 두 능력은 제한된 파라미터를 두고 경쟁한다. 게다가 파싱 학습에 필요한 고품질 라벨(표 구조, 수식 LaTeX, 읽기 순서)은 사람이 달기에 가장 비싼 종류의 라벨이다. 이 논문은 라벨 비용과 능력 경쟁 두 문제를 각각 데이터 엔진과 학습 레시피로 공격한다.

(출처: arXiv:2609.36136, Figure 2)
약 1억 7천만 샘플의 코퍼스는 모두 이미지 - 지시문 - 응답 형식으로 통일되어 있고, 텍스트·표·수식을 잘라낸 영역 단위(region-level) 샘플과 전체 문서를 다루는 페이지 단위(page-level) 샘플로 구성된다. 이 코퍼스를 만드는 장치가 세 부분이다.
(a) 앙상블 삼중 합의 (Ensemble Triplet Consensus)
서로 계보가 다른 8개의 공개 OCR 전문 모델 — PaddleOCR-VL-1.6, MinerU2.5-Pro, GLM-OCR, dots.ocr, HunyuanOCR-1.5, TeleOCR, OvisOCR2, Qianfan-OCR — 이 같은 영역을 각자 읽는다. 그 다음 절차는 이렇다.
여기서 유사도 는 모달리티마다 다르게 쓴다. 텍스트는 (정규화 편집거리의 보수), 표는 TEDS, 수식은 CDM이다. 직관은 단순하다. 서로 다른 구조의 모델 여러 개가 같은 답을 내놓으면 그 답은 믿을 만하고, 제각각이면 그 영역은 어렵다는 신호다. 그래서 일치도 구간별로 처리를 갈라 놓는다: 0.9 이상은 그대로 채택, 0.6~0.9는 렌더링 기반 교정으로 보냄, 0.6 미만은 교정 또는 사람 검수.
(b) 렌더링 기반 교정-판정 (Render-Guided Refine-and-Judge)
이 논문에서 가장 재미있는 장치다. 교정 담당은 전문가 풀에 의도적으로 포함시키지 않은 별도의 큰 모델 Qwen3.5-122B다. 상위 2개 전문가의 예측을 초기값으로 받아 최대 3라운드 동안 다음을 반복한다.
현재 후보 라벨 를 다시 이미지로 렌더링해() 원본 이미지 조각과 나란히 놓고 비교한 뒤, 수정 제안 를 받는다.
렌더링 대상 포맷은 텍스트와 표는 HTML, 수식은 LaTeX다. 3라운드로도 결론이 안 나면, 그간의 검증 기록 전체를 보여주고 "반복적으로 틀리는 지점이 무엇인가"를 묻는 2차 비평 단계로 넘긴다. 교정된 후보는 다시 전문가 풀로 돌아가 재합의를 거치고, 거기서 높은 일치도를 받은 것만 최종 코퍼스에 들어간다.
왜 렌더링인가. 표의 셀 병합이 틀렸거나 수식의 괄호 범위가 어긋난 오류는 HTML/LaTeX 문자열만 들여다봐서는 잡기 어렵지만, 그려서 원본과 겹쳐 보면 눈에 띈다. 사람이 조판 교정을 볼 때 하는 일을 그대로 자동화한 셈이다.
(c) 다요인 샘플 마이닝과 표적 합성
샘플마다 세 가지 신호를 기록한다. 전문가 일치도 , 모델이 같은 입력을 여러 번 풀었을 때의 자기 일관성 , 그리고 Qwen3-VL-Embedding 특징을 K-Means로 묶은 의미 클러스터 다. 샘플링 확률은
로 두어, 라벨은 믿을 만하지만( 높음) 모델이 흔들리는( 낮은 일관성) 구간을 하드 샘플로 집중 수집한다. 학습/검증 분할은 출처 문서 단위로 나누고, 검증 분할은 합성 데이터의 입력에서 완전히 배제해 누수를 막았다 — 기술 보고서치고 꼼꼼한 부분이다.
합성은 두 방향이다. 커버리지 기반 합성은 샘플이 적은 클러스터를 겨냥해 긴 표, 복잡한 헤더, 병합 셀 템플릿과 저자원 문자·폰트·배경을 변형해 채운다. 실패 기반 합성은 하드 검증셋에서 실제로 틀린 사례를 진단하고, 그 난이도를 유지한 채 템플릿·폰트·레이아웃·열화 조건만 바꿔 증식한다. 그렇게 만든 합성 데이터를 기존 학습 데이터에 섞어 고정된 하드 검증셋으로 재평가한 뒤, 효과가 있을 때만 레시피를 채택한다.

(출처: arXiv:2609.36136, Figure 3)
1단계 — Q-Mask 텍스트 앵커링. VLM 위에 질의 조건부 마스크 디코더를 하나 더 얹어, 모델이 텍스트를 토큰으로 생성하는 동시에 그 텍스트가 이미지의 어디에 있는지를 가리키는 마스크까지 예측하게 한다. 손실은
로, 일반적인 다음 토큰 예측 손실에 마스크에 대한 Dice 손실과 픽셀별 교차엔트로피가 더해진다. 효과는 분명하다. 글자를 받아쓰면서 그 위치를 함께 짚어야 하므로, 전체 페이지 파싱을 배우기 전에 내용과 좌표 사이의 정렬이 먼저 몸에 익는다. 이 단계에는 TextAnchor-26M과, 기존 문서 파싱 샘플을 같은 Q-Mask 형식으로 변환한 데이터를 쓴다.
2단계 — 지속 사전학습(CPT). 마스크 디코더는 떼어내고 비전-언어 백본만 이어받는다. 손실은 다음 토큰 예측에 베이스 모델이 이미 갖고 있는 다중 토큰 예측(MTP) 헤드를 함께 학습시키는 항을 더한 형태다.
코퍼스는 문서 파싱을 주축으로 하되 OCR 기반 이해, OCR 캡셔닝, 장면 텍스트·손글씨·서예, 그리고 화학식·차트 같은 롱테일 과제를 섞는다. 모델 카드 기준으로 이 단계는 파싱 데이터의 9% → 29% → 50%를 쓰는 3개 하위 단계로 나뉘며, 뒤에 나오는 "초기/중기/후기" 전이 분석이 바로 이 구간에 대응한다.
3단계 — Mix-RL. GRPO 위에 DAPO 계열의 기법을 얹은 정책 최적화다. 토큰 단위 손실 집계, clip-higher, 동적 샘플링을 쓰고, 참조 정책에 대한 명시적 KL 페널티는 두지 않는다. 보상 분산이 0인 롤아웃 그룹은 버린다.
이름의 "Mix"는 문서 파싱(텍스트·표·수식·전체 페이지)과 OCR 이해(VQA·KIE)를 한 번에 섞어 돌린다는 뜻이다. 보상은 전부 검증 가능한 규칙 기반이고 학습된 리워드 모델을 쓰지 않는다.
| 과제 | 보상 신호 |
|---|---|
| 텍스트 파싱 | 편집 유사도(edit similarity) |
| 표 파싱 | TEDS |
| 수식 파싱 | CDM |
| 전체 페이지 파싱 | (가중치는 정답 내 문자 비중) |
| VQA | ANLS |
| KIE | JSON 유효성 → 필드 매칭 → 필드 값의 정규화 편집 유사도 (누락 필드는 0점) |
파싱 불가·형식 오류·길이 초과 출력은 일괄 0점이다. RL 프롬프트는 2절의 하드 샘플 마이닝 결과를 다시 필터링하고 더 큰 언어모델과 사람이 검수해 만들었다.
비교군으로 등장하는 MOPD는 multi-teacher on-policy distillation, 즉 파싱 교사와 이해 교사(각 4B) 두 명을 두고 증류하는 방식이다. 저자들은 Mix-RL을 이 MOPD와 나란히 놓고 비교한다.
| 모델 | 크기 | OmniDocBench v1.6 ↑ | Real5 ↑ | Wild ↑ |
|---|---|---|---|---|
| Xiaomi-OCR-0 | 0.8B | 96.83 | 95.24 | 87.94 |
| TeleOCR | 1.2B | 96.87 | — | 88.53 |
| OvisOCR2 | 0.8B | 96.58 | 92.29 | 87.91 |
| PaddleOCR-VL-1.6 | 0.9B | 96.33 | 93.19 | 87.36 |
| MinerU2.5-Pro | 1.2B | 95.75 | 88.94 | 87.33 |
| GLM-OCR | 0.9B | 95.22 | 90.32 | 85.08 |
표를 과장 없이 읽으면 이렇다. 표준 벤치마크인 OmniDocBench v1.6(96.83)과 야외 문서인 Wild(87.94)에서는 1.2B인 TeleOCR이 각각 96.87, 88.53으로 오히려 앞선다. Xiaomi-OCR-0의 분명한 우위는 Real5-OmniDocBench의 95.24로, 차순위 PaddleOCR-VL-1.6(93.19)보다 +2.05다. Real5는 촬영·재스캔 같은 실제 획득 조건에서의 강건성을 보는 벤치마크이므로, 이 격차가 가장 실무적인 의미를 갖는 숫자다. 즉 "모든 지표 1위"가 아니라 0.8B라는 크기에서 획득 강건성을 크게 끌어올린 모델로 보는 편이 정확하다.
한편 논문의 Table 1은 소형 OCR 전용 모델뿐 아니라 범용 대형 VLM도 비교군에 올려두는데, 확인된 행만 보면 Ovis2.6-30B-A3B가 93.70, Gemini 3 Pro가 92.91이다. 문서 파싱이라는 좁은 과제에서는 0.8B가 30B급과 프런티어 API 모델을 앞설 수 있다는 익숙한 그림이 여기서도 반복된다.
| 모델 | 크기 | DocVQA | InfoVQA | ChartQA | OCRBench | TextVQA | 평균 |
|---|---|---|---|---|---|---|---|
| Xiaomi-OCR-0 | 0.8B | 93.1 | 75.1 | 84.6 | 84.6 | 78.6 | 83.2 |
| Qwen3.5-0.8B | 0.8B | 88.5 | 60.3 | 69.5 | 77.9 | 68.3 | 72.9 |
| Qwen3.5-2B | 2B | 92.4 | 72.4 | 77.0 | 85.9 | 76.9 | 80.9 |
| Qwen3.5-4B | 4B | 94.4 | 80.4 | 82.4 | 86.6 | 80.8 | 84.9 |
| MiniCPM-V-4.5 | 8B | 84.9 | 69.6 | 87.4 | 89.0 | 82.2 | 82.6 |
여기가 이 논문의 가장 설득력 있는 구간이다. 같은 베이스인 Qwen3.5-0.8B의 평균 72.9에서 83.2로 +10.3이 올랐고, 2.5배 큰 Qwen3.5-2B(80.9)와 10배 큰 MiniCPM-V-4.5(82.6)를 모두 넘었다. 4B 모델(84.9)에는 1.7점 뒤지지만 파라미터는 1/5이다. 벤치마크별로는 DocVQA가 93.1로 가장 강하고, ChartQA·OCRBench·TextVQA에서는 8B 모델이 여전히 우위다. 문서 중심 과제에 특화된 향상이라는 뜻이다.
파싱(OmniDocBench v1.6):
| 설정 | Overall ↑ | Text Edit ↓ | Formula CDM ↑ | Table TEDS ↑ | Table TEDS-S ↑ | Reading Order Edit ↓ |
|---|---|---|---|---|---|---|
| 4B 파싱 교사 | 96.9745 | 0.0308 | 98.4102 | 95.5932 | 97.5050 | 0.1228 |
| 0.8B CPT | 96.4739 | 0.0332 | 98.3444 | 94.3973 | 96.6835 | 0.1221 |
| 0.8B MOPD | 96.7417 | 0.0314 | 98.4677 | 94.8975 | 97.1579 | 0.1223 |
| 0.8B Mix-RL | 96.8277 | 0.0313 | 98.5044 | 95.1087 | 97.1929 | 0.1221 |
이해(VQA 5종):
| 설정 | Overall ↑ | DocVQA | InfoVQA | ChartQA | OCRBench | TextVQA |
|---|---|---|---|---|---|---|
| 4B VQA 교사 | 88.1 | 95.9 | 84.4 | 87.1 | 88.3 | 84.8 |
| 0.8B CPT | 78.1 | 92.2 | 72.5 | 83.4 | 80.6 | 62.0 |
| 0.8B MOPD | 82.7 | 93.1 | 74.8 | 84.2 | 83.9 | 77.5 |
| 0.8B Mix-RL | 83.2 | 93.1 | 75.1 | 84.6 | 84.6 | 78.6 |
0.8B Mix-RL 행의 96.8277이 초록의 96.83과 맞아떨어진다. 즉 출시된 Xiaomi-OCR-0가 곧 0.8B Mix-RL 설정이다. 두 표에서 읽히는 것은 세 가지다.
첫째, 파싱에서 Mix-RL은 CPT(96.47) → MOPD(96.74) → Mix-RL(96.83)로 올라가며 4B 교사(96.97)와의 격차를 0.15로 좁힌다. 파싱은 작은 모델로도 교사를 거의 따라잡을 수 있는 과제라는 뜻이다.
둘째, 이해에서는 78.1 → 82.7 → 83.2로 +5.1이 오르는데, 특히 TextVQA가 62.0 → 77.5 → 78.6으로 +16.6이라는 가장 큰 폭의 개선을 보인다. 다만 4B 교사(88.1)와는 여전히 4.9점 차이가 남는다.
셋째, 그래서 저자들의 결론이 나온다. 파싱은 0.8B로 충분하지만 이해는 파라미터를 더 요구한다. 0.8B → 4B로 키우면 VQA는 약 4.9점 오르는데 파싱은 0.15점밖에 오르지 않는다.
가장 인용할 만한 분석 결과는 이해 데이터를 언제 섞느냐에 따라 파싱 점수의 변화 방향이 바뀐다는 것이다.
| 이해 지도를 추가한 시점 | 파싱 점수 변화 |
|---|---|
| CPT 초기 | -0.330 |
| CPT 중기 | +0.639 |
| CPT 후기 | +0.0749 |
초기에는 해가 되고, 중기에 가장 크게 도움이 되고, 후기에는 효과가 작아진다. 멀티태스크 학습을 "데이터를 다 섞으면 좋다"로 접근하는 관행에 대한 구체적인 반례다. 학습 동역학 측면에서는 MOPD가 더 적은 연산으로 빠르게 수렴하는 반면, Mix-RL은 학습을 길게 가져갈 때 두 능력 모두에서 더 높은 정점에 도달한다고 보고한다.
이 논문은 산업계 기술 보고서 형식이라 독립된 "Limitations" 절을 두지 않는다. 아래는 본문 분석에서 저자들이 스스로 드러낸 제약과, 리뷰어로서 짚고 싶은 부분이다.
Xiaomi-OCR-0가 보여준 것은 "작은 모델도 된다"보다 조금 더 구체적이다. 사람 라벨링 없이도 여러 모델의 합의 + 렌더링 기반 자동 검증으로 문서 파싱용 고품질 라벨을 대규모로 만들 수 있고, 텍스트와 위치를 함께 맞추는 사전학습으로 기초를 깐 뒤 검증 가능한 보상만으로 파싱과 이해를 동시에 강화할 수 있다는 것이다. 그 결과 0.8B 단일 모델이 Real5에서 차순위보다 2점 앞서고, OCR VQA 평균에서 8B 모델을 넘어섰다.
실무 관점에서 가장 실용적인 교훈은 오히려 전이 분석 쪽이다. 문서 처리 파이프라인을 만들 때 파싱 모델과 이해 모델을 하나로 합치려는 시도는 흔하지만, 이 논문은 합치는 순서가 결과를 바꾼다는 것을 숫자로 보여준다. 파싱 기초가 덜 잡힌 상태에서 이해 데이터를 밀어넣으면 손해라는 관찰은, 도메인 특화 문서 모델을 학습시키는 쪽이라면 바로 적용해볼 수 있는 이야기다.
렌더링해서 눈으로 확인하는 검증 루프도 눈여겨볼 만하다. 사람이 교정쇄를 보는 방식을 그대로 자동화한 이 발상은 OCR을 넘어 출력이 다시 렌더링될 수 있는 모든 구조화 과제 — 차트 생성, 다이어그램, UI 코드 — 로 옮겨갈 여지가 있다.
본문에 포함된 이미지는 모두 원논문에서 인용한 것이며, 저작권은 원저자에게 있습니다.
이 글은 논문 학습·리뷰 목적의 개인 정리이며, 해석이나 요약 과정의 오류는 원논문의 입장이 아니라 작성자의 몫입니다. 정확한 내용은 원문을 확인해 주세요.