Mistral OCR 4: 72%는 선호 투표일 뿐, 증거가 아니다

OCR 4의 72% 승률: 블라인드 선호 연구, 600건 이상 문서, 비공개 경쟁사, 미공개 방법론.

Mistral OCR 4: 72%는 선호 투표일 뿐, 증거가 아니다
Share

Mistral의 OCR 4 출시 글은 하나의 숫자, 즉 72% 승률을 앞세웠고, 대부분의 보도도 이를 그대로 반복했습니다. 이 수치를 벤치마크로 받아들이기 전에, 그것이 정확히 어떻게 만들어졌는지 아는 것이 좋습니다. 답은 “점수”가 아니라 “투표”에 가깝기 때문입니다.

72%는 이렇게 집계됐습니다: 쌍대 선호도 평가

72%는 정확도 지표가 아니라 인간 선호도 기준의 승률입니다. Mistral은 2026년 6월 23일 OCR 4를 발표하면서, 독립 평가자들이 문서 하나씩 OCR 4의 출력과 경쟁 모델의 출력을 나란히 보고 어느 시스템이 만든 것인지 모르는 상태에서 비교했을 때 평균적으로 쌍대 비교의 72%에서 OCR 4를 선호했다고 밝혔습니다 (the-decoder, 2026-06). 다시 말해, 이는 문자나 필드가 얼마나 정확히 추출됐는지가 아니라 사람이 어느 출력물을 더 낫다고 봤는지를 측정한 것입니다.

평가 세트는 엄선된 테스트 페이지가 아니라 산업 현장의 사용 사례를 반영하도록 제3자 공급업체에서 확보한 12개 이상 언어의 실제 문서 600건 이상이었습니다 (Mistral, 2026-06). Mistral은 OCR 4가 전체 비교에서 테스트한 모든 주요 시스템을 앞섰다고 말합니다. 이것은 실제 신호이기는 합니다. 블라인드 방식의 나란한 순위 평가는 사람이 실제로 체감하는 출력 품질을 포착하는 합리적인 방법입니다. 다만 이는 공급사가 운영하고 공급사가 보고한 연구이며, 집계값은 보여주는 만큼 많은 것을 가립니다.

공개 글에서 밝히지 않은 부분은 이 주장을 재현하거나 비중 있게 해석하려는 사람에게 중요합니다:

공개된 내용공개되지 않은 내용
블라인드, 쌍대(head-to-head) 비교 형식경쟁 모델의 정체
문서 600건 이상, 12개 이상 언어평가자 수
제3자 출처의 문서 세트경쟁 모델별 승률
72% 집계 승률원본 모델 출력과 문서 세트 자체
평가자는 독립적이었음통계적 신뢰구간 / 평가자 지침

이런 누락은 벤치마크를 해석할 때 보통 사용하는 지렛대를 하나씩 없앱니다. 경쟁 모델별 세부 결과가 없으면 72%가 강력한 시스템을 근소하게 앞선 결과인지, 약한 시스템을 크게 이긴 결과인지 알 수 없습니다. 경쟁 모델 목록이 없으면 “모든 주요 시스템을 앞섰다”는 말은 외부에서 검증할 수 없습니다. 평가자 수나 신뢰구간이 없으면 그 차이가 안정적인지 잡음인지 판단할 방법이 없습니다. 그리고 문서 세트가 비공개이기 때문에 제3자가 같은 비교를 다시 실행할 수도 없습니다.

빌더 입장에서의 실용적 해석은 이렇습니다. 72%는 블라인드 제3자 주석 평가에서 나온 집계값이지, 독립적으로 재현 가능한 벤치마크가 아닙니다 (Mistral, 2026-06). 공급사가 선택한 말뭉치에서 인간 리뷰어가 OCR 4의 출력을 선호했다는 증거로는 의미가 있지만, 직접 보유한 문서에서 모델을 돌려보기 전까지 조달 결정을 설계할 숫자는 아닙니다.

OCR 4가 흔들리는 구간: 수식 표기와 단 구성

Mistral OCR 4: the 72% is preference voting, not proof

OCR 4 출시에서 승률보다 더 유용한 자료는 Mistral이 벤치마킹 과정에서 맞닥뜨린 채점 실패를 점검한 투명성 섹션입니다. 프로덕션 빌더라면 그 자체 점검을 먼저 읽는 편이 좋습니다. 자동 OCR 점수가 실제 품질을 따라가지 못하기 시작하는 지점, 즉 수학·과학 문서와 다단 문서를 정확히 지목하기 때문입니다 . 이는 대부분의 엔터프라이즈 수집 파이프라인이 실제로 중요하게 여기는 문서 유형이기도 하므로, 단서 조항이 헤드라인보다 더 중요합니다.

Mistral의 점검은 몇 가지 구체적인 산출물 유형을 짚습니다. 첫째는 정답 주석 오류입니다. 공개 자동 평가 세트의 기준 라벨 자체가 일부 잘못되어 있으며, 특히 수학과 과학 문서에 오류가 집중됩니다. 즉, 올바른 OCR 출력도 결함 있는 정답지와 비교되어 오답으로 채점될 수 있습니다 . 이는 Mistral만의 불만이 아닙니다. PureDocBench 연구는 OmniDocBench식 평가기가 채점한 블록을 독립적으로 점검해 12.08%의 주석 오류율, 즉 확인된 오류 2,580건을 발견했으며, 이런 평가 세트의 최고 점수가 이제 90%를 넘어서 포화 상태에 가까워 시스템 간 차이를 구분할 여지가 거의 없다고 지적했습니다 .

둘째는 수학 및 LaTeX 표기 격차입니다. 서로 다르지만 유효한 표기로 쓰인 동치 표현이 기준 정답과 불일치로 채점됩니다. 같은 방정식이라도 서식이 다르면 틀린 것으로 기록되는 식입니다 . Mistral은 방정식 분할 차이도 같은 범주에 넣습니다. 기준 데이터가 방정식을 모델과 다른 개수의 블록으로 나누면, 구조적으로 문제가 없는 결과도 비교 과정에서 불이익을 받습니다. 문서 말뭉치에 수식이 많다면, 집계 벤치마크 숫자만으로는 OCR 4가 여러분의 수식을 쓸 만하게 재현하는지 거의 알 수 없습니다.

셋째는 단이 많은 PDF에서의 레이아웃 귀속입니다. 남은 오류 집중 구간은 다단 읽기 순서 가정과 머리말/꼬리말 블록 귀속입니다. 모델과 기준 데이터가 어느 단을 먼저 읽어야 하는지, 또는 반복 머리말을 본문에 포함해야 하는지를 두고 다르게 판단할 수 있고, 채점기는 이런 불일치를 모두 오류로 처리합니다 . Mistral의 입장은 이런 산출물이 실제 추출 실패라기보다 겉보기 오류율을 부풀린다는 것입니다. 그래서 평가 세트의 총점만 믿지 말고 사용자의 실제 문서에서 평가하라고 권하는 이유이기도 합니다.

평가 계획 측면에서 결론은 이렇습니다. 취약 구간은 예측 가능하고, 특정 유형에 몰려 있습니다. 문서가 단일 단의 일반 산문이라면 OCR 4의 벤치마크 숫자는 실제 동작을 꽤 정직하게 반영할 가능성이 큽니다. 반대로 과학 논문, 각주가 있는 재무제표, 2단 보고서라면 공개 점수는 방향성 정도로만 보고, 직접 보유한 파일에서 작은 골드 세트를 만들어야 합니다. 실제 누락과 표기 불일치를 구분할 수 있는 리뷰어가 채점해야 합니다.

Mistral이 자동 평가를 '확정값이 아니라 방향성 지표'라고 부르는 이유

Mistral의 자동 평가 점수는 표면적으로 강하지만, 회사가 스스로 단 단서가 있다. Mistral은 이 점수들을 "확정적이라기보다 방향성을 보여주는 지표"라고 설명하며, 사용자에게 각자의 문서로 직접 평가하라고 말한다 . OCR 4는 OlmOCRBench 85.20(테스트된 모델 중 전체 최고 점수로 설명됨), OmniDocBench 93.07, 그리고 내부 'Crawl Multilingual' 세트 0.98을 보고한다 . 문제는 각주에 있다. 모든 경쟁사 수치는 공식 리더보드 항목이 아니라 Mistral 자체의 내부 재현 결과이며, Mistral은 두 벤치마크 모두 알려진 한계가 있다고 표시한다 .

공개 기록 역시 마케팅보다 신중론에 힘을 싣는다. 현재 OmniDocBench 리더보드(v1.7 기준)는 여전히 "Mistral OCR"을 2503 버전으로 올려 두고 있다. 이는 OCR 4가 아니라 이전 릴리스이며, 점수는 약 85.66으로 OCRVerse, MonkeyOCR-pro-3B, GPT-5.2, Dolphin-1.5, MinerU-Pipeline, olmOCR보다 아래에 있다 . 이것이 OCR 4의 93.07과 모순되는 것은 아니지만, 공개된 동일 채점 규칙 아래 확인할 수 있는 유일한 Mistral 수치는 이전 모델의 것이며, 그 모델은 최상위가 아니라는 뜻이다. OCR 4의 대표 점수는 아직 누구나 재현할 수 있는 공식 공개 항목으로 올라오지 않았다.

점수 / 신호산출 주체
OmniDocBench (OCR 4)93.07Mistral 내부 재현
OlmOCRBench (OCR 4)85.20Mistral 내부 재현
OmniDocBench 공개 항목 (Mistral OCR 2503)~85.66, 6개 이상 시스템보다 낮은 순위공개 v1.7 리더보드
OmniDocBench 기준 주석 오류율12.08% (확인된 오류 2,580개)PureDocBench 감사

잣대 자체를 불신할 이유도 있다. PureDocBench는 OmniDocBench의 정답 주석을 감사해 12.08%의 주석 오류율을 발견했다. 평가자가 채점한 블록 안에서 확인된 오류가 2,580개였고, 상위 점수는 이미 90% 이상에서 포화 상태였다 . 기준 데이터가 그만큼 시끄럽고 상한이 그만큼 좁아져 있다면, 시스템 간 1~2점 차이는 의미 있는 역량 차이라기보다 측정 흔들림에 가깝다.

다국어 성능에는 더 단단한 상한이 있다. 100개 이상의 유니코드 문자를 평가한 GlotOCR Bench는 최전선 OCR 시스템조차 품질이 무너지기 전까지 일반화할 수 있는 문자가 약 30개에 그친다는 점을 발견했다 . OCR 4는 저자원 언어를 포함해 10개 언어군, 170개 언어를 내세우지만, 그 저자원 상한은 거의 확실히 OCR 4에도 적용된다. 그리고 현재 공개 벤치마크 중 OCR 4가 긴 꼬리의 문자 체계에서 어떻게 동작하는지 따로 분리해 보여주는 것은 없다. 이 논문들 중 OCR 4를 직접 테스트한 것은 없다. 다만 Mistral 자신의 경고를 되풀이할 뿐이다. 단일 종합 점수는 오해를 부를 수 있으므로, 리더보드를 믿기 전에 자신의 문서 조합으로 검증해야 한다.

요소 좌표, 블록 유형, 인라인 신뢰도: OCR 4가 추출하는 것

Mistral OCR 4: the 72% is preference voting, not proof

OCR 4는 이전 버전에 없던 세 가지 구조 신호를 반환한다. 문단 및 요소 수준의 경계 좌표, 모든 블록에 붙는 유형 라벨, 그리고 페이지별·단어별 신뢰도 점수다. 이 모든 것은 모델이 이미 생성하던 Markdown 텍스트 위에 함께 얹힌다 . 실제 효과는 추출 결과가 평면적인 문자열에서 벗어나, 페이지 위의 위치가 고정되고 기계가 분류한 지도처럼 바뀐다는 점이다. 빌더 입장에서는 "여기 텍스트가 있다"와 "여기 텍스트가 있고, 어디에 놓였으며, 어떤 요소이고, 모델이 얼마나 확신하는지까지 있다"의 차이다.

가장 중요한 추가 기능은 경계 상자다. 모든 문단과 요소가 좌표를 갖기 때문에, RAG 인용을 그것이 나온 정확한 영역까지 되짚을 수 있고, 깨지기 쉬운 문자열 매칭이 아니라 기하 정보로 서명 블록을 검게 가리는 삭제 작업도 구동할 수 있다 . 공간적 근거가 있어야 "출처를 보여 달라"는 요구가 대략적인 추정이 아니라 감사 가능한 작업이 된다.

유형별 블록 분류도 함께 동작한다. 각 페이지 요소에는 제목, 표, 수식, 서명, 머리글, 바닥글 같은 카테고리가 붙기 때문에, 다운스트림 코드는 레이아웃 휴리스틱을 다시 파싱하지 않고도 유형별로 라우팅하거나 필터링할 수 있다 . 송장 파이프라인은 표 블록만 가져올 수 있고, 컴플라이언스 단계는 서명만 분리할 수 있으며, 검색 인덱스는 청킹 전에 머리글과 바닥글을 제거할 수 있다.

인라인 신뢰도 값은 사람이 검토에 들어갈 지점을 만든다. 단어별·페이지별 점수는 확신도가 낮은 추출을 표시하므로, 문서 전체를 믿거나 전부 감사하는 대신 바로 그 페이지만 검토 대기열에 넣거나 조용히 걸러낼 수 있다 . 여기에 Mistral이 직접 문서화한 수식 및 열 처리 관련 주의점을 결합하면, 신뢰도 점수는 실패 모드가 프로덕션에 도달하기 전에 잡아내는 가장 저렴한 방법이 된다.

"모든 요청은 동일한 기본 OCR 모델에서 실행되며, 항상 추출된 콘텐츠, 경계 상자, 블록 유형, 신뢰도 점수, markdown 텍스트를 반환한다." — Mistral AI, OCR 4 릴리스 노트에서 (source: Mistral AI). 상위 티어인 Document AI 계층은 스키마 형태의 JSON 추출과 커스텀 프롬프트 해석을 추가하며, 구조화 출력은 mistral-small-2603을 통해 처리된다.

지원 범위는 엔터프라이즈용 메시지와 맞아떨어진다. 저자원 언어를 포함해 10개 언어군, 170개 언어를 지원하며, 입력은 PDF, DOC, PPT, OpenDocument 파일로 받을 수 있다 . 모델 카드에 따르면 이 서비스는 Premier v4.0, 모델 식별자 mistral-ocr-4-0+2로 명시되어 있다 . 종합하면, 이런 출력들이 바로 Mistral이 OCR 4를 최종 사용자 제품이 아니라 RAG, 에이전트형, 인간 검증 파이프라인을 위한 수집 구성요소로 설명하는 이유다.

OCR 4의 페이지당 4달러 요금: 프리미엄이 제값을 하는 지점

OCR 4는 API(mistral-ocr-latest)를 통한 온디맨드 사용 기준 1,000페이지당 4달러입니다. 2025년 3월 출시 당시 1달러당 약 1,000페이지였던 기존 Mistral OCR보다 대략 4배 비쌉니다. OCR 4의 타입이 지정된 블록, 좌표, 신뢰도 점수가 원래 직접 구축하고 유지해야 했을 2차 파싱 계층을 대체한다면 이 프리미엄은 설명 가능합니다. 반면 대량의 평면 텍스트 추출만 필요하다면 페이지당 비용에서는 여전히 오픈소스 파서가 이기기 어렵습니다.

구분해야 할 가격대는 세 가지입니다. 기본 OCR 모델은 1,000페이지당 4달러이지만, Batch API로 요청을 라우팅하면 비대화형 처리량 중심 작업에서는 1,000페이지당 2달러로 절반이 됩니다. 상위 티어인 Document AI 제품은 스키마 형태의 JSON 추출, 이미지 주석, 커스텀 프롬프트 해석을 더하며, 구조화 출력은 mistral-small-2603가 처리합니다. 가격은 1,000페이지당 5달러입니다.

티어제공 항목1,000페이지당 가격
기존 Mistral OCR(2503, 2025년 3월)마크다운 텍스트 추출~1달러
OCR 4 — Batch API같은 모델, 처리량 중심 작업2달러
OCR 4 — 온디맨드바운딩 박스, 블록 타입, 신뢰도, 마크다운4달러
Document AIOCR 4 + 스키마 JSON, 주석, 커스텀 프롬프트5달러

계산은 추가 비용이 무엇을 대체하느냐에 달려 있습니다. OCR 4의 모든 요청은 추출된 콘텐츠, 문단 단위 바운딩 박스, 타입이 지정된 블록 분류, 페이지별 및 단어별 신뢰도 점수, 마크다운을 한 번에 반환합니다 . 현재 파이프라인이 더 저렴한 텍스트 추출기에 레이아웃 파서, 표 재구성기, 신뢰도 휴리스틱을 덧붙이는 구조라면 OCR 4는 그 스택을 접어버립니다. 그리고 4달러, 또는 배치 기준 2달러는 원래 직접 떠안았을 엔지니어링을 되사는 비용입니다.

효과가 크지 않은 경우도 있습니다. 구조 요구사항이 없는 고용량 일반 텍스트 수집입니다. 깨끗한 PDF에서 깔끔한 마크다운만 필요하다면, 자체 호스팅 오픈 파서가 원가 기준으로 1,000페이지당 4달러보다 저렴하고 규모가 커질수록 격차는 벌어집니다. 판단 기준은 "OCR 4가 좋은가"가 아니라 "구조화 출력이 내가 직접 배포해야 할 계층을 대체하는가"입니다. 대체한다면 프리미엄은 통합 비용 절감이고, 그렇지 않다면 추가 부담입니다.

온프레미스 OCR 4: 에어갭 컨테이너와 기밀 PDF 추출

Mistral OCR 4: the 72% is preference voting, not proof

규제 산업의 빌더에게 OCR 4에서 가장 중요한 기능은 단일 컨테이너로 완전한 자체 호스팅 배포가 가능하다는 점입니다. 조직은 문서가 경계를 벗어나지 않도록 자체 네트워크 안에서 모델 전체를 실행할 수 있습니다 . 이 기능은 2026년 6월 23일 모델과 함께 발표되었으며, OCR 4를 클라우드 전용 API와 가르는 선입니다. 네트워크를 통해 호출하던 동일한 기반 모델, 즉 Premier v4.0, 식별자 mistral-ocr-4-0+2를 자체 방화벽 뒤에서 에어갭으로 실행할 수 있습니다 .

목표도 분명합니다. 금융, 법률, 의료처럼 민감한 PDF를 제3자 클라우드 엔드포인트로 보내는 것이 계약상 또는 법적으로 불가능한 환경의 데이터 레지던시, 주권, 기밀성 제약입니다 . 앞서 다룬 요소별 바운딩 박스와 단어별 신뢰도 점수를 에어갭 컨테이너와 결합하면, 신뢰 경계 안에서 근거가 있고 감사 가능한 추출을 얻을 수 있습니다. 규제 환경의 검색 및 휴먼 인 더 루프 검토 파이프라인이 실제로 필요로 하는 조합입니다.

이 포지셔닝은 온프레미스 규제 워크플로에서 OCR 4를 Google Document AI, Azure Document Intelligence, AWS Textract 같은 관리형 클라우드 문서 AI 서비스와 정면으로 맞붙게 합니다. 단일 자체 호스팅 컨테이너처럼 고객의 에어갭 인프라 안에서 실행되는 서비스가 아니기 때문입니다 . 또한 이전까지 "우리가 직접 호스팅한다" 영역을 기본적으로 차지하던 오픈 OCR 스택에도 압박을 줍니다.

VentureBeat는 출시 보도에서 이 변화를 직설적으로 표현했습니다. "Mistral launches OCR 4, turning document extraction into a full enterprise AI play" — VentureBeat, 2026-06. 핵심은 엔터프라이즈 포지셔닝입니다. 이것은 최종 사용자 제품이 아니라 배포 통제력을 내세워 판매되는 수집 구성요소입니다.

하드웨어를 준비하기 전에 한 가지 단서가 있습니다. 출시 자료는 자체 호스팅 라이선스 조건이나 최소 하드웨어 사양을 완전히 상세히 밝히지 않았습니다 . 컨테이너가 특정 GPU를 요구하는지, 어느 정도 처리량을 유지하는지, 라이선스 가격이 1,000페이지당 4달러인 API 요금과 어떻게 비교되는지는 아직 열려 있는 질문입니다. 인프라를 확정하거나 현재 스택에서의 이전 예산을 잡기 전에 Mistral과 해당 조건을 확인해야 합니다.

OCR 4 시험판은 어디에 집중해야 할까: 수식 많은 PDF와 빽빽한 다단 레이아웃

OCR 4 시험판은 깔끔한 페이지가 아니라, Mistral 자체 감사에서 가장 약한 영역으로 지목한 문서 유형 — 수식이 많고, 과학적이며, 여러 단으로 구성된 레이아웃 — 에 적용하세요. 깔끔한 페이지에서는 어떤 최신 파서도 좋은 점수를 냅니다. Mistral은 직접 보유한 문서 조합으로 평가하라고 명시적으로 권하며, 종합 점수는 "directional rather than definitive"라고 경고합니다 . 72% 블라인드 선호 승률은 12개 이상 언어의 600개 이상 문서 전반에서 나온 평균입니다 ; 모든 경우에 똑같이 유지되지는 않으며, 여러분의 콘텐츠와 그 평균 사이의 차이를 재는 것이 바로 시험판의 목적입니다.

출시 발표에서 스스로 드러낸 취약 지점을 우선 확인하세요. Mistral의 투명성 섹션은 동등한 LaTeX/수학 표기가 불일치로 표시되는 문제, 수식 분할 차이, 다단 문서의 읽기 순서 가정, 헤더/푸터 블록 귀속 문제 같은 채점상의 흔적이 수학, 과학, 다단 문서에 집중된다고 설명합니다 . 코퍼스가 금융 공시, 연구 논문, 빽빽한 기술 매뉴얼이라면 OCR 4가 제값을 하는지는 바로 이런 페이지에서 결정되며, 이 구간에서는 headline 숫자가 가장 덜 유용합니다.

문서가 흔한 문자 체계를 넘어선 스크립트를 포함한다면 의도적으로 테스트하세요. OCR 4는 10개 언어 그룹에 걸쳐 170개 언어를 지원한다고 내세웁니다 . 그러나 독립 연구는 이 폭넓은 범위를 신중하게 보게 만듭니다. 100개가 넘는 유니코드 스크립트를 평가한 GlotOCR Bench는 최전선 OCR 시스템조차 대략 30개 스크립트를 넘어서면 일반화에 실패한다고 밝혔습니다 . 명시된 지원 범위가 곧 안정적인 추출을 뜻하지는 않습니다. 언어 목록이 정확도로 이어진다고 가정하지 말고, 신뢰하는 정답 데이터에 맞춰 저자원 스크립트를 검증하세요.

비교는 느낌이 아니라 결정을 낼 수 있게 설계하세요. 동일한 PDF를 OCR 4와 더 저렴한 대안 — 오픈 파서나 저비용 전문 도구 — 에 넣고, OCR 4가 프리미엄을 받는 구체적 출력물을 비교하세요. 즉 요소 bounding-box 좌표, 유형화된 블록 분류, 단어별 confidence 값을 API 요금 1,000페이지당 4달러(또는 50% Batch 할인 적용 시 2달러)와 함께 평가해야 합니다 . 박스가 정확히 맞는지, confidence 점수가 가장 어려운 페이지의 오류를 실제로 예측하는지, downstream RAG나 추출 품질이 비용을 정당화할 만큼 개선되는지 확인하세요.

요점은 이렇습니다. 72%는 OCR 4를 시험해볼 이유이지, 곧바로 도입할 이유가 아닙니다. 대규모로 확정하기 전에 수식이 많고, 다단 구성이 빽빽하며, 여러 스크립트가 섞인 여러분의 문서에서 검증하세요. 여러분의 파이프라인에 실제로 구속력을 갖는 벤치마크는 여러분의 문서로 돌린 벤치마크뿐입니다.

자주 묻는 질문

Mistral OCR 4의 72% 승률은 독립적으로 검증됐나요?

아니요. 72% 평균 승률은 벤더가 실행하고 벤더가 보고한 수치입니다 . 독립적인 제3자 주석 작업자가 12개 이상 언어의 600개 이상 문서에 대해 블라인드 쌍대 비교를 수행했지만, Mistral은 경쟁 제품 목록, 주석 작업자 수, 경쟁 제품별 세부 결과, 신뢰구간을 공개하지 않았습니다 . 출시 시점 기준으로 OCR 4는 자체 버전 식별자로 공개 리더보드에 올라오지 않았습니다. 공개 OmniDocBench 목록에는 OCR 4가 아니라 더 오래된 Mistral 버전 2503이 여전히 표시됩니다 . 재현 검증 전까지는 마케팅 주장으로 보는 편이 맞습니다.

OCR 4는 OCR 3가 반환하지 않던 무엇을 추가하나요?

OCR 4는 OCR 3(2026년 1월 출시)가 반환하지 않던 세 가지 구조적 출력을 Markdown 텍스트와 함께 인라인으로 얹습니다. 유형화된 블록 분류(제목, 표, 수식, 서명, 헤더, 푸터), 문단 및 요소 수준의 bounding 좌표, 그리고 페이지별·단어별 confidence 점수입니다 . 모델 카드는 이 서비스를 Premier v4.0, 모델 식별자 mistral-ocr-4-0+2로 표기합니다 . 덕분에 출력물을 RAG, 양식 및 송장 추출, 비식별 처리, human-in-the-loop 검증에서 인용 가능한 형태로 사용할 수 있습니다.

OCR 가격은 왜 네 배로 뛰었나요?

초기 Mistral OCR API는 대략 1달러당 1,000페이지 수준으로 출시됐습니다 . OCR 4는 온디맨드 기준 1,000페이지당 4달러이며, 50% Batch-API 할인을 적용하면 2달러로 내려갑니다. 상위 티어 Document AI 제품은 1,000페이지당 5달러입니다 . 인상분은 단순 텍스트 추출에서 구조 인식 출력 — bounding 좌표, 유형화된 블록 라벨, confidence 값 — 으로 옮겨간 점과, 10개 언어 그룹에 걸친 170개 언어 지원 확대를 반영합니다 .

OCR 4는 어디에서 가장 약한가요?

Mistral 자체 투명성 감사는 가장 약한 구간을 지목합니다. 동등한 경우에도 불일치로 채점되는 수학 및 LaTeX 표기, 다단 문서의 읽기 순서 오류, 수식 분할 차이, 헤더/푸터 블록 귀속 문제가 그것입니다 . 회사는 이런 문제가 수학, 과학, 다단 문서에 집중된다고 설명합니다. 독립 연구도 이 신중론을 뒷받침합니다. PureDocBench는 감사된 평가자 채점 블록에서 12.08%의 주석 오류율(확인된 오류 2,580건)을 보고했으며, 어려운 페이지에서는 단일 종합 점수가 왜 오해를 부를 수 있는지 보여줍니다 .

Mistral OCR 4를 자체 서버에서 실행할 수 있나요?

네. OCR 4는 단일 컨테이너로 완전한 자체 호스팅 배포를 지원합니다. 민감한 문서를 제3자 클라우드 API로 보낼 수 없는 데이터 거주성, 주권, 기밀성 제약을 가진 조직을 겨냥한 방식입니다 . bounding box와 confidence 점수와 결합하면 금융, 법률, 의료 분야의 규제 워크플로를 겨냥하게 됩니다 . 라이선스 조건과 최소 하드웨어 사양은 출시 시점에 공개되지 않았으므로, 배포를 계획하기 전에 Mistral의 엔터프라이즈 문서에서 확인하세요.