변환 벤치마크

이 수치는 참고 자료이며 모든 컴퓨터나 문서에 대한 약속이 아닙니다. 두 도구가 모두 성공한 파일만 비교하고 각 측정의 version과 revision을 함께 기록합니다.

Coverage, performance, output preservation을 나누어 측정

세 가지 질문을 섞지 않습니다. coverage는 실제로 변환한 파일, performance는 시작 시간, 변환 시간, CPU 시간, peak memory, output preservation은 형식별 검사입니다. 이를 모호한 종합 점수로 합치지 않습니다. CLI, browser WebAssembly, 장기 실행 HTTP server도 따로 측정합니다.

정확성을 확인한 뒤 시간 측정

native CLI와 browser는 output check를 통과한 결과만 timing에 포함합니다. server는 현재 성공 response와 비어 있지 않은 body만 확인하므로 그 timing이 의미 품질 검사를 대신하지는 못합니다. Docling은 parser backend만 사용하며 OCR, VLM, ASR, layout model, table model, enrichment, accelerator를 모두 끕니다.

벤치마크 재현

corpus는 license가 서로 다른 제삼자 문서로 구성되어 다시 배포하지 않습니다. manifest에 source, format, size, SHA-256을 기록합니다. benchmarks/fetch_corpus.sh는 같은 파일을 가져와 모든 digest를 확인합니다.

영어 전체 표와 원본 데이터 보기