← 전체 태그

#OCR 4편

24화 2026-06-21

1.2B 파서를 형사기록에 들이밀다 — 점수와 실사용의 거리

지난 화 끝에 적었듯, 구독자 한 분이 한국딥러닝의 KDL-Frontier-Parser-nano를 알려주셨다. 12억(1.2B) 매개변수의 초경량 문서 파싱 모델인데, 글로벌 문서 파싱 벤치마크 P…

23화 2026-06-20

표와 자필진술서, OCR은 어디까지 읽어낼까

지난 화에서 qwen3-vl:8b-instruct로 인쇄된 한글 본문을 빠르고 정확하게 읽었다. 피의자신문조서나 판결문처럼 문장이 줄줄이 이어지는 글, 이 글에서는 이런 페이지를 '줄글'이라 부르겠…

21화 2026-06-17

형사 증거기록 OCR, 어떤 모델로 할까

형사 사건을 맡으면 증거기록을 받는다. 수십, 수백 페이지짜리 스캔본 PDF다. 이걸 읽고 사실관계를 파악하고 변론 방향을 잡는 것이 일의 출발점인데, 종이를 통째로 다시 타이핑할 수는 없으니 OC…

22화 2026-06-17

한글 형사기록, 로컬 모델로 읽힌 첫 페이지

지난 화에서 비교군을 좁혔다. 글로벌 범용 VLM인 Qwen3-VL을 기준선으로 삼아, 실제 증거기록 한 페이지를 읽혀보기로 했다.