将 PDF 转成文本,遇到扫描件、多栏排版、复杂表格和公式,传统 OCR 经常识别错乱。
olmOCR,一款基于视觉语言模型的 PDF 转 Markdown 工具,已斩获了 17900+ Star!
能处理公式、表格、手写体和复杂版式,还会自动去掉页眉页脚。
并且按自然阅读顺序输出,哪怕多栏排版也不会读串行。
GitHub:http://github.com/allenai/olmocr
单 GPU 本地跑之外也支持接入远程推理服务,处理成本能压到每百万页不到 200 美元。
需要批量处理 PDF、扫描件转成可编辑文本的朋友,尤其是做数据处理或者知识库搭建的,这个工具可以试试。
olmOCR는 시각 언어 모델 기반 PDF→Markdown 도구로, 스캔본·다단 편집·복잡한 표·수식·필기체를 자연스러운 읽기 순서로 변환하고 머리말·꼬리말도 자동 제거할 수 있다는 내용입니다. 로컬 단일 GPU와 원격 추론 서비스를 모두 지원하며, 대량 PDF 처리나 지식베이스 구축용으로 활용해볼 만한 도구로 소개됩니다.
olmOCR는 GitHub 스타 17,900개 이상을 받은 비전 언어 모델 기반 PDF-투-마크다운 변환 도구로, 수식·표·손글씨·복잡한 레이아웃을 처리하고 머리글/바닥글을 자동 제거하며 다단 구성에서도 자연스러운 읽기 순서를 유지한다. 단일 GPU로 로컬 실행하거나 원격 추론 서비스와 연동할 수 있고 처리 비용을 100만 페이지당 200달러 이하로 낮출 수 있어, 대량 PDF/스캔 문서 변환이 필요한 데이터 처리 및 지식베이스 구축 작업에 적합하다.