MonkeyOCR
a small, multimodal document-parsing model
MonkeyOCR is an open-source document-parsing tool built on a lightweight multimodal LLM that parses PDFs in three stages—layout, recognition, relation—to reconstruct formulas, tables, and reading order into Markdown, with local GPU inference.