About This Resource

A document parser for extracting text and layout information from PDFs and related formats. It combines spatial text extraction, optional optical character recognition, and page-image generation for downstream processing.