About This Resource

A vision-language model project for extracting document content and layout. It covers tasks such as recognizing text, tables, formulas, and reading order across multilingual document pages.