Discover and explore top open-source AI tools and projects—updated daily.
opendatalabUniversal OCR post-processing for structured documents
Top 97.2% on SourcePulse
Summary
MinerU-Popo is a lightweight, universal framework enhancing OCR outputs by transforming page-level parsing into document-level semantic structures. It targets document analysis practitioners, providing crucial post-processing to unlock deeper understanding and improve downstream tasks.
How It Works
This project uses a 4B parameter model for four subtasks: table, text, title hierarchy, and image-text analysis. It tackles cross-page discontinuity and long document scalability via a Task-Oriented Data Engine, Dynamic Chunking/Synchronization for global consistency, and Document Enrichment for semantic tree construction and node splitting. This approach enables robust, scalable parsing beyond raw OCR.
Quick Start & Requirements
Install via source (pip install -r requirements.txt in Python 3.10 Conda env) or Docker (docker run -it --rm --gpus=all --ipc=host --network=host dockerrr8277/mineru-popo-vllm:latest). Download the model from Hugging Face (hf download DreamEternal/MinerU-Popo --local-dir models/Mineru-Popo). Configuration involves setting POPO_MODEL_PATH or editing inference function parameters. GPU acceleration is required for Docker.
Highlighted Details
Maintenance & Community
No specific details regarding maintainers, community channels (e.g., Discord, Slack), or a public roadmap are provided in the README.
Licensing & Compatibility
The project is licensed under the permissive MIT License, allowing for broad use, modification, and distribution, including in commercial applications and closed-source projects.
Limitations & Caveats
The provided README does not explicitly detail known limitations, alpha/beta status, or specific unsupported platforms. The setup process involves multiple distinct steps (normalization, inference, tree building) which may require careful integration.
1 month ago
Inactive
VectifyAI