レイアウト、表式、境界ボックスに対応した軽量 PDF パーサー
## Japanese Translation:
Papero は、PDF、DOCX、PPTX、XLSX、EPUB および HTML など多様な形式から構造化されたコンテンツを抽出することを目的とした、ユニークな機械学習不使用ユーティリティです。本ツールは、重厚な GPU リソースやクラウド処理を必要とせず、ローカル CPU 上またはウェブブラウザ内で動作します。レイアウト解析には PDFium のような既存のライブラリを利用し、OCR には Tesseract を使用(スキャン画像に対応するサーバーサイドサポートあり)、非 PDF メタデータの抽出には Apache Tika を利用します。このアプローチにより、複雑なレイアウト、読み順、列整列、フォント、図表、数式を維持した高忠実度の出力が可能となり、これらを LaTeX またはイメージとして Word や HTML 形式へエクスポートし、すべてのブロックに対してバウンディングボックスを付与します。ベンチマークでは、54 の高密度研究論文においてゼロの失敗を確認しており、単一のラップトップ CPU でページあたりわずか 39 ミリ秒で処理可能です。ユーザーは CLI または Python API コールを通じてフォルダをバッチ変換し、RAG レディなデータセットを生成でき、詳細なレポートを作成することで、高密度 Word エクスポートにおける潜在的な改行問題や境界のないテーブルでの課題などを特定できます。若干の制限は存在します(線形化された行列出力やスキャンドキュメントに対するサーバーサイド OCR の必要性など)が、Papero はページの重ね書きやレイアウト再構築の確認といった本質的な機能を提供しており、プライバシー、スピード、ローカル制御を重視する研究者にとって堅牢なソリューションとなります。
## Text to translate:
**Improved Summary:**
Papero is a unique, machine-learning-free utility designed to extract structured content from diverse formats including PDFs, DOCX, PPTX, XLSX, EPUB, and HTML without requiring heavy GPU resources or cloud processing. Operating entirely on local CPUs or within a web browser, it leverages established libraries like PDFium for layout analysis and Tesseract for OCR (with server-side support for scanned images), while using Apache Tika for non-PDF metadata extraction. This approach ensures high-fidelity output that preserves complex layouts, reading orders, column alignment, fonts, figures, and mathematical formulas—exported as LaTeX or images—to Word or HTML formats with bounding boxes for every block. Benchmarks demonstrate zero failures across 54 dense research papers, processing pages in just 39 milliseconds on a single laptop CPU. Users can batch convert folders into RAG-ready datasets via CLI or Python API calls, generating detailed reports that identify specific issues such as potential line breaks in dense Word exports or challenges with borderless tables. While minor limitations exist, such as linearized matrix outputs and the need for server-side OCR for scanned documents, Papero offers essential capabilities like drawing over pages and verifying layout reconstruction, making it a robust solution for researchers prioritizing privacy, speed, and local control.