PDF पार्सर
PDFParser
PDFParser कच्ची PDF बाइट स्ट्रीम को पढ़ता और व्याख्या करता है, दस्तावेज़ के लिए COS ऑब्जेक्ट ग्राफ़ बनाता है। यह मौजूदा PDF बाइट स्रोत को एक नेविगेबल ऑब्जेक्ट मॉडल में पार्स करने के लिए प्रवेश बिंदु है।
PDFLexer
PDFLexer बाइट स्ट्रीम से PDF सिंटैक्स को टोकनाइज़ करता है, कीवर्ड, नाम, स्ट्रिंग, नंबर और अन्य लेक्सिकल तत्वों की पहचान करता है। यह PDFParser द्वारा उपयोग किया जाने वाला मूल स्कैनर है।
PDFWriter
PDFWriter COS ऑब्जेक्ट मॉडल को फिर से PDF बाइट स्ट्रीम में सीरियलाइज़ करता है। यह क्रॉस-रेफ़रेंस टेबल जनरेशन और इन्क्रीमेंटल अपडेट लॉजिक को संभालता है।
पार्सर API का उपयोग करके
Document क्लास कन्स्ट्रक्टर फाइल पाथ या स्ट्रीम मिलने पर पार्सर को आंतरिक रूप से कॉल करता है। डायरेक्ट पार्सर एक्सेस के लिए, Document.getParser() का उपयोग करके लोडेड डॉक्यूमेंट से जुड़ा PDFParser इंस्टेंस प्राप्त करें:
try (Document doc = new Document("input.pdf")) {
PDFParser parser = doc.getParser();
// Access low-level document structure
}