PDF पार्सर

PDFParser

PDFParser कच्ची PDF बाइट स्ट्रीम को पढ़ता और व्याख्या करता है, दस्तावेज़ के लिए COS ऑब्जेक्ट ग्राफ़ बनाता है। यह मौजूदा PDF बाइट स्रोत को एक नेविगेबल ऑब्जेक्ट मॉडल में पार्स करने के लिए प्रवेश बिंदु है।

PDFLexer

PDFLexer बाइट स्ट्रीम से PDF सिंटैक्स को टोकनाइज़ करता है, कीवर्ड, नाम, स्ट्रिंग, नंबर और अन्य लेक्सिकल तत्वों की पहचान करता है। यह PDFParser द्वारा उपयोग किया जाने वाला मूल स्कैनर है।

PDFWriter

PDFWriter COS ऑब्जेक्ट मॉडल को फिर से PDF बाइट स्ट्रीम में सीरियलाइज़ करता है। यह क्रॉस-रेफ़रेंस टेबल जनरेशन और इन्क्रीमेंटल अपडेट लॉजिक को संभालता है।

पार्सर API का उपयोग करके

Document क्लास कन्स्ट्रक्टर फाइल पाथ या स्ट्रीम मिलने पर पार्सर को आंतरिक रूप से कॉल करता है। डायरेक्ट पार्सर एक्सेस के लिए, Document.getParser() का उपयोग करके लोडेड डॉक्यूमेंट से जुड़ा PDFParser इंस्टेंस प्राप्त करें:

try (Document doc = new Document("input.pdf")) {
    PDFParser parser = doc.getParser();
    // Access low-level document structure
}

यह भी देखें

 हिन्दी