Parsers
Parsers
Intern API — De klassen op deze pagina maken geen deel uit van de publieke API en worden niet geëxporteerd vanuit het top-niveau
aspose.words_fosspakket. Ze worden intern gebruikt door de documentconversiepijplijn. De meeste ontwikkelaars zouden deLdmMarkdownWriter/LdmPdfWriterklassen en deDocument.texteigenschap in plaats daarvan. Zie Core Management voor de publieke API. Deze klassen zijn implementatiedetails en kunnen zonder kennisgeving veranderen.
Aspose.Words FOSS for Python bevat gespecialiseerde parsers die gestructureerde gegevens uit de interne DOCX-structuur extraheren. De NumberingParser verwerkt lijstnummeringsdefinities, en StyleParser extraheert documentstijlen.
Nummeringsparser
NumberingParser leest de nummeringsdefinities uit een DOCX-pakket en maakt ze beschikbaar via een query API. Gebruik parse_numbering_part() om nummering XML te laden, en query vervolgens lijst-eigenschappen met hulpfuncties.
| Methode | Beschrijving |
|---|---|
NumberingParser.parse_numbering_part() | Parse het DOCX-numbering-element |
NumberingParser.get_list_info() | Haal informatie op over een specifieke lijst op ID |
NumberingParser.get_level_info() | Haal niveau-details op voor een lijst op een opgegeven diepte |
NumberingParser.is_ordered_list() | Controleer of een lijstniveau geordend of met opsommingstekens is |
NumberingParser.get_start_value() | Haalt het beginnummer op voor een lijstniveau. |
NumberingParser.get_delimiter() | Haalt de scheidingstekenreeks op voor een lijstniveau |
Stijlparser
StyleParser parseert stijlnamen naar gestructureerde ParsedStyle objecten. Het identificeert koppen, blokcitaten, codeblokken en lijst-paragrafen uit DOCX-stijlnamen.
| Methode | Beschrijving |
|---|---|
StyleParser.parse() | Parse een stijlnaam naar een ParsedStyle object |
StyleParser.get_style_chain() | Parse een keten van stijlnamen voor geërfde stijlen |
StyleParser.is_setext_heading() | Controleer of een stijl een Setext-stijl kop is |
StyleParser.extract_all_styles() | Extraheer individuele stijlnamen uit een door komma’s gescheiden keten |
Nummeringsgegevensmodel
Geparseerde nummeringsgegevens worden opgeslagen in gestructureerde objecten:
| Klasse | Beschrijving |
|---|---|
NumberingInfo | Nummeringsdefinitie met num_id, abstract_num_id en levels |
NumberingLevel | Niveau-definitie met format, start en text eigenschappen |
ListInfo | Informatie over een specifieke lijstinstantie |
ListLevelInfo | Niveauspecifieke opmaakdetails |
Tips en best practices
- Roep
parse_numbering_part()één keer aan na het laden van een document om alle lijstdefinities te vullen - Gebruik
is_ordered_list()om genummerde lijsten te onderscheiden van opsommingstekenslijsten - Gebruik
get_style_chain()om geërfde stijlketens in één oproep te parseren - Nummerings- en stijlparsers worden intern gebruikt door de documentconversiepijplijn
Veelvoorkomende problemen
| Probleem | Oorzaak | Oplossing |
|---|---|---|
| Lege nummeringsdefinities | Document heeft geen lijsten | Controleer de retourwaarde van get_list_info() voordat u eigenschappen benadert |
| Ontbrekende stijl | Stijlnaam niet herkend | Gebruik parse() met een bekende stijlnaam |
| Onjuist lijstniveau | Verkeerde niveauparameter | Lijstniveaus zijn nul-geïndexeerd |
API Reference Samenvatting
| Klasse / Methode | Beschrijving |
|---|---|
NumberingParser.parse_numbering_part() | Parse DOCX-nummeringsdefinities |
NumberingParser.get_list_info() | Vraag lijstinformatie op per ID |
NumberingParser.is_ordered_list() | Controleer of een lijstniveau geordend is |
StyleParser.parse() | Parse een stijlnaam naar gestructureerde informatie |
StyleParser.get_style_chain() | Parse een keten van geërfde stijlnamen |
NumberingInfo | Nummeringsdefinitie datamodel |
NumberingLevel | Niveau-definitie met formaat en startwaarde |