CMap (Zeichenzuordnung)

CMap in PDF

Ein CMap (Zeichenkarte) ordnet Zeichencodes in einem PDF-Inhaltsstrom Unicode-Codepunkten oder Glyphennamen zu. CMap-Ressourcen werden für die Textextraktion, Suche und Barrierefreiheit in PDF-Dokumenten verwendet (ISO 32000-1:2008, §9.10).

AdobeGlyphList

AdobeGlyphList stellt eine statische Zuordnung von Adobe-Glyphennamen zu Unicode-Codepunkten bereit:

int unicode = AdobeGlyphList.getUnicode("bullet");  // returns 0x2022
boolean exists = AdobeGlyphList.contains("copyright");  // true

Dies wird verwendet, wenn Glyphennamen von Type-1- und TrueType-Schriften dekodiert werden, die die Adobe-Standard-Glyphennamenskonvention verwenden.

Textkodierung

Die PDF-Textkodierung ordnet Zeichencodes Glyphen über eine Kombination aus dem Encoding-Verzeichnis der Schrift, dem ToUnicode-CMap und der Zeichenbreitentabelle der Schrift zu. Eine korrekte CMap-Verarbeitung ist für eine zuverlässige Textextraktion unerlässlich.

Siehe auch

 Deutsch