CMap (Mapowanie znaków)

CMap w PDF

CMap (Mapa znaków) mapuje kody znaków w strumieniu zawartości PDF na punkty kodowe Unicode lub nazwy glifów. Zasoby CMap są używane do wyodrębniania tekstu, wyszukiwania i dostępności w dokumentach PDF (ISO 32000-1:2008, §9.10).

AdobeGlyphList

AdobeGlyphList zapewnia statyczne mapowanie nazw glifów Adobe na punkty kodowe Unicode:

int unicode = AdobeGlyphList.getUnicode("bullet");  // returns 0x2022
boolean exists = AdobeGlyphList.contains("copyright");  // true

Jest to używane przy dekodowaniu nazw glifów z czcionek Type 1 oraz TrueType, które stosują standardową konwencję nazewnictwa glifów Adobe.

Kodowanie tekstu

Kodowanie tekstu w PDF mapuje kody znaków na glify za pomocą kombinacji słownika Encoding czcionki, CMap ToUnicode oraz tabeli szerokości znaków czcionki. Poprawne obsługiwanie CMap jest niezbędne dla niezawodnego wyodrębniania tekstu.

Zobacz także

 Polski