Skip to content
This repository was archived by the owner on Jul 11, 2024. It is now read-only.
This repository was archived by the owner on Jul 11, 2024. It is now read-only.

Umlaut handling #13

Description

@WolfgangFahl

2021_10_20_15_51_33.pdf
Has "ALDI SÜD" as copyable text in it (tested with Preview on MacOS). When reading it with PyPDF3 using:

def getPDFText(self):
        '''
        get my PDF Text
        '''
        pdfText=None
        if self.scannedFile.lower().endswith("pdf"):
            pdfText=""
            pdf_file = open(self.scannedFile, 'rb')
            read_pdf = PdfFileReader(pdf_file)
            number_of_pages = read_pdf.getNumPages()
            pdfText=""
            delim=""
            for pageNo in range(number_of_pages):
                page = read_pdf.getPage(pageNo)
                page_content = page.extractText()
                pdfText+=delim+page_content
                delim="\n"
        return pdfText

i get 'ALDI SƒD' instead. How can this be fixed?

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions