I många affärsarbetsflöden måste skannade PDF-dokument omvandlas till sökbar eller redigerbar text. Extract Text from Scanned PDFs with Aspose.PDF OCR in C#‑handledningen visar hur man utnyttjar den integrerade OCR‑motorn i Aspose.PDF for .NET för att hämta vanlig text från bildbaserade sidor. Genom att följa den här guiden får du en färdig‑till‑körning‑lösning som fungerar med vilken skannad PDF som helst, oavsett storlek eller språk.

Extrahera text från skannade PDF-filer med Aspose.PDF OCR SDK

Skannade PDF‑filer innehåller endast bilder, så vanliga textutvinnings‑API:er returnerar inget. OCR (Optical Character Recognition) omvandlar dessa bilder till maskinläsbara tecken, vilket möjliggör indexering, datautvinning och efterföljande bearbetning. Att automatisera OCR i C# tar bort manuella kopiera‑och‑klistra‑steg, förbättrar noggrannheten och kan skalas för stora dokumentbatcher.

Aspose.PDF tillhandahåller Aspose.Pdf.Ocr‑namnutrymmet, som inkluderar OcrTextRecognitionOptions, OcrTextAbsorber och språk‑enums. Biblioteket distribueras via NuGet. Installera det med följande kommando:

Install-Package Aspose.PDF

För mer information, besök Aspose.PDF produktsida.

Extrahera text från skannade PDF-filer med Aspose.PDF OCR i C#

  1. Läs in den skannade PDF-filen i ett Aspose.Pdf.Document.
  2. Konfigurera OCR-alternativ (språk, upplösning, sidseparator).
  3. Applicera en OcrTextAbsorber på dokumentets sidkollektion.
  4. Hämta den igenkända texten och spara den.

Exemplet visar hur man laddar en skannad PDF, konfigurerar OCR, extraherar text och skriver resultatet till en fil med C#.

// For complete examples and data files, visit https://github.com/aspose-pdf/Aspose.PDF-for-.NET
private static void RecognizeTextWithOcr()
{
    // The path to the documents directory
    var dataDir = RunExamples.GetDataDir_AsposePdf();

// Open PDF document
    using (var document = new Aspose.Pdf.Document(dataDir + "input.pdf"))
    {
        // Configure OCR recognition options
        var options = new Aspose.Pdf.Ocr.OcrTextRecognitionOptions
        {
            Language = Aspose.Pdf.Ocr.OcrLanguage.English,
            Resolution = 300,
            PageSeparator = "\n\n"
        };

// Recognize text from all pages
        var absorber = new Aspose.Pdf.Ocr.OcrTextAbsorber(options);
        document.Pages.Accept(absorber);

// Save recognized text
        System.IO.File.WriteAllText(dataDir + "recognized-text.txt", absorber.Text);
    }
}

Aspose.PDF Funktioner som är viktiga för denna uppgift

  • Integrerad OCR-motor – Inga externa beroenden; OCR-motorn finns i namnutrymmet Aspose.Pdf.Ocr.
  • SpråkvalOcrLanguage-enum låter dig ange ordboken för bättre igenkänning.
  • Upplösningskontroll – Högre DPI förbättrar teckenåtergivning, särskilt för svaga skanningar.
  • PageSeparator – Anpassningsbar sträng för att separera sidor i utmatningstexten.
  • Trådsäker sidinsamling – Möjliggör parallell bearbetning av stora PDF-filer.

Dessa funktioner möjliggör en robust, enda‑bibliotekslösning för att extrahera text från vilken som helst skannad PDF.

Installation och konfiguration i C#

  1. Öppna din .NET-lösning i Visual Studio.
  2. Öppna Package Manager Console och kör Install-Package Aspose.PDF.
  3. Lägg till using Aspose.Pdf; och using Aspose.Pdf.Ocr; högst upp i din klassfil.
  4. Se till att du har en tillfällig eller fullständig licens; utan den kan utdata innehålla ett vattenmärke.

För licensdetaljer, se den tillfälliga licenssidan.

Steg‑för‑steg-implementering i C#

Vad svarar det här avsnittet på? Vilka är de exakta kodstegen för att extrahera text?

  1. Initiera dokumentet
    var pdfPath = "path/to/scanned.pdf";
    var document = new Document(pdfPath);
    
  2. Skapa OCR-alternativ
    var ocrOptions = new OcrTextRecognitionOptions
    {
        Language = OcrLanguage.English,
        Resolution = 300,
        PageSeparator = "\n--- Page Break ---\n"
    };
    
  3. Kör absorberaren
    var absorber = new OcrTextAbsorber(ocrOptions);
    document.Pages.Accept(absorber);
    
  4. Få åtkomst till den extraherade texten
    string extractedText = absorber.Text;
    
  5. Spara eller bearbeta texten
    System.IO.File.WriteAllText("output.txt", extractedText);
    

Koden följer samma flöde som det omfattande exemplet ovan men delar upp logiken i lättsmälta steg.

Få en gratis licens

Utvärdera Aspose.PDF utan kostnad genom att begära en tillfällig licens här: https://purchase.aspose.com/temporary-license/

Gratis ytterligare resurser

Slutsats

Den här guiden ledde dig genom att extrahera text från skannade PDF-filer med Aspose.PDF OCR i C#. Du lärde dig hur du installerar biblioteket, konfigurerar OCR-alternativ för noggrannhet, implementerar en ren extraktionspipeline och tillämpar prestandaoptimeringar för stora dokument. Med dessa tekniker kan vilken .NET‑utvecklare som helst omvandla bild‑endast PDF-filer till sökbara, redigerbara textströmmar.

FAQs

  1. Hur extraherar jag text från en skannad PDF i C# med Aspose.PDF?
    Skapa ett Document, konfigurera OcrTextRecognitionOptions, kör en OcrTextAbsorber på sidorna och läs Text‑egenskapen.

  2. Vilka OCR‑språk stöds av Aspose.PDF?
    Biblioteket stöder många språk via OcrLanguage‑enumet, inklusive engelska, franska, tyska, spanska, kinesiska och fler.

  3. Hur kan jag förbättra OCR‑noggrannheten för lågupplösta skanningar?
    Öka Resolution (t.ex. 300 DPI), välj rätt språk och överväg förbehandling av bilder för att öka kontrasten.

  4. Är det säkert att bearbeta stora PDF-filer parallellt?
    Ja, genom att dela upp dokumentet i sidintervall och bearbeta varje intervall i en separat tråd, samtidigt som minnesanvändningen övervakas.

  5. Vilken licens krävs för OCR‑funktioner?
    OCR är fullt tillgängligt med en giltig Aspose.PDF for .NET‑licens; en tillfällig licens kan erhållas för utvärdering.

  6. Var kan jag hitta mer dokumentation om OCR‑inställningar?
    Detaljerad vägledning för OCR‑konfiguration finns i Aspose.PDF OCR‑inställningsdokumentationen på https://docs.aspose.com/pdf/net/.

Läs mer