I många affärsarbetsflöden måste skannade PDF-dokument omvandlas till sökbar eller redigerbar text. Extract Text from Scanned PDFs with Aspose.PDF OCR in C#‑handledningen visar hur man utnyttjar den integrerade OCR‑motorn i Aspose.PDF for .NET för att hämta vanlig text från bildbaserade sidor. Genom att följa den här guiden får du en färdig‑till‑körning‑lösning som fungerar med vilken skannad PDF som helst, oavsett storlek eller språk.
Extrahera text från skannade PDF-filer med Aspose.PDF OCR SDK
Skannade PDF‑filer innehåller endast bilder, så vanliga textutvinnings‑API:er returnerar inget. OCR (Optical Character Recognition) omvandlar dessa bilder till maskinläsbara tecken, vilket möjliggör indexering, datautvinning och efterföljande bearbetning. Att automatisera OCR i C# tar bort manuella kopiera‑och‑klistra‑steg, förbättrar noggrannheten och kan skalas för stora dokumentbatcher.
Aspose.PDF tillhandahåller Aspose.Pdf.Ocr‑namnutrymmet, som inkluderar OcrTextRecognitionOptions, OcrTextAbsorber och språk‑enums. Biblioteket distribueras via NuGet. Installera det med följande kommando:
Install-Package Aspose.PDF
För mer information, besök Aspose.PDF produktsida.
Extrahera text från skannade PDF-filer med Aspose.PDF OCR i C#
- Läs in den skannade PDF-filen i ett
Aspose.Pdf.Document. - Konfigurera OCR-alternativ (språk, upplösning, sidseparator).
- Applicera en
OcrTextAbsorberpå dokumentets sidkollektion. - Hämta den igenkända texten och spara den.
Exemplet visar hur man laddar en skannad PDF, konfigurerar OCR, extraherar text och skriver resultatet till en fil med C#.
// For complete examples and data files, visit https://github.com/aspose-pdf/Aspose.PDF-for-.NET
private static void RecognizeTextWithOcr()
{
// The path to the documents directory
var dataDir = RunExamples.GetDataDir_AsposePdf();
// Open PDF document
using (var document = new Aspose.Pdf.Document(dataDir + "input.pdf"))
{
// Configure OCR recognition options
var options = new Aspose.Pdf.Ocr.OcrTextRecognitionOptions
{
Language = Aspose.Pdf.Ocr.OcrLanguage.English,
Resolution = 300,
PageSeparator = "\n\n"
};
// Recognize text from all pages
var absorber = new Aspose.Pdf.Ocr.OcrTextAbsorber(options);
document.Pages.Accept(absorber);
// Save recognized text
System.IO.File.WriteAllText(dataDir + "recognized-text.txt", absorber.Text);
}
}
Aspose.PDF Funktioner som är viktiga för denna uppgift
- Integrerad OCR-motor – Inga externa beroenden; OCR-motorn finns i namnutrymmet
Aspose.Pdf.Ocr. - Språkval –
OcrLanguage-enum låter dig ange ordboken för bättre igenkänning. - Upplösningskontroll – Högre DPI förbättrar teckenåtergivning, särskilt för svaga skanningar.
- PageSeparator – Anpassningsbar sträng för att separera sidor i utmatningstexten.
- Trådsäker sidinsamling – Möjliggör parallell bearbetning av stora PDF-filer.
Dessa funktioner möjliggör en robust, enda‑bibliotekslösning för att extrahera text från vilken som helst skannad PDF.
Installation och konfiguration i C#
- Öppna din .NET-lösning i Visual Studio.
- Öppna Package Manager Console och kör
Install-Package Aspose.PDF. - Lägg till
using Aspose.Pdf;ochusing Aspose.Pdf.Ocr;högst upp i din klassfil. - Se till att du har en tillfällig eller fullständig licens; utan den kan utdata innehålla ett vattenmärke.
För licensdetaljer, se den tillfälliga licenssidan.
Steg‑för‑steg-implementering i C#
Vad svarar det här avsnittet på? Vilka är de exakta kodstegen för att extrahera text?
- Initiera dokumentet
var pdfPath = "path/to/scanned.pdf"; var document = new Document(pdfPath); - Skapa OCR-alternativ
var ocrOptions = new OcrTextRecognitionOptions { Language = OcrLanguage.English, Resolution = 300, PageSeparator = "\n--- Page Break ---\n" }; - Kör absorberaren
var absorber = new OcrTextAbsorber(ocrOptions); document.Pages.Accept(absorber); - Få åtkomst till den extraherade texten
string extractedText = absorber.Text; - Spara eller bearbeta texten
System.IO.File.WriteAllText("output.txt", extractedText);
Koden följer samma flöde som det omfattande exemplet ovan men delar upp logiken i lättsmälta steg.
Få en gratis licens
Utvärdera Aspose.PDF utan kostnad genom att begära en tillfällig licens här: https://purchase.aspose.com/temporary-license/
Gratis ytterligare resurser
Slutsats
Den här guiden ledde dig genom att extrahera text från skannade PDF-filer med Aspose.PDF OCR i C#. Du lärde dig hur du installerar biblioteket, konfigurerar OCR-alternativ för noggrannhet, implementerar en ren extraktionspipeline och tillämpar prestandaoptimeringar för stora dokument. Med dessa tekniker kan vilken .NET‑utvecklare som helst omvandla bild‑endast PDF-filer till sökbara, redigerbara textströmmar.
FAQs
Hur extraherar jag text från en skannad PDF i C# med Aspose.PDF?
Skapa ettDocument, konfigureraOcrTextRecognitionOptions, kör enOcrTextAbsorberpå sidorna och läsText‑egenskapen.Vilka OCR‑språk stöds av Aspose.PDF?
Biblioteket stöder många språk viaOcrLanguage‑enumet, inklusive engelska, franska, tyska, spanska, kinesiska och fler.Hur kan jag förbättra OCR‑noggrannheten för lågupplösta skanningar?
ÖkaResolution(t.ex. 300 DPI), välj rätt språk och överväg förbehandling av bilder för att öka kontrasten.Är det säkert att bearbeta stora PDF-filer parallellt?
Ja, genom att dela upp dokumentet i sidintervall och bearbeta varje intervall i en separat tråd, samtidigt som minnesanvändningen övervakas.Vilken licens krävs för OCR‑funktioner?
OCR är fullt tillgängligt med en giltig Aspose.PDF for .NET‑licens; en tillfällig licens kan erhållas för utvärdering.Var kan jag hitta mer dokumentation om OCR‑inställningar?
Detaljerad vägledning för OCR‑konfiguration finns i Aspose.PDF OCR‑inställningsdokumentationen på https://docs.aspose.com/pdf/net/.
