Dalam banyak alur kerja bisnis, dokumen PDF yang dipindai harus diubah menjadi teks yang dapat dicari atau dapat diedit. Tutorial Extract Text from Scanned PDFs with Aspose.PDF OCR in C# menunjukkan cara memanfaatkan mesin OCR terintegrasi di Aspose.PDF for .NET untuk mengambil teks biasa dari halaman berbasis gambar. Dengan mengikuti panduan ini, Anda akan mendapatkan solusi siap pakai yang berfungsi dengan PDF yang dipindai apa pun, terlepas dari ukuran atau bahasanya.

Ekstrak Teks dari PDF yang Dipindai menggunakan Aspose.PDF OCR SDK

PDF yang dipindai hanya berisi gambar, sehingga API ekstraksi teks biasa tidak mengembalikan apa pun. OCR (Optical Character Recognition) mengubah gambar tersebut menjadi karakter yang dapat dibaca mesin, memungkinkan pengindeksan, penambangan data, dan pemrosesan lanjutan. Mengotomatiskan OCR dalam C# menghilangkan langkah salin‑tempel manual, meningkatkan akurasi, dan dapat menangani batch dokumen yang besar.

Aspose.PDF menyediakan namespace Aspose.Pdf.Ocr, yang mencakup OcrTextRecognitionOptions, OcrTextAbsorber, dan enum bahasa. Perpustakaan ini didistribusikan melalui NuGet. Instal dengan perintah berikut:

Install-Package Aspose.PDF

Untuk informasi lebih lanjut, kunjungi Halaman produk Aspose.PDF.

Ekstrak Teks dari PDF yang Dipindai dengan Aspose.PDF OCR di C#

  1. Muat PDF yang dipindai ke dalam Aspose.Pdf.Document.
  2. Konfigurasikan opsi OCR (bahasa, resolusi, pemisah halaman).
  3. Terapkan OcrTextAbsorber ke koleksi halaman dokumen.
  4. Ambil teks yang dikenali dan simpan.

Contoh ini menunjukkan cara memuat PDF yang dipindai, mengonfigurasi OCR, mengekstrak teks, dan menulis hasilnya ke file menggunakan C#.

// For complete examples and data files, visit https://github.com/aspose-pdf/Aspose.PDF-for-.NET
private static void RecognizeTextWithOcr()
{
    // The path to the documents directory
    var dataDir = RunExamples.GetDataDir_AsposePdf();

// Open PDF document
    using (var document = new Aspose.Pdf.Document(dataDir + "input.pdf"))
    {
        // Configure OCR recognition options
        var options = new Aspose.Pdf.Ocr.OcrTextRecognitionOptions
        {
            Language = Aspose.Pdf.Ocr.OcrLanguage.English,
            Resolution = 300,
            PageSeparator = "\n\n"
        };

// Recognize text from all pages
        var absorber = new Aspose.Pdf.Ocr.OcrTextAbsorber(options);
        document.Pages.Accept(absorber);

// Save recognized text
        System.IO.File.WriteAllText(dataDir + "recognized-text.txt", absorber.Text);
    }
}

Aspose.PDF Fitur yang Penting untuk Tugas ini

  • Mesin OCR Terintegrasi – Tanpa ketergantungan eksternal; mesin OCR berada di namespace Aspose.Pdf.Ocr.
  • Pemilihan bahasa – enum OcrLanguage memungkinkan Anda menentukan kamus untuk pengenalan yang lebih baik.
  • Kontrol resolusi – DPI yang lebih tinggi meningkatkan keakuratan karakter, terutama pada pemindaian yang pudar.
  • PageSeparator – String yang dapat disesuaikan untuk memisahkan halaman dalam teks output.
  • Koleksi halaman yang thread‑safe – Memungkinkan pemrosesan paralel PDF besar.

Kemampuan ini memungkinkan solusi perpustakaan tunggal yang kuat untuk mengekstrak teks dari setiap PDF yang dipindai.

Instalasi dan Penyiapan di C#

  1. Buka solusi .NET Anda di Visual Studio.
  2. Buka Package Manager Console dan jalankan Install-Package Aspose.PDF.
  3. Tambahkan using Aspose.Pdf; dan using Aspose.Pdf.Ocr; di bagian atas file kelas Anda.
  4. Pastikan Anda memiliki lisensi sementara atau penuh; tanpa itu, output mungkin berisi watermark.

Untuk detail lisensi, lihat halaman lisensi sementara.

Implementasi Langkah demi Langkah dalam C#

Apa yang dijawab oleh bagian ini? Apa langkah kode tepat untuk mengekstrak teks?

  1. Inisialisasi dokumen
    var pdfPath = "path/to/scanned.pdf";
    var document = new Document(pdfPath);
    
  2. Buat opsi OCR
    var ocrOptions = new OcrTextRecognitionOptions
    {
        Language = OcrLanguage.English,
        Resolution = 300,
        PageSeparator = "\n--- Page Break ---\n"
    };
    
  3. Jalankan absorber
    var absorber = new OcrTextAbsorber(ocrOptions);
    document.Pages.Accept(absorber);
    
  4. Akses teks yang diekstrak
    string extractedText = absorber.Text;
    
  5. Simpan atau proses teks
    System.IO.File.WriteAllText("output.txt", extractedText);
    

Kode tersebut mengikuti alur yang sama seperti contoh komprehensif di atas tetapi memecah logika menjadi langkah‑langkah yang dapat dicerna.

Dapatkan Lisensi Gratis

Evaluasi Aspose.PDF tanpa biaya dengan meminta lisensi sementara di sini: https://purchase.aspose.com/temporary-license/

Sumber Daya Tambahan Gratis

Kesimpulan

Panduan ini memandu Anda melalui proses mengekstrak teks dari PDF yang dipindai menggunakan Aspose.PDF OCR dalam C#. Anda belajar cara menginstal perpustakaan, mengonfigurasi opsi OCR untuk akurasi, menerapkan alur ekstraksi yang bersih, dan menerapkan optimisasi kinerja untuk dokumen besar. Dengan teknik ini, setiap pengembang .NET dapat mengubah PDF yang hanya berisi gambar menjadi aliran teks yang dapat dicari dan dapat diedit.

FAQs

  1. Bagaimana cara mengekstrak teks dari PDF yang dipindai di C# menggunakan Aspose.PDF?
    Buat sebuah Document, konfigurasikan OcrTextRecognitionOptions, jalankan OcrTextAbsorber pada halaman-halaman, dan baca properti Text.

  2. Bahasa OCR apa saja yang didukung oleh Aspose.PDF?
    Perpustakaan ini mendukung banyak bahasa melalui enum OcrLanguage, termasuk Inggris, Prancis, Jerman, Spanyol, Mandarin, dan lainnya.

  3. Bagaimana saya dapat meningkatkan akurasi OCR untuk pemindaian beresolusi rendah?
    Tingkatkan Resolution (mis., 300 DPI), pilih bahasa yang tepat, dan pertimbangkan pra‑pemrosesan gambar untuk meningkatkan kontras.

  4. Apakah aman memproses PDF besar secara paralel?
    Ya, dengan membagi dokumen menjadi rentang halaman dan memproses setiap rentang pada thread terpisah, sambil memantau penggunaan memori.

  5. Lisensi apa yang diperlukan untuk fitur OCR?
    OCR sepenuhnya tersedia dengan lisensi Aspose.PDF for .NET yang valid; lisensi sementara dapat diperoleh untuk evaluasi.

  6. Di mana saya dapat menemukan dokumentasi lebih lanjut tentang pengaturan OCR?
    Panduan konfigurasi OCR yang detail tersedia di dokumen pengaturan OCR Aspose.PDF pada https://docs.aspose.com/pdf/net/.

Baca Selengkapnya