Dalam banyak alur kerja bisnis, dokumen PDF yang dipindai harus diubah menjadi teks yang dapat dicari atau dapat diedit. Tutorial Extract Text from Scanned PDFs with Aspose.PDF OCR in C# menunjukkan cara memanfaatkan mesin OCR terintegrasi di Aspose.PDF for .NET untuk mengambil teks biasa dari halaman berbasis gambar. Dengan mengikuti panduan ini, Anda akan mendapatkan solusi siap pakai yang berfungsi dengan PDF yang dipindai apa pun, terlepas dari ukuran atau bahasanya.
Ekstrak Teks dari PDF yang Dipindai menggunakan Aspose.PDF OCR SDK
PDF yang dipindai hanya berisi gambar, sehingga API ekstraksi teks biasa tidak mengembalikan apa pun. OCR (Optical Character Recognition) mengubah gambar tersebut menjadi karakter yang dapat dibaca mesin, memungkinkan pengindeksan, penambangan data, dan pemrosesan lanjutan. Mengotomatiskan OCR dalam C# menghilangkan langkah salin‑tempel manual, meningkatkan akurasi, dan dapat menangani batch dokumen yang besar.
Aspose.PDF menyediakan namespace Aspose.Pdf.Ocr, yang mencakup OcrTextRecognitionOptions, OcrTextAbsorber, dan enum bahasa. Perpustakaan ini didistribusikan melalui NuGet. Instal dengan perintah berikut:
Install-Package Aspose.PDF
Untuk informasi lebih lanjut, kunjungi Halaman produk Aspose.PDF.
Ekstrak Teks dari PDF yang Dipindai dengan Aspose.PDF OCR di C#
- Muat PDF yang dipindai ke dalam
Aspose.Pdf.Document. - Konfigurasikan opsi OCR (bahasa, resolusi, pemisah halaman).
- Terapkan
OcrTextAbsorberke koleksi halaman dokumen. - Ambil teks yang dikenali dan simpan.
Contoh ini menunjukkan cara memuat PDF yang dipindai, mengonfigurasi OCR, mengekstrak teks, dan menulis hasilnya ke file menggunakan C#.
// For complete examples and data files, visit https://github.com/aspose-pdf/Aspose.PDF-for-.NET
private static void RecognizeTextWithOcr()
{
// The path to the documents directory
var dataDir = RunExamples.GetDataDir_AsposePdf();
// Open PDF document
using (var document = new Aspose.Pdf.Document(dataDir + "input.pdf"))
{
// Configure OCR recognition options
var options = new Aspose.Pdf.Ocr.OcrTextRecognitionOptions
{
Language = Aspose.Pdf.Ocr.OcrLanguage.English,
Resolution = 300,
PageSeparator = "\n\n"
};
// Recognize text from all pages
var absorber = new Aspose.Pdf.Ocr.OcrTextAbsorber(options);
document.Pages.Accept(absorber);
// Save recognized text
System.IO.File.WriteAllText(dataDir + "recognized-text.txt", absorber.Text);
}
}
Aspose.PDF Fitur yang Penting untuk Tugas ini
- Mesin OCR Terintegrasi – Tanpa ketergantungan eksternal; mesin OCR berada di namespace
Aspose.Pdf.Ocr. - Pemilihan bahasa – enum
OcrLanguagememungkinkan Anda menentukan kamus untuk pengenalan yang lebih baik. - Kontrol resolusi – DPI yang lebih tinggi meningkatkan keakuratan karakter, terutama pada pemindaian yang pudar.
- PageSeparator – String yang dapat disesuaikan untuk memisahkan halaman dalam teks output.
- Koleksi halaman yang thread‑safe – Memungkinkan pemrosesan paralel PDF besar.
Kemampuan ini memungkinkan solusi perpustakaan tunggal yang kuat untuk mengekstrak teks dari setiap PDF yang dipindai.
Instalasi dan Penyiapan di C#
- Buka solusi .NET Anda di Visual Studio.
- Buka Package Manager Console dan jalankan
Install-Package Aspose.PDF. - Tambahkan
using Aspose.Pdf;danusing Aspose.Pdf.Ocr;di bagian atas file kelas Anda. - Pastikan Anda memiliki lisensi sementara atau penuh; tanpa itu, output mungkin berisi watermark.
Untuk detail lisensi, lihat halaman lisensi sementara.
Implementasi Langkah demi Langkah dalam C#
Apa yang dijawab oleh bagian ini? Apa langkah kode tepat untuk mengekstrak teks?
- Inisialisasi dokumen
var pdfPath = "path/to/scanned.pdf"; var document = new Document(pdfPath); - Buat opsi OCR
var ocrOptions = new OcrTextRecognitionOptions { Language = OcrLanguage.English, Resolution = 300, PageSeparator = "\n--- Page Break ---\n" }; - Jalankan absorber
var absorber = new OcrTextAbsorber(ocrOptions); document.Pages.Accept(absorber); - Akses teks yang diekstrak
string extractedText = absorber.Text; - Simpan atau proses teks
System.IO.File.WriteAllText("output.txt", extractedText);
Kode tersebut mengikuti alur yang sama seperti contoh komprehensif di atas tetapi memecah logika menjadi langkah‑langkah yang dapat dicerna.
Dapatkan Lisensi Gratis
Evaluasi Aspose.PDF tanpa biaya dengan meminta lisensi sementara di sini: https://purchase.aspose.com/temporary-license/
Sumber Daya Tambahan Gratis
Kesimpulan
Panduan ini memandu Anda melalui proses mengekstrak teks dari PDF yang dipindai menggunakan Aspose.PDF OCR dalam C#. Anda belajar cara menginstal perpustakaan, mengonfigurasi opsi OCR untuk akurasi, menerapkan alur ekstraksi yang bersih, dan menerapkan optimisasi kinerja untuk dokumen besar. Dengan teknik ini, setiap pengembang .NET dapat mengubah PDF yang hanya berisi gambar menjadi aliran teks yang dapat dicari dan dapat diedit.
FAQs
Bagaimana cara mengekstrak teks dari PDF yang dipindai di C# menggunakan Aspose.PDF?
Buat sebuahDocument, konfigurasikanOcrTextRecognitionOptions, jalankanOcrTextAbsorberpada halaman-halaman, dan baca propertiText.Bahasa OCR apa saja yang didukung oleh Aspose.PDF?
Perpustakaan ini mendukung banyak bahasa melalui enumOcrLanguage, termasuk Inggris, Prancis, Jerman, Spanyol, Mandarin, dan lainnya.Bagaimana saya dapat meningkatkan akurasi OCR untuk pemindaian beresolusi rendah?
TingkatkanResolution(mis., 300 DPI), pilih bahasa yang tepat, dan pertimbangkan pra‑pemrosesan gambar untuk meningkatkan kontras.Apakah aman memproses PDF besar secara paralel?
Ya, dengan membagi dokumen menjadi rentang halaman dan memproses setiap rentang pada thread terpisah, sambil memantau penggunaan memori.Lisensi apa yang diperlukan untuk fitur OCR?
OCR sepenuhnya tersedia dengan lisensi Aspose.PDF for .NET yang valid; lisensi sementara dapat diperoleh untuk evaluasi.Di mana saya dapat menemukan dokumentasi lebih lanjut tentang pengaturan OCR?
Panduan konfigurasi OCR yang detail tersedia di dokumen pengaturan OCR Aspose.PDF pada https://docs.aspose.com/pdf/net/.
