كيفية جعل ملف PDF الممسوح قابلًا للبحث باستخدام OCR
يقرأ OCR النص من صور الصفحات ويضيف طبقة نص قابلة للبحث. وتؤثر جودة المصدر واللغة واتجاه الصفحة مباشرة في الدقة.
تحقق أولًا من حاجة الملف إلى OCR
افتح PDF وحاول تحديد جملة. إذا استطعت تمييز كلمات منفردة فهذا يعني أن المستند يحتوي على نص بالفعل. أما إذا تعاملت الصفحة كلها كصورة واحدة فيمكن لـ OCR جعلها قابلة للبحث والنسخ.
حسّن دقة التعرف
- استخدم مسحًا مستقيمًا بتباين قوي ومن دون ظلال.
- دوّر كل صفحة إلى اتجاه القراءة الصحيح.
- استخدم دقة تقارب 300 نقطة في البوصة للنص المطبوع العادي.
- اختر لغة التعرف الصحيحة عند توفر الخيار.
- راجع الأرقام وعلامات الترقيم بعناية في الصفحات العربية والإنجليزية المختلطة.
أنشئ PDF قابلًا للبحث
- اختر المستند في أداة OCR لملفات PDF.
- حدد لغة المستند وابدأ التعرف.
- نزّل النتيجة وابحث عن كلمات من صفحات مختلفة.
- انسخ فقرة إلى محرر نصوص للتحقق من ترتيب القراءة.
اعرف حدود OCR
قد تتسبب الدقة المنخفضة والخط اليدوي والخطوط المزخرفة والجداول والصفحات المنحنية في أخطاء. لا تعتبر OCR نسخًا مضمونًا للأسماء القانونية أو أرقام الحسابات أو القياسات الفنية، وتحقق من المعلومات المهمة بمقارنتها مع الصفحة الظاهرة.
البحث مقابل التحرير
يحافظ PDF القابل للبحث على صورة الصفحة ويضيف نصًا مخفيًا تم التعرف عليه. وهو ممتاز للعثور على المصطلحات وأرشفة الملفات. وإذا أردت إعادة كتابة الفقرات أو تعديل الجداول فحوّل المستند بعد التعرف إلى Word وراجع التخطيط.