ملف PDF الممسوح ضوئيًا قد يبدو كأنه يحتوي على نص، لكنه في الحقيقة مجموعة صور لا يمكن البحث فيها أو نسخ كلماتها. OCR يحاول التعرف على الحروف وإضافة طبقة نص قابلة للبحث.
يعالج PDFUAE العربية والإنجليزية والمستندات المختلطة محليًا. ويصدر النص بترميز UTF-8 مع اتجاه RTL، وإحداثيات الكلمات في TSV، وCSV مرشحًا للجداول. هذه النتائج تحتاج مراجعة، خاصة في الصور الهاتفية والأرقام والجداول المعقدة.
كيف تحصل على OCR عربي أدق
ابدأ بمسح واضح
استخدم دقة مناسبة وصفحات مستقيمة وتباينًا جيدًا. الظلال والقص والحركة تقلل الدقة قبل أن يبدأ المحرك.
اختر اللغة الصحيحة
استخدم العربية فقط للمستند العربي الخالص، أو عربي + English للنماذج التي تحتوي أرقامًا ومصطلحات لاتينية.
فعّل PDF القابل للبحث
احتفظ بالحزمة الكاملة إذا كنت تحتاج البحث، والنص المستخرج، وإحداثيات الكلمات للمراجعة أو الأرشفة.
راجع الأرقام والأسماء والجداول
قارن النص بالصورة الأصلية، ولا تعتمد ناتج OCR وحده في بيانات حساسة أو مبالغ أو أرقام هوية.
اختبار جودة OCR بعد التشغيل
اتجاه السطور العربية صحيح
الأسماء والأرقام مطابقة للأصل
البحث يعثر على كلمات فعلية
ترتيب الصفحات محفوظ
الجداول المرشحة روجعت يدويًا
حدود يجب إعلانها بوضوح
الصورة الهاتفية الضعيفة
لا تخلط دقتها مع مستند نظيف ممسوح جيدًا؛ قد تحتاج إعادة تصوير أو تحسين المصدر.
الجداول المعقدة
CSV الناتج مرشح يساعد المراجعة وليس إعادة بناء مضمونة لكل خلية أو عنوان.
الاعتماد على نسبة عامة
الدقة تختلف حسب الخط والمسح واللغة. قيّم النص الفعلي في مستندك بدل الاكتفاء بنسبة تسويقية.