لماذا لا يمكنك البحث في ملف PDF ممسوح ضوئيًا
لأنه لا توجد فيه كلمات. فهم ما يوجد في الملف فعلًا يفسّر كل الأعراض، ويدلّك على الإعداد الوحيد الذي يحدد مدى إمكانية إصلاحه.
آخر مراجعة
لا توجد كلمات في الملف
يمكن لملف PDF أن يحمل شيئين مختلفين تمامًا يبدوان متطابقين على الشاشة. المستند المُصدَّر من Word يحمل نصًا — أحرفًا فعلية، لكل منها موضع وخط — ولهذا يمكنك تحديد جملة والبحث عن اسم ونسخ فقرة. أما المستند الممسوح ضوئيًا فيحمل صورة فوتوغرافية لصفحة. لا شيء فيه سوى البكسلات، تمامًا كما لا يوجد شيء سوى البكسلات في صورة فوتوغرافية للافتة طريق.
كل الأعراض تنبع من هذه الحقيقة الواحدة. البحث لا يجد شيئًا لأنه لا يوجد ما يطابقه. تحديد النص لا يعمل لأنه لا يوجد نص لتحديده — المؤشر يرسم مستطيلًا فوق صورة بدلًا من ذلك. النسخ لا يعطيك شيئًا. الملف كبير نسبةً إلى طوله، لأن الصور ثقيلة والكلمات ليست كذلك. وتحويله إلى Word ينتج إما مستندًا فارغًا أو صورة ملصقة داخل مستند.
الاختبار السريع: حاول تحديد كلمة واحدة بالفأرة. إذا ظهر لك مؤشر نص وكلمة مظللة، فهناك نص حقيقي. وإذا ظهر مربع، فهي صورة.
ما الذي يضيفه OCR فعلًا
يقرأ التعرف الضوئي على الحروف الأشكال في الصورة ويستنتج أي حروف هي. والجزء المفيد هو ما يحدث بعد ذلك: تُكتب الكلمات المتعرَّف عليها مرة أخرى في ملف PDF كنص غير مرئي، موضوع فوق الكلمات في الصورة. تبدو الصفحة تمامًا كما كانت، لأنه لم يتغير شيء بصريًا — لكن أصبح بالإمكان الآن البحث فيها وتحديد نصها ونسخه وفهرستها.
هذا تصميم متحفظ عن قصد، وهو الصحيح للمستندات. لا يُعاد تنضيد أي شيء، فيبقى العقد مطابقًا للعقد الذي وُقّع، وتظل الصورة الممسوحة الأصلية هي السجل المرئي. OCR لملفات PDF يفعل هذا في تمرير واحد، وعادةً يقوّم الصفحات ويديرها أيضًا، لأن القراءة كانت تحتاج إلى ذلك على أي حال.
إذا كان ما تريده مستندًا قابلًا للتعديل لا مستندًا قابلًا للبحث، فهذه مهمة مختلفة وأصعب بكثير: يجب استخراج النص، واستنتاج التخطيط، وإعادة بناء النتيجة كفقرات وجداول. تحويل PDF إلى Word يفعل ذلك، والنتيجة تحتاج دائمًا إلى مراجعة بطريقة لا تحتاجها طبقة النص.
الإعداد الذي يحدد كل شيء: 300 DPI
تعتمد دقة التعرف على المسح أكثر بكثير مما تعتمد على البرنامج، والرقم الأهم على الإطلاق هو الدقة. 300 DPI هي المعيار، وهي ليست رقمًا اعتباطيًا — فهي تضع نحو 30 بكسلًا من الارتفاع في النص العادي، وهذا أكثر بكثير من الحد الأدنى اللازم للتمييز بين أشكال الحروف المتشابهة.
عند 150 DPI تنخفض الدقة بشكل ملحوظ، والأخطاء من النوع الخبيث: 1 تُقرأ l، و5 تُقرأ S، وrn تُقرأ m. وتحت ذلك تتدهور بسرعة. أما تجاوز 300 فنادرًا ما يفيد ويجعل الملفات أكبر بكثير — 600 DPI تستحق فقط للخط الصغير جدًا أو الأصول الرديئة.
وهناك ثلاثة إعدادات التقاط أخرى مهمة بالقدر نفسه تقريبًا. التدرج الرمادي بدلًا من الأبيض والأسود، لأن العتبة الحادة تدمر الأجزاء الرفيعة من الحروف. مسطّحة ومتعامدة مع المستشعر، لأن الصفحة المصوّرة بزاوية تتغير أشكال حروفها عبر الصفحة. وإضاءة متساوية — والخطأ الكلاسيكي هو ظلك أنت يقع على صفحة تصوّرها من الأعلى.
ما لا يقرؤه أي OCR
الصراحة في هذا توفّر وقتًا كبيرًا. الكتابة اليدوية المتصلة لا يتعرف عليها OCR العام، والسبب بنيوي لا مسألة جهد: قراءة الحروف المطبوعة تعمل بإيجاد الحدود بين الحروف، وفي الكتابة المتصلة لا توجد حدود. أما الحروف اليدوية المنفصلة والحروف الكبيرة المنفصلة وخانات النماذج فتعمل جيدًا في الغالب، لأنها أشكال منفصلة بينها فراغات.
النص الذي هو جزء من صورة فوتوغرافية — كلمات على لافتة، أو على منتج، أو فوق خلفية مزدحمة — أصعب بكثير من النص على الورق، والحروف المزخرفة أو شديدة التنميق أصعب أيضًا. ونسخ النسخ المصوّرة تفقد الخطوط الرفيعة التي تميّز الحروف. والمستند المختوم أو المشروح أو المظلل تُقرأ مواضعه أسوأ حيثما تتداخل العلامات مع النص.
الأداة الجيدة تخبرك بمدى ثقتها، وهذا الرقم موجود ليُستخدم. انخفاض الثقة في منتصف جملة يمكنك قراءتها من السياق أقل أهمية بكثير من انخفاضها في رقم ضمن رقم حساب. الأخطاء الخطيرة هي تلك التي تأتي بثقة عالية، لأنه لا شيء ينبّه إليها.
لماذا يهم هذا أبعد من مجرد الراحة
أرشيف ممسوح ضوئيًا بلا طبقة نص هو، من الناحية العملية، أرشيف ضائع. لا شيء يستطيع البحث فيه، ولا شيء يستطيع فهرسته، ولا يستطيع أي نظام امتثال العثور على اسم فيه، ولا يستطيع أي قارئ شاشة قراءته بصوت عالٍ — وهذا في كثير من الولايات القضائية يجعل نشره مشكلة قانونية لا مجرد إزعاج.
ولهذا أيضًا يستحق الأمر الإصرار على المسح بالإعدادات الصحيحة من المرة الأولى. إعادة مسح صندوق من المستندات تكلّف أكثر بكثير من مسحه بشكل صحيح مرة واحدة، ولا تستطيع أي معالجة استعادة تفاصيل لم تُلتقط أصلًا.
الأسئلة الشائعة
ما مدى دقة OCR فعلًا؟
مع مسح نظيف بدقة 300 DPI لنص مطبوع عادي، دقيق جدًا — بدرجة تجعل الأخطاء عرضية لا روتينية. ومع صورة هاتف ملتقطة بزاوية في إضاءة ضعيفة، أسوأ بكثير. جودة المسح أهم بكثير من اختيار البرنامج.
هل سيغيّر OCR مظهر مستندي؟
لا. يُضاف النص المتعرَّف عليه بشكل غير مرئي فوق الصورة الموجودة، فتبدو الصفحة تمامًا كما كانت. وعادةً تُقوَّم الصفحات وتُعدَّل وضعيتها كجزء من العملية، مما يجعل المستندات الممسوحة المائلة تبدو أفضل لا مختلفة.
هل يمكنني تعديل النص بعد تشغيل OCR؟
ليس داخل ملف PDF نفسه — فالصفحة المرئية لا تزال صورة، وطبقة النص موضوعة فوقها بشكل غير مرئي. للحصول على شيء قابل للتعديل، حوّل المستند المتعرَّف عليه إلى Word، وتوقّع أن تحتاج إلى مراجعة النتيجة.
هل يعمل OCR مع الكتابة اليدوية؟
الحروف اليدوية المنفصلة والنماذج المعبّأة تعمل في الغالب. أما الكتابة المتصلة فلا، في أي أداة OCR عامة — فالحروف متصلة ببعضها بلا حدود يمكن إيجادها. والأدوات المدرّبة خصيصًا على الكتابة اليدوية تؤدي أفضل، مقابل إرسال صفحاتك إلى طرف ثالث.
لماذا أصبح ملف PDF القابل للبحث أكبر بكثير؟
يجب ألا يتغير تقريبًا — فطبقة النص تشغل بضعة كيلوبايتات لكل صفحة. إذا زاد حجمه كثيرًا، فالأرجح أن الصفحات أُعيد عرضها بدلًا من الاحتفاظ بها، وهذا يستحق التحقق منه، لأن الغاية من طبقة النص هي الحفاظ على الصورة الأصلية دون مساس.