ما الذي يفعله OCR فعلًا، وما لا يستطيعه
يتعرّف OCR على الأشكال ويعيد حروفًا. إنه لا يقرأ. لا فهم وراءه للكلمات، فالرقم «1» الذي يُظن حرف «l» يعود بالثقة الظاهرة نفسها التي لكل حرف صحيح حوله. ولهذا تعرض هذه الصفحات درجة ثقة القارئ نفسه بجانب النص، بدلًا من أن تسلّمك نتيجة تبدو نظيفة وتتركك تبحث عن الأخطاء. في النص المطبوع الواضح، المصوَّر باستقامة وبتركيز جيد، يبلغ معدل الخطأ بضعة أحرف في الألف. ومع الوهج أو الظل أو خط غير مألوف قد يسوء كثيرًا جدًا، دون أن يبدو أي شيء في المخرجات مختلفًا.
هناك قارئان وراء هذه الصفحات. الأول يجد النص أينما كان في الصفحة دون أن يعرف بأي نظام كتابة هو، ويقرأ خمسين لغة ونيّفًا من قاموس واحد. والثاني، المدرَّب منفصلًا لكل لغة، يقف خلفه ويغطي أكثر من 120 لغة. ترك اللغة على الاكتشاف التلقائي يتيح للقارئ الأول المحاولة، وهذا مهم لأن تحديد اللغة الخطأ هو الطريقة الكلاسيكية للحصول على لا شيء — قائمة طعام بولندية تُعرَّف على أنها سيريلية وتُقرأ كروسية تعيد صفحة فارغة، بكل ثقة. أما تحديد اللغة بنفسك فيربط المهمة بقارئ تلك اللغة، وهذا ما تريده حين تعرف بالضبط ما لديك.
الدقة هي ما يهم، لا حجم الملف. يريد القارئ ارتفاعًا معينًا للحرف، ويُعاد تحجيم كل شيء ليحصل عليه: تُعرض صفحات PDF الممسوح بدقة 300 DPI للقراءة، وتُقاس الصورة من الحبر نفسه لا من أبعادها، ثم تُكبَّر أو تُصغَّر بما يناسب. ونص الشاشة هو الحالة التي يخطئ فيها الناس — ففي الحجم العادي يبلغ ارتفاع الحرف نحو عشرة بكسلات، أي نحو ثلث ما يريده القارئ، لذا تُكبَّر لقطة الشاشة قبل قراءتها. وتحت ثمانية بكسلات للحرف تقريبًا لا تبقى تفاصيل لتكبيرها، ولا تخترعها أي معالجة. وفي الاتجاه الآخر، صورة لقائمة طعام بدقة 48 ميغابكسل ليست أدق من صورة صغيرة حادة؛ فبعد حدّ معين تكلّف البكسلات الإضافية وقتًا ولا تشتري شيئًا.
الميلان والإضاءة غير المتساوية يدمّران أكثر مما يبدو. الصفحة المصوَّرة مائلة درجة أو درجتين ومضاءة من جانب واحد، لذا تقيس «تحويل الصورة إلى نص» و«مسح المستندات ضوئيًا» تلك الزاوية عبر الصفحة كلها وتزيلها، ثم تقدّر سطوع الورق خلف الحبر على شكل رقع وترفعه إلى بياض موحّد. هذا ليس تجميلًا. فخطوط التسطير المستقيمة هي ما يسمح بالعثور على الجدول كشبكة أصلًا، والتباين المتساوي هو ما يمنع قراءة ظل يدك على أنه حبر. ولقطة الشاشة لا تخضع لأي من المعالجتين، عن قصد: فهي مستقيمة ومتساوية الإضاءة أصلًا، ومعالجتها كأنها صورة فوتوغرافية لا تضيف إلا أخطاء.
الجداول والتخطيطات متعددة الأعمدة هي الحالة الصعبة حقًا، والأرقام تستحق المعرفة. حين قُرئ نموذج مسطّر كنص نثري لصفحة كاملة، امتد نص الخلايا إلى العمود التالي وسقط ثلث التسميات — خمسة عشر إلى عشرين بالمئة من الأحرف خاطئة. والعثور على خطوط التسطير أولًا وقراءة كل خلية على حدة خفّض ذلك إلى نحو خمسة بالمئة. لذا يُعثر على الجدول ذي الخطوط المرئية كشبكة ويعود صفوفًا مفصولة بعلامات جدولة تُلصق مباشرة في جدول بيانات، وتُقرأ أعمدة النثر بترتيب القراءة لا عرضيًا عبر الصفحة. أما الجدول المنظّم بالمسافات وحدها فلا خطوط فيه يُعثر عليها، ويصمد عند اللصق بالحظ لا بالتصميم.
ملف PDF القابل للبحث والنص المستخرج شيئان مختلفان. تترك «OCR لملفات PDF» و«مسح المستندات ضوئيًا» الصورة كما كانت تمامًا وتضعان الكلمات المتعرَّف عليها فوقها بشكل غير مرئي: تبدو الصفحة مطابقة، ويبدأ Ctrl+F بالعثور على الأشياء، ويمكنك التحديد والنسخ. لا يُرسم أي شيء على الصفحة أبدًا — وهذا يعني أيضًا أن خطأ القراءة يختبئ داخل مستند يبدو مثاليًا. أما «تحويل الصورة إلى نص» و«استخراج النص من لقطة الشاشة» فتفعلان العكس: تحصل على الحروف ولا شيء غيرها، دون خطوط ولا ألوان ولا خط عريض ولا الصورة. وتنبيه واحد بشأن طبقة النص، لأنه سهل الإغفال — لا تستطيع أن تحمل إلا الحروف التي يستطيع خط مرفق كتابتها، لذا تُحصى لك الكلمات الصينية واليابانية والكورية بدلًا من كتابتها، إلى أن يُضاف خط لها.
حيث يكون المتصفح الأداة الخطأ حقًا
بقاء الصورة على جهازك هو الحجة كلها لقراءتها هنا، وثمنه الدقة في المستندات الصعبة. هذه المقايضة حقيقية، وتستحق أن تُقال بوضوح لا أن تُدفن.
خط اليد المتصل لا يُتعرَّف عليه — لا هنا، ولا بأي أداة OCR عامة. هذه قارئات للخط المطبوع: تتعرّف على أشكال الحروف، والخط المتصل لا أشكال منفصلة فيه للحروف لتتعرّف عليها. أما الحروف المكتوبة باليد منفصلةً فكثيرًا ما تعود بجودة تكفي لتصحيحها بدلًا من إعادة كتابتها — الحروف الكبيرة، أو نموذج مملوء باليد، أو ملاحظة مكتوبة بعناية — ولهذا توجد أداة «التعرف على خط اليد»، ولهذا تضع رقم الثقة بجانب النص. قراءة الخط المتصل كما ينبغي تحتاج إلى قارئ مدرَّب على خط اليد تحديدًا، والجيدة منها تعمل على خادم لا في علامة تبويب.
خدمات OCR السحابية ستتفوق على هذا في المستندات الصعبة. تشغّل Google وAmazon وMicrosoft أدوات تعرّف مدرَّبة على بيانات تفوق بكثير ما يتسع في علامة تبويب متصفح، وستكون أدق بشكل ملحوظ مع صورة رديئة، أو صفحة كثيفة متعددة الأعمدة، أو خط غير مألوف، أو نموذج مملوء. وكذلك برنامج مكتبي مدفوع مثل ABBYY FineReader. إن كانت الدقة في مستند صعب أهم من بقاء المستند على جهازك، فاستخدم أحدها — هذه هي المقارنة الأمينة، والمعيار الذي ينبغي أن تختار على أساسه.
العمل الجماعي مكانه سطر الأوامر. هذه الأدوات تقرأ مستندًا واحدًا حين ينقر شخص. أما ألفا مستند ممسوح وفق جدول زمني فمهمة لأداة OCR مكتبية مثل OCRmyPDF، التي تضيف طبقة نص إلى مجلد كامل من ملفات PDF بأمر واحد — مجانًا، وبالنوع نفسه من القراءة دون أي نقر.
بعض الأشياء لا تُنجز ببساطة. لا يُصحَّح المنظور: الصفحة المصوَّرة من الجانب تحتفظ بشكلها شبه المنحرف ولا يُصحَّح إلا الدوران، لذا يستحق التصوير من الأعلى مباشرة ثانيةً إضافية. والطيّة الثقيلة، أو الانحناء قرب كعب الكتاب، يبقى منحنيًا. ولا توجد كاميرا هنا — قارئات الرموز تفك رموز صورة لديك أصلًا، لا بثًا مباشرًا.
وثمن عملي واحد للتشغيل محليًا: يُجلب القارئ وحزمة اللغة من هذا الموقع في أول مرة تستخدم فيها لغة ما، وهي بضعة ميغابايتات تجعل التشغيل الأول أبطأ مما بعده. لا شيء يأتي من شبكة CDN تابعة لأي جهة أخرى، ولا شيء يعود.
الاختيار بين الأدوات المتشابهة الأسماء
تحويل الصورة إلى نص مقابل استخراج النص من لقطة الشاشة. القارئ نفسه، بمعالجة مسبقة مختلفة، والفرق ليس شكليًا. الصورة الفوتوغرافية تُقوَّم وتُسوّى إضاءتها؛ ولقطة الشاشة تُكبَّر وتُترك على حالها فيما عدا ذلك، لأنه لا ميلان فيها ولا إضاءة غير متساوية، ومعاملتها كأن فيها ذلك تجعلها أسوأ. وتقبل «استخراج النص من لقطة الشاشة» أيضًا اللصق — Ctrl+V، أو Cmd+V على Mac، مباشرة من الحافظة، دون حفظ أي شيء على القرص أولًا.
تحويل الصورة إلى نص مقابل مسح المستندات ضوئيًا. تعطيك «تحويل الصورة إلى نص» الكلمات وتتخلص من الصورة. أما «مسح المستندات ضوئيًا» فتحتفظ بالصورة وتقوّمها وتبيّض الورق خلف الحبر وتعطيك ملف PDF يبدو ممسوحًا ضوئيًا — مع النص موضوعًا خلفه بشكل غير مرئي إن شئت. إن أردت لصق النص في مكان ما، فالأولى. وإن أردت إرسال المستند إلى شخص، فالثانية.
مسح المستندات ضوئيًا مقابل OCR لملفات PDF. تبدأ «مسح المستندات ضوئيًا» من صور فوتوغرافية وتنتج ملف PDF. وتبدأ «OCR لملفات PDF» من ملف PDF موجود أصلًا وتضيف إليه طبقة نص. ولا تغيّر أيٌّ منهما مظهر الصفحات. صوّرت عقدًا؟ تريد الأولى. وصلك مستند ممسوح بالبريد الإلكتروني؟ تريد الثانية.
التعرف على خط اليد مقابل تحويل الصورة إلى نص. القارئ نفسه، مع إيقاف أداة العثور على الجداول ومنح رقم الثقة المكانة التي يستحقها، لأن هذا الرقم مع خط اليد هو الجزء المفيد من النتيجة. إن كانت الكتابة متصلة فلن تقرأها أيٌّ من الصفحتين، وتقول صفحة خط اليد ذلك بدلًا من إعادة هراء معقول المظهر.
قارئ رمز QR مقابل قارئ الباركود. رموز مربعة في مقابل رموز مخططة، ويستحق الأمر أن تعرف أيها تحمل. تقرأ صفحة QR رموز QR وMicro QR وData Matrix وAztec وPDF417 — وهذا يشمل بطاقات صعود الطائرة ورخص القيادة، التي تكون رموزها مربعة الشكل حتى حين تبدو كلطخة من النقاط. وتقرأ صفحة الباركود صيغ التجزئة والخدمات اللوجستية المخططة — EAN وUPC وCode 128 وCode 39 وITF — وتتحقق من رقم التحقق، أي الرقم الأخير المحسوب من البقية، وهو الفرق بين رقم يمكنك الوثوق به ورقم يبدو صحيحًا فحسب. ولا أيٌّ منهما OCR: فالرمز شكل ذو هندسة معروفة، وفك ترميزه عملية حسابية لا تخمين لأشكال الحروف. وهما يفشلان بشكل مختلف أيضًا. الرموز المربعة تحمل تصحيحًا للأخطاء وتصمد أمام خدش أو شعار مطبوع في وسطها؛ أما المخططة فلا تحمل أيًّا منه، فالوهج على الأشرطة يعني عدم القراءة لا رقمًا خاطئًا.