تخطَّ إلى المحتوى

اجعل ملف PDF الممسوح ضوئيًا قابلًا للبحث

اقرأ الكلمات من المستند الممسوح وضعها بشكل غير مرئي فوق الصفحات. يبدو المستند كما هو — لكنه يصبح قابلًا للبحث والتحديد والنسخ. وتُقوَّم الصفحات الممسوحة بميل أو على جانبها.

  • لا يُخزَّن أبدًا
  • لا طابور ولا انتظار
  • دون تسجيل ودون علامة مائية

كيف تعمل الأداة

1

أضِف ملف PDF الممسوح ضوئيًا

أفلِت الملف. تتحقق الأداة مما إذا كانت فيه طبقة نص أصلًا، وتخبرك إن كان OCR سيعني خطوة إلى الوراء.

2

تحقّق من اللغة

تقرأ الأداة الصفحة الأولى وتخبرك باللغة التي وجدتها. وتتوفر أكثر من 120 لغة إذا احتجت إلى اختيار لغة بنفسك.

3

تنزيل

تحصل على المستند نفسه، ومعه الآن طبقة نص مخفية خلف الصورة الممسوحة.

طبقة غير مرئية فوق صفحة لم تتغير

تُحفظ الصورة الممسوحة كما كانت تمامًا. والمضاف هو طبقة نص مرسومة بوضع عرض غير مرئي — أحرف حقيقية، موضوعة كلمةً كلمةً فوق الكلمات في الصورة، ومعلَّمة بحيث لا تُرسم أبدًا. تبدو الصفحة مطابقة لأنه لم يتغير فيها شيء بصريًا؛ وحين تحدّد جملة يقع التظليل على الكلمات الصحيحة لأن النص غير المرئي موجود حيث يوجد الحبر المرئي. هذه هي الطريقة القياسية لصنع مستند ممسوح قابل للبحث، ولهذا يمكن البحث في النتيجة ونسخها وفهرستها رغم أنها لا تزال صورة فوتوغرافية لمستند.

وهناك أمران في الصفحة يُصحَّحان عمدًا، لأن القراءة كانت تحتاج إليهما على أي حال. فالصفحة الممسوحة على جانبها تُدار لتصبح قائمة، والصفحة التي مرّت في وحدة التغذية مائلة تُقوَّم — لذا غالبًا ما تكون النتيجة أكثر ترتيبًا من الأصل. وتُحفظ مقاسات الصفحات كما في ملف PDF الأصلي بدل توحيدها، فيبقى المستند ذو المقاسات المختلطة كما هو ولا يُعاد تحجيم أي شيء.

تعتمد الدقة كليًا تقريبًا على المسح الضوئي، والفارق كبير جدًا. فالمسح النظيف للنص المطبوع بدقة 300 DPI يُقرأ بدقة عالية جدًا؛ والصفحة نفسها بدقة 150 DPI تُقرأ أسوأ بشكل ملحوظ؛ أما صورة فوتوغرافية ملتقطة بزاوية في إضاءة ضعيفة فمسألة مختلفة تمامًا. إذا كنت تتحكم في المسح، فإن 300 DPI بتدرج الرمادي هو الإعداد المهم — نادرًا ما تفيد دقة أعلى من ذلك، وأي دقة أقل تضر فورًا. والخط الصغير، والتباعد الضيق بين الأسطر، والخلفيات الملونة، والنسخ المصوّرة عن نسخ مصوّرة، وكل ما هو مختوم أو مكتوب بخط اليد، كلها أصعب بطرق لا يحلها أي برنامج حلًا كاملًا.

وما يُستبعد عمدًا لا يقل أهمية عما يُضاف. فالصور الفوتوغرافية والشعارات والتواقيع والرسومات الزخرفية تُتجاهل ولا تُقرأ، لأن إجبار صورة على إخراج حروف ينتج هراءً يبدو معقولًا ثم يظهر في كل عملية بحث. ويُتعرَّف على الكلمات الصينية واليابانية والكورية لكنها تُستبعد من طبقة النص وتُعدّ لك، بدل كتابتها كفراغات، إلى أن يتوفر خط يستطيع حملها. ولا شيء هنا يعيد صفّ المستند: فالكلمات على الصفحة لا تزال صورة، والتحويل إلى Word هو الأداة التي تحوّلها إلى نص قابل للتعديل.

عندما تحتاج إلى شيء آخر

OCRmyPDF هي الأداة الأصلية التي لا تعدو هذه الصفحة أن تكون بديلًا مريحًا بجانبها، وهي مجانية. يؤدي ocrmypdf --deskew --rotate-pages in.pdf out.pdf المهمة نفسها بتحكم أكبر، ويضيف --optimize 3 لتصغير النتيجة، و--redo-ocr لاستبدال طبقة نص رديئة موجودة، و--output-type pdfa لإنتاج ملف أرشيفي في الخطوة نفسها. وهي تتعامل مع آلاف الصفحات، وتعمل مع مراقِب للمجلدات، وهي ما تستخدمه المكتبات وأرشيفات المستندات فعلًا.

وللمواد الصعبة — المطبوعات التاريخية، والتخطيطات غير المألوفة، والجداول الكثيفة — تستطيع خدمة مستضافة من Google أو Amazon أو Microsoft قراءة صفحات يعجز عنها التعرّف العام، لأنها مدرّبة على مواد أكثر بكثير. هذا فرق حقيقي في القدرات ويستحق المعرفة. لكنه يعني أيضًا إرسال مستنداتك إلى طرف ثالث، وهذه بالضبط المقايضة التي وُجدت هذه الصفحة لتجنّبها — لذا فهي الخيار الصحيح لكتاب قديم هش، والخيار الخطأ لصندوق من السجلات الطبية.

الأسئلة الشائعة

هل ستبدو الصفحات مختلفة بعد ذلك؟

أكثر استقامة فقط: فالصفحة الممسوحة بانحراف درجة واحدة أو على جانبها تُعدَّل لتصبح قائمة. تُحفظ الصورة الممسوحة نفسها، وتُوضع الكلمات المتعرَّف عليها فوقها بحبر غير مرئي — لا تُرسم أبدًا ولا تُطبع أبدًا. والذي يتغير هو أن Ctrl+F يبدأ بالعثور على ما تبحث عنه.

هل يُخزَّن مستندي في أي مكان؟

لا. التعرّف لا يخزّن أي شيء. يأتي محرك القراءة وحزمة اللغة من هذا الموقع في أول مرة تستخدم فيها لغة ما؛ أما المستند نفسه فلا يغادر الجهاز أبدًا.

ما مدى دقته؟

عالية جدًا مع المستندات الممسوحة بوضوح للنصوص المطبوعة. وتقلّ مع الصور الضبابية وخط اليد والخطوط غير المألوفة؛ ويُصحَّح الميل قبل القراءة. وتُقرأ الجداول المسطّرة خلية خلية، فلا تختلط تسميات النماذج بقيمها.

ما اللغات المدعومة؟

أكثر من 120 لغة، منها الإنجليزية والبنغالية والهندية والأردية والعربية والإسبانية والفرنسية والصينية واليابانية والكورية. تُكتشف الكتابة من الصفحة؛ وحين تشترك عدة لغات في كتابة واحدة، تُستخدم لغة متصفحك للترجيح، ويمكنك تغييرها.

بعض الكلمات مفقودة من طبقة النص. لماذا؟

لا تستطيع طبقة النص أن تحمل إلا الأحرف التي يستطيع أحد الخطوط المرفقة كتابتها. للبنغالية والديفاناغارية والعربية والتايلاندية ونحو أربع وعشرين كتابة أخرى خطوطها الخاصة هنا؛ أما الصينية واليابانية والكورية فليس لها خط بعد، لذا تُعدّ تلك الكلمات لك بدل حفظها كفراغات. وتمنحك أداة «تحويل PDF إلى Word» مع OCR ذلك النص كاملًا.

كم يستغرق ذلك؟

بضع ثوانٍ لكل صفحة، لأن جهازك أنت هو الذي يقرأ لا مزرعة خوادم. ويُعرض التقدم صفحةً صفحة.

معلومة مفيدة: تُستبعد الكلمات الصينية واليابانية والكورية من طبقة النص وتُعدّ لك، بدل حفظها كفراغات، إلى أن يتوفر خط لها؛ أما كل كتابة أخرى يعرفها محرك القراءة فتُكتب. وتُتجاهل الصور والشعارات والتواقيع حتى لا تتحول أبدًا إلى نص عديم المعنى. ولا تتعرف أي أداة OCR عامة على خط اليد بشكل موثوق.

أضِف هذه الأداة إلى موقعك

مجانية لأي مدونة أو صفحة فصل دراسي أو مقالة مساعدة. الصق مقتطفًا واحدًا وسيتمكن زوارك من استخدامها مباشرةً على صفحتك.