تحويل PDF إلى نص
استخرج الكلمات من ملف PDF مع بقاء أسطرها وفقراتها كما هي — انسخها مباشرة إلى الحافظة أو نزّلها كملف .txt. لا يُخزَّن أي شيء.
- لا يُخزَّن أبدًا
- لا طابور ولا انتظار
- دون تسجيل ودون علامة مائية
كيف تعمل الأداة
أضف ملف PDF
أفلِت ملف PDF على الصفحة. يبدأ الاستخراج فورًا، صفحة تلو الأخرى.
اقرأ وعدّل
يظهر النص في مربع قابل للتعديل. شغّل علامات فواصل الصفحات أو أوقفها، وعدّل ما تشاء قبل الحفظ.
انسخ أو نزّل
انسخ النص كله إلى الحافظة، أو نزّله كملف .txt.
من أين تأتي الكلمات، وبأي ترتيب تصل
الأحرف في ملف PDF لا تُخزَّن كنص، بل كأرقام رموز خطية (glyphs) تشير إلى خط مضمَّن، وتحويلها إلى أحرف من جديد يعتمد على جدول داخل الملف يبيّن الحرف الذي يمثله كل رمز. معظم البرامج التي تنشئ PDF تضيف هذا الجدول. وحين لا يفعل أحدها — والمتهم المعتاد هو المجموعات الجزئية المقتطعة من الخطوط التي تنتجها بعض برامج التصميم — تبدو الصفحة مثالية على الشاشة وتخرج عند الاستخراج رموزًا لا معنى لها، لأن المعلومات اللازمة لقراءتها لم تُكتب أصلًا. ولا يستطيع أي أداة استخراج إصلاح ذلك؛ فهي بيانات مفقودة لا مشكلة صعبة.
ترتيب القراءة هو ما يجب التحقق منه قبل الوثوق بالنتيجة. يخرج النص بالترتيب الذي ترسمه به الصفحة، أي الترتيب الذي صادف أن أخرجه البرنامج الذي أنشأ ملف PDF — وكثيرًا ما لا يكون هو الترتيب الذي يقرأ به الإنسان. فالصفحة ذات العمودين تُستخرج أحيانًا عمودًا أيسر وعمودًا أيمن منفصلين بشكل صحيح، وأحيانًا أسطرًا متداخلة بينهما، والأمر يتوقف كليًا على طريقة إنشائها. أما الترويسات والتذييلات وأرقام الصفحات والأشرطة الجانبية فتقع حيث رُسمت، وغالبًا في وسط النص.
ثمة بعض الشوائب الصغيرة التي يستحق التعرف عليها بدلًا من الحيرة أمامها. فالحروف المركبة (ligatures) تصل كالحرف الواحد الذي استخدمه الخط فعلًا، فقد تصل "find" كرمز واحد بدلًا من f يليه i، فيفوتها البحث البسيط عن "find". والكلمات المقسومة بشرطة عند نهاية السطر تبقى مقسومة، لأن الفاصل حقيقي في الملف. وعلامات الاقتباس المستقيمة كثيرًا ما تكون منحنية، وهذا مهم إن كان النص متجهًا إلى كود أو ملف CSV.
الصفحة الممسوحة ضوئيًا لا تعطي شيئًا على الإطلاق، والأداة تخبرك بذلك بدلًا من أن تعيد إليك ملفًا فارغًا — فلا أحرف في صورة فوتوغرافية لمستند، بل بكسلات فقط. والأمر نفسه ينطبق على النص المحوَّل إلى مخططات، وهو ما يفعله المصممون عمدًا ليُطبع الملف بشكل مطابق في كل مكان؛ فيصبح عندها رسمًا فعليًا. وكلاهما يحتاج إلى OCR لا إلى الاستخراج.
عندما تحتاج إلى شيء آخر
حين تكون الأعمدة مهمة، فإن الأمر pdftotext -layout in.pdf out.txt من Poppler أفضل من أي شيء يفعله المتصفح: فهو يعيد بناء التباعد المرئي بمسافات حقيقية، فتبقى الأعمدة أعمدة ويبقى الجدول جدولًا يمكنك قراءته. أما pdftotext -raw فيسلك الاتجاه المعاكس ويعطي ترتيب الرسم كما هو، وهو أحيانًا ما يحتاجه السكربت.
لاستخراج النص من مئات الملفات، فإن mutool draw -F txt ومكتبة pdfplumber في Python هما ما يُبنى عليه — ولا سيما pdfplumber التي تعطيك كل حرف مع إحداثياته وخطه وحجمه، فتستطيع استبعاد الترويسة والتذييل حسب الموضع لا بالتخمين. هذه هي المهمة التي لا تستطيع هذه الصفحة أداءها، وهي المهمة المهمة حين يكبر الحجم.
الأسئلة الشائعة
هل يحافظ على الفقرات وفواصل الأسطر؟
نعم. لا يخزّن ملف PDF أي فقرات على الإطلاق — بل أحرفًا عند إحداثيات فقط — لذا يُعاد بناء النص بتجميع الكلمات التي تشترك في خط أساس واحد، وبدء فقرة جديدة حيث تتسع المسافة العمودية. فتأتي النتيجة مقروءة كالأصل، لا كتلة نص متصلة.
هل يُخزَّن ملف PDF في أي مكان؟
لا. يقرأ متصفحك أنت النص، ولا يُرسَل إلى أي مكان. يمكنك قطع الاتصال بالإنترنت بعد تحميل الصفحة وستظل الأداة تعمل.
تقول الأداة إن ملف PDF لا يحتوي على نص — لماذا؟
لأنه مستند ممسوح ضوئيًا أو صورة فوتوغرافية: الصفحة عبارة عن صورة، والصور لا تحتوي على نص يمكن استخراجه. استخدم أداة «OCR لملفات PDF» التي تقرأ الكلمات من الصورة نفسها.
هل يمكنني تعديل النص قبل التنزيل؟
نعم — المربع قابل للتعديل بالكامل، وما تراه هو بالضبط ما يُحفَظ.
ماذا عن الجداول والأعمدة؟
تُقرأ الأعمدة بالترتيب الذي يرسمها به ملف PDF، وهو صحيح عادةً لكنه قد يُداخل بينها في التخطيطات المعقدة متعددة الأعمدة. وتخرج الجداول أسطرًا من النص لا شبكة — للجداول استخدم «تحويل PDF إلى Excel».
معلومة مفيدة: النص العادي لا يحمل أي تنسيق: الخط العريض والأحجام والألوان والصور وبنية الجداول تسقط كلها بطبيعة الحال. والنص المرسوم كمخططات متجهة بدلًا من أحرف حقيقية (وهو شائع في الشعارات وبعض ملفات PDF التصميمية) لا يمكن لأي أداة استخراجه دون OCR.
أضِف هذه الأداة إلى موقعك
مجانية لأي مدونة أو صفحة فصل دراسي أو مقالة مساعدة. الصق مقتطفًا واحدًا وسيتمكن زوارك من استخدامها مباشرةً على صفحتك.
المزيد من أدوات PDF
تحويل PDF إلى Word
إلى .docx قابل للتعديل، مع OCR للمستندات الممسوحة
OCR لملفات PDF
اجعل المستند الممسوح قابلًا للبحث
تحويل TXT إلى PDF
النصوص والملاحظات في PDF مرتّب
تحويل PDF إلى HTML
صفحة ويب واحدة مكتفية بذاتها
تحويل PDF إلى PDF/A
صيغة أرشيفية للحفظ طويل الأمد
تحويل PDF إلى Excel
الجداول إلى جدول بيانات حقيقي