মূল অংশে যান

PDF থেকে টেক্সটে কনভার্ট করুন

PDF-এর লেখা বের করে নিন, লাইন ও অনুচ্ছেদ অক্ষত রেখে — সরাসরি ক্লিপবোর্ডে কপি করুন বা .txt ফাইল ডাউনলোড করুন। কিছুই সংরক্ষণ করা হয় না।

  • কখনো সংরক্ষণ করা হয় না
  • কোনো লাইন নেই, অপেক্ষা নেই
  • সাইনআপ নেই, ওয়াটারমার্ক নেই

যেভাবে কাজ করে

1

আপনার PDF যোগ করুন

PDF-টি পেজে ছাড়ুন। সঙ্গে সঙ্গেই পেজ ধরে ধরে লেখা বের করা শুরু হয়।

2

পড়ুন ও ঠিক করে নিন

লেখাটি একটি এডিটযোগ্য বক্সে দেখা যায়। পেজ-বিরতির চিহ্ন চালু বা বন্ধ করুন, আর সেভের আগে যা খুশি এডিট করুন।

3

কপি বা ডাউনলোড করুন

সবটুকু ক্লিপবোর্ডে কপি করুন, অথবা .txt ফাইল হিসেবে ডাউনলোড করুন।

শব্দগুলো কোথা থেকে আসে, আর কোন ক্রমে আসে

PDF-এর অক্ষরগুলো টেক্সট হিসেবে সংরক্ষিত থাকে না। সেগুলো থাকে গ্লিফ নম্বর হিসেবে, যা ফাইলে এমবেড করা একটি ফন্টের দিকে নির্দেশ করে; আর সেগুলোকে আবার অক্ষরে ফেরানো নির্ভর করে ফাইলের ভেতরের একটি টেবিলের ওপর, যেখানে লেখা থাকে কোন গ্লিফ কোন অক্ষর বোঝায়। বেশিরভাগ সফটওয়্যার এটি রাখে। যখন রাখে না — আর কিছু ডিজাইন সফটওয়্যারের বানানো ছাঁটা ফন্ট-সাবসেটই সাধারণত এর জন্য দায়ী — তখন পেজটি স্ক্রিনে নিখুঁত দেখায়, কিন্তু বের করলে আসে অর্থহীন হিজিবিজি, কারণ পড়ার জন্য যে তথ্য দরকার তা কখনো লেখাই হয়নি। কোনো এক্সট্র্যাক্টরই এটি ঠিক করতে পারে না; এটি কঠিন সমস্যা নয়, হারানো তথ্য।

আউটপুটে ভরসা করার আগে পড়ার ক্রমটি যাচাই করুন। লেখা আসে পেজ যে ক্রমে আঁকা হয়েছে সেই ক্রমে, অর্থাৎ PDF-টি যে সফটওয়্যার বানিয়েছে সেটি যেভাবে লিখে গেছে — আর তা প্রায়ই মানুষের পড়ার ক্রম নয়। দুই কলামের একটি পেজ প্রায়ই বাঁ কলাম আর ডান কলাম হিসেবে ঠিকঠাক আলাদা হয়ে আসে, আবার কখনো দুই কলামের লাইন মিশে যায় — পুরোটাই নির্ভর করে ফাইলটি কীভাবে তৈরি হয়েছে তার ওপর। হেডার, ফুটার, পেজ নম্বর আর সাইডবার যেখানে আঁকা হয়েছে সেখানেই বসে, সাধারণত মূল লেখার মাঝখানে।

কিছু ছোটখাটো অসংগতি চিনে রাখা ভালো, তাতে মাথা ঘামাতে হয় না। লিগেচার আসে ফন্টে আসলে যে একক অক্ষরটি ব্যবহৃত হয়েছে সেটি হিসেবে, তাই “find” f আর i আলাদা না হয়ে একটি গ্লিফ হিসেবে আসতে পারে, আর তখন সরাসরি “find” খুঁজলে তা পাওয়া যায় না। লাইনের শেষে হাইফেন দিয়ে ভাঙা শব্দ হাইফেনসহই থাকে, কারণ ফাইলে ভাঙনটি সত্যিই আছে। আর সোজা উদ্ধৃতিচিহ্ন প্রায়ই বাঁকানো হয়ে আসে, যা গুরুত্বপূর্ণ যদি লেখাটি কোড বা CSV-তে যায়।

স্ক্যান করা পেজ থেকে কিছুই পাওয়া যায় না, আর টুলটি ফাঁকা ফাইল ধরিয়ে না দিয়ে সেটি স্পষ্ট জানিয়ে দেয় — ডকুমেন্টের ছবিতে কোনো অক্ষর থাকে না, থাকে শুধু পিক্সেল। আউটলাইনে রূপান্তরিত লেখার ক্ষেত্রেও একই কথা; ডিজাইনাররা ইচ্ছে করেই এটি করেন, যাতে ফাইলটি সব জায়গায় হুবহু একইভাবে প্রিন্ট হয় — তখন সেটি সত্যিই আর লেখা নয়, আর্টওয়ার্ক। দুটির জন্যই বের করা নয়, OCR দরকার।

অন্য কিছু দরকার হলে

কলাম যখন গুরুত্বপূর্ণ, তখন Poppler-এর pdftotext -layout in.pdf out.txt ব্রাউজারের যেকোনো কিছুর চেয়ে ভালো: এটি আসল স্পেস দিয়ে দৃশ্যমান ফাঁকগুলো আবার গড়ে তোলে, ফলে কলাম কলামই থাকে আর টেবিল থাকে পড়ার মতো টেবিল। pdftotext -raw উল্টো পথে যায়, আঁকার ক্রম অপরিবর্তিত রেখে দেয় — কোনো স্ক্রিপ্টের কখনো কখনো ঠিক এটিই দরকার।

শত শত ফাইল থেকে লেখা বের করতে হলে ভিত্তি হিসেবে নিন mutool draw -F txt আর Python-এর pdfplumber — বিশেষ করে pdfplumber প্রতিটি অক্ষর তার স্থানাঙ্ক, ফন্ট ও সাইজসহ দেয়, ফলে আন্দাজে নয়, অবস্থান দেখে হেডার আর ফুটার বাদ দিতে পারেন। এই কাজটি এই পেজ করতে পারে না, আর বেশি পরিমাণে কাজ করলে ঠিক এটিই গুরুত্বপূর্ণ।

সাধারণ প্রশ্নোত্তর

অনুচ্ছেদ আর লাইন ব্রেক কি ঠিক থাকে?

হ্যাঁ। PDF-এ আসলে কোনো অনুচ্ছেদই সংরক্ষিত থাকে না — থাকে শুধু নির্দিষ্ট স্থানাঙ্কে বসানো অক্ষর — তাই একই বেসলাইনের শব্দগুলো একসাথে জুড়ে, আর যেখানে উল্লম্ব ফাঁক বেড়ে যায় সেখানে নতুন অনুচ্ছেদ শুরু করে লেখাটি আবার গড়ে তোলা হয়। ফলাফল পড়তে মূল ডকুমেন্টের মতোই লাগে, একটানা এক লম্বা লেখার মতো নয়।

আমার PDF কি কোথাও সংরক্ষণ করা হয়?

না। লেখাটি আপনার নিজের ব্রাউজারই পড়ে, আর তা কোথাও পাঠানো হয় না। পেজ লোড হওয়ার পর ইন্টারনেট সংযোগ বিচ্ছিন্ন করে দিলেও এটি কাজ করবে।

বলছে আমার PDF-এ কোনো লেখা নেই — কেন?

কারণ এটি একটি স্ক্যান বা ছবি: পেজটি আসলে একটি ছবি, আর ছবিতে বের করার মতো কোনো টেক্সট থাকে না। PDF OCR ব্যবহার করুন, যা ছবি থেকেই শব্দগুলো পড়ে নেয়।

ডাউনলোডের আগে কি লেখা এডিট করা যায়?

হ্যাঁ — বক্সটি পুরোপুরি এডিটযোগ্য, আর যা দেখছেন ঠিক সেটিই সেভ হবে।

টেবিল আর কলামের কী হয়?

PDF যে ক্রমে কলামগুলো আঁকে, সেই ক্রমেই সেগুলো পড়া হয় — সাধারণত তা ঠিকই থাকে, তবে জটিল বহু-কলাম লেআউটে লাইনগুলো মিশে যেতে পারে। টেবিল আসে লেখার লাইন হিসেবে, গ্রিড হিসেবে নয় — টেবিলের জন্য PDF থেকে Excel ব্যবহার করুন।

জেনে রাখুন: প্লেইন টেক্সটে কোনো ফরম্যাটিং থাকে না: বোল্ড, ফন্টের সাইজ, রং, ছবি আর টেবিলের কাঠামো সংজ্ঞাগতভাবেই বাদ পড়ে। যে লেখা আসল অক্ষর হিসেবে নয়, ভেক্টর আউটলাইন হিসেবে আঁকা (লোগো ও কিছু ডিজাইনার PDF-এ যা প্রায়ই দেখা যায়), তা OCR ছাড়া কোনো টুলই বের করতে পারে না।

এই টুলটি আপনার ওয়েবসাইটে যোগ করুন

যেকোনো ব্লগ, ক্লাসের পেজ বা হেল্প আর্টিকেলের জন্য ফ্রি। একটি স্নিপেট পেস্ট করলেই আপনার ভিজিটররা আপনার পেজেই এটি ব্যবহার করতে পারবেন।