মূল অংশে যান

PDF থেকে Word-এ কনভার্ট করুন

যেকোনো PDF-কে এডিটযোগ্য Word ডকুমেন্টে পরিণত করুন — ছবিসহ, মূল পেজের হুবহু প্রতিচ্ছবি দেওয়া “হুবহু চেহারা” মোড আর স্ক্যানের জন্য বিল্ট-ইন OCR-সহ। কিছুই সংরক্ষণ করা হয় না; আপনার ফাইল কখনো রাখা হয় না।

  • কখনো সংরক্ষণ করা হয় না
  • কোনো লাইন নেই, অপেক্ষা নেই
  • সাইনআপ নেই, ওয়াটারমার্ক নেই

যেভাবে কাজ করে

1

আপনার PDF যোগ করুন

একটি PDF পেজে টেনে এনে ছাড়ুন। টুলটি স্বয়ংক্রিয়ভাবে এটি যাচাই করে, আর স্ক্যান শনাক্ত করলে OCR চালু করে দেয়।

2

মোড বেছে নিন

ডিফল্ট মোড “এডিটযোগ্য লেখা” আপনাকে দেয় PDF-এর সঙ্গে পেজে পেজে মেলানো একটি সাধারণ Word ডকুমেন্ট: অনুচ্ছেদ, শিরোনাম, বোল্ড ও ইটালিক, লিংক আর ছবি, প্রতিটি পেজ তার মূল সাইজে, নিজস্ব মার্জিন ও লাইন স্পেসিং নিয়ে — তাই PDF-এর ১২ নম্বর পেজই ডকুমেন্টের ১২ নম্বর পেজ — আর ফাইলটি মোটামুটি PDF-এর সমান সাইজের। “হুবহু চেহারা” প্রতিটি লাইন পেজের একটি ছবির ওপর ঠিক আগের জায়গায় বসিয়ে দেয় — প্রিন্টের জন্য এটি PDF-এর হুবহু প্রতিচ্ছবি, কিন্তু এডিট করা কঠিন এবং সাইজে কয়েকগুণ বড়। স্ক্যানের ক্ষেত্রে OCR নিজেই চালু হয়, প্রথম পেজ দেখে ভাষা বুঝে নেয়, আর বাঁকা হয়ে স্ক্যান হওয়া পেজ সোজা করে দেয়।

3

কনভার্ট করে ডাউনলোড করুন

“Word-এ কনভার্ট করুন”-এ ক্লিক করে শিরোনাম ও অনুচ্ছেদসহ একটি পরিষ্কার .docx ডাউনলোড করুন, এডিটের জন্য তৈরি।

কী পরিষ্কারভাবে কনভার্ট হয়, আর কী হয় না

PDF কোঅর্ডিনেটে গ্লিফ রেকর্ড করে। এতে কোনো অনুচ্ছেদ নেই, আর কেউ ইচ্ছে করে ট্যাগ না করলে শিরোনামও নেই — তাই দুটোই পড়া নয়, হিসাব করে বের করা হয়। একই বেসলাইনে থাকা শব্দগুলো মিলে একটি লাইন হয়, উল্লম্ব ফাঁক বেড়ে গেলে নতুন অনুচ্ছেদ শুরু হয়, আর ডকুমেন্টের মূল লেখার গড় (মিডিয়ান) সাইজের প্রায় ১.৬ গুণে বসানো ছোট লাইন হয় Heading 1, ১.৩ গুণে Heading 2। এডিট শুরুর আগে শেষ নিয়মটি জেনে রাখা ভালো: যে ডকুমেন্টের শিরোনাম বোল্ড কিন্তু মূল লেখার চেয়ে বড় নয়, সেগুলো সাধারণ লেখা হিসেবে আসে, আর Word-এর নেভিগেশন প্যান খালি থাকবে।

লিংক টিকে থাকে, যা মানুষকে অবাক করে। লেখার ওপরের লিংক অ্যানোটেশন আসল Word হাইপারলিংক হয়ে যায়, আর যে সূচিপত্রের এন্ট্রি বা ক্রস-রেফারেন্স বারো নম্বর পেজে নিয়ে যেত, সেটি ওই পেজের শুরুতে বসানো একটি বুকমার্কের অভ্যন্তরীণ লিংক হয়ে যায় — তাই কনভার্শনের পরও সূচিপত্র কাজ করে।

দুটি জিনিস একেবারেই পড়া হয় না। পূরণ করা PDF ফর্মের উত্তরগুলো পেজে নয়, ফিল্ড অবজেক্টে থাকে, তাই “এডিটযোগ্য লেখা”-য় সেগুলো থাকেই না; “হুবহু চেহারা” সেগুলো দেখায়, কারণ সেগুলো পেজের ছবির অংশ, কিন্তু এডিটযোগ্য লেখা হিসেবে নয়। মন্তব্য ও স্ট্যাম্পও একই ধরনের অবজেক্ট, আর তাদের পরিণতিও একই। আর “হুবহু চেহারা”-য় আর্টওয়ার্ক একবার ১৪৪ DPI-তে রেন্ডার করা হয়, আসল লেখা তার ওপরে বসানো থাকে, তাই PDF-এ যে লোগো বা চার্ট ভেক্টর ছিল, .docx-এ তা একটি ছবি — বড় করলেই সেটা বোঝা যায়।

অন্য কিছু দরকার হলে

আপনার যদি Word ডকুমেন্ট নয়, শুধু শব্দগুলো দরকার হয়, তবে Poppler-এর pdftotext -layout file.pdf বেশি দ্রুত ও অনুমানযোগ্য, স্পেস দিয়ে কলামগুলো আলাদা রাখে, আর PDF-কে অন্য কিছুতে পাঠানোর প্রচলিত উপায় এটাই। আর PDF যদি শুরুতেই কোনো Word ফাইল থেকে বানানো হয়ে থাকে, যিনি বানিয়েছেন তাঁর কাছে .docx-টি চেয়ে নিন: উল্টো দিকের প্রতিটি কনভার্শন কোঅর্ডিনেট থেকে নতুন করে গড়া, আর মূল ফাইলটিই একমাত্র কপি যা তা নয়।

টেবিল হলো PDF থেকে যেকোনো কিছুতে কনভার্ট করা সব কনভার্টারের দুর্বল জায়গা, এটিও তার ব্যতিক্রম নয়। ডকুমেন্টে যদি বেশিরভাগই টেবিল থাকে আর সংখ্যাগুলো গুরুত্বপূর্ণ হয়, তবে Tabula ও Camelot ফ্রি, ঠিক এই একটি সমস্যার জন্যই তৈরি, আর এ কাজে সাধারণ কনভার্টারকে হারিয়ে দেবে।

সাধারণ প্রশ্নোত্তর

কনভার্ট করার সময় কি আমার PDF সংরক্ষণ করা হয়?

না। দুটি কনভার্শন মোডের কোনোটিতেই কিছু সংরক্ষণ করা হয় না — আপনার ফাইল কখনো রাখা হয় না। OCR ব্যবহার করলে প্রথমবার রিডার আর ভাষার প্যাক এই সাইট থেকে আসে; আপনার ডকুমেন্ট নিজে কখনো কোথাও পাঠানো হয় না।

স্ক্যান করা PDF আর ডকুমেন্টের ছবি কি কনভার্ট করা যায়?

হ্যাঁ। OCR চালু করুন (স্ক্যান শনাক্ত করলে টুলটি স্বয়ংক্রিয়ভাবেই এটি প্রস্তাব করে), আর পেজের ছবি থেকে লেখা পড়া হবে। ভাষা পেজ দেখেই শনাক্ত হয় — ১২০টির বেশি ভাষা সমর্থিত, যার মধ্যে ইংরেজি, বাংলা, হিন্দি, উর্দু, আরবি, স্প্যানিশ ও চীনা আছে — আর অনুমান ভুল হলে আপনি নিজেই ভাষা বেছে নিতে পারেন। “এডিটযোগ্য লেখা” মোডে দাগ টানা ফর্ম আসল Word টেবিল হিসেবে আসে।

OCR কতটা নির্ভুল?

ছাপা লেখার পরিষ্কার স্ক্যানে নির্ভুলতা খুব বেশি। ঝাপসা ছবি, হাতের লেখা বা অস্বাভাবিক ফন্টে মান কমে যায়। পরিষ্কার, সোজা, ভালো আলোয় করা স্ক্যানে সবচেয়ে ভালো ফল পাওয়া যায়।

আমার ফরম্যাটিং আর ছবি কি অক্ষত থাকবে?

হ্যাঁ। “হুবহু চেহারা” প্রতিটি পেজ মূল সাইজে রাখে এবং দুটি স্তরে নতুন করে গড়ে: প্রতিটি ছবি, লোগো, রঙিন ব্যান্ড ও ভেক্টর আর্টওয়ার্ক PDF যেভাবে আঁকে হুবহু সেভাবেই আসে, আর আসল লেখা তার ওপরে মূল অবস্থানে বসে, মূল রং, বোল্ড ও শিরোনামসহ। অন্যদিকে “এডিটযোগ্য লেখা” পড়ার ক্রমে ছবিসহ পরিষ্কার অনুচ্ছেদ ও শিরোনাম নতুন করে গড়ে, PDF-এর সঙ্গে পেজে পেজে মিলিয়ে — অনেক বেশি এডিট করতে চাইলে এটিই ভালো পছন্দ।

কোন Word ফরম্যাট পাব?

একটি সাধারণ .docx ফাইল, যা Microsoft Word, Google Docs, LibreOffice ও সব আধুনিক এডিটরে খোলে।

পেজ বা ফাইলের কোনো সীমা আছে কি?

নির্দিষ্ট কোনো সীমা নেই। OCR-এ প্রতি পেজে কয়েক সেকেন্ড লাগে, কারণ পড়ার কাজটি করে আপনার নিজের ডিভাইস, তাই খুব লম্বা স্ক্যানে শুধু সময় বেশি লাগে — একটি প্রগ্রেস ইন্ডিকেটর ঠিক কোথায় আছে তা দেখায়।

জেনে রাখুন: ফন্টগুলোর বদলে কাছাকাছি সমতুল্য ফন্ট বসানো হয়, কারণ PDF নিজের ফন্ট এমবেড করে আর Word সেগুলো ব্যবহার করতে পারে না — তাই “হুবহু চেহারা” পিক্সেল-পর্যন্ত এক নয়, প্রায় একই রকম, আর কোনো লাইন মূলের চেয়ে সামান্য চওড়া বা সরু হতে পারে। টেক্সট PDF-এর টেবিল Word টেবিল না হয়ে নির্দিষ্ট স্থানে বসানো লেখা হিসেবে আসে; স্ক্যানে দাগ টানা টেবিল Word টেবিল হয়, কিন্তু দাগহীন টেবিল নির্দিষ্ট স্থানে বসানো লেখাই থাকে। OCR ইচ্ছে করেই ছবি, লোগো আর সাজসজ্জার গ্রাফিক্স উপেক্ষা করে, যাতে সেগুলো কখনো আবর্জনা অক্ষরে পরিণত না হয়; হাতের লেখা ও স্ট্যাম্প ছবি হিসেবেই রাখে; আর প্রতি পেজে কয়েক সেকেন্ড সময় নেয়।

এই টুলটি আপনার ওয়েবসাইটে যোগ করুন

যেকোনো ব্লগ, ক্লাসের পেজ বা হেল্প আর্টিকেলের জন্য ফ্রি। একটি স্নিপেট পেস্ট করলেই আপনার ভিজিটররা আপনার পেজেই এটি ব্যবহার করতে পারবেন।