মূল অংশে যান

বাংলা PDF থেকে Word-এ কনভার্ট করুন

একটি বাংলা PDF — পরিপত্র, ফর্ম, বইয়ের অধ্যায়, স্ক্যান — এডিট করার মতো .docx-এ, যুক্তাক্ষর আর স্বরচিহ্ন সঠিক ক্রমে, আর স্ক্যান করা পেজের জন্য OCR বাংলায় সেট করা। কিছুই সংরক্ষণ করা হয় না।

  • কখনো সংরক্ষণ করা হয় না
  • কোনো লাইন নেই, অপেক্ষা নেই
  • সাইনআপ নেই, ওয়াটারমার্ক নেই

যেভাবে কাজ করে

1

আপনার PDF যোগ করুন

টেক্সট PDF বা স্ক্যান। টুলটি প্রথম পেজ দেখে, স্ক্যান হলে OCR চালু করে দেয়; রিডার আগে থেকেই বাংলায় সেট করা।

2

মোড বেছে নিন

“এডিটযোগ্য লেখা” দেয় একটি সাধারণ Word ডকুমেন্ট, পেজে পেজে মিলিয়ে। “হুবহু চেহারা” প্রতিটি লাইন পেজের ছবির ওপর ঠিক আগের জায়গায় বসিয়ে দেয়, এডিটের বদলে প্রিন্টের জন্য।

3

কনভার্ট করে ডাউনলোড করুন

ইউনিকোড বাংলা ফন্টে একটি .docx — শিরোনাম, অনুচ্ছেদ, ছবি আর লিংকসহ।

বাংলা PDF-এ আলাদা কী

পুনর্বিন্যাসই আসল কথা। PDF-এর টেক্সট লেয়ার গ্লিফ রাখে আঁকার ক্রমে, আর বাংলার শেপিং ইঞ্জিন ব্যঞ্জনের আগে বসা স্বরচিহ্ন (ি, ে, ৈ) আঁকে ব্যঞ্জনের আগে, আর ো ও ৌ-কে তার দুই পাশে দুটি গ্লিফে ভাগ করে; তাই সাধারণ এক্সট্র্যাক্টর থেকে যে লেখা বেরোয় তা “স্ব␃াভািবক”, যেখানে পাতায় লেখা “স্বাভাবিক”। অন্য কিছু করার আগে প্রতিটি লাইন যৌক্তিক ক্রমে ফিরিয়ে আনা হয় — স্বরচিহ্ন তার গুচ্ছের পরে, রেফ র্ হিসেবে যে গুচ্ছের ওপর বসে তার আগে, দুই অংশের স্বরচিহ্ন একটি কোড পয়েন্টে। OCR-এর আউটপুটে এর কিছুই লাগে না, কারণ ইঞ্জিন এমনিতেই যৌক্তিক ক্রমে লেখা দেয়।

শিরোনাম, অনুচ্ছেদ, লিংক, ছবি আর পেজ ব্রেক ঠিক সাধারণ PDF থেকে Word পেজের মতোই হিসাব করা হয়: একই বেসলাইনে থাকা শব্দগুলো একটি লাইন, ফাঁক বেড়ে গেলে নতুন অনুচ্ছেদ, মূল লেখার ১.৬ গুণ সাইজের ছোট লাইন একটি শিরোনাম, আর লিংক অ্যানোটেশন হয়ে যায় Word হাইপারলিংক। “হুবহু চেহারা” পেজের আর্টওয়ার্ক ১৪৪ DPI-তে রেন্ডার করে তার ওপর আসল লেখা বসায়; “এডিটযোগ্য লেখা” পড়ার ক্রমে পরিষ্কার অনুচ্ছেদ নতুন করে গড়ে।

বাংলা অঙ্ক বাংলা অঙ্কই থাকে, আর পাতার ল্যাটিন শব্দ — ইমেইল ঠিকানা, রেফারেন্স নম্বর — ল্যাটিনই থাকে। স্ক্যানের ক্ষেত্রে লোড হয় বাংলার প্যাক, তাই ইংরেজি লেটারহেডসহ বাংলার পাতায় বাংলাটা ঠিকই পড়া হয়, কিন্তু লেটারহেড বাংলার আকারের অর্থহীন লেখা হিসেবে পড়া হতে পারে; ইংরেজিটা দরকারি হলে ভাষার তালিকায় ইংরেজি যোগ করুন।

অন্য কিছু দরকার হলে

Word ফাইল থেকে বানানো PDF মানেই নতুন করে গড়ার অপেক্ষায় থাকা একটি ফাইল; পারলে .docx-টিই চেয়ে নিন। আর বিজয় .docx-কে PDF-এ প্রিন্ট করে আবার ফিরিয়ে আনার চেয়ে বিজয় থেকে ইউনিকোড দিয়ে কনভার্ট করা ভালো — কি-স্ট্রোকগুলো একটিও ভুল ছাড়া কনভার্ট হয়, ফরম্যাটিং টিকে থাকে, আর পিক্সেল থেকে কিছুই নতুন করে পড়তে হয় না।

স্ক্যান করা বাংলা বইয়ের আর্কাইভের জন্য বাংলা মডেলসহ একটি ডেস্কটপ OCR টুল রাতভর একটি ফোল্ডার পড়ে ফেলে, আর OCRmyPDF প্রতিটি PDF-এ চেহারা না বদলে সার্চযোগ্য লেয়ার যোগ করে — শত শত ফাইলের জন্য সঠিক আকারের টুল সেটাই, যেখানে এই পেজটি একটির জন্য।

সাধারণ প্রশ্নোত্তর

আমার PDF কি সংরক্ষণ করা হয়?

না। কিছুই সংরক্ষণ করা হয় না; আপনার ফাইল কখনো রাখা হয় না। স্ক্যানের ক্ষেত্রে রিডার আর বাংলার প্যাক একবার এই সাইট থেকে আসে এবং পরের বারের জন্য রেখে দেওয়া হয় — ডকুমেন্টটি নিজে কোথাও যায় না।

PDF থেকে বাংলা সাধারণত ভুল বানানে আসে কেন?

কারণ PDF গ্লিফগুলো যে ক্রমে আঁকা হয় সেই ক্রমে রাখে, আর বাংলার জন্য সেটি দৃশ্যমান ক্রম: ই-কার যে ব্যঞ্জনের পরে আসে তার আগে আঁকা হয়, আর ো-র দুই অর্ধেক বসে তার দুই পাশে। বেশিরভাগ কনভার্টার ওই ক্রমই যেমন আছে তেমন কপি করে দেয়, তাই বাংলাদেশ আসে ভুল অক্ষরের সামনে বসা স্বরচিহ্ন নিয়ে, আর প্রতিটি শব্দ এমনভাবে ভুল বানানে আসে যা কোনো বানান পরীক্ষক ঠিক করতে পারে না। এই কনভার্টার চিহ্নগুলো ইউনিকোড যেখানে চায় সেখানে ফিরিয়ে দেয় — প্রতিটি বাংলা PDF-এর যে পুনর্বিন্যাস লাগে, এই সাইটে বানানো PDF-সহ।

বিজয় ডকুমেন্ট থেকে বানানো PDF সামলাতে পারে?

PDF-এ SutonnyMJ-তে টেক্সট লেয়ার থাকলে লেখা আসে বিজয় কি-স্ট্রোক হিসেবে, কারণ ফাইলে সেটাই আছে; ফলাফলটি বিজয় থেকে ইউনিকোড দিয়ে চালিয়ে নিন, ফরম্যাটিং টিকে থাকবে। PDF-টি স্ক্যান হলে OCR ছবিটি পড়ে সরাসরি ইউনিকোড দেয়।

বাংলা স্ক্যানে OCR কতটা ভালো?

ছাপা বাংলার পরিষ্কার ৩০০ dpi স্ক্যান ভালোই পড়া যায়; বিবর্ণ ফটোকপি আর ফোনের ছবিতে যুক্তাক্ষর হারায়। এই পেজে ভাষা বাংলায় স্থির করা, তাই ল্যাটিন লেটারহেড বা রেফারেন্স নম্বর পুরো পাতার জন্য রিডারকে ইংরেজিতে ঠেলে দিতে পারে না। বাঁকা হয়ে স্ক্যান হওয়া পেজ আগে সোজা করা হয়।

কোন Word ফরম্যাট পাব?

একটি সাধারণ .docx, ইউনিকোড বাংলা ফন্টে সেট করা, যা Word, Google Docs ও LibreOffice-এ খোলে। লেখাটি সত্যিকারের ইউনিকোড: সার্চযোগ্য, আর Avro বা Ridmik দিয়ে টাইপ করে বদলানো যায়।

টেবিল আর ফর্মের ক্ষেত্রে কী হয়?

স্ক্যানের দাগ টানা ফর্ম “এডিটযোগ্য লেখা” মোডে আসল Word টেবিল হিসেবে আসে। টেক্সট PDF-এর টেবিল আসে নির্দিষ্ট স্থানে বসানো লেখা হিসেবে, যেমন প্রতিটি PDF-থেকে-Word কনভার্টারেই হয় — স্প্রেডশিটের জন্য PDF থেকে Excel ভালো টুল।

জেনে রাখুন: ফন্ট বদলে যায়: .docx-এ ব্যবহার হয় একটি ইউনিকোড বাংলা ফন্ট, PDF-এর নিজের ফন্ট নয়, তাই চেহারা হুবহু এক নয়, কাছাকাছি। বিজয় ফন্টে সেট করা টেক্সট PDF বিজয় কি-স্ট্রোক হিসেবে কনভার্ট হয়, আর পরে বিজয় থেকে ইউনিকোড কনভার্টার লাগে। OCR ছবি ও লোগো উপেক্ষা করে, হাতের লেখা ছবি হিসেবেই রাখে, আর প্রতি পেজে কয়েক সেকেন্ড নেয়, কারণ পড়ার কাজটি করে আপনার নিজের ডিভাইস।

এই টুলটি আপনার ওয়েবসাইটে যোগ করুন

যেকোনো ব্লগ, ক্লাসের পেজ বা হেল্প আর্টিকেলের জন্য ফ্রি। একটি স্নিপেট পেস্ট করলেই আপনার ভিজিটররা আপনার পেজেই এটি ব্যবহার করতে পারবেন।