PDF থেকে Excel-এ কনভার্ট করুন
PDF-এর টেবিলগুলো বের করে এমন একটি আসল .xlsx-এ নিন, যা সর্ট, ফিল্টার ও যোগ করা যায় — পেজ থেকেই নতুন করে গড়া।
- কখনো সংরক্ষণ করা হয় না
- কোনো লাইন নেই, অপেক্ষা নেই
- সাইনআপ নেই, ওয়াটারমার্ক নেই
যেভাবে কাজ করে
আপনার PDF যোগ করুন
যে ডকুমেন্টে আপনার দরকারি টেবিলটি আছে, সেটি টেনে এনে ছাড়ুন।
কনভার্ট করুন
একই বেসলাইন দেখে সারি, আর পেজে লেখা কোথা থেকে শুরু হয় তা দেখে কলাম খুঁজে বের করা হয়।
ডাউনলোড করুন
প্রতি পেজে একটি শিট, যা Excel, Google Sheets, Numbers ও LibreOffice-এ খোলে।
যাতে কোনো গ্রিড নেই, তা থেকে কীভাবে গ্রিড উদ্ধার করা হয়
PDF-এ কোনো টেবিল থাকে না। থাকে কোঅর্ডিনেটে বসানো অক্ষর, আর যে রেখাগুলো টেবিলের মতো দেখায় সেগুলো আঁকা আর্টওয়ার্ক, ভেতরের লেখার সঙ্গে যার কোনো সংযোগ নেই। তাই গ্রিডটি অনুমান করে বের করা হয়, দুটি নিয়মে, যা ঠিকঠাক জেনে রাখা ভালো। সারি আসে একই বেসলাইন থেকে, উল্লম্ব অবস্থানকে চার পয়েন্টের ভাগে গোল করে নিয়ে, যাতে সুপারস্ক্রিপ্ট বা সামান্য ওপরে ওঠা মুদ্রার চিহ্ন আলাদা সারি শুরু না করে। কলাম আসে পেজের প্রতিটি আলাদা বাম প্রান্ত সংগ্রহ করে, আর একে অপরের আট পয়েন্টের মধ্যে থাকা যেকোনো দুটিকে মিলিয়ে — এটি সারি ধরে ধরে নয়, পুরো পেজজুড়ে করা হয়, তাই কোনো লাইনে ঘটনাচক্রে খালি থাকা কলামও অন্য লাইনে নিজের জায়গা ধরে রাখে।
এ কারণেই ডানে সাজানো সংখ্যা কঠিন ক্ষেত্র, আর এটা স্পষ্ট করে বলা দরকার, কারণ এখানে সবচেয়ে সাধারণ হতাশা এটাই। ডানে সাজানো সংখ্যার কলামে প্রতিটি সারির বাম প্রান্ত আলাদা — 9.99 শুরু হয় 1,234,567.89-এর অনেক ডানে — আর সেই প্রান্তগুলোর পার্থক্য আট পয়েন্টের বেশি হলেই সেগুলো আলাদা কলাম হিসেবে পড়া হয়। তাই একটি আর্থিক টেবিল এমন কয়েকটি কলামে ছড়িয়ে আসতে পারে, যা আসলে একটি হওয়ার কথা। বামে সাজানো ও মাঝখানে সাজানো কলামে এই সমস্যা নেই। দুটি লেখা একই সেলে পড়লে একটি অন্যটির ওপর লেখা হয় না, স্পেস দিয়ে জোড়া হয়।
বের হওয়ার সময় সেলগুলোর ধরন ঠিক করা হয়: যা কিছু পরিষ্কারভাবে সংখ্যা হিসেবে পার্স হয় তা সংখ্যা হিসেবে লেখা হয় এবং যোগ করা যাবে, আর বাকি সবকিছু টেক্সট হিসেবে লেখা হয়। হিসাবের প্রচলিত সাজসজ্জা পার্স হয় না — হাজারের বিভাজক, শেষে শতাংশ চিহ্ন, মুদ্রার চিহ্ন, বা বন্ধনীতে (1,234) লেখা ঋণাত্মক সংখ্যা — তাই সেই সেলগুলো দেখতে সংখ্যার মতো কিন্তু যোগ হতে চায় না এমন টেক্সট হিসেবে আসে। Excel-এর নিজস্ব Text to Columns এক দফাতেই পুরো কলাম ঠিক করে দেয়।
প্রতিটি পেজ জোড়া লাগিয়ে একটানা একটি টেবিল না হয়ে নিজস্ব শিট হয়, যার নাম Page 1, Page 2 এভাবে — তিন পেজের টেবিল আসে তিনটি শিটে, প্রতিটিতে হেডার পুনরাবৃত্তি করে। যা আসে তা শুধু মান। ফর্মুলা কখনো PDF-এ ছিলই না যে উদ্ধার করা যাবে, আর ফিল কালার, বর্ডার, ফন্ট, মার্জ করা সেল ও চার্ট ইচ্ছে করেই নতুন করে বানানো হয় না, কারণ সেগুলো আন্দাজ করলে এমন স্প্রেডশিট তৈরি হয় যা দেখতে নির্ভরযোগ্য অথচ সূক্ষ্মভাবে ভুল।
অন্য কিছু দরকার হলে
টেবিল বের করা সত্যিকারের গবেষণার বিষয়, আর এমন টুলও আছে যা শুধু এ কাজই করে। টেবিলে দাগ টানা থাকলে Tabula ব্যবহার করুন: এটি লেখার অবস্থান থেকে গ্রিড অনুমান না করে আঁকা রেখাগুলোকেই গ্রিড হিসেবে পড়ে, যা ডানে সাজানো সংখ্যার সমস্যা পুরোপুরি মিটিয়ে দেয়। এটি ফ্রি, এর পয়েন্ট-অ্যান্ড-ক্লিক ইন্টারফেস আছে, আর এটি CSV এক্সপোর্ট করে। Camelot Python থেকে একই কাজ করে — দাগ টানা টেবিলের জন্য ল্যাটিস মোড আর দাগহীন টেবিলের জন্য স্ট্রিম মোড — আর এটি কতটা নিশ্চিত, তাও জানায়।
লেআউট সরল হলে আর শুধু পড়ার মতো করতে চাইলে Poppler-এর pdftotext -layout in.pdf out.txt কলামের ফাঁকগুলো প্লেইন টেক্সট হিসেবে রাখে, যা স্প্রেডশিটে সরাসরি ফিক্সড-উইডথ ডেটা হিসেবে খোলে এবং অনুমানের ঝামেলা পুরোপুরি এড়িয়ে যায়। আর PDF যদি স্ক্যান হয়, এখানকার কিছুই খাটে না — অবস্থান ঠিক করার মতো কোনো লেখাই নেই, আগে OCR দরকার।
সাধারণ প্রশ্নোত্তর
PDF-এর টেবিল আদৌ স্প্রেডশিট হয় কীভাবে?
PDF-এ টেবিলের কোনো ধারণাই নেই — আছে শুধু কোঅর্ডিনেটে বসানো অক্ষর। গ্রিডটি নতুন করে গড়া হয়: একই বেসলাইনের লেখা মিলে একটি সারি হয়, আর পুরো পেজজুড়ে লেখার বাম প্রান্তগুলো গুচ্ছ করে কলাম বানানো হয়, তাই এক সারিতে খালি থাকা সেলও অন্য সারিগুলোতে নিজের জায়গা ধরে রাখে।
এটি কতটা নির্ভুল?
সামঞ্জস্যপূর্ণ কলামসহ পরিষ্কার, দাগ টানা টেবিলে খুব ভালো। মার্জ করা সেল, সেলের ভেতরে একাধিক লাইনে ভাঙা লেখা, আর পেজজুড়ে সরে যাওয়া কলামে এটি হিমশিম খায় — টেবিলটির অর্থ না জেনে এগুলোর সবই সত্যিই দ্ব্যর্থক। ভরসা করার আগে ফলাফলটি যাচাই করে নিন।
সংখ্যা কি সংখ্যাই থাকে?
হ্যাঁ। যা কিছু সংখ্যা হিসেবে পড়া যায়, তা সংখ্যার সেল হিসেবে লেখা হয়, তাই সবকিছু টেক্সট হিসেবে না থেকে যোগফল ও ফর্মুলা সঙ্গে সঙ্গেই কাজ করে।
আমার PDF কি কোথাও সংরক্ষণ করা হয়?
না। প্রতিটি পেজ সংরক্ষণ না করেই পড়া হয়।
স্ক্যান করা PDF হলে কী হবে?
স্ক্যান থেকে বের করার মতো কোনো লেখা থাকে না। আগে “PDF OCR” চালান, তারপর কনভার্ট করুন।
জেনে রাখুন: মার্জ করা সেল, একাধিক লাইনের সেল আর সরে যাওয়া কলামই কঠিন ক্ষেত্র, পরে কিছুটা গুছিয়ে নিতে হতে পারে। ফরম্যাটিং, রং, ফর্মুলা ও চার্ট নতুন করে বানানো হয় না — শুধু মানগুলো আসে। প্রতিটি PDF পেজ জোড়া লাগিয়ে একটি লম্বা টেবিল না হয়ে নিজস্ব শিট হয়।
এই টুলটি আপনার ওয়েবসাইটে যোগ করুন
যেকোনো ব্লগ, ক্লাসের পেজ বা হেল্প আর্টিকেলের জন্য ফ্রি। একটি স্নিপেট পেস্ট করলেই আপনার ভিজিটররা আপনার পেজেই এটি ব্যবহার করতে পারবেন।