এডিটের পরে আসলে কী টিকে থাকে
একটি PDF একটিমাত্র জিনিস নয়। পেজের দৃশ্যমান কনটেন্টের পাশাপাশি এতে থাকে একটি আউটলাইন (বুকমার্ক), ফর্ম ফিল্ড ও তাদের মান, স্ক্রিন রিডারের জন্য ট্যাগ কাঠামো, সংযুক্ত ফাইল, ডিজিটাল সিগনেচার আর ডকুমেন্টের মেটাডেটা। বেশিরভাগ অনলাইন টুল এর কয়েকটি চুপচাপ ফেলে দেয়, আর আপনি জানতে পারেন পরে।
আমাদের টুলগুলো কী করে, তা এখানে বলা হলো, আর বিভাজন রেখাটা আপনার ধারণার চেয়েও স্পষ্ট। মার্জ, ভাগ ও পেজ বের করা একটি সম্পূর্ণ নতুন ডকুমেন্ট তৈরি করে তাতে পেজগুলো কপি করে। যা কিছু *পেজের ওপর* থাকে, তা হুবহু আসে — টেক্সট, ছবি ও ভেক্টর আর্টওয়ার্ক কপি হয়, কখনো নতুন করে কমপ্রেস বা রিসাইজ হয় না, তাই পেজগুলো দেখতে হুবহু এক। কিন্তু যা কিছু *ডকুমেন্টের* স্তরে থাকে, তা পেছনে রয়ে যায়: বুকমার্কের আউটলাইন, ফর্মের ডিকশনারি, স্ক্রিন রিডার যে ট্যাগ কাঠামো অনুসরণ করে, ডকুমেন্টের ভাষা, আর Title ও Author ফিল্ড। তাই মার্জ বা ভাগ করা ফাইলে কোনো বুকমার্কই থাকে না — প্রথম ফাইলেরটাও না, কোনোটাই না — আর ফর্মের ঘরগুলো হয়তো আঁকা থাকবে, কিন্তু আর পূরণযোগ্য ফিল্ড থাকবে না। আউটলাইন রাখা জরুরি হলে জেনে রাখুন, qpdf মার্জের সময় মূল ডকুমেন্টের ক্যাটালগ রেখে দেয়; ব্রাউজারে চলা কোনো কিছুই তা করে না।
ইনপুটগুলোর মধ্যে রিসোর্স ভাগাভাগিও হয় না, আর এটিই এমন একটি ফলের ব্যাখ্যা, যা মানুষকে অবাক করে: একই ফন্ট এমবেড করা দুটি রিপোর্ট মার্জ করলে ফন্টটি দুবার এমবেড হয়, তাই জোড়া ফাইলটি ছোট না হয়ে মোটামুটি দুটির যোগফলের সমান হয়। এসবের ব্যতিক্রম হলো ঘোরানো — এটি নতুন ডকুমেন্ট না বানিয়ে ডকুমেন্টটি লোড করে আবার সেভ করে, শুধু পেজের রোটেশন এন্ট্রি বদলায়, তাই এটি লসলেস, ফেরানো যায়, আর আউটলাইন, ফর্ম, ট্যাগ ও মেটাডেটা অক্ষত রাখে।
কমপ্রেশনই একমাত্র কাজ, যাতে কিছু ছাড় দিতে হয়, আর কী ছাড় দিতে হয়, সে ব্যাপারে এটি সৎ: ছবিগুলো কম মানে রি-এনকোড হয়, আর টেক্সট ও ভেক্টর আর্টওয়ার্ক যেমন ছিল তেমনই থাকে। এ কারণেই শুধু লেখার একটি রিপোর্ট কমপ্রেস করলে প্রায় কিছুই কমে না, আর স্ক্যান করা একটি ব্রোশিওর কমপ্রেস করলে নব্বই শতাংশ পর্যন্ত কমতে পারে।
ডিজিটাল সিগনেচার কোনো এডিটেই টেকে না — নকশাগতভাবেই। সই ডকুমেন্টের হুবহু বাইটগুলোকে ঢেকে রাখে, তাই সই করা PDF মার্জ, ভাগ, ঘোরানো বা কমপ্রেস করলে সিগনেচার অকার্যকর হয়ে যায়। এটি ফরম্যাটের সঠিক আচরণ, টুলের বাগ নয়, আর কোথাও কোনো PDF এডিটর এটি এড়াতে পারে না।
যেখানে ব্রাউজার সত্যিই ভুল টুল
আপনার ফাইল ব্যক্তিগত রাখার জন্যই এগুলো তৈরি, আর এর একটি মূল্য আছে। কাজের মাঝপথে আপনি নিজে আবিষ্কার করার চেয়ে আমরা এখানেই তা বলে দিতে চাই।
খুব বড় ফাইল। সবকিছু আপনার ডিভাইসের মেমোরিতে রাখা হয়, তাই সীমা কোনো প্ল্যানের নয়, ট্যাবের মেমোরি বাজেটের। ল্যাপটপে কয়েকশো মেগাবাইট অনায়াসে চলে; ফোন আগেই হাল ছেড়ে দেবে। সার্ভারে চলা একটি টুল দুই গিগাবাইটের ফাইল স্ট্রিম করতে পারে, যা আমরা খুলতে পারি না।
স্ক্যান করা পেজ। PDF যদি কাগজের ছবি হয়, তাতে খুঁজে পাওয়ার মতো কোনো টেক্সট নেই। আমাদের OCR টুলস ওই পেজগুলো এতটা ভালোভাবে পড়ে যে সার্চ ও কপি করা যায়, তবে আপনার ভাষা ও লেআউটে প্রশিক্ষিত একটি ডেস্কটপ OCR প্যাকেজ এগুলোকে ছাড়িয়ে যাবে, আর কোনোটিই জটিল টেবিল নিখুঁতভাবে আবার গড়তে পারবে না।
প্রিন্টে হুবহু পুনরুৎপাদন। স্পট কালার, ওভারপ্রিন্ট, ট্র্যাপিং ও ICC রেন্ডারিং ইনটেন্ট পেশাদার প্রিপ্রেস সফটওয়্যারের এলাকা। আপনার ফাইলে যে রঙের তথ্য আগে থেকে আছে, আমরা তা রেখে দিই, কিন্তু তা নিয়ন্ত্রণ করি না।
একসাথে অনেক ফাইল ও অটোমেশন। এই টুলগুলো চলে যখন কেউ ক্লিক করেন। নির্দিষ্ট সময়সূচিতে চার হাজার ইনভয়েস কনভার্ট করা সার্ভারে কমান্ড-লাইন টুলের কাজ — Ghostscript, qpdf ও pdfcpu সবই ফ্রি, আর যেকোনো ওয়েব পেজের চেয়ে এ কাজে ভালো।
একই রকম শোনায় এমন টুলগুলোর মধ্যে বেছে নেওয়া
PDF মার্জ বনাম PDF-এর পেজ সাজানো। মার্জ পুরো ফাইলগুলো জোড়ে আর ফাইলগুলোর ক্রম ঠিক করতে দেয়। পেজ সাজানো কাজ করে একটি ডকুমেন্টের ভেতরে, আর আলাদা আলাদা পেজ টেনে সরাতে দেয়। কয়েকটি ফাইল জোড়া *এবং* তাদের পেজ একটির ফাঁকে আরেকটি সাজানো দুই ধাপের কাজ: আগে মার্জ, তারপর পেজ সাজানো।
PDF ভাগ করা বনাম PDF থেকে পেজ বের করা। ভাগ করা একটি ডকুমেন্টকে কয়েকটি ডকুমেন্টে কেটে ফেলে। পেজ বের করা বাছাই করা পেজগুলো একটি নতুন ফাইলে নিয়ে আসে, আর মূল ফাইলটি যেমন ছিল তেমনই রাখে।
PDF আনলক বনাম রেস্ট্রিকশন সরানো। আনলকে পাসওয়ার্ড লাগে, আর এটি এনক্রিপশন সরিয়ে দেয়। রেস্ট্রিকশন হলো মালিকের বসানো ফ্ল্যাগ, যা প্রিন্ট বা কপি বন্ধ রাখে; এগুলো পরামর্শমূলক, আর পাসওয়ার্ড ছাড়াই সরানো যায়। যে ডকুমেন্ট খোলার অধিকার আপনার নেই, কোনোটিই তাতে ঢোকার উপায় নয়।
PDF থেকে Word বনাম PDF থেকে টেক্সট। PDF থেকে Word অনুচ্ছেদ, শিরোনাম ও টেবিল এডিটযোগ্য Word কনটেন্ট হিসেবে আবার গড়ে, আর জটিল লেআউটে তা নিখুঁত হবে না। PDF থেকে টেক্সট দেয় কোনো ফরম্যাটিং ছাড়া কাঁচা অক্ষরগুলো, যা সার্চ, বিশ্লেষণ বা অন্য কোথাও ব্যবহারের জন্য ঠিক যা দরকার।