মূল অংশে যান

ছবি থেকে লেখা বের করুন

ফটো, স্ক্যান বা স্ক্রিনশট থেকে লেখা পড়ে নিন, আর এমন টেক্সট হিসেবে নিয়ে যান যা এডিট, সার্চ ও পেস্ট করা যায়। ছবি কখনো সংরক্ষণ করা হয় না।

  • কখনো সংরক্ষণ করা হয় না
  • কোনো লাইন নেই, অপেক্ষা নেই
  • সাইনআপ নেই, ওয়াটারমার্ক নেই

যেভাবে কাজ করে

1

ছবি যোগ করুন

JPG, PNG, WebP, GIF, BMP, iPhone-এর HEIC বা স্ক্যানারের TIFF। কোণ থেকে তোলা ছবি পড়ার আগে সোজা করা হয় এবং আলো সমান করা হয়।

2

ভাষা দেখে নিন

ছবি থেকে লিপি পড়ে আপনার জন্য ভাষা বেছে দেওয়া হয়। অনুমান ভুল হলে, বা ছবিতে একাধিক ভাষা থাকলে, ১২০টির বেশি ভাষা থেকে বেছে নিতে পারবেন।

3

কপি বা ডাউনলোড করুন

লেআউট ঠিক রাখুন, লাইন আর কলাম যেখানে ছিল সেখানেই, অথবা লাইনগুলো জুড়ে টানা অনুচ্ছেদ বানান, অন্য কোথাও পেস্ট করার জন্য তৈরি।

ছবিটি কীভাবে পড়া হয়

রিডারের কোন সাইজ দরকার, তা মাপা হয় কালি থেকে, ফাইল থেকে নয়। ছবি থেকেই লেখার এক লাইনের উচ্চতা আন্দাজ করা হয়, আর সবকিছু এমনভাবে রিস্কেল করা হয় যাতে এক লাইন মোটামুটি চৌত্রিশ পিক্সেলে দাঁড়ায় — ছোট স্ক্রিনশট চার গুণ পর্যন্ত বড় করা হয়, আর বিশাল ছবি ছোট করা হয়, দুই ক্ষেত্রেই লম্বা দিকের একটা সর্বোচ্চ সীমা থাকে। এ কারণেই মেন্যুর নয় মেগাপিক্সেলের ছবি একটি ঝকঝকে ছোট ছবির চেয়ে বেশি নির্ভুল নয়, আর যে ছবির ছোট দিক প্রায় তিনশো পিক্সেলের কম, তাতে ভাষা শনাক্তকরণ পুরোপুরি বাদ দিয়ে ল্যাটিন লিপি হিসেবে পড়া হয়। এসবের আগে কালির পেছনের কাগজ টুকরো টুকরো অংশে আন্দাজ করে ভাগ করে আলো সমান করা হয়, পুরো উচ্চতাজুড়ে পেজ কতটা হেলে আছে মেপে সোজা করে ঘোরানো হয়, আর ফলাফলকে একটিমাত্র সামগ্রিক থ্রেশহোল্ডে সাদাকালোতে নামিয়ে আনা হয়।

ভাষা বাছাই একটা অডিশন, সোজা খুঁজে দেখা নয়, কারণ প্রচলিত ডিটেক্টর আসলে ভাষা শনাক্ত করে না। প্রথম ধাপে শুধু লিপি আর ঘূর্ণন জানা যায়, এর বেশি কিছু নয়; লিপি বাছাইয়ের পরিসর ছোট করে, একই লিপির ভাষাগুলোর মধ্যে টাই ভাঙে আপনার ব্রাউজারের ভাষা সেটিং, তারপর প্রতিটি প্রার্থী ভাষা দিয়ে ছবির একটি ছোট কপি সত্যিই পড়া হয় আর কতগুলো আত্মবিশ্বাসী শব্দ পাওয়া গেল তা দিয়ে নম্বর দেওয়া হয়। বিজয়ী ভাষা আসল পেজটি পড়ে, আর শনাক্ত করা লেখা আবার পরীক্ষা করা হয় — ডায়াক্রিটিক, বৈশিষ্ট্যসূচক অক্ষরজোড়া, প্রচলিত ছোট শব্দ দেখে — অন্য কোনো ভাষা আরও ভালো করত কি না বুঝতে। “ভুল ভাষা বেছে দিলে আত্মবিশ্বাসী একটা ফাঁকা পেজ পাবেন” — এর পেছনে এই ব্যবস্থাই কাজ করে: অডিশন ঠিক এ জন্যই আছে, যাতে অনুমানটি শুধু ঘোষণা না করে আপনার ছবির ওপর যাচাই করা হয়।

আউটপুটে কী পৌঁছায়, সে বিষয়ে একটা কথা জেনে রাখা ভালো। যে অনুচ্ছেদ নিয়ে রিডার নিশ্চিত ছিল না, তা দেখানোর বদলে বাদ দেওয়া হয়, তাই ছবিতে যে লেখা দেখতে পাচ্ছেন, তা আজেবাজে হয়ে না এসে ফলাফল থেকে পুরোপুরি হারিয়ে যেতে পারে। রিডার যেসব ব্লককে ছবি বা নয়েজ হিসেবে ধরেছে, আর যেসব বিচ্ছিন্ন দাগে কোনো অক্ষর বা অঙ্ক নেই, সেগুলোর ক্ষেত্রেও একই কথা। সাধারণ কম-নিশ্চিত শব্দের ওপর কোনো ছাঁটাই নেই, তাই অনুচ্ছেদের ভেতরের ভুল পড়া থেকে যায় আর তা ধরার দায়িত্ব আপনার। নিশ্চয়তার সংখ্যা ভালো অথচ পেজের একটা অংশ একেবারেই নেই — তাহলে এটাই ঘটেছে।

অন্য কিছু দরকার হলে

কিছুই সংরক্ষণ করা হয় না, তবে সাইটে এটাই একমাত্র টুল যেখানে প্রথমবার চালানো বিনা খরচে হয় না: রিডার নিজেই কয়েক মেগাবাইট, আর প্রতিটি ল্যাঙ্গুয়েজ প্যাক আরও এক থেকে পাঁচ মেগাবাইট, এই সাইট থেকে আনা হয় এবং পরের বারের জন্য রেখে দেওয়া হয়। একটি পেজের জন্য অপেক্ষা করা চলে, কিন্তু নিয়মিত দুই হাজার স্ক্যানের জন্য নয় — সে কাজ OCRmyPDF-এর মতো ডেস্কটপ OCR টুলের, যা একটি কমান্ডে পুরো ফোল্ডারে টেক্সট লেয়ার যোগ করে, কোনো ডাউনলোড বা ক্লিক ছাড়াই।

তিনটি জিনিস এখানে চেষ্টাই করা হয় না, আর কোনগুলো তা জানা থাকলে নিজে আবিষ্কার করার চেয়ে দ্রুত হয়। পারস্পেক্টিভ ঠিক করা হয় না — পেজের ঘূর্ণন মেপে সোজা করা হয়, কিন্তু পাশ থেকে তোলা ছবি তার ট্র্যাপিজিয়াম আকৃতিই রাখে, তাই ঠিক ওপর থেকে তোলায় বাড়তি এক সেকেন্ড দেওয়া সার্থক। কালি থেকে কাগজ আলাদা করার থ্রেশহোল্ড পুরো ছবির জন্য একটিই মান, প্রতিটি অংশের জন্য আলাদা নয়, তাই যে পেজের অর্ধেক ছায়ায়, আলো সমান করার পরেও তার অন্ধকার অর্ধেকটা হারিয়ে যাবে; লড়াই না করে সমান আলোয় আবার ছবি তুলুন। আর দাগ না টেনে শুধু ফাঁকা জায়গা দিয়ে সাজানো টেবিলে খোঁজার মতো কোনো দাগ নেই, তাই সেটা লেখার কলাম হিসেবে পড়া হয়, আর স্প্রেডশিটে পেস্ট করলে ঠিক থাকে শুধু ভাগ্যক্রমে।

সাধারণ প্রশ্নোত্তর

এটা কতটা নির্ভুল?

সোজা করে তোলা, ফোকাসে থাকা পরিষ্কার ছাপা লেখায় খুবই — হাজারে কয়েকটি অক্ষর মাত্র। ঝাপসা, চকচকে প্রতিফলন, কম কনট্রাস্ট আর অস্বাভাবিক টাইপফেসে নির্ভুলতা কমে যায়, আর পেজটি আপনাকে আন্দাজ করতে না দিয়ে দেখিয়ে দেয় রিডার কতটা নিশ্চিত ছিল। সংখ্যাটা কম হলে সাধারণত ছবিই সমস্যা: বেশি আলো, কম কোণ, আর লেখা দিয়ে ফ্রেম ভরিয়ে দিলে বেশিরভাগটাই ঠিক হয়ে যায়।

আমার ছবি কি কোথাও সংরক্ষণ করা হয়?

না। কোনো ভাষা প্রথমবার ব্যবহার করলে তার ল্যাঙ্গুয়েজ প্যাক এই সাইট থেকে আসে; ছবিটি নিজে কখনো সংরক্ষণ করা হয় না এবং কোথাও পাঠানো হয় না, তাই Wi-Fi বন্ধ থাকলেও কাজ করে।

কোন কোন ভাষা পড়তে পারে?

১২০টির বেশি, যার মধ্যে আছে ইংরেজি, বাংলা, হিন্দি, উর্দু, আরবি, স্প্যানিশ, ফরাসি, জার্মান, পর্তুগিজ, রুশ, চীনা, জাপানি ও কোরিয়ান। লিপি ছবি থেকেই পড়া হয়; যেখানে কয়েকটি ভাষা একই লিপি ব্যবহার করে — ল্যাটিন, সিরিলিক, আরবি, দেবনাগরী — সেখানে আপনার ব্রাউজারের ভাষা সেটিং দিয়ে ঠিক হয়, আর আপনি সবসময় তা বদলাতে পারেন।

কলাম আর টেবিল কি ঠিক থাকবে?

হ্যাঁ, যদি আপনি তা চান। দাগ টানা টেবিল খুঁজে নিয়ে সেল ধরে ধরে পড়া হয়, তাই একটি লেবেল তার মানের সঙ্গে মিশে যায় না, আর সেগুলো ট্যাব দিয়ে আলাদা করা সারি হিসেবে আসে, যা সরাসরি স্প্রেডশিটে পেস্ট করা যায়। লেখার কলামগুলো সোজা আড়াআড়ি না পড়ে পড়ার ক্রমে পড়া হয়। এর বদলে লাইন জোড়া বেছে নিলে সেই কাঠামো ইচ্ছে করেই বাদ দেওয়া হয়, যা আপনি চাইবেন এমন অনুচ্ছেদের জন্য, যেটা নতুন করে সাজাতে যাচ্ছেন।

হাতের লেখা পড়তে পারে?

গোছানো, আলাদা আলাদা অক্ষরে লেখা — যেমন ফর্মে বড় হাতের অক্ষর — প্রায়ই পড়া যায়। টানা হাতের লেখা পড়া যায় না, এখানেও না, অন্য কোনো সাধারণ OCR টুলেও না; সৎ উত্তর হলো, এটা আলাদা একটা সমস্যা, যার জন্য আলাদা পদ্ধতি লাগে। হাতের লেখার জন্য একটি আলাদা পেজ আছে, যা এ কথা সোজাসুজি বলে এবং যতটুকু পারল তা দেখায়।

কোন কোন ছবির ফরম্যাট চলে?

ব্রাউজারের মাধ্যমেই JPG, PNG, WebP, GIF, BMP ও SVG, সঙ্গে iPhone-এর HEIC ও স্ক্যানারের TIFF। ফোনে খাড়াভাবে তোলা ছবি সঠিক দিকেই আসে, কারণ ক্যামেরার লেখা ওরিয়েন্টেশন ফ্ল্যাগ আগে প্রয়োগ করা হয়।

কিছু শব্দ ভুল পড়ল কেন?

প্রায় সবসময়ই ছবির কারণে, লেখার কারণে নয়: পেজজুড়ে চকচকে প্রতিফলন, হাতের ছায়া, ক্যামেরা কেঁপে যাওয়া, অথবা স্ক্রিনে এত ছোট লেখা যে প্রতিটি অক্ষর মাত্র কয়েকটি পিক্সেল। রিডারকে ছবিটি সেই সাইজে দেওয়া হয় যেখানে সে সবচেয়ে ভালো পড়ে, আর আগে আলো সমান করা হয়, কিন্তু কোনো প্রক্রিয়াই ক্যামেরা যা ধরেনি সেই খুঁটিনাটি বানিয়ে দিতে পারে না।

সাইজের কোনো সীমা আছে?

শুধু আপনার ডিভাইসের নিজের মেমরি। কিছুই সংরক্ষণ করা হয় না, তাই সার্ভারের কোনো সীমায় আটকানোর প্রশ্ন নেই। খুব বড় ছবিকে রিডারের কাজে লাগে এমন সাইজে ছোট করা হয় — একটা পর্যায়ের পর বেশি পিক্সেল শুধু খরচ বাড়ায়, নির্ভুলতা নয়।

জেনে রাখুন: টানা হাতের লেখা কোনো সাধারণ OCR টুল নির্ভরযোগ্যভাবে শনাক্ত করতে পারে না, এটিও নয়। ছবির ওপর ছাপা লেখা, খুব সাজানো নকশার অক্ষর আর খুব কম কনট্রাস্টের লেখা আংশিকভাবে আসবে। ফলাফল প্লেইন টেক্সট: টাইপফেস, রং, বোল্ড ও ইটালিক আসে না, ছবিটিও নয়।

এই টুলটি আপনার ওয়েবসাইটে যোগ করুন

যেকোনো ব্লগ, ক্লাসের পেজ বা হেল্প আর্টিকেলের জন্য ফ্রি। একটি স্নিপেট পেস্ট করলেই আপনার ভিজিটররা আপনার পেজেই এটি ব্যবহার করতে পারবেন।