Image to Text (OCR)
নতুনExtract text from any image, screenshot or photo — free online OCR that runs entirely in your browser, no upload required.
Tips for best results
- • Use high-resolution images (300 DPI+ for scanned docs, HD screenshots)
- • Enable "Auto-enhance" for dark backgrounds or low-contrast images
- • Keep text horizontal — rotated images reduce accuracy
- • PNG preserves quality better than JPEG for text-heavy images
- • First use downloads the OCR engine (~4 MB, cached by your browser)
Runs entirely in your browser. Nothing is uploaded.
ইমেজ টু টেক্সট কনভার্শন (OCR) কী এবং কেন এটি দরকারি
ইমেজ টু টেক্সট কনভার্শন — যাকে ঠিকঠাক বলা হয় অপটিক্যাল ক্যারেক্টার রিকগনিশন (OCR) — ভিজ্যুয়াল কনটেন্ট (ছবি, স্ক্যান, স্ক্রিনশট) এবং এডিটযোগ্য, সার্চযোগ্য ডিজিটাল টেক্সটের মধ্যে সেতুবন্ধন তৈরি করে। আপনি যখনই একটি মেনুর ছবি তোলেন, কোনো ডকুমেন্টের স্ক্রিনশট নেন, বা রিসিট স্ক্যান করেন, তখন OCR প্রযুক্তিই সেই পিক্সেল প্যাটার্নগুলোকে আবার এমন টেক্সটে রূপান্তরিত করে যা আপনি কপি, এডিট, সার্চ ও শেয়ার করতে পারেন।
আগে OCR করতে ABBYY FineReader বা Adobe Acrobat Pro-এর মতো ব্যয়বহুল ডেস্কটপ সফটওয়্যার লাগত। আজকাল শক্তিশালী OCR সম্পূর্ণভাবে আপনার ওয়েব ব্রাউজারে চলে — কোনো সফটওয়্যার ইনস্টল নেই, সাবস্ক্রিপশন নেই, বাইরের সার্ভারে ছবি আপলোড নেই। এই ফ্রি অনলাইন OCR টুল Tesseract.js ব্যবহার করে, যা Google-এর ওপেন-সোর্স Tesseract ইঞ্জিনের একটি WebAssembly সংস্করণ, এবং যেকোনো আধুনিক ব্রাউজারে নেটিভ গতিতে পরিষ্কার প্রিন্টেড টেক্সটে ৯৫%-এর বেশি নির্ভুলতা দেয়। OnlineOCR.net বা i2OCR-এর মতো আপলোড-ভিত্তিক বিকল্পগুলোর বিপরীতে, আপনার ফাইল কখনও আপনার ডিভাইস ছেড়ে যায় না।
ইমেজ টু টেক্সট কনভার্টার যেভাবে ব্যবহার করবেন
এই ফ্রি OCR টুল ব্যবহার করতে তিনটি ধাপ লাগে। আপনার ছবি আপলোড জোনে ফেলুন (অথবা ব্রাউজ করতে ক্লিক করুন, বা ক্লিপবোর্ড থেকে পেস্ট করতে Ctrl+V চাপুন), Tesseract ছবিটি প্রসেস করার জন্য কয়েক সেকেন্ড অপেক্ষা করুন, আর আপনার বের করা টেক্সট আউটপুট বক্সে দেখা যাবে — এক ক্লিকে কপি করার জন্য প্রস্তুত।
টুলটি JPG, PNG, WebP, GIF ও BMP গ্রহণ করে। ভালো ফলাফলের জন্য উঁচু-রেজোলিউশনের ভালো কনট্রাস্টযুক্ত ছবি ব্যবহার করুন — আধুনিক ডিসপ্লের স্ক্রিনশট (1920×1080 বা তার বেশি) চমৎকার ফলাফল দেয়, আর স্ক্যান করা ডকুমেন্ট ৩০০ DPI বা তার বেশি হওয়া উচিত। সবকিছুই আপনার ব্রাউজারে স্থানীয়ভাবে চলে: আপনার ছবি কখনও ডিভাইস ছেড়ে যায় না। প্রথমবার লোড হওয়ার পর ইঞ্জিন ক্যাশ হয়ে যায় এবং টুলটি সম্পূর্ণভাবে অফলাইনেও কাজ করে।
ফ্রি অনলাইন OCR-এর সাধারণ ব্যবহার
ডকুমেন্ট ডিজিটাইজেশন সবচেয়ে বেশি ব্যবহৃত হয়: কাগজের ডকুমেন্ট, শুধু-ছবি-সংবলিত পুরোনো PDF, বা ছাপা বইকে সার্চযোগ্য টেক্সটে রূপান্তর করা। ডেস্কের ওপর সমতলভাবে, ভালো আলোয় তোলা একটি প্রিন্টেড পাতার ফোন-ছবিও সাধারণত পরিষ্কার ফন্টে ৯৫%+ নির্ভুলতা দেয়। এটি হাতে টাইপ করার চেয়ে অনেক দ্রুত এবং বেশিরভাগ কাজের জন্য যথেষ্ট।
স্ক্রিনশট ও স্ক্রিন ক্যাপচার-এই এই টুলটি সত্যিই আলাদা — এমন অ্যাপ্লিকেশন থেকে টেক্সট কপি করা যেগুলো সিলেকশন করতে দেয় না: লক করা PDF, গেমের টেক্সট, এরর মেসেজ, ভিডিও সাবটাইটেল। বিজনেস কার্ড স্ক্যানিং কার্ডের ছবি থেকে যোগাযোগের বিবরণ বের করে কনট্যাক্ট অ্যাপে আমদানি করার জন্য। রিসিট ও ইনভয়েস প্রসেসিং এক্সপেন্স রিপোর্টের জন্য মোট পরিমাণ, তারিখ ও বিক্রেতার নাম বের করে। গবেষণা ও উদ্ধৃতি-এর ক্ষেত্রে বই, পেপার বা জার্নাল থেকে অংশবিশেষ ডিজিটাইজ করে প্রতিটি শব্দ পুনরায় টাইপ না করেই সঠিকভাবে উদ্ধৃত করা যায়। এই সবগুলো ক্ষেত্রেই OnlineOCR.net-এর মতো আপলোড-ভিত্তিক টুলের তুলনায় প্রাইভেসির সুবিধা সিদ্ধান্তমূলক — আপনার ডকুমেন্টের বিষয়বস্তু কখনও ব্রাউজার ছেড়ে যায় না।
সেরা OCR নির্ভুলতার জন্য টিপস
OCR নির্ভুলতায় সবচেয়ে বেশি প্রভাব ফেলে ছবির মান। রেজোলিউশনই সবচেয়ে গুরুত্বপূর্ণ: ৩০০-DPI স্ক্যানের টেক্সট একই টেক্সটের ৭২-DPI ওয়েব-স্কেল ছবির চেয়ে অনেক বেশি নির্ভুলভাবে চেনা যায়। ডকুমেন্টের ছবি তোলার সময়, ক্যামেরা সরাসরি ওপরে রাখুন (কোণাকুণি নয়), ছায়া ছাড়া সমান আলো নিশ্চিত করুন, আর তীক্ষ্ণভাবে ফোকাস করুন। ভালো পরিস্থিতিতে বেশিরভাগ আধুনিক স্মার্টফোন ক্যামেরা (১২+ মেগাপিক্সেল) চমৎকার OCR-উপযোগী ছবি তৈরি করে।
স্ক্রিনশটের জন্য, ফোনে স্ক্রিন-ফটো তোলার বদলে আপনার OS-এর নিজস্ব ক্যাপচার টুল ব্যবহার করুন — ফোনের ছবিতে Moiré হস্তক্ষেপ প্যাটার্ন দেখা দেয় যা OCR-এর মান খারাপ করে। জটিল লে-আউট (একাধিক কলাম, টেবিল, ব্যাকগ্রাউন্ড ছবি) OCR করার সময়, ভালো ফলাফলের জন্য টেক্সটের অংশগুলো আলাদাভাবে এক্সট্র্যাক্ট করুন। আউটপুট সবসময় প্রুফরিড করুন — ৫০০ শব্দের একটি ডকুমেন্টে ৯৯% নির্ভুলতাতেও কিছু ভুল থাকতে পারে, বিশেষ করে আইনি, চিকিৎসা বা আর্থিক প্রেক্ষাপটে।
বিকল্পগুলোর সাথে UtiloKit OCR-এর তুলনা
OnlineOCR.net ও i2OCR আপলোড-ভিত্তিক ওয়েব টুল — ব্যবহার সহজ, কিন্তু আপনার ছবির ফাইল তাদের সার্ভারে যায়, ফ্রি টায়ার রেট-লিমিটেড (OnlineOCR.net ফ্রি ব্যবহারকারীদের ঘণ্টায় ১৫টি পাতায় সীমাবদ্ধ রাখে)। Adobe Acrobat চমৎকার OCR মান দেয় কিন্তু মাসে $১৩-২৩ থেকে শুরু হওয়া পেইড সাবস্ক্রিপশনের পেছনে। Google Docs OCR ফ্রি এবং শক্তিশালী কিন্তু Google অ্যাকাউন্ট এবং Google-এর সার্ভারে ফাইল আপলোড প্রয়োজন।
ABBYY FineReader জটিল কমার্শিয়াল ডকুমেন্ট OCR-এর জন্য সোনার মান — এটি টেবিল, ফর্ম ও মিশ্র-লেআউট স্ক্যান Tesseract-এর চেয়ে ভালোভাবে সামলায় — কিন্তু এর খরচ $৯৯-১৯৯ এবং স্থানীয় ইনস্টলেশন বা ক্লাউড আপলোড প্রয়োজন। সবচেয়ে সাধারণ OCR কাজের জন্য (স্ক্রিনশট, স্ক্যান করা পাতা, ডকুমেন্টের ছবি), UtiloKit-এর ব্রাউজার Tesseract OCR নির্ভুলতায় এই সেবাগুলোর সমতুল্য, সাথে এমন কিছু দেয় যা এগুলোর কোনোটিই দিতে পারে না: শূন্য আপলোড, শূন্য খরচ, এবং সম্পূর্ণ প্রাইভেসি। আপনার ছবি সম্পূর্ণভাবে আপনার নিজের ডিভাইসে প্রসেস হয় এবং কখনও কোথাও পাঠানো হয় না।
Tesseract.js বোঝা — এই টুলের পেছনের ইঞ্জিন
Tesseract বিশ্বের সবচেয়ে বেশি ব্যবহৃত ওপেন-সোর্স OCR ইঞ্জিন, মূলত ১৯৮০-এর দশকে HP Labs-এ তৈরি হয়েছিল এবং পরে Google ওপেন-সোর্স করে রক্ষণাবেক্ষণ করে আসছে। Tesseract.js এর WebAssembly সংস্করণ, যা নেটিভ C++ ইঞ্জিনকে যেকোনো আধুনিক ব্রাউজারে প্রায়-নেটিভ গতিতে চালানোর জন্য কম্পাইল করে। ভার্সন ৪+ একটি LSTM (Long Short-Term Memory) নিউরাল নেটওয়ার্ক ব্যাকএন্ড যোগ করেছে, যা আগের রুল-ভিত্তিক পদ্ধতির তুলনায় নির্ভুলতা উল্লেখযোগ্যভাবে বাড়িয়েছে — বিশেষত বিভিন্ন ফন্ট, নষ্ট টেক্সট, এবং শব্দযুক্ত ডকুমেন্টে।
WebAssembly-এর মাধ্যমে ব্রাউজারে Tesseract চালানো নেটিভ ডেস্কটপ অ্যাপ্লিকেশনের সমান নির্ভুলতা অর্জন করে, কোনো সার্ভার ইনফ্রাস্ট্রাকচার ছাড়াই। প্রথম লোডে প্রায় ৭ MB ইঞ্জিন ও ভাষার মডেল ফাইল ডাউনলোড হয়; পরবর্তী লোডগুলো ব্রাউজার ক্যাশ থেকে তাৎক্ষণিকভাবে সরবরাহ হয়। এই স্থাপত্যই এই টুলকে সত্যিকার অর্থে প্রাইভেট করে তোলে: আপলোড করার কোনো সার্ভার নেই কারণ সব হিসাব আপনার ব্রাউজার ট্যাবের ভেতরেই ঘটে।
প্রাইভেসি, নিরাপত্তা এবং স্পর্শকাতর ডকুমেন্টের জন্য OCR
স্পর্শকাতর ডকুমেন্টের OCR — চুক্তি, বেতনের কাগজ, চিকিৎসার রেকর্ড, পাসপোর্টের ছবি, আর্থিক বিবৃতি — ছবিগুলো কোথায় যাচ্ছে সে বিষয়ে সতর্ক চিন্তা প্রয়োজন। OnlineOCR.net, i2OCR, এবং Adobe Acrobat-এর ওয়েব OCR সবই তাদের সার্ভারে আপনার ছবি গ্রহণ করে। এরা কয়েক ঘণ্টার মধ্যে ফাইল মুছে ফেলার দাবি করলেও, ডকুমেন্টটি আপনার নিয়ন্ত্রণের বাইরে চলে গেছে, ইন্টারনেট পার হয়েছে, এবং এমন হার্ডওয়্যারে প্রসেস হয়েছে যা আপনি নিয়ন্ত্রণ করেন না।
এই টুল স্থাপত্যগতভাবেই আপনার ছবি দেখতে অক্ষম — এটি একটি স্ট্যাটিক ওয়েব পেজ যা আপনার নিজের ব্রাউজার ট্যাবে Tesseract.js চালায়। আপনি ব্রাউজারের Developer Tools (F12) খুলে, Network ট্যাবে গিয়ে, একটি OCR কাজ চালিয়ে এটি যাচাই করতে পারেন: আপনি শূন্য আউটগোয়িং ফাইল ট্রান্সফার দেখবেন। এটি এমন ডকুমেন্ট OCR করা নিরাপদ করে তোলে যা আপনি কখনও কোনো অচেনা মানুষকে ইমেইল করতেন না — কারণ কার্যত, কোনো অচেনা মানুষ এখানে জড়িত নয়।
OCR-এর সংক্ষিপ্ত ইতিহাস: যান্ত্রিক পাঠক থেকে নিউরাল নেটওয়ার্ক পর্যন্ত
অপটিক্যাল ক্যারেক্টার রিকগনিশনের ইতিহাস বেশিরভাগ মানুষের ধারণার চেয়ে অনেক পুরোনো। ১৯১৪ সালে, Edmund Fournier d'Albe Optophone আবিষ্কার করেন, একটি হাতে ধরার যন্ত্র যা প্রিন্টেড অক্ষরকে সুরের ধারায় রূপান্তরিত করত — যা অন্ধ পাঠকদের শব্দের মাধ্যমে টেক্সট বুঝতে সাহায্য করত। এটি আধুনিক অর্থে মেশিন রিকগনিশন ছিল না, কিন্তু এটি প্রতিষ্ঠা করেছিল যে অক্ষরের আকৃতি এমন তথ্য বহন করে যা অন্য মাধ্যমে রূপান্তরিত করা যায়। প্রথম প্রকৃত যান্ত্রিক পাঠক যন্ত্র এসেছিল ১৯২৯ সালে, যখন জার্মান আবিষ্কারক Gustave Tauschek ফটোসেল ব্যবহার করে অক্ষরের রূপরেখা টেমপ্লেটের সাথে মেলানোর একটি যন্ত্রের পেটেন্ট নেন — টেমপ্লেট-ম্যাচিং পদ্ধতির প্রাথমিক রূপ যা পরবর্তী অর্ধশতাব্দী OCR-এ প্রাধান্য বিস্তার করেছিল। ১৯৫৭ সালে IBM যখন US Postal Service-এর জন্য এমন একটি সিস্টেম তৈরি করে যা সেকেন্ডে ১,০০০ অক্ষর গতিতে হাতে লেখা পোস্টাল কোড পড়তে পারত, তখন কমার্শিয়াল OCR শিল্পে পৌঁছায়, যা মেইল সর্টিং নাটকীয়ভাবে ত্বরান্বিত করে।
আধুনিক OCR যুগের শুরু হয় Ray Kurzweil-এর ১৯৭০-৮০ দশকের কাজের মাধ্যমে, যা প্রথম ওমনি-ফন্ট OCR সিস্টেম তৈরি করে যা টাইপফেস নির্বিশেষে টেক্সট চিনতে পারত। Tesseract OCR ইঞ্জিন HP Labs-এ ১৯৮৫ থেকে ১৯৯৫-এর মধ্যে তৈরি হয়েছিল, মূলত একটি অভ্যন্তরীণ গবেষণা প্রকল্প হিসেবে। Google ২০০৫ সালে Tesseract ওপেন-সোর্স করে, এবং এটি তখন থেকে বিশ্বের সবচেয়ে বেশি ব্যবহৃত ওপেন-সোর্স OCR ইঞ্জিন হয়ে উঠেছে। গুরুত্বপূর্ণ Tesseract 4.0 রিলিজ মূল প্যাটার্ন-ম্যাচিং ইঞ্জিনের পাশাপাশি একটি LSTM (Long Short-Term Memory) নিউরাল নেটওয়ার্ক রিকগনিশন লেয়ার যোগ করে, যা ১১৬টির বেশি ভাষা সমর্থন করে এবং বিশাল টাইপসেট টেক্সট কর্পাসে প্রশিক্ষিত মডেল ব্যবহার করে। LSTM পদ্ধতি অক্ষরের প্রসঙ্গ বোঝে — এটি চেনে যে 'TH'-এর পরের অক্ষর 'X'-এর চেয়ে 'E' হওয়ার সম্ভাবনা বেশি — যা নষ্ট বা অস্বাভাবিক ইনপুটে নির্ভুলতা উল্লেখযোগ্যভাবে বাড়ায়।
আজকের OCR-এর অগ্রভাগে রয়েছে বড় পরিসরে ডিপ লার্নিং। Google Document AI, AWS Textract, Azure Computer Vision, এবং ABBYY Vantage-এর মতো সিস্টেম COCO-Text এবং বার্ষিক ICDAR প্রতিযোগিতার বেঞ্চমার্কের মতো ডেটাসেট থেকে টানা লক্ষ লক্ষ ডকুমেন্ট ছবিতে প্রশিক্ষিত হয়, পরিষ্কার প্রিন্টেড ইংরেজি টেক্সটে ৯৯%+ অক্ষর নির্ভুলতা অর্জন করে। এই ইঞ্জিনগুলো ডকুমেন্টের গঠনও বোঝে — টেবিল, ফর্ম ফিল্ড, হেডার এবং মাল্টি-কলাম লেআউট শনাক্ত করে — যা সাধারণ অক্ষর রিকগনিশনের অনেক বাইরে যায়। ব্রাউজার-ভিত্তিক Tesseract.js কাঁচা নির্ভুলতায় এই অগ্রভাগের ঠিক নিচে থাকে কিন্তু ব্যক্তিগত ব্যবহারের সবচেয়ে গুরুত্বপূর্ণ মানদণ্ডে প্রতিটি ক্লাউড OCR সেবাকে ছাড়িয়ে যায়: আপনার ডকুমেন্ট কখনও আপনার ডিভাইস ছেড়ে যায় না।
OCR নির্ভুলতার নিয়ামক: রেজোলিউশন, স্কিউ, বাইনারাইজেশন এবং নয়েজ
OCR নির্ভুলতার সবচেয়ে নিয়ন্ত্রণযোগ্য বিষয় হলো ছবির রেজোলিউশন। স্ক্যান করা ডকুমেন্টের OCR-এর জন্য মানদণ্ড সুপারিশ হলো ন্যূনতম ৩০০ DPI (dots per inch); ১০ পয়েন্টের চেয়ে ছোট ফন্টযুক্ত ডকুমেন্টের জন্য ৬০০ DPI পরামর্শ দেওয়া হয়। রেজোলিউশন কেন গুরুত্বপূর্ণ তা বুঝতে: ৩০০ DPI-তে একটি ১২-পয়েন্ট অক্ষর প্রায় ৫০ × ৫০ পিক্সেল দখল করে, যা রিকগনিশন ইঞ্জিনকে 'a', 'e', এবং 'o'-এর মতো একইরকম অক্ষরের আকৃতি আলাদা করার জন্য যথেষ্ট বিস্তারিত তথ্য দেয়। ৭২ DPI-তে — সাধারণ ওয়েব ছবির রেজোলিউশন — একই অক্ষর মাত্র ১২ × ১২ পিক্সেল, যা অক্ষরের সূক্ষ্ম রেখাগুলো মুছে ফেলে যা বিভিন্ন অক্ষরকে আলাদা করে। স্ক্রিনশটের জন্য, ব্যবহারিক সমতুল্য হলো একটি স্কেল-ডাউন এক্সপোর্টের বদলে আপনার ডিভাইসের নেটিভ রেজোলিউশন ব্যবহার করা; একটি Retina বা 4K স্ক্রিন ক্যাপচার সাধারণ UI টেক্সটের জন্য ইতিমধ্যেই ৩০০ DPI-এর সমান বা তার বেশি।
দুটি প্রি-প্রসেসিং ধাপের নির্ভুলতায় বিশাল প্রভাব রয়েছে: ডিস্কিউয়িং এবং বাইনারাইজেশন। অনুভূমিক থেকে ২-৩ ডিগ্রি ঘোরানো টেক্সটও OCR ইঞ্জিনের লাইন-খোঁজার অ্যালগরিদমকে অনিয়মিত শব্দের সীমানা তৈরি করতে বাধ্য করে, যা রিকগনিশন ত্রুটির ঢল নামায়। আধুনিক OCR পাইপলাইন Hough transform বা প্রজেকশন প্রোফাইল বিশ্লেষণ ব্যবহার করে প্রধান টেক্সট কোণ শনাক্ত করে, তারপর রিকগনিশন শুরুর আগে একটি ক্ষতিপূরণকারী ঘূর্ণন প্রয়োগ করে। বাইনারাইজেশন — একটি গ্রেস্কেল ছবিকে বিশুদ্ধ কালো-সাদায় রূপান্তর — গ্রেস্কেল অস্পষ্টতা দূর করে রিকগনিশনের কাজ নাটকীয়ভাবে সহজ করে। Otsu থ্রেশহোল্ডিং অ্যালগরিদম ছবির পিক্সেল ইনটেনসিটি হিস্টোগ্রাম বিশ্লেষণ করে কালি ও কাগজ আলাদা করার সর্বোত্তম থ্রেশহোল্ড খুঁজে এটি স্বয়ংক্রিয় করে। অসম আলোবিশিষ্ট ছবির জন্য (উদাহরণস্বরূপ, বইয়ের বাঁধাইয়ের কাছে বাঁকা একটি পাতার ফোন-ছবি), অ্যাডাপ্টিভ লোকাল থ্রেশহোল্ডিং প্রতিটি ছোট ছবির অঞ্চলে ভিন্ন থ্রেশহোল্ড প্রয়োগ করে, এমন ছায়া সামলায় যা একটি গ্লোবাল থ্রেশহোল্ড পারে না।
উঁচু-রেজোলিউশনের, সঠিকভাবে ঘোরানো একটি ছবিও নির্দিষ্ট ধরনের নয়েজের কারণে OCR-কে হারিয়ে দিতে পারে। সল্ট-অ্যান্ড-পেপার নয়েজ — স্ক্যানার সেন্সর ত্রুটি থেকে আসা বিচ্ছিন্ন উজ্জ্বল বা গাঢ় পিক্সেল — এমন ভৌতিক বিন্দু তৈরি করে যা ইঞ্জিন যতিচিহ্ন হিসেবে ভুল পড়তে পারে। ব্লিড-থ্রু, যেখানে পাতলা কাগজের উল্টো পাশের কালি সামান্য দেখা যায়, একটি ভুতুড়ে টেক্সট লেয়ার যোগ করে যা ইঞ্জিনকে উপেক্ষা করতে হয়। JPEG কম্প্রেশন আর্টিফ্যাক্ট বিশেষভাবে ক্ষতিকর: JPEG-এর ব্লক-ভিত্তিক কম্প্রেশন অক্ষরের রেখার মতো উচ্চ-কনট্রাস্ট প্রান্তে রিংিং তৈরি করে, একইরকম অক্ষরকে আলাদা করা সূক্ষ্ম সেরিফ ও প্রান্ত ঝাপসা করে দেয়। একটি মিডিয়ান ফিল্টার বা হালকা গাউসিয়ান ব্লার সল্ট-অ্যান্ড-পেপার নয়েজ দূর করে; সোর্স ছবি JPEG-এর বদলে PNG (লসলেস) হিসেবে সংরক্ষণ করলে কম্প্রেশন আর্টিফ্যাক্ট সম্পূর্ণভাবে এড়ানো যায়। ফন্টের আকার একটি কঠোর নিম্ন সীমা: রেজোলিউশন নির্বিশেষে ৮ পয়েন্টের নিচে OCR নির্ভুলতা তীব্রভাবে কমে যায়, এবং সাজসজ্জামূলক ফন্ট — ডিসপ্লে টাইপফেস, ব্ল্যাকলেটার, হাতের লেখার মতো ফন্ট — সবচেয়ে আধুনিক ইঞ্জিনের জন্যও সত্যিকারার্থে কঠিন থেকে যায় কারণ তাদের অক্ষরের আকৃতি প্রশিক্ষণে ব্যবহৃত স্ট্যান্ডার্ড আকৃতি থেকে অনেক দূরে।
হাতের লেখা রিকগনিশন বনাম প্রিন্টেড টেক্সট OCR: ICR, LSTM এবং বাস্তব সীমাবদ্ধতা
প্রিন্টেড টেক্সট OCR এবং হাতের লেখা রিকগনিশন সম্পর্কিত সমস্যা হলেও তাদের কঠিনতার মাত্রা খুবই আলাদা। প্রিন্টেড টেক্সটের ধারাবাহিক, অনুমানযোগ্য অক্ষরের আকৃতি থাকে: Times New Roman-এর প্রতিটি 'a' একই রকম, স্পেসিং নিয়মিত, বেসলাইন সোজা। এই নিয়মিততাই প্যাটার্ন-ম্যাচিং এবং নিউরাল নেটওয়ার্ক মডেলগুলোকে ৯৯%+ নির্ভুলতা অর্জন করতে দেয়। হাতের লেখা — যা প্রযুক্তিগতভাবে সাধারণ OCR-এর বদলে ICR (Intelligent Character Recognition) দ্বারা সামলানো হয় — ব্যক্তিভেদে ব্যাপকভাবে ভিন্ন হয়, সংযুক্ত কার্সিভ স্ট্রোক ব্যবহার করে, অক্ষরের আকার অসংগত, বেসলাইন অনিয়মিত, এবং অক্ষরের আকৃতি অস্পষ্ট (অনেকের হাতের লেখায় 'a' এবং 'u' প্রায় একইরকম দেখায়)। কার্সিভ হাতের লেখার মৌলিক চ্যালেঞ্জ হলো ক্যারেক্টার সেগমেন্টেশন: একটি অক্ষর চেনার আগে তাকে ধারাবাহিক কালির স্ট্রোক থেকে আলাদা করতে হবে — কিন্তু কার্সিভে স্ট্রোক পাশের অক্ষরগুলোকে সংযুক্ত করে, যা সেগমেন্টেশন ও রিকগনিশনকে পরস্পর নির্ভরশীল সমস্যায় পরিণত করে যা পরিষ্কারভাবে ধারাবাহিকভাবে সমাধান করা যায় না।
MNIST ডেটাসেট — US Census Bureau কর্মচারী এবং হাই স্কুল শিক্ষার্থীদের কাছ থেকে সংগৃহীত ০-৯ হাতে লেখা সংখ্যার ৭০,০০০ ছবি — Yann LeCun ১৯৯৮ সালে প্রকাশ করার পর হাতের লেখা রিকগনিশন গবেষণার মৌলিক বেঞ্চমার্ক হয়ে ওঠে। আধুনিক কনভোলিউশনাল নিউরাল নেটওয়ার্ক MNIST অংকে ৯৯.৭%-এর বেশি নির্ভুলতা অর্জন করে, যা চিত্তাকর্ষক শোনায় যতক্ষণ না আপনি বাস্তব জগতের হাতের লেখার বৈচিত্র্যের মুখোমুখি হন: অসংগত কলমের চাপ, ওভারল্যাপিং স্ট্রোক, অপ্রচলিত উপায়ে তৈরি অক্ষর, এবং নষ্ট কাগজ। Google Lens-এ Google-এর পদ্ধতি — সবচেয়ে সক্ষম কনজিউমার হাতের লেখা OCR — ৫০+ ভাষায় লক্ষ লক্ষ হাতে লেখা নমুনায় প্রশিক্ষিত রিকারেন্ট নিউরাল নেটওয়ার্ক ব্যবহার করে, গতি ও প্রাইভেসির জন্য অফলাইন অন-ডিভাইস অনুমান সমর্থন করে, এবং তারপরও অত্যন্ত ব্যক্তিগত কার্সিভ স্ক্রিপ্টে সংগ্রাম করে। ডিজিট-স্তরের বেঞ্চমার্ক নির্ভুলতা এবং বাস্তব-জগতের অনুচ্ছেদ-স্তরের হাতের লেখা নির্ভুলতার মধ্যে ব্যবধান এখনও উল্লেখযোগ্য।
একটি ক্ষেত্র যেখানে হাতের লেখা রিকগনিশনের বাস্তব-জগতের জরুরিতা রয়েছে তা হলো মেডিকেল প্রেসক্রিপশন প্রসেসিং। US Institute of Medicine অনুমান করেছে যে ওষুধের ভুল — যার অনেকগুলো ভুল-পঠিত হাতে লেখা প্রেসক্রিপশন থেকে হয় — প্রতি বছর যুক্তরাষ্ট্রে ১৫ লক্ষ মানুষের ক্ষতি করে। RxElite এবং ScriptPro-এর মতো কোম্পানির স্বয়ংক্রিয় প্রেসক্রিপশন রিকগনিশন সিস্টেম এখন হাসপাতাল এবং খুচরা ফার্মেসিতে মোতায়েন করা হয়েছে, যা বিতরণের আগে অস্পষ্টতা চিহ্নিত করতে চেনা ওষুধের নামগুলো ফর্মুলারি ডেটাবেসের সাথে ক্রস-রেফারেন্স করে। এই সিস্টেমগুলো OCR-এর সাথে ডোমেইন-নির্দিষ্ট ভাষা মডেল সংযুক্ত করে যা ফার্মাসিউটিক্যাল নামকরণ নিয়ম বোঝে, এমন একটি নিরাপত্তা জাল সরবরাহ করে যা শুধুমাত্র OCR পারে না। সাধারণ ব্যবহারকারীদের জন্য ব্যবহারিক সিদ্ধান্ত পরিষ্কার: Tesseract এবং একইধরনের ইঞ্জিন প্রিন্টেড টেক্সটের জন্য অপ্টিমাইজড এবং পরিষ্কার ব্লক-অক্ষর হাতের লেখায় ভালো ফলাফল দেয়, কিন্তু কার্সিভ বা অত্যন্ত ব্যক্তিগত স্ক্রিপ্টের জন্য, Google Cloud Vision-এর হাতের লেখা মডেল বা Microsoft Azure-এর হাতে লেখা টেক্সট রিকগনিশন API-র মতো বিশেষ-উদ্দেশ্যে তৈরি হাতের লেখা সেবাগুলো টাইপসেট ডকুমেন্টে মূলত প্রশিক্ষিত একটি সাধারণ-উদ্দেশ্যের ইঞ্জিনকে ছাড়িয়ে যাবে।
Frequently asked questions
OCR কী এবং এটি কীভাবে কাজ করে?
OCR মানে Optical Character Recognition — এমন প্রযুক্তি যা টেক্সটের ছবি (টাইপ করা, প্রিন্ট করা, বা হাতে লেখা) মেশিন-পঠনযোগ্য টেক্সটে রূপান্তরিত করে যা আপনি কপি, সার্চ এবং এডিট করতে পারেন। ইঞ্জিন পিক্সেল প্যাটার্ন বিশ্লেষণ করে এবং অক্ষরের মতো দেখতে অঞ্চলগুলোকে পরিচিত অক্ষরের আকৃতির সাথে মিলিয়ে দেয়, প্যাটার্ন রিকগনিশন এবং ভাষার মডেল ব্যবহার করে অস্পষ্টতা সমাধান করে। আধুনিক ডিপ-লার্নিং OCR — যেমন এই টুলের পেছনে থাকা Tesseract 4+ — লক্ষ লক্ষ ডকুমেন্ট ছবিতে প্রশিক্ষিত LSTM নিউরাল নেটওয়ার্ক ব্যবহার করে, পরিষ্কার প্রিন্টেড টেক্সটে ৯৮%-এর বেশি নির্ভুলতা অর্জন করে। পুরো প্রক্রিয়াটি আপনার ব্রাউজারে স্থানীয়ভাবে চলে; কোনো সার্ভার কখনও আপনার ফাইল দেখে না।
এই টুল কি আমার ছবি কোথাও আপলোড করে?
না — এবং এটিই UtiloKit এবং প্রায় প্রতিটি অন্য অনলাইন OCR সেবার মধ্যে একমাত্র সবচেয়ে গুরুত্বপূর্ণ পার্থক্য। এই টুল সম্পূর্ণভাবে আপনার ব্রাউজারে Tesseract.js ব্যবহার করে চলে, Tesseract OCR ইঞ্জিনের WebAssembly সংস্করণ। আপনার ছবি আপনার ডিভাইসে স্থানীয়ভাবে প্রসেস হয় এবং কখনও ইন্টারনেটে পাঠানো হয় না। এটি এটিকে সম্পূর্ণভাবে প্রাইভেট এবং GDPR-সম্মত করে তোলে, এবং এর মানে ইঞ্জিন ফাইল ক্যাশ হওয়ার পর টুলটি অফলাইনেও কাজ করে। OnlineOCR.net এবং i2OCR-এর মতো সাইটে ফাইল আপলোড করতে হয় এবং তাদের সার্ভারে ছবি প্রসেস করা হয় — এই টুল কখনও তা করে না।
এটি Adobe Acrobat OCR-এর সাথে কীভাবে তুলনীয়?
Adobe Acrobat-এর OCR একটি পেইড সাবস্ক্রিপশনের অংশ (Adobe Acrobat Standard প্রায় $১৩/মাস থেকে শুরু) এবং ওয়েব সংস্করণেও ফাইল Adobe-এর ক্লাউডে আপলোড করা প্রয়োজন। এই টুল সম্পূর্ণভাবে ফ্রি, কোনো Adobe অ্যাকাউন্ট প্রয়োজন হয় না, এবং কখনও কিছু আপলোড করে না। মাল্টি-কলাম PDF এবং জটিল টেবিল লেআউটের জন্য Adobe-এর ইঞ্জিনের কিছু সুবিধা আছে, কিন্তু একটি একক ছবি, স্ক্রিনশট, বা পরিষ্কার স্ক্যান থেকে টেক্সট বের করার জন্য ব্রাউজার-ভিত্তিক Tesseract OCR প্রায় একই ফলাফল দেয় — শূন্য খরচে এবং সম্পূর্ণ প্রাইভেসিসহ।
এটি Google Docs OCR-এর সাথে কীভাবে তুলনীয়?
Google Docs OCR (একটি ছবি Google Drive-এ আপলোড করে Google Doc হিসেবে খোলা) শক্তিশালী এবং ফ্রি কিন্তু একটি Google অ্যাকাউন্ট প্রয়োজন, আপনার ফাইল Google-এর সার্ভারে আপলোড করে, এবং ক্লাউডে প্রসেস করে। প্রাইভেট ডকুমেন্টের জন্য — চুক্তি, চিকিৎসার রেকর্ড, আর্থিক বিবৃতি — এটি একটি উল্লেখযোগ্য ট্রেড-অফ। এই টুল সম্পূর্ণভাবে আপনার ব্রাউজারে Tesseract.js দিয়ে চলে: কোনো Google অ্যাকাউন্ট নেই, কোনো ফাইল আপলোড হয় না, কোনো ডেটা রক্ষিত থাকে না। Google Docs OCR অফলাইনেও কাজ করে না এবং একক ছবির জন্য ধীরগতির। উভয়ই পরিষ্কার প্রিন্টেড টেক্সটে চমৎকার ফলাফল দেয়; স্পর্শকাতর ডকুমেন্টের জন্য এখানে প্রাইভেসির সুবিধা সিদ্ধান্তমূলক।
এটি ABBYY FineReader-এর সাথে কীভাবে তুলনীয়?
ABBYY FineReader সবচেয়ে নির্ভুল কমার্শিয়াল OCR ইঞ্জিন এবং জটিল ডকুমেন্ট লেআউট, মাল্টি-কলাম টেক্সট, টেবিল এবং ফর্ম রিকগনিশনে দক্ষ। এর খরচ $১৯৯+ চিরস্থায়ী বা $৯৯/বছর সাবস্ক্রিপশন, সাথে একটি ক্লাউড সেবা যেখানে ফাইল আপলোড প্রয়োজন। বড় পরিসরে পেশাদার ডকুমেন্ট ডিজিটাইজেশনের জন্য, কঠিন ইনপুটে ABBYY-এর নির্ভুলতা টেক্কা দেওয়া কঠিন। তবে সবচেয়ে সাধারণ OCR কাজের জন্য — স্ক্রিনশট, স্ক্যান করা পাতা, বা ডকুমেন্টের ছবি থেকে টেক্সট বের করা — এই ফ্রি ব্রাউজার-ভিত্তিক Tesseract টুল বিনামূল্যে এবং সম্পূর্ণ প্রাইভেসিসহ যথেষ্টের বেশি ফলাফল দেয়। এটি ডকুমেন্ট-ম্যানেজমেন্ট পাইপলাইনে ABBYY-এর প্রতিস্থাপন নয়, কিন্তু দ্রুত প্রাত্যহিক এক্সট্র্যাকশনের জন্য এটি আদর্শ।
এটি OnlineOCR.net এবং i2OCR-এর সাথে কীভাবে তুলনীয়?
OnlineOCR.net এবং i2OCR জনপ্রিয় ফ্রি OCR ওয়েবসাইট, কিন্তু উভয়েরই আপনার ছবি তাদের সার্ভারে আপলোড করতে হয় — আপনার ছবি ইন্টারনেট পার হয়ে যায় এবং সাময়িকভাবে একটি তৃতীয়-পক্ষের সার্ভারে সংরক্ষিত হয়। উভয়ই ফ্রি ব্যবহারকারীদের ওপর দৈনিক সীমা আরোপ করে (OnlineOCR.net ফ্রি ব্যবহারকারীদের ঘণ্টায় ১৫ পাতায় সীমাবদ্ধ করে; i2OCR-ও রেট-লিমিটেড)। কোনোটিই অফলাইনে কাজ করে না। এই টুল সম্পূর্ণভাবে আপনার ব্রাউজারে ছবি প্রসেস করে: কিছুই আপলোড হয় না, কোনো রেট লিমিট নেই, এবং প্রাথমিক ইঞ্জিন লোডের পর এটি অফলাইনেও কাজ করে। প্রাইভেসি-সচেতন ব্যবহারকারী বা যারা নিয়মিত ফ্রি-টায়ার সীমায় পৌঁছান, তাদের জন্য পার্থক্যটি উল্লেখযোগ্য।
OCR টুলটি কোন ফাইল ফরম্যাট গ্রহণ করে?
টুলটি সাধারণ ওয়েব ছবির ফরম্যাট গ্রহণ করে: JPG/JPEG, PNG, WebP, GIF, এবং BMP। সেরা ফলাফলের জন্য PNG ব্যবহার করুন (লসলেস কম্প্রেশন সূক্ষ্ম টেক্সটের বিবরণ রক্ষা করে যা JPEG কম্প্রেশন আর্টিফ্যাক্ট নষ্ট করতে পারে) বা একটি উঁচু-মানের JPEG। খুব গাঢ়, খুব ছোট, বা কম-কনট্রাস্ট ছবি এডিট করার প্রয়োজন হতে পারে — উজ্জ্বলতা বাড়ান, কনট্রাস্ট বাড়ান, শার্পেন করুন — OCR গ্রহণযোগ্য ফলাফল দেওয়ার আগে। PDF ফাইল সরাসরি সমর্থিত নয়; আপনার PDF ভিউয়ার থেকে একটি স্ক্রিনশট নিন বা পৃথক পাতাগুলো ছবি হিসেবে এক্সপোর্ট করুন, তারপর সেই ছবিগুলোতে একবারে একটি করে OCR চালান।
কোন ধরনের ছবি সবচেয়ে ভালো কাজ করে?
OCR নির্ভুলতা সবচেয়ে বেশি হয় যখন ছবির থাকে: উঁচু রেজোলিউশন (স্ক্যান করা ডকুমেন্টের জন্য অন্তত ৩০০ DPI, বা স্ক্রিনশটের জন্য ২× জুম), টেক্সট ও ব্যাকগ্রাউন্ডের মধ্যে উঁচু কনট্রাস্ট (সাদা কাগজে কালো টেক্সট আদর্শ), ঝাপসা বা নয়েজ ছাড়া তীক্ষ্ণ ফোকাস, অনুভূমিক অভিমুখ (ঘোরানো বা তির্যক টেক্সট নির্ভুলতা উল্লেখযোগ্যভাবে কমায়), এবং সামঞ্জস্যপূর্ণ পরিষ্কার ফন্ট — সেরিফ বা সান-সেরিফ প্রিন্টেড টাইপ। খারাপ আলো, ভারী JPEG আর্টিফ্যাক্ট, ছোট টেক্সট, সাজসজ্জামূলক ফন্ট, এবং জটিল ব্যাকগ্রাউন্ডের ওপর ওভারলে করা টেক্সট — সবই নির্ভুলতা কমায়। ছবির মান কম হলে, প্রসেস করার আগে নির্ভুলতা বাড়ানো নিয়ে FAQ দেখুন।
এটি কি হাতের লেখা থেকে টেক্সট বের করতে পারে?
প্রিন্টেড টেক্সটের তুলনায় Tesseract-এর হাতের লেখা রিকগনিশন সীমিত। এটি স্পষ্ট, পরিষ্কার প্রিন্টেড ক্যাপিটাল অক্ষরে লেখা হাতের লেখা মোটামুটি ভালোভাবে সামলায়, কিন্তু কার্সিভ লেখায় সাধারণত খারাপ ফলাফল দেয়। ভালো হাতের লেখা OCR-এর জন্য, Google Cloud Vision API বা Microsoft Azure Computer Vision-এর মতো বিশেষায়িত সেবা বেশি নির্ভুল — যদিও এগুলোর জন্য ইন্টারনেট সংযোগ প্রয়োজন এবং খরচ হতে পারে। এই টুল প্রিন্টেড টেক্সটের জন্য অপ্টিমাইজড — ডকুমেন্ট, স্ক্রিনশট, প্রেজেন্টেশন, বই এবং সাইনেজ থেকে। বড় পরিসরে হাতের লেখা এক্সট্র্যাকশনের জন্য, একটি সাধারণ-উদ্দেশ্যের OCR ইঞ্জিনের বদলে একটি বিশেষ-উদ্দেশ্যে তৈরি সেবা ব্যবহার করুন।
কম-মানের ছবিতে OCR নির্ভুলতা কীভাবে বাড়াবো?
OCR নির্ভুলতা বাড়াতে: (১) রেজোলিউশন বাড়ান — ডিভাইসের অ্যাক্সেসিবিলিটি জুম ব্যবহার করুন বা উঁচু DPI-তে স্ক্রিনশট নিন। (২) কনট্রাস্ট বাড়ান — যেকোনো ফটো এডিটরে কনট্রাস্ট বাড়ান এবং উজ্জ্বলতা কমান যাতে টেক্সট ব্যাকগ্রাউন্ড থেকে আলাদা দেখায়। (৩) গ্রেস্কেল বা কালো-সাদায় রূপান্তর করুন — রঙ প্যাটার্ন ম্যাচিংকে বিভ্রান্ত করতে পারে। (৪) নয়েজ দূর করুন — হালকা শার্পেন ফিল্টার প্রয়োগ করুন। (৫) ডিস্কিউ করুন — ছবি ঘোরান যাতে টেক্সটের লাইনগুলো অনুভূমিক হয়। (৬) টেক্সট এলাকায় শক্তভাবে ক্রপ করুন — ব্যাকগ্রাউন্ডের বিশৃঙ্খলা দূর করলে ভুল মিলের সম্ভাবনা কমে। সামান্য প্রি-প্রসেসিংও সাধারণত নির্ভুলতা ৭০% থেকে ৯৫%+-এ নিয়ে যায়।
OCR কোন কোন ভাষা সমর্থন করে?
এই টুল ডিফল্টভাবে Tesseract-এর ইংরেজি ভাষার প্যাক ব্যবহার করে। Tesseract নিজেই ১০০টির বেশি ভাষা সমর্থন করে — স্প্যানিশ, ফরাসি, জার্মান, ইতালিয়ান, পর্তুগিজ, চীনা (সরলীকৃত ও ঐতিহ্যবাহী), জাপানি, কোরিয়ান, আরবি, রুশ, হিন্দি, এবং আরও অনেক — প্রতিটির জন্য প্রতি ৫-২০ MB আকারের ভিন্ন প্রশিক্ষিত মডেল ফাইল প্রয়োজন। টুলটি বর্তমানে দ্রুত ব্রাউজার লোডিংয়ের জন্য অপ্টিমাইজড ইংরেজি OCR চালায়; ভবিষ্যতের আপডেটে বহু-ভাষা সমর্থন যোগ হতে পারে। বর্তমানে নন-ইংরেজি OCR-এর জন্য, Google Docs OCR বা ABBYY FineReader ভালো বিকল্প।
এটি কি স্ক্রিনশট থেকে টেক্সট বের করতে ব্যবহার করা যায়?
হ্যাঁ — স্ক্রিনশট সবচেয়ে সাধারণ OCR ব্যবহারের ক্ষেত্র এবং যেখানে এই টুল বিশেষভাবে ভালো কাজ করে। একটি স্ক্রিনশট নিন (Windows: Win+Shift+S বা PrtScn; Mac: Cmd+Shift+4; মোবাইল: পাওয়ার+ভলিউম), টুলে ফেলুন বা পেস্ট করুন, আর কয়েক সেকেন্ডে বের করা টেক্সট দেখা যাবে। আধুনিক উঁচু-DPI ডিসপ্লে (Retina, 4K) থেকে স্ক্রিনশট চমৎকার ফলাফল দেয় কারণ টেক্সট পরিষ্কার অ্যান্টি-অ্যালিয়াসড প্রান্তসহ উঁচু রেজোলিউশনে রেন্ডার হয়। যেহেতু আপনার স্ক্রিনশট কখনও আপনার ডিভাইস ছেড়ে যায় না, এটি এমন গোপনীয় ডকুমেন্ট বা কর্মক্ষেত্রের সিস্টেম থেকে টেক্সট বের করার জন্য আদর্শ যেখানে আপনি আপলোড-ভিত্তিক টুল ব্যবহার করতে পারবেন না।
ব্রাউজার-ভিত্তিক OCR কতটা নির্ভুল?
LSTM ইঞ্জিনসহ Tesseract 4+ পরিষ্কার, ভালো আলোযুক্ত, অনুভূমিক প্রিন্টেড ডকুমেন্টে পর্যাপ্ত রেজোলিউশনে ৯৫-৯৯% অক্ষর নির্ভুলতা অর্জন করে। পরিষ্কার প্রিন্টেড টেক্সটের ১,০০০-অক্ষরের একটি ব্লকের জন্য ১-৫০টি ভুল আশা করুন। সাধারণ কাজের জন্য — PDF স্ক্রিনশট থেকে টেক্সট কপি করা, প্রেজেন্টেশন স্লাইড থেকে টেক্সট বের করা, বিজনেস কার্ডের ছবি পড়া — নির্ভুলতা যথেষ্টের বেশি, শুধু ছোট ম্যানুয়াল সংশোধনের প্রয়োজন হয়। জটিল লেআউট (মাল্টি-কলাম টেক্সট, টেবিল, ছবির ওপর টেক্সট) এবং সাজসজ্জামূলক ফন্ট বেশি ভুল তৈরি করে। খুবই কঠিন ইনপুটে ABBYY FineReader এবং Google Cloud Vision Tesseract-এর চেয়ে সামান্য এগিয়ে থাকতে পারে, কিন্তু প্রাত্যহিক ব্যবহারে পার্থক্য নগণ্য।
ছবির ফাইলের আকারে কি কোনো সীমা আছে?
কোনো কঠোর সার্ভার-আরোপিত সীমা নেই কারণ সব প্রসেসিং আপনার ব্রাউজারে হয়। খুব বড় ছবি (২০-৩০ MB-এর বেশি) ধীরে প্রসেস হতে পারে বা পুরোনো ডিভাইসের মেমরি শেষ করে দিতে পারে। সেরা পারফরম্যান্সের জন্য ছবি ৫ MB-এর নিচে রাখুন। বড় স্ক্যান করা ডকুমেন্ট OCR করলে, এটিকে পৃথক পাতার ছবিতে ভাগ করুন এবং একবারে একটি করে প্রসেস করুন। OCR-এর জন্য ৮০-৯০% মানের JPEG ছবি সাধারণত টেক্সটের স্পষ্টতা এবং ফাইলের আকারের মধ্যে ভালো ভারসাম্য রাখে। OnlineOCR.net-এর মতো আপলোড-ভিত্তিক সেবার বিপরীতে, আপনি প্রোভাইডারের আরোপিত ফাইল-আকারের সীমায় পৌঁছাবেন না।
প্রথমবার ব্যবহার কেন পরের বারের চেয়ে ধীর?
প্রথমবার ব্যবহারে আপনার ব্রাউজার Tesseract ইঞ্জিন ডাউনলোড করে — WebAssembly কোর (~2 MB) এবং ইংরেজি ভাষার মডেল (~5 MB)। এটি একবারের ডাউনলোড। আপনার ব্রাউজার এই ফাইলগুলো স্বয়ংক্রিয়ভাবে ক্যাশ করে রাখে, তাই প্রতিটি পরবর্তী ভিজিটে ইঞ্জিন তাৎক্ষণিকভাবে ক্যাশ থেকে লোড হয়, কোনো নেটওয়ার্ক ট্রাফিক ছাড়াই। ক্যাশ হওয়ার পর ইঞ্জিন এক সেকেন্ডেরও কম সময়ে শুরু হয়। টুলটি শুধু প্রথম রানে 'OCR ইঞ্জিন লোড হচ্ছে (~4 MB, ক্যাশ হওয়ার পর)' দেখায়। ক্যাশিং যাচাই করতে চাইলে, ট্যাব বন্ধ করুন, আবার খুলুন, এবং লক্ষ্য করুন দ্বিতীয় লোড কত দ্রুত হয়।
প্রথম লোডের পর কি এটি অফলাইনে ব্যবহার করা যায়?
হ্যাঁ। টুলটি প্রথমবার ব্যবহারের পর, Tesseract ইঞ্জিন ফাইল (WebAssembly কোর এবং ইংরেজি ভাষার মডেল) আপনার ব্রাউজারের HTTP ক্যাশ বা সার্ভিস ওয়ার্কারে ক্যাশ হয়। পরবর্তী ভিজিটগুলোতে OCR ইঞ্জিন কোনো ইন্টারনেট সংযোগ ছাড়াই ক্যাশ থেকে লোড হয়। আপনার ছবি কখনও কোনো সার্ভারে আপলোড হয় না — সব প্রসেসিং আপনার ব্রাউজার ট্যাবে স্থানীয়ভাবে হয়। বিঃদ্রঃ: ব্রাউজার ক্যাশ মুছে ফেলা বা প্রাইভেট/ইনকগনিটো উইন্ডো ব্যবহার করলে পরবর্তী ব্যবহারে নতুন ডাউনলোড শুরু হবে।
আপলোডের বদলে কি আমি সরাসরি একটি ছবি পেস্ট করতে পারি?
হ্যাঁ — আপনি Ctrl+V (Windows/Linux) বা Cmd+V (Mac) ব্যবহার করে সরাসরি আপনার ক্লিপবোর্ড থেকে ড্রপ জোনে একটি ছবি পেস্ট করতে পারেন। এটি স্ক্রিনশটের জন্য বিশেষভাবে দ্রুত: আপনার স্ক্রিনশট নিন, ব্রাউজার ট্যাবে যান, এবং পেস্ট করুন। কোনো ফাইল-পিকার ডায়ালগ ছাড়াই ছবিটি তাৎক্ষণিকভাবে দেখা যাবে। এটি আপনার OS থেকে কপি করা স্ক্রিনশট, অন্য অ্যাপ্লিকেশন থেকে কপি করা ছবি, এমনকি ওয়েবসাইট থেকে কপি করা ছবির সাথেও কাজ করে। পেস্ট করা ছবি একটি ফাইল আপলোডের মতোই সম্পূর্ণভাবে আপনার ব্রাউজারে প্রসেস হয়।
OCR কি বোল্ড বা ইটালিকের মতো টেক্সট ফরম্যাটিং সংরক্ষণ করে?
না — OCR শুধু সাদামাটা টেক্সট বের করে; শব্দগুলো বোল্ড, ইটালিক, আন্ডারলাইন করা, বা নির্দিষ্ট ফন্টে ছিল কিনা তা এটি শনাক্ত করতে পারে না। আউটপুট আনফরম্যাটেড ইউনিকোড টেক্সট। অনুচ্ছেদের ব্রেকের মতো গঠনগত সংকেত মাঝে মাঝে সংরক্ষিত থাকে যদি অনুচ্ছেদের মধ্যে স্পষ্ট উল্লম্ব ফাঁক থাকে, কিন্তু জটিল ফরম্যাটিং — কলাম, টেবিল, ইনডেন্টেশন, বুলেট চিহ্ন — সঠিকভাবে পুনরুৎপাদিত নাও হতে পারে। ডকুমেন্টের ফরম্যাটিং বজায় রাখার জন্য, বিশেষায়িত ডকুমেন্ট কনভার্শন টুল (যেমন PDF-টু-Word কনভার্টার যা অভ্যন্তরীণভাবে OCR ব্যবহার করে) একটি সাধারণ টেক্সট এক্সট্র্যাক্টরের চেয়ে বেশি উপযুক্ত।
এটি এবং একটি PDF টেক্সট এক্সট্র্যাক্টরের মধ্যে পার্থক্য কী?
একটি PDF টেক্সট এক্সট্র্যাক্টর বহু PDF ফাইলে ইতিমধ্যেই থাকা এমবেডেড টেক্সট লেয়ার পড়ে — কোনো ইমেজ রিকগনিশন প্রয়োজন হয় না, এবং এটি প্রায় তাৎক্ষণিক এবং নিখুঁত নির্ভুলতাসহ। এই OCR টুল ছবির জন্য এবং 'শুধু-ছবি' PDF-এর জন্য (এমবেডেড টেক্সট লেয়ার ছাড়া স্ক্যান করা PDF)। আপনার PDF-এ যদি সিলেক্টযোগ্য টেক্সট থাকে (আপনি একটি PDF ভিউয়ারে তা হাইলাইট ও কপি করতে পারেন), একটি টেক্সট এক্সট্র্যাক্টর দ্রুততর এবং বেশি নির্ভুল। PDF যদি স্ক্যান বা ছবি-ভিত্তিক এক্সপোর্ট হয়, এই OCR টুলটিই সঠিক পছন্দ। যেকোনো PDF ভিউয়ারে টেক্সট হাইলাইট করার চেষ্টা করে আপনি আপনার PDF পরীক্ষা করতে পারেন — যদি এটি সিলেক্ট হয়, একটি টেক্সট এক্সট্র্যাক্টর ব্যবহার করুন; যদি না হয়, OCR ব্যবহার করুন।
আমি কি বাণিজ্যিকভাবে বের করা টেক্সট ব্যবহার করতে পারি?
বের করা টেক্সট আপনার সরবরাহ করা ছবির বিষয়বস্তু থেকে তৈরি হয়। আউটপুট টেক্সট দিয়ে আপনি কী করবেন তার ওপর UtiloKit কোনো বিধিনিষেধ আরোপ করে না — আপনি ফলাফলের মালিক এবং নিয়ন্ত্রক। কপিরাইট বা লাইসেন্সিং সম্পর্কিত বিবেচনাগুলো আপনার ছবির সোর্স উপাদানের সাথে সম্পর্কিত, OCR প্রক্রিয়ার সাথে নয়। এই টুল যেকোনো উদ্দেশ্যে ফ্রি ব্যবহারের জন্য, ইনভয়েস ডিজিটাইজেশন, রিসিট প্রসেসিং, বা ডকুমেন্ট আর্কাইভিংয়ের মতো কমার্শিয়াল ওয়ার্কফ্লোসহ। আউটপুটে কোনো ওয়াটারমার্ক যোগ করা হয় না, কোনো অ্যাট্রিবিউশন প্রয়োজন নেই, এবং কোনো ব্যবহার-ভিত্তিক ফি নেই।
এটি কি আইফোন, আইপ্যাড এবং অ্যান্ড্রয়েডে কাজ করে?
হ্যাঁ — OCR টুলটি যেকোনো আধুনিক মোবাইল ব্রাউজারে কাজ করে, আইফোন এবং আইপ্যাডে Safari এবং অ্যান্ড্রয়েডে Chrome-সহ। আপনি আপনার ক্যামেরা রোল থেকে একটি ছবি বেছে নিতে পারেন বা ব্রাউজারের ফাইল-পিকার থেকে সরাসরি একটি নতুন ছবি তুলতে পারেন। Tesseract ইঞ্জিন সম্পূর্ণভাবে আপনার ডিভাইসের ব্রাউজার ট্যাবে চলে — কোনো আপলোড নেই এবং কোনো সার্ভার জড়িত নয়। প্রসেসিং গতি আপনার ডিভাইসের CPU-এর ওপর নির্ভর করে; আধুনিক ফোন ও ট্যাবলেট ইঞ্জিনটি স্বাচ্ছন্দ্যে সামলায়। আইফোন ব্যবহারকারীদের জন্য, Share Sheet Photos, Files, বা Mail থেকে ছবি শেয়ার করে আপনার ব্রাউজারে খোলার সুযোগও দেয়।
Related tools
সব টুল দেখুনPDF থেকে JPG
PDF পৃষ্ঠাগুলো আপনার পছন্দের মানে JPG, PNG বা WebP ছবিতে রূপান্তর করুন — সবকিছু আপনার ব্রাউজারেই।
মিম জেনারেটর
ক্লাসিক উপরের/নিচের টেক্সট বা টেনে সরানো যায় এমন টেক্সট বক্স দিয়ে মিম বানান — কোনো ওয়াটারমার্ক নেই, সাইন-আপ লাগে না।
ছবির কোণ গোলাকার করুন
যেকোনো ছবির কোণ গোলাকার করুন এবং স্বচ্ছ PNG ডাউনলোড করুন — আপনার ব্রাউজারে।
ইমেজ কমপ্রেসর
কোয়ালিটি স্লাইডার দিয়ে JPG, PNG ও WebP ছবি কমপ্রেস করুন — আপনার ব্রাউজারে।
ইমেজ রিসাইজার
অ্যাসপেক্ট-রেশিও লক সহ পিক্সেল বা শতাংশ অনুযায়ী ছবি রিসাইজ করুন।
ইমেজ কনভার্টার
কোয়ালিটি নিয়ন্ত্রণসহ PNG, JPG ও WebP-এর মধ্যে ছবি রূপান্তর করুন।