টেক্সট ক্লিনার
নতুনটেক্সট থেকে অতিরিক্ত স্পেস, লাইন ব্রেক, HTML ও স্মার্ট কোট মুছে ফেলুন।
✶ AI preset — strips em dashes (—), smart/curly quotes, zero-width & invisible Unicode, and Markdown: the fingerprints left by ChatGPT and other LLMs.
Runs entirely in your browser. Nothing is uploaded.
এক ক্লিকে অগোছালো টেক্সট পরিষ্কার করুন
কপি-পেস্ট করার সময় যা কিছু গোলমাল হতে পারে, এই ফ্রি টেক্সট ক্লিনার তার সবটাই ঠিক করে দেয়: এলোমেলো ফরম্যাটিং, ডাবল স্পেস, অদ্ভুত লাইন ব্রেক, ফাঁকা লাইন, অবশিষ্ট HTML, বাঁকা “স্মার্ট” কোট, এম-ড্যাশ এবং অদৃশ্য ইউনিকোড ক্যারেক্টার। যে ক্লিনআপগুলো চান সেগুলো টগল করুন, ফলাফল সঙ্গে সঙ্গে আপডেট হয় — কোনো আপলোড নেই, সাইন-আপ নেই, পেজ রিলোড নেই।
PDF, ইমেইল, Word, Google Docs ও ওয়েব পেজ থেকে কপি করা কনটেন্টকে পরিষ্কার প্লেইন টেক্সটে বদলে ফেলার এটাই সবচেয়ে দ্রুত উপায় — যা টেক্সট থেকে ফরম্যাটিং সরিয়ে যেকোনো জায়গায় পেস্ট করার উপযোগী করে তোলে।
ChatGPT ও AI-জেনারেটেড টেক্সট পরিষ্কার করুন
AI লেখার টুলগুলো কিছু চেনা চিহ্ন রেখে যায়: লম্বা এম-ড্যাশ (—), বাঁকা স্মার্ট কোট (“ ” ‘ ’), নন-ব্রেকিং স্পেস এবং জিরো-উইথ / অদৃশ্য ইউনিকোড ক্যারেক্টার, যেগুলো সাধারণ কপি-পেস্টের পরও থেকে যায়। এক-ক্লিকের Clean AI / ChatGPT text প্রিসেট এই সবগুলোকে একসঙ্গে সরিয়ে দেয়, সাথে অবশিষ্ট Markdown-ও — ফলে টেক্সট মানুষের লেখার মতো দেখায় এবং CMS, কোড এডিটর বা ইমেইলে নির্বিঘ্নে পেস্ট হয়।
বাঁকা “কোট”-কে সোজা কোটে এবং এম-ড্যাশ (—) কে হাইফেনে (-) বদলে দেওয়া CSV ফাইল, JSON ও প্লেইন-টেক্সট সিস্টেমে যে এনকোডিং গ্লিচ হয়, তাও বন্ধ করে।
লাইন ব্রেক, \n এবং অতিরিক্ত স্পেস সরান
সব লাইন ব্রেক সরিয়ে একটাই প্যারাগ্রাফে জোড়া লাগাতে চান? লাইন-ব্রেক মোডকে “Join with space”-এ সেট করুন। স্প্রেডশিট বা তালিকার জন্য লাইন ব্রেককে কমা দিয়ে বদলাতে চান? “Join with comma” বেছে নিন, প্রতিটি লাইন কমা দিয়ে আলাদা করা ভ্যালুতে পরিণত হবে। হোয়াইটস্পেস টগলগুলো একই সাথে লাইনের শেষের স্পেস ছেঁটে ফেলে, অতিরিক্ত স্পেস একটায় নামিয়ে আনে, ট্যাবকে রূপান্তর করে এবং ফাঁকা লাইন সরিয়ে দেয়।
এতে টেক্সট ফাইল থেকে নিউলাইন সরানো, স্ট্রিং থেকে \n ক্যারেক্টার মোছা, লাইন স্পেসিং ঠিক করা এবং Word বা Excel-এ লাইন ব্রেক সরানোর মতো জনপ্রিয় সমস্যাগুলো — সবই ম্যাক্রো, প্লাগইন বা Find & Replace-এর ঝামেলা ছাড়াই সমাধান হয়ে যায়।
HTML, Markdown, ইমোজি ও ইউনিকোড স্ট্রিপ করুন
কোনো ওয়েব কনটেন্টের অংশ পেস্ট করে Strip HTML চালু করলে প্রতিটি <tag> বাদ যায় এবং -এর মতো এনটিটি ডিকোড হয়ে যায়। Strip Markdown হেডিং, **bold**, _italic_, লিংক ও কোড ফেন্স সরিয়ে দেয়। Remove emojis 😀 ও ফ্ল্যাগ/স্কিন-টোন সিকোয়েন্স মুছে ফেলে, আর Remove non-ASCII — একটি প্রকৃত ইউনিকোড টেক্সট ক্লিনার — টেক্সটকে সাধারণ 7-বিট ASCII-তে নামিয়ে আনে।
শুধু শব্দ দরকার হলে, ঐচ্ছিক টগলগুলো দিয়ে যতিচিহ্ন, সিম্বল বা সংখ্যাও সরিয়ে ফেলা যায়।
প্রিসেট, লাইভ কাউন্ট ও এক্সপোর্ট
পাঁচটি এক-ক্লিক প্রিসেট — Clean AI text, Remove all formatting, Single line, Tidy whitespace এবং Plain ASCII — সঠিক টগলগুলো সঙ্গে সঙ্গে সেট করে দেয়, তারপর আপনি চাইলে নিজে সূক্ষ্ম সমন্বয় করতে পারেন। লাইভ কাউন্টার ইনপুট ও পরিষ্কার করা আউটপুট — দুটোরই ক্যারেক্টার, শব্দ ও লাইন সংখ্যা দেখায়, এবং ঠিক কতগুলো ক্যারেক্টার সরানো হয়েছে তাও জানায়। প্রস্তুত হলে ফলাফল Copy করুন অথবা .txt ফাইল হিসেবে Download করুন।
TextSoap, Text Mechanic ও TinyWow-এর তুলনায় এটি কেমন
TextSoap (Unmarked Software-এর, $40) প্রায় একই ধরনের ক্লিনিং করে, কিন্তু শুধু macOS-এ চলে, টাকা লাগে, এবং কোনো ব্রাউজার ভার্সন বা AI-টেক্সট প্রিসেট নেই — তাই Windows, Linux বা ফোনে থাকলে এটি ব্যবহার করার উপায় নেই। Text Mechanic (textmechanic.com) ফ্রি ও পরিচিত, কিন্তু এর ফিচারগুলো আলাদা আলাদা পেজে ছড়ানো: একটা পেজ ফাঁকা লাইন সরানোর জন্য, আরেকটা লাইন ব্রেক সরানোর জন্য, তৃতীয়টি HTML স্ট্রিপ করার জন্য। কোনো একত্রিত ওয়ার্কস্পেস নেই, AI ক্লিনআপ প্রিসেটও নেই।
TinyWow-তেও টেক্সট টুল আছে, কিন্তু আপনি যা পেস্ট করেন তা প্রসেসিংয়ের জন্য TinyWow-এর সার্ভারে পাঠানো হয়। সংবেদনশীল নয় এমন কনটেন্টের জন্য এটা ঠিক আছে, কিন্তু এর মানে আপনার টেক্সট ডিভাইস ছেড়ে চলে যায়। অনেক অন্যান্য “অনলাইন টেক্সট ক্লিনার”-ও চুপচাপ সার্ভার-সাইডে কাজ করে। UtiloKit-এর টেক্সট ক্লিনার আপনার ব্রাউজার ট্যাবে JavaScript ব্যবহার করে পুরো কাজ স্থানীয়ভাবে করে — কোথাও কিছু পাঠানো হয় না, পেজ প্রথমবার লোড হওয়ার পর টুলটি অফলাইনেও কাজ করে, আর কোনো ব্যবহারের সীমা বা ওয়াটারমার্ক নেই।
প্রাইভেট, তাৎক্ষণিক এবং অফলাইন
ইনস্টল করার কিছু নেই, সাইন আপ করার কিছু নেই। প্রতিটি ক্লিনআপ — স্পেস একত্র করা, HTML স্ট্রিপ করা, কোট সোজা করা, অদৃশ্য ইউনিকোড সরানো — স্থানীয়ভাবে আপনার ব্রাউজারে ঘটে, তাই আপনার টেক্সট কখনো ডিভাইস ছাড়ে না। সার্ভারের উপর নির্ভরশীল না হওয়ায়, এই টেক্সট ক্লিনার পেজ লোড হওয়ার পর অফলাইনেও কাজ করতে থাকে। বুকমার্ক করে রাখুন এবং যেকোনো সময় টেক্সট গুছিয়ে নিন।
অদৃশ্য ক্যারেক্টারের সমস্যা: স্মার্ট কোট, জিরো-উইথ স্পেস ও বাইট-অর্ডার মার্ক
ওয়ার্ড প্রসেসর বা ওয়েবসাইট থেকে টেক্সট কপি করলে এক শ্রেণির ক্যারেক্টার অদৃশ্যভাবে সাথে চলে আসে, যা চোখে দেখে ধরা প্রায় অসম্ভব এমন গোলমাল তৈরি করে। স্মার্ট কোট — টাইপোগ্রাফিক বাম ও ডান ডাবল কোট (U+201C “ এবং U+201D ”) এবং একক কোট (U+2018 ‘ এবং U+2019 ’) — ছাপায় ঠিকঠাক দেখালেও এগুলো সোজা ASCII কোট (U+0022) ও সোজা ASCII অ্যাপোস্ট্রফি (U+0027)-এর থেকে সম্পূর্ণ ভিন্ন কোড পয়েন্ট, যা JSON, CSV, SQL, শেল স্ক্রিপ্ট এবং বেশিরভাগ প্রোগ্রামিং ভাষা প্রত্যাশা করে। {key: “value”}-এর মতো একটি JSON ভ্যালু সিনট্যাক্স এরর তৈরি করে; একটি SQL WHERE name = ‘Alice’ নীরবে শূন্য সারি ফেরত দেবে।
জিরো-উইথ স্পেস (U+200B) এমন একক ক্যারেক্টার যা একেবারে কিছুই দেখায় না — কোনো গ্লিফ নেই, প্রস্থ নেই — তবু ওয়েবসাইট, PDF বা AI টুল থেকে কপি করার সময় এগুলো শব্দের মাঝখানে ঢুকে পড়ে। “résumé” শব্দের সার্চ, একই দেখতে কিন্তু “é”-এর পরে জিরো-উইথ স্পেসযুক্ত একটি শব্দ মিস করে যাবে। জিরো-উইথ নন-জয়নার (U+200C) এবং সফট হাইফেন (U+00AD) একই ধরনের অদৃশ্য-অমিলের সমস্যা তৈরি করে, আর বাইট-অর্ডার মার্ক (U+FEFF, BOM) — যা Windows Notepad-এ UTF-8 মোডে সেভ করা ফাইলের শুরুতে যুক্ত হয়ে যায় — প্রতিটি CSV-এর প্রথম ফিল্ড নষ্ট করে দেয় এবং যেসব পার্সার স্পষ্টভাবে এটি বাদ দেয় না, সেখানে “অপ্রত্যাশিত টোকেন” এরর ঘটায়। এর একমাত্র নির্ভরযোগ্য সমাধান হলো এমন একটি ক্লিনার দিয়ে টেক্সট চালানো যা এই সব কোড পয়েন্ট চেনে এবং এক ধাপেই মুছে ফেলে।
শনাক্তকরণই প্রথম বাধা: এই ক্যারেক্টারগুলোর কোনোটিই সাধারণ টেক্সট এডিটর বা ওয়ার্ড প্রসেসরে দেখা যায় না। এগুলোর জন্য একটি হেক্স এডিটর অথবা এমন একটি টুল দরকার যা সরাসরি এদের টার্গেট করে। এখানকার Remove invisible Unicode টগল এক ধাপেই জিরো-উইথ স্পেস, জিরো-উইথ নন-জয়নার, সফট হাইফেন এবং BOM মুছে দেয়, আর Straighten quotes টগল চারটি বাঁকা-কোট ভ্যারিয়েন্টকেই তাদের সাধারণ ASCII সমতুল্যে রূপান্তর করে, ফলে কপি করা টেক্সট কোড, কনফিগ ফাইল ও ডেটাবেসে পেস্ট করার জন্য নিরাপদ হয়ে ওঠে।
ইউনিকোড নরমালাইজেশন: দেখতে একরকম দুটি স্ট্রিং কেন সমান নয়
ইউনিকোড একই দেখতে ক্যারেক্টারকে একাধিক বাইট সিকোয়েন্সে এনকোড করার সুযোগ দেয়। উদাহরণস্বরূপ, ü অক্ষরটি একটি একক কম্পোজড কোড পয়েন্ট U+00FC (NFC ফর্ম — প্রিকম্পোজড) হিসেবে, অথবা সাধারণ অক্ষর u (U+0075)-এর পরে একটি কম্বাইনিং ডায়েরেসিস (U+0308) যুক্ত করে (NFD ফর্ম — ডিকম্পোজড) সংরক্ষণ করা যেতে পারে। দুটোই একইরকম দেখায়, কিন্তু বাইট-বাই-বাইট স্ট্রিং তুলনা false ফেরত দেয়, একটি রেগুলার এক্সপ্রেশন মিলে ব্যর্থ হয়, এবং একটি ডিকশনারি লুকআপ কী খুঁজে পায় না। এতে ডেটাবেসে নীরব ডেটা ক্ষতি, ফাইলসিস্টেম এরর ও ভাঙা সার্চ ইনডেক্স তৈরি হয়।
কিছু বাস্তব পরিস্থিতিতে এই সমস্যা বিশেষভাবে তীব্র। হেডিং থেকে তৈরি URL স্লাগ সার্ভার ও ব্রাউজার কোন নরমালাইজেশন ফর্ম বেছে নিয়েছে তার উপর নির্ভর করে সংঘর্ষ করতে পারে বা 404 দেখাতে পারে। macOS ফাইলনেম NFD-তে সংরক্ষণ করে; Windows এবং বেশিরভাগ Linux ফাইলসিস্টেম NFC ব্যবহার করে। café.txt নামের একটি ফাইল প্ল্যাটফর্মের মধ্যে কপি করলে একই দেখতে নাম অথচ প্রকৃতপক্ষে ভিন্ন পাথের দুটি ফাইল তৈরি হতে পারে। NFKC ও NFKD আরও এগিয়ে যায়: এগুলো কম্প্যাটিবিলিটি ক্যারেক্টার-ও প্রসারিত করে, যেমন fi (U+FB01) লিগেচারকে দুই-অক্ষরের fi-তে রূপান্তর করা, এবং রোমান সংখ্যা Ⅳ (U+2163)-কে সাধারণ অক্ষর IV-তে নামিয়ে আনা — টেক্সট সার্চযোগ্য বা ইনডেক্সযোগ্য করতে হলে এটি অপরিহার্য। বেশিরভাগ আধুনিক ডেটাবেস ও সার্চ ইঞ্জিন অভ্যন্তরীণভাবে নরমালাইজ করে, তবে বাহ্যিক উৎস থেকে আসা ডেটা — ওয়েব স্ক্র্যাপিং, ফাইল ইম্পোর্ট, API রেসপন্স — সংরক্ষণের আগে একটি সামঞ্জস্যপূর্ণ ফর্মে নরমালাইজ করা উচিত।
বেশিরভাগ টেক্সট-প্রসেসিং কাজের জন্য ব্যবহারিক সমাধান হলো তুলনা বা সংরক্ষণের আগে সবকিছু NFC-তে নরমালাইজ করা, এবং সার্চের জন্য সম্পূর্ণ কম্প্যাটিবিলিটি ডিকম্পোজিশন দরকার হলে NFKC ব্যবহার করা। JavaScript-এ, str.normalize('NFC') এই কাজ করে। টেক্সট ক্লিনার তার ইউনিকোড ক্লিনআপের অংশ হিসেবে এই নরমালাইজেশন প্রয়োগ করে, ফলে যেসব স্ট্রিং দেখতে সমান কিন্তু কোডে অসমান তুলনা হচ্ছিল, সেগুলো এখন সামঞ্জস্যপূর্ণ এনকোডিং নিয়ে বেরিয়ে আসে।
মোজিবাকে: টেক্সট এনকোডিং এরর দেখতে কেমন এবং কীভাবে ঠিক করবেন
মোজিবাকে (文字化け — জাপানি ভাষায় “অক্ষর রূপান্তর”) হলো সেই এলোমেলো টেক্সট যা তৈরি হয় যখন এক এনকোডিংয়ে লেখা বাইট ভিন্ন এনকোডিংয়ে পড়া হয়। ওয়েবে সবচেয়ে সাধারণ ঘটনা হলো UTF-8 টেক্সটকে Windows-1252 (যাকে cp1252 বা “ANSI”-ও বলা হয়) হিসেবে ভুল পড়া, যা Windows ও Internet Explorer-এর পুরোনো ভার্সনের ডিফল্ট এনকোডিং ছিল। ডান একক কোট ’ UTF-8-এ দুই-বাইট সিকোয়েন্স 0xE2 0x80 0x99 হিসেবে সংরক্ষিত হয়; এই বাইটগুলো Windows-1252 হিসেবে ডিকোড করলে তিন-অক্ষরের স্ট্রিং ’ তৈরি হয়। একইভাবে, অ্যাকিউট চিহ্নসহ e (é, U+00E9) UTF-8-এ 0xC3 0xA9-তে এনকোড হয়, যা Windows-1252 দুই-অক্ষরের স্ট্রিং é হিসেবে পড়ে। এই প্যাটার্নগুলো একবার শিখে নিলে মোজিবাকে সঙ্গে সঙ্গে চেনা যায়।
এনকোডিং ডিক্লারেশন পাইপলাইনের তিনটি স্তর আছে, এবং যেকোনো একটিতে অমিল হলেই সমস্যা তৈরি হয়। HTML meta charset ট্যাগ (<meta charset="utf-8">) ব্রাউজারকে বলে দেয় পেজটি কীভাবে ডিকোড করতে হবে। HTTP Content-Type হেডার (Content-Type: text/html; charset=utf-8) দুটোই উপস্থিত থাকলে meta ট্যাগের চেয়ে অগ্রাধিকার পায়। ডেটাবেস কোলেশন — যেমন MySQL-এ utf8mb4_unicode_ci — নির্ধারণ করে ডেটাবেস কীভাবে স্ট্রিং সংরক্ষণ ও তুলনা করে। এই স্তরগুলোর যেকোনো দুটির মধ্যে অমিল অক্ষর নষ্ট করার জন্য যথেষ্ট, এবং এই ক্ষতি ক্রমবর্ধমান হতে পারে: যে টেক্সট একবার ভুল-এনকোড হয়েছে তা আবার ভুল-এনকোড হতে পারে, যা বাম একক কোটের জন্য ‘-এর মতো ডাবল-মোজিবাকে তৈরি করে।
Windows-1252 প্রায় ISO-8859-1 (Latin-1)-এর মতোই, তবে 0x80–0x9F বাইট রেঞ্জে ভিন্ন ক্যারেক্টার বরাদ্দ করে, যা ISO-8859-1-এ কন্ট্রোল ক্যারেক্টার হিসেবে থাকে। সেই রেঞ্জের প্রিন্টেবল ক্যারেক্টারগুলোর মধ্যে আছে ইউরো চিহ্ন € (0x80), একক ও ডাবল লো-9 কোটেশন মার্ক ‚ ও „ (0x82, 0x84), হরাইজন্টাল এলিপসিস … (0x85) এবং এম-ড্যাশ ও এন-ড্যাশ — ও – (0x97, 0x96)। এই Windows-1252 বাইটগুলো Latin-1 হিসেবে ডিকোড করা হলে এই ক্যারেক্টারগুলো অদৃশ্য হয়ে যায় বা কন্ট্রোল কোডে পরিণত হয়। মোজিবাকে শনাক্ত করা সহজ: ’ বা é দেখলে বুঝবেন বাইটগুলো UTF-8 ছিল কিন্তু Windows-1252 হিসেবে ডিকোড হয়েছে। বক্স বা প্রশ্নবোধক চিহ্ন দেখলে বুঝবেন বাইটে এমন কোড পয়েন্ট ছিল যা নির্বাচিত এনকোডিং একেবারেই সংজ্ঞায়িত করে না। সমাধান সবসময় একই — প্রকৃত উৎস এনকোডিং শনাক্ত করে যেকোনো পরবর্তী প্রসেসিংয়ের আগে কাঁচা বাইটগুলো সঠিকভাবে পুনরায় ডিকোড করা।
হোয়াইটস্পেস শ্রেণিবিন্যাস: যে স্পেসগুলো আসলে স্পেস নয়
সব হোয়াইটস্পেসই সাধারণ স্পেস ক্যারেক্টার (U+0020) নয়। ওয়েব কনটেন্ট, ওয়ার্ড-প্রসেসর আউটপুট এবং আন্তর্জাতিকীকৃত টেক্সটে নিয়মিতভাবে এমন স্পেস ক্যারেক্টার থাকে যা দেখতে সাধারণ স্পেসের মতো হলেও লেআউট, সার্চ ও স্ট্রিং প্রসেসিংয়ে ভিন্নভাবে আচরণ করে। সবচেয়ে সাধারণ হলো নন-ব্রেকিং স্পেস (U+00A0, HTML-এ ), যা এর দুই পাশের শব্দের মাঝে লাইন ব্রেক ঘটতে দেয় না। ব্রাউজারে এটি ঠিকঠাক দেখায়, কিন্তু টেক্সট ফিল্ড বা ডেটাবেসে “New York” সার্চ করলে নন-ব্রেকিং স্পেসযুক্ত “New York” মিস হয়ে যাবে — এগুলো ভিন্ন বাইট। ওয়েব পেজ থেকে কপি করা টেক্সটে নন-ব্রেকিং স্পেস অত্যন্ত সাধারণ, কারণ ব্রাউজার হোয়াইটস্পেস রান সংরক্ষণের জন্য এটি স্বয়ংক্রিয়ভাবে যোগ করে।
সাধারণ ক্ষেত্রগুলোর বাইরেও, ইউনিকোডে পেশাদার টাইপোগ্রাফিতে ব্যবহৃত প্রস্থ-নির্দিষ্ট স্পেস ক্যারেক্টারের একটি পুরো সেট আছে। থিন স্পেস (U+2009) গাণিতিক অপারেটরের চারপাশে এবং কিছু সংখ্যা ফরম্যাটিং স্ট্যান্ডার্ডে (যেমন 1,000,000-এর বদলে 1 000 000) ব্যবহৃত হয়। হেয়ার স্পেস (U+200A) আরও সরু এবং টাইপসেট বইয়ে যতিচিহ্নের চারপাশে দেখা যায়। ফিগার স্পেস (U+2007) একটি সংখ্যার সমান প্রস্থের, সংখ্যার কলাম সারিবদ্ধ করতে ব্যবহৃত হয়। এম স্পেস (U+2003) বর্তমান ফন্টের em-এর সমান। আইডিওগ্রাফিক স্পেস (U+3000) হলো CJK (চাইনিজ, জাপানি, কোরিয়ান) টেক্সটে ব্যবহৃত ফুল-উইথ স্পেস, যেখানে প্রতিটি অক্ষর একই বর্গাকার ব্লক দখল করে; এটি একজন অ-পাঠকের কাছে ফুল-উইথ আইডিওগ্রাফ থেকে আলাদা করা কঠিন, তবে ল্যাটিন স্পেসের চেয়ে দ্বিগুণ চওড়া।
লাইন এন্ডিং হোয়াইটস্পেস অস্পষ্টতার আরেকটি মাত্রা। Windows ব্যবহার করে দুই-বাইটের ক্যারেজ-রিটার্ন + লাইন-ফিড সিকোয়েন্স (CRLF, U+000D U+000A)। Unix ও আধুনিক macOS শুধু লাইন-ফিড ব্যবহার করে (LF, U+000A)। ক্লাসিক Mac OS (OS X-এর আগে) শুধু ক্যারেজ-রিটার্ন ব্যবহার করত (CR, U+000D)। Windows-এ সেভ করা এবং Unix টুলে খোলা ফাইলে প্রায়ই প্রতিটি লাইনের শেষে আক্ষরিক ^M ক্যারেক্টার দেখা যায়; ক্লাসিক Mac OS-এ সেভ করা ফাইল বেশিরভাগ আধুনিক এডিটরে পুরো কনটেন্ট একটি মাত্র লাইন হিসেবে দেখায়। যেকোনো টেক্সট প্রসেসিংয়ের আগে সঠিক পদ্ধতি হলো সব লাইন এন্ডিংকে একটি সামঞ্জস্যপূর্ণ ফর্মে — প্রায় সবসময় LF-এ — নরমালাইজ করা, এবং আশেপাশের টেক্সট ডিসপ্লের জন্য নাকি ডেটা ফিল্ডের জন্য তার উপর নির্ভর করে সব ব্যতিক্রমী স্পেস ক্যারেক্টারকে সাধারণ স্পেসে রূপান্তর করা বা সরিয়ে ফেলা।
Frequently asked questions
টেক্সট থেকে ফরম্যাটিং কীভাবে সরাব?
আপনার টেক্সট ইনপুট বক্সে পেস্ট করুন, পরিষ্কার করা সংস্করণ সঙ্গে সঙ্গে ডানদিকে দেখা যাবে। Strip HTML, Straighten quotes এবং হোয়াইটস্পেস টগলগুলো চালু করে এক ধাপেই বোল্ড/ইটালিক স্টাইলিং, বাঁকা কোট এবং এলোমেলো স্পেসিং বাদ দিন — অথবা “Remove all formatting” প্রিসেটে ক্লিক করুন। যেমন, রিচ-টেক্সট স্নিপেট <code><b>Hello</b>&nbsp; there</code> সাধারণ লাইন “Hello there”-এ পরিণত হয়। প্রতিটি টগল লাইভ আপডেট হয়, ফলে কপি করার আগেই আপনি ফলাফল দেখতে পান।
ChatGPT বা AI-জেনারেটেড টেক্সট কীভাবে পরিষ্কার করব?
এক-ক্লিকের “Clean AI / ChatGPT text” প্রিসেটে ক্লিক করুন। এটি এক ধাপেই AI-এর চেনা চিহ্নগুলো সরিয়ে দেয়: লম্বা এম-ড্যাশ (—) হাইফেন হয়ে যায়, বাঁকা “স্মার্ট কোট” সোজা হয়ে যায়, নন-ব্রেকিং ও জিরো-উইথ/অদৃশ্য ইউনিকোড ক্যারেক্টার সরে যায়, আর অবশিষ্ট Markdown যেমন **bold** সমান হয়ে যায়। ফলাফল মানুষের লেখার মতো পড়া যায় এবং CMS, ইমেইল বা কোড এডিটরে নির্বিঘ্নে পেস্ট হয়।
টেক্সট ফাইল থেকে নিউলাইন কীভাবে সরাব?
যেকোনো টেক্সট এডিটরে ফাইলটি খুলুন, টেক্সট কপি করুন, তারপর এখানে পেস্ট করুন। প্রতিটি নিউলাইনকে একটি স্পেস দিয়ে বদলাতে Line breaks কন্ট্রোলকে “Join with space”-এ সেট করুন (পুরো ফাইলটি এক লম্বা প্যারাগ্রাফে পরিণত হবে), অথবা কমা দিয়ে আলাদা করা তালিকা তৈরি করতে “Join with comma” বেছে নিন। ফলাফলটি পরিষ্কার .txt ফাইল হিসেবে সেভ করতে Download-এ ক্লিক করুন। পুরো প্রক্রিয়া তাৎক্ষণিক এবং কিছুই আপনার ডিভাইস ছেড়ে যায় না।
Word-এ সব লাইন ব্রেক কীভাবে সরাব?
Word-এ আপনাকে Find & Replace খুলতে হবে, Find-এ ^p টাইপ করতে হবে ও Replace-এ একটা স্পেস দিয়ে Replace All করতে হবে — যা বেশ ঝামেলার এবং সহজেই ভুল হতে পারে। এখানে আরও দ্রুত হয়: টেক্সট পেস্ট করুন, Line breaks কন্ট্রোলকে “Join with space” (এক প্যারাগ্রাফ) বা “Join with comma” (কমা-বিভক্ত তালিকা)-তে সেট করুন, তারপর ফলাফলটি কপি করে Word-এ ফিরিয়ে আনুন। চাইলে পরিষ্কার করা টেক্সট .txt ফাইল হিসেবে ডাউনলোড করে নতুন করে খুলতেও পারেন।
স্ট্রিং থেকে \n কীভাবে সরাব?
\n হলো নিউলাইন ক্যারেক্টার। স্ট্রিংটি এখানে পেস্ট করুন এবং প্রতিটি \n-কে একটি স্পেস দিয়ে বদলাতে Line breaks-কে “Join with space”-এ সেট করুন, অথবা প্রতিটি নিউলাইনকে কমা ও স্পেসে বদলাতে “Join with comma” বেছে নিন। যেমন, “line1\nline2\nline3” হয়ে যায় “line1, line2, line3”। একই ধাপে ফাঁকা লাইনও সরে যায়, ফলে ডাবল সেপারেটর কখনো তৈরি হয় না।
লাইন স্পেসিং কীভাবে সরাব?
“লাইন স্পেসিং” সাধারণত দুটি জিনিসের একটা বোঝায়। প্যারাগ্রাফের মাঝে অতিরিক্ত ফাঁকা লাইন বোঝালে, Remove blank lines চালু করুন — এটি প্রতিটি ফাঁকা লাইন ফিল্টার করে দেয়। একটি লাইনের মধ্যে একাধিক স্পেসের রান বোঝালে, Collapse spaces চালু করুন যা একাধিক স্পেসের যেকোনো সিকোয়েন্সকে একটায় নামিয়ে আনে। দুটি টগলই একসাথে কাজ করে এবং টাইপ করার সাথে সাথে আউটপুট লাইভ আপডেট হয়।
স্মার্ট বা বাঁকা কোটকে সোজা কোটে কীভাবে রূপান্তর করব?
“Straighten quotes” টগলটি চালু করুন। এটি বাঁকা ডাবল কোট “ ”-কে সোজা কোটে এবং বাঁকা একক কোট ‘ ’ (ও অ্যাপোস্ট্রফি ’)-কে সোজা অ্যাপোস্ট্রফিতে ম্যাপ করে, ফলে Word, Google Docs বা কোনো AI টুল থেকে কপি করা টেক্সট আর CSV ফাইল, JSON ও কোড ভাঙে না। যেমন “it’s a “test”” একটি পরিষ্কার, সোজা-কোটযুক্ত সংস্করণে পরিণত হয়।
টেক্সট থেকে এম-ড্যাশ কীভাবে সরাব?
“Normalize dashes” চালু করুন। প্রতিটি এম-ড্যাশ (—) ও এন-ড্যাশ (–) একটি সাধারণ হাইফেনে (-) বদলে যায়, আর একটি ইউনিকোড এলিপসিস (…) তিনটি ডট (...)-এ পরিণত হয়। AI-জেনারেটেড লেখাকে স্বাভাবিক দেখানোর এটি অন্যতম দ্রুততম উপায়, কারণ ভারী এম-ড্যাশ ব্যবহার একটি সাধারণ LLM চিহ্ন।
স্পেশাল বা ইউনিকোড ক্যারেক্টার কীভাবে সরাব?
টেক্সটকে সাধারণ 7-বিট ASCII-তে নামিয়ে আনতে (একটি প্রকৃত ইউনিকোড টেক্সট ক্লিনার) “Remove non-ASCII” ব্যবহার করুন, অথবা শুধু অক্ষর, সংখ্যা ও স্পেস রাখতে “Remove punctuation” ব্যবহার করুন। টিপস: প্রথমে “Straighten quotes” ও “Normalize dashes” চালু করুন, যাতে দরকারি ক্যারেক্টারগুলো মুছে না গিয়ে তাদের ASCII সমতুল্যে রূপান্তরিত হয়।
জিরো-উইথ বা অদৃশ্য ক্যারেক্টার কীভাবে সরাব?
“Remove invisible Unicode” চালু করুন। এটি জিরো-উইথ স্পেস (U+200B), জিরো-উইথ জয়নার/নন-জয়নার, বাইট-অর্ডার মার্ক (U+FEFF), ওয়ার্ড জয়নার এবং সফট হাইফেন মুছে দেয় — এগুলোই সেই লুকানো ক্যারেক্টার যা AI টুল ও ওয়েবসাইট থেকে পেস্ট হয়ে আসে এবং পর্দায় অদৃশ্য থেকেও সার্চ, স্লাগ ও কোড ভেঙে দিতে পারে।
টেক্সট থেকে HTML ট্যাগ কীভাবে স্ট্রিপ করব?
“Strip HTML” চালু করুন। <p>, <a> বা <span>-এর মতো প্রতিটি ট্যাগ সরে যায় এবং , &, "-এর মতো সাধারণ এনটিটি আসল ক্যারেক্টারে ডিকোড হয়ে যায়। ফলে “<p>Hi&nbsp;there</p>” প্লেইন টেক্সট “Hi there”-এ পরিণত হয়।
টেক্সট থেকে ইমোজি কীভাবে সরাব?
“Remove emojis” চালু করুন। এটি মাল্টি-ক্যারেক্টার সিকোয়েন্সসহ ইমোজি — স্কিন-টোন ভ্যারিয়েন্ট, 🇺🇸-এর মতো ফ্ল্যাগ এবং কীক্যাপ — সাফ করে দেয়, ফলে “Great work 👍🏽🎉” হয়ে যায় “Great work ”। ইমোজি সরানোর ফলে থাকা ফাঁক ঠিক করতে এর সাথে “Collapse spaces” ব্যবহার করুন।
ফরম্যাটিং ছাড়া কীভাবে পেস্ট করব?
বেশিরভাগ অ্যাপে Ctrl+Shift+V (Mac-এ Cmd+Shift+V) দিয়ে প্লেইন টেক্সট হিসেবে পেস্ট করা যায়, যা উৎসের স্টাইলিং বাদ দেয়। যখন এটি পাওয়া যায় না — বা আপনার কোট, ড্যাশ ও অদৃশ্য ক্যারেক্টারও ঠিক করা দরকার — তখন এখানে পেস্ট করুন, “Remove all formatting” প্রিসেট প্রয়োগ করুন, এবং পরিষ্কার ফলাফলটি কপি করুন।
এটি TextSoap ও Text Mechanic-এর তুলনায় কেমন?
TextSoap (Unmarked Software থেকে $40-এ) একই ধরনের ক্লিনিং করে, কিন্তু টাকা লাগে এবং শুধু macOS-এ চলে — কোনো ওয়েব ভার্সন নেই, ফোনে নেই, AI-টেক্সট প্রিসেটও নেই। Text Mechanic (textmechanic.com) ফ্রি কিন্তু প্রতিটি ফাংশনকে আলাদা আলাদা পৃষ্ঠায় ছড়িয়ে দেয়, কোনো একত্রিত প্রিসেট নেই এবং ChatGPT ক্লিনআপও নেই। TinyWow-এর টেক্সট টুলগুলো আপনার কনটেন্ট প্রসেসিংয়ের জন্য তাদের সার্ভারে আপলোড করে। UtiloKit-এর টেক্সট ক্লিনার সব ফাংশন একই পৃষ্ঠায় একত্র করে, ব্রাউজারযুক্ত যেকোনো ডিভাইসে কাজ করে, এবং সম্পূর্ণভাবে আপনার ডিভাইসেই চলে — কোথাও কিছু পাঠানো হয় না।
অনলাইনে টেক্সট পরিষ্কার করা কি নিরাপদ, এবং এটি কি অফলাইনে কাজ করে?
হ্যাঁ। প্রতিটি ক্লিনআপ সম্পূর্ণভাবে আপনার ব্রাউজারে JavaScript দিয়ে চলে — আপনার টেক্সট কখনো আপলোড, লগ বা কোনো সার্ভারে পাঠানো হয় না, তাই গোপনীয় ডকুমেন্টও আপনার ডিভাইসেই থাকে। নেটওয়ার্কের উপর নির্ভর না করায়, পেজ লোড হওয়ার পর টুলটি অফলাইনেও কাজ করতে থাকে।
Related tools
সব টুল দেখুনলাইন টুল
ডুপ্লিকেট লাইন মুছুন, সাজান, ট্রিম, উল্টে দিন, এলোমেলো করুন ও টেক্সট লাইন নম্বর দিন।
টেক্সট খুঁজুন ও প্রতিস্থাপন করুন
প্লেইন টেক্সট বা regex দিয়ে বাল্কে টেক্সট প্রতিস্থাপন করুন — কেস উপেক্ষা ও সম্পূর্ণ-শব্দ সহ।
শব্দ ফ্রিকোয়েন্সি কাউন্টার
stop-word ফিল্টারিং ও CSV এক্সপোর্ট সহ শব্দ ও বাক্যাংশের ফ্রিকোয়েন্সি গণনা করুন।
Markdown টেবিল জেনারেটর
একটি এডিটযোগ্য গ্রিডে বা CSV থেকে অ্যালাইনমেন্ট সহ Markdown টেবিল তৈরি করুন।
টেক্সট রিভার্সার
অক্ষর, শব্দ বা লাইন উল্টে দিন, অথবা টেক্সট উল্টোদিকে ফ্লিপ করুন।
টেক্সট থেকে স্পিচ
নির্বাচনযোগ্য ভয়েস, রেট ও পিচ সহ টেক্সট জোরে পড়ুন — আপনার ব্রাউজারে।