শব্দ ফ্রিকোয়েন্সি কাউন্টার
নতুনstop-word ফিল্টারিং ও CSV এক্সপোর্ট সহ শব্দ ও বাক্যাংশের ফ্রিকোয়েন্সি গণনা করুন।
| # | Word / phrase | Count | Density |
|---|---|---|---|
| Paste text above to see word frequency. | |||
Runs entirely in your browser. Nothing is uploaded.
এই ওয়ার্ড ফ্রিকোয়েন্সি কাউন্টার যা করে
এই ওয়ার্ড ফ্রিকোয়েন্সি কাউন্টার আপনার লেখাটিকে টোকেনে ভাগ করে এবং গণনা করে প্রতিটি শব্দ কতবার এসেছে, তারপর সবচেয়ে বেশি থেকে সবচেয়ে কম ব্যবহৃত অনুসারে প্রতিটি শব্দকে র্যাঙ্ক করে। টেবিলের প্রতিটি সারিতে দেখানো হয় শব্দটি, তার কাঁচা সংখ্যা এবং তার কীওয়ার্ড ডেনসিটি — অর্থাৎ মোট শব্দের কত শতাংশ সেটি দখল করেছে। যেকোনো ডকুমেন্ট, ব্লগ পোস্ট, বক্তৃতা বা সার্ভে উত্তর পেস্ট করুন, আর সম্পূর্ণ র্যাঙ্ক করা টেবিলটি সঙ্গে সঙ্গে দেখা যাবে — সাথে উপরের স্ট্যাটস বারে একটি পড়ার-সময়ের আনুমানিক হিসাব ও অনন্য শব্দের সংখ্যাও থাকবে।
bigram (২-শব্দের বাক্যাংশ) বা trigram (৩ শব্দ)-এ পাল্টে নিয়ে আপনার লেখায় সবচেয়ে সাধারণ শব্দসমষ্টি ও কীওয়ার্ড কম্বিনেশন খুঁজে বের করুন। একটি সাধারণ শব্দ গণনাকারী শুধু একটি সমষ্টিগত মোট সংখ্যা দেয়, কিন্তু ওয়ার্ড ফ্রিকোয়েন্সি বিশ্লেষণ ঠিক দেখিয়ে দেয় কোন শব্দগুলো আপনার লেখায় প্রাধান্য বিস্তার করছে — SEO অডিট, একাডেমিক টেক্সট বিশ্লেষণ, সম্পাদকীয় মান পর্যালোচনা এবং কনটেন্ট কৌশল সিদ্ধান্তের জন্য যা অপরিহার্য। টুলটি সম্পূর্ণভাবে আপনার ব্রাউজারে চলে, তাই কোনো লেখা কখনও আপলোড বা প্রেরণ করা হয় না।
N-gram বিশ্লেষণ: bigram এবং trigram
একক-শব্দের ফ্রিকোয়েন্সি পুরো গল্পের অর্ধেক মাত্র বলে। bigram ও trigram বিশ্লেষণ সেই বাক্যাংশগুলো প্রকাশ করে যেগুলো ধারাবাহিকভাবে একসাথে আসে। phrase length ২-এ সেট করলে ‘free shipping’, ‘machine learning’ বা ‘customer support’ সবচেয়ে বেশি পুনরাবৃত্ত দুই-শব্দের কম্বিনেশন হিসেবে উঠে আসতে পারে — যা ‘free’, ‘machine’ ও ‘customer’ আলাদাভাবে কতবার এসেছে তা জানার চেয়ে কনটেন্ট কৌশলের জন্য অনেক বেশি কার্যকর।
এই n-gram কাউন্টার আপনার লেখার প্রতিটি পরপর জোড়া বা ত্রয়ীকে প্রসেস করে: bigram-এর জন্য বিশ্লেষণ করা একটি ৫০০-শব্দের পণ্য বর্ণনা ঠিক দেখায় কোন দুই-শব্দের বাক্যাংশগুলো লেখাটিকে ধরে রেখেছে। bigram ডেনসিটি শতাংশকে একক-শব্দের বিশ্লেষণের সাথে মিলিয়ে চিহ্নিত করুন কোথায় ভাষা বৈচিত্র্যময় করবেন বা একটি নির্দিষ্ট কীওয়ার্ড বাক্যাংশ জোরদার করবেন। N-gram ফ্রিকোয়েন্সি ডেটা হলো সেই উপায় যার মাধ্যমে সার্চ ইঞ্জিন বিষয়ভিত্তিক প্রাসঙ্গিকতা পরিমাপ করে, তাই এই বিশ্লেষণ আপনাকে Ahrefs ও SEMrush-এর মতো SEO টুল তাদের on-page কনটেন্ট রিপোর্টে যে সংকেত দেখায় সেটাই দেয় — একদম ফ্রিতে।
Stop word এবং কীওয়ার্ড ডেনসিটি
সাধারণ ফাংশন শব্দ — আর্টিকেল (‘a’, ‘an’, ‘the’), সংযোজক (‘and’, ‘but’, ‘or’) এবং পূর্বসর্গ (‘in’, ‘on’, ‘at’, ‘of’) — প্রায় যেকোনো ইংরেজি লেখায় প্রাধান্য বিস্তার করে অথচ নিজে থেকে খুব কম অর্থ বহন করে। Exclude stop words চালু করলে এগুলো ফ্রিকোয়েন্সি টেবিল থেকে সরে যায়, ফলে অর্থবহ কনটেন্ট শব্দগুলো উপরে উঠে আসে।
কীওয়ার্ড ডেনসিটি — প্রতিটি শব্দের সংখ্যা সমস্ত শব্দের শতাংশ হিসেবে — Density কলামে দেখা যায়। SEO লেখার জন্য আপনার প্রধান কীওয়ার্ডের জন্য ১–২% ডেনসিটি সাধারণ; ৩–৪%-এর বেশি হলে তা সার্চ ইঞ্জিনের কাছে অতিরিক্ত-অপ্টিমাইজড দেখাতে পারে এবং স্প্যাম ফিল্টার সক্রিয় করতে পারে। বেশিরভাগ SEO প্ল্যাটফর্ম এটি চিহ্নিত করে, কিন্তু প্রকাশের আগে এখানে যাচাই করা ফ্রি ও তাৎক্ষণিক। শতাংশ কলাম ব্যবহার করে চিহ্নিত করুন কোন শব্দটি অতিরিক্ত পুনরাবৃত্ত হয়েছে এবং কিছু ব্যবহারকে সমার্থক শব্দ বা সম্পর্কিত বাক্যাংশ দিয়ে প্রতিস্থাপন করুন। stop-word ফিল্টারিং ও ডেনসিটি শতাংশের সমন্বয় এটিকে একটি হালকা on-page SEO অডিট টুলে পরিণত করে।
আপনার লেখায় অতিরিক্ত ব্যবহৃত শব্দ খুঁজে বের করুন
লেখকরা লক্ষ্য না করেই কিছু নির্দিষ্ট শব্দ পুনরাবৃত্তি করেন। একটি খসড়া প্রবন্ধ, ইমেল বা মার্কেটিং রিপোর্ট টুলে পেস্ট করুন, stop-word ফিল্টারিং চালু করুন, আর ২–৩%-এর বেশি ব্যবহৃত যেকোনো কনটেন্ট শব্দ প্রতিস্থাপনের প্রার্থী। প্রতিটি শব্দের পাশের ইনলাইন ফ্রিকোয়েন্সি বার এক নজরেই ভারী শব্দগুলো স্পষ্ট করে দেয়, টেবিলের প্রতিটি সংখ্যা খুঁটিয়ে দেখতে হয় না।
ন্যূনতম-দৈর্ঘ্য ফিল্টার আপনাকে গুরুত্বপূর্ণ শব্দে মনোযোগ দিতে দেয়: stop-word তালিকায় ইতিমধ্যে না থাকা ছোট ফিলার শব্দ বাদ দিতে এটিকে ৪ বা ৫ অক্ষরে সেট করুন। Ignore numbers টগল করলে সম্পূর্ণ সংখ্যাসূচক টোকেন সরে যায় — ডেটা-ভারী রিপোর্ট বিশ্লেষণের সময় এটি কাজে লাগে, যেখানে সংখ্যাসূচক মান অন্যথায় টেবিলের উপরের অংশ ভিড় করে ফেলত। একসাথে এই ফিল্টারগুলো আপনাকে একটি পরিষ্কার, কার্যকর ভোকাবুলারি অডিট দেয়, যা Microsoft Word-এর বিল্ট-ইন টুল সহজভাবে দিতে পারে না।
তুলনা: Excel COUNTIF, Python এবং Microsoft Word
Excel-এ ওয়ার্ড ফ্রিকোয়েন্সি, Python এবং Microsoft Word-এর সার্চ মানুষ কীভাবে ওয়ার্ড ফ্রিকোয়েন্সি টুল খুঁজে পায় তার একটি বড় অংশ — যা দেখায় কত ব্যবহারকারীর এই বিশ্লেষণ দরকার অথচ সেটি পেতে বাধার সম্মুখীন হন। Excel-এ প্রতিটি অনন্য শব্দের জন্য আপনাকে একটি আলাদা COUNTIF সূত্র লিখতে হবে: সময়সাপেক্ষ ও ত্রুটিপ্রবণ। Python-এ collections.Counter(text.split()) এটি দক্ষভাবে করে কিন্তু একটি কোডিং পরিবেশ, লাইব্রেরি ইমপোর্ট এবং প্রথমে যতিচিহ্ন পরিষ্কার করার জ্ঞান প্রয়োজন। Microsoft Word-এ কোনো বিল্ট-ইন ওয়ার্ড ফ্রিকোয়েন্সি ফিচারই নেই — শুধু Ctrl+H দিয়ে একক-শব্দ খোঁজা-ও-গণনা।
এই ফ্রি অনলাইন কাউন্টার সেই সব বাধা দূর করে দেয়। আপনার লেখা পেস্ট করুন, অপশন বেছে নিন, আর যেকোনো স্প্রেডশিটে খোলার উপযুক্ত একটি CSV ডাউনলোড করুন। Excel-এ যে বিশ্লেষণে দশ মিনিট সূত্র লেখা লাগত, তা এখানে সেকেন্ডে হয়ে যায়। নিয়মিত SEO অডিট বা সম্পাদকীয় মান যাচাই করা কনটেন্ট টিমের জন্য এটি দ্রুততর ও বেশি বাস্তবসম্মত পথ।
প্রাইভেট, তাৎক্ষণিক ও ফ্রি — এবং অফলাইনেও চলে
সমস্ত প্রসেসিং JavaScript ব্যবহার করে স্থানীয়ভাবে আপনার ব্রাউজারে চলে — আপনার লেখা কখনও আপনার ডিভাইস ছেড়ে যায় না। কোনো সাইনআপ নেই, লেখার দৈর্ঘ্যে কোনো সীমা নেই এবং কোনো খরচ নেই। টুলটি Unicode-সচেতন, তাই এটি ইংরেজি, ফরাসি, স্প্যানিশ, জার্মান এবং বেশিরভাগ ল্যাটিন-লিপির ভাষায় সঠিকভাবে কাজ করে। পেজটি একবার লোড হয়ে গেলে, এটি ইন্টারনেট সংযোগ ছাড়াও কাজ করে।
সংবেদনশীল লেখা বিশ্লেষণকারী ব্যবহারকারীদের জন্য এটি বিশেষভাবে গুরুত্বপূর্ণ: ক্লায়েন্ট চুক্তি, আইনি ব্রিফ, অভ্যন্তরীণ কৌশল ডকুমেন্ট বা অপ্রকাশিত পাণ্ডুলিপি। সার্ভার-ভিত্তিক কীওয়ার্ড ডেনসিটি টুল আপনার কনটেন্ট ইন্টারনেটে প্রেরণ করে এবং লগ করতে পারে। এই টুল তা করে না — গ্রহণ করার মতো কোনো সার্ভারই নেই। SEO কনটেন্ট অডিট, সম্পাদকীয় পর্যালোচনা, একাডেমিক গবেষণা এবং যেকোনো সময় একটি লেখার ভোকাবুলারি গঠন বুঝতে চাইলে এটি বুকমার্ক করে রাখুন।
Zipf-এর সূত্র: কেন গুটিকয়েক শব্দ প্রতিটি লেখায় প্রাধান্য বিস্তার করে
Zipf-এর সূত্র — হার্ভার্ড ভাষাবিজ্ঞানী George Kingsley Zipf (1902–1950)-এর নামে নামকরণ করা — হলো এই পর্যবেক্ষণমূলক সত্য যে যেকোনো যথেষ্ট বড় কর্পাসে একটি শব্দের ফ্রিকোয়েন্সি ফ্রিকোয়েন্সি টেবিলে তার র্যাঙ্কের বিপরীত অনুপাতে থাকে। সবচেয়ে সাধারণ শব্দটি দ্বিতীয় সবচেয়ে সাধারণ শব্দের প্রায় দ্বিগুণ, তৃতীয়টির প্রায় তিনগুণ, এবং এভাবেই আসে। গাণিতিক রূপটি হলো frequency ∝ 1 / rank^α, যেখানে প্রাকৃতিক ভাষার জন্য α প্রায় 1.0। Brown Corpus of American English-এ — ১৯৬০-এর দশকে Brown University-তে সংকলিত এক-মিলিয়ন-শব্দের একটি রেফারেন্স সংগ্রহ — ‘the’ প্রায় ৬৯,০০০ বার (র্যাঙ্ক ১), ‘of’ প্রায় ৩৬,০০০ বার (র্যাঙ্ক ২) এবং ‘and’ প্রায় ২৮,০০০ বার (র্যাঙ্ক ৩) আসে, যা পূর্বাভাসিত 1/rank প্যাটার্নের সাথে ঘনিষ্ঠভাবে মেলে।
সূত্রটির একটি চমকপ্রদ ব্যবহারিক পরিণতি আছে: একটি ক্ষুদ্র ভোকাবুলারি যেকোনো লেখার বেশিরভাগ অংশ ঢেকে ফেলে। সবচেয়ে ফ্রিকোয়েন্ট শীর্ষ ১০০টি ইংরেজি শব্দ বেশিরভাগ গদ্যের প্রায় ৫০% শব্দের হিসাব রাখে; শীর্ষ ১,০০০টি প্রায় ৮৫%। এই power law distribution শুধু ভাষার জন্য অনন্য নয় — একই বক্ররেখা শহরের জনসংখ্যার আকার, ওয়েবসাইট ট্রাফিক, আয় বণ্টন, ভূমিকম্পের মাত্রা এবং বইয়ের বিক্রয় র্যাঙ্কও বর্ণনা করে। আপনি যখন একটি ওয়ার্ড ফ্রিকোয়েন্সি বিশ্লেষণ চালান এবং লক্ষ্য করেন প্রথম কয়েকটি এন্ট্রির সংখ্যা বাকি সব কিছুর চেয়ে নাটকীয়ভাবে বেশি, তখন আপনি Zipf-এর সূত্রকে কাজ করতে দেখছেন। বিরল শব্দের দীর্ঘ লেজ যা শুধু একবার আসে (যাকে বলা হয় hapax legomena) সাধারণত যেকোনো বড় ডকুমেন্টের অনন্য ভোকাবুলারির ৪০–৬০% গঠন করে — power law-এর আরেকটি সরাসরি পরিণতি।
কনটেন্ট বিশ্লেষক ও SEO অনুশীলনকারীদের জন্য Zipf-এর সূত্র ব্যাখ্যা করে কেন stop word তালিকা এত ভালো কাজ করে: যেকোনো ফ্রিকোয়েন্সি র্যাঙ্কিংয়ের একেবারে শীর্ষে থাকা শব্দগুলো প্রায় সবসময়ই প্রতিটি বিষয়ের প্রতিটি ডকুমেন্টে একই ফাংশন শব্দ, কারণ তাদের চরম ফ্রিকোয়েন্সি লেখার বিষয়বস্তুর সংকেত নয় বরং ভাষার একটি কাঠামোগত বৈশিষ্ট্য। শীর্ষ-র্যাঙ্কের ফাংশন শব্দগুলো ছেঁটে ফেলাই নিচে থাকা অর্থবহ কনটেন্ট শব্দগুলোর মুখোশ উন্মোচন করে — এই টুলের stop-word ফিল্টার ঠিক সেটাই করে।
ফাংশন শব্দ, কনটেন্ট শব্দ এবং কর্পাস-নির্দিষ্ট ফ্রিকোয়েন্সি তালিকা
প্রতিটি সাধারণ ইংরেজি লেখার ফ্রিকোয়েন্সি টেবিলের শীর্ষ ফাংশন শব্দ দ্বারা প্রভাবিত — ভাষার ব্যাকরণিক আঠা: নির্ধারক (‘the’, ‘a’, ‘an’), পূর্বসর্গ (‘of’, ‘in’, ‘to’, ‘at’, ‘from’, ‘with’), সমন্বয়কারী সংযোজক (‘and’, ‘but’, ‘or’) এবং সাধারণ সর্বনাম (‘it’, ‘you’, ‘they’, ‘we’)। এই শব্দগুলো ঘরানা জুড়ে অসাধারণভাবে স্থিতিশীল: ‘the’ চিকিৎসা জার্নাল, আইনি চুক্তি, শিশুদের ছবির বই এবং সফটওয়্যার ডকুমেন্টেশন সবেতেই সবচেয়ে ফ্রিকোয়েন্ট শব্দ। কনটেন্ট শব্দ — বিশেষ্য, মূল ক্রিয়া, বিশেষণ এবং ক্রিয়াবিশেষণ যা অর্থগত ভার বহন করে — সেগুলোই আলাদা হয়। চিকিৎসা সাহিত্যে সবচেয়ে ফ্রিকোয়েন্ট কনটেন্ট শব্দগুলো শারীরস্থান, রোগবিদ্যা ও চিকিৎসার চারপাশে জড়ো হয়; আইনি চুক্তিতে সেগুলো হলো ‘party’, ‘agreement’, ‘term’, ‘shall’ এবং ‘provision’; শিশুদের বইয়ে সেগুলো মূর্ত, ছোট বিশেষ্য ও সরল ক্রিয়া। এই কারণেই stop-word অপসারণের পর একটি ওয়ার্ড ফ্রিকোয়েন্সি বিশ্লেষণ সঙ্গে সঙ্গে প্রকাশ করে একটি লেখা আসলে কী নিয়ে।
কর্পাস ভাষাবিজ্ঞানীরা কার্যকর ফ্রিকোয়েন্সি থ্রেশহোল্ডকে আনুষ্ঠানিক রূপ দিয়েছেন। Michael West-এর General Service List (1953) সবচেয়ে ফ্রিকোয়েন্ট ২,০০০টি ইংরেজি শব্দ পরিবার চিহ্নিত করে; গবেষণা ধারাবাহিকভাবে দেখায় এগুলো যেকোনো সাধারণ লেখার চলমান শব্দের প্রায় ৯০% ঢেকে ফেলে। Averil Coxhead-এর Academic Word List (AWL, 2000) GSL-এ ইতিমধ্যে না থাকা ৫৭০টি একাডেমিক শব্দ পরিবার যোগ করে — ‘analyze’, ‘concept’, ‘derive’, ‘establish’, ‘indicate’, ‘significant’-এর মতো শব্দ — যা একাডেমিক গদ্যের আরও প্রায় ১০%-এর হিসাব রাখে। একটি শব্দ এই ফ্রিকোয়েন্সি স্কেলে কোথায় বসে তা জানা ভাষা শিক্ষার্থী ও কনটেন্ট লেখক উভয়ের জন্যই গুরুত্বপূর্ণ: উচ্চ-GSL শব্দ ব্যাপকভাবে বোঝা যায়, আর কম-ফ্রিকোয়েন্সির ডোমেইন ভোকাবুলারি দক্ষতার সংকেত দেয় কিন্তু সাধারণ পাঠকদের বাদ দিতে পারে। একটি লেখায় ওয়ার্ড ফ্রিকোয়েন্সি যাচাই করে শীর্ষ কনটেন্ট শব্দগুলোকে GSL ও AWL-এর সাথে মিলিয়ে দেখা যেকোনো ডকুমেন্টের ভোকাবুলারি স্তর ক্যালিব্রেট করার একটি দ্রুত উপায়।
ন্যাচারাল ল্যাঙ্গুয়েজ প্রসেসিং (NLP)-তে ফ্রিকোয়েন্সি বিশ্লেষণের আগে stop word অপসারণ একটি মৌলিক প্রিপ্রসেসিং ধাপ। NLTK, spaCy এবং scikit-learn-এর মতো লাইব্রেরিগুলো ইংরেজি ও আরও কয়েক ডজন ভাষার জন্য বিল্ট-ইন stop word তালিকা সরবরাহ করে। stop word লাইব্রেরি ও ব্যবহার অনুসারে সামান্য ভিন্ন হয় — scikit-learn-এর তালিকা বেশি আক্রমণাত্মক (৩১৮টি শব্দ) আর NLTK-এর ডিফল্ট ছোট — কিন্তু নীতিটি এই টুলের টগলের অনুরূপ: প্রথমে ফাংশন শব্দ ফিল্টার করুন, তারপর অবশিষ্ট ফ্রিকোয়েন্সি বণ্টন বিষয়ভিত্তিক অর্থবহ শব্দগুলো প্রকাশ করে। বহুভাষিক লেখার জন্য এই কাউন্টারের Unicode-সচেতন টোকেনাইজেশন ল্যাটিন-লিপির ভাষাগুলোর একই অপসারণ সামলায়; অন্য লিপির জন্য কাঁচা ফ্রিকোয়েন্সি টেবিল (stop ফিল্টারিং ছাড়া) এখনও বৈধ n-gram ও র্যাঙ্ক ডেটা দেয়।
TF-IDF: কাঁচা ফ্রিকোয়েন্সি থেকে ডকুমেন্ট-পৃথককারী প্রাসঙ্গিকতা
TF-IDF (Term Frequency–Inverse Document Frequency) হলো সেই ওজন-নির্ধারণ পদ্ধতি যা তথ্য পুনরুদ্ধারকে শক্তি দেয় এবং ক্লাসিক্যাল সার্চ ইঞ্জিনের মেরুদণ্ড গঠন করে। এটি ১৯৭২ সালে Karen Spärck Jones তৈরি করেন এবং পরে Gerard Salton তাঁর Vector Space Model-এ আনুষ্ঠানিক রূপ দেন। এটি যে সমস্যা সমাধান করে তা ঠিক কাঁচা ওয়ার্ড ফ্রিকোয়েন্সির সীমাবদ্ধতা: একটি শব্দ একটি ডকুমেন্টে দশবার আসলেও তা অপরিহার্যভাবে গুরুত্বপূর্ণ নয় যদি সেটি কর্পাসের প্রায় প্রতিটি ডকুমেন্টেই আসে। Term Frequency (TF) হলো একটি শব্দের সংখ্যাকে ডকুমেন্টের মোট শব্দ দিয়ে ভাগ করা — মূলত এই টুল যে কীওয়ার্ড ডেনসিটি শতাংশ দেখায় সেটাই। Inverse Document Frequency (IDF) হলো মোট ডকুমেন্ট সংখ্যাকে যতগুলো ডকুমেন্টে শব্দটি আছে তা দিয়ে ভাগ করে তার লগারিদম। TF-IDF = TF × IDF: যে শব্দ একটি ডকুমেন্টে ঘন ঘন আসে কিন্তু বৃহত্তর কর্পাস জুড়ে বিরল, তা উচ্চ স্কোর পায়, ফলে এটি সাধারণ ফিলার শব্দের বদলে সেই নির্দিষ্ট ডকুমেন্টের একটি পৃথককারী শব্দ হিসেবে চিহ্নিত হয়।
TF-IDF-এর প্রয়োগ ব্যাপক ও ব্যবহারিক। সার্চ ইঞ্জিন একটি কোয়েরির সাথে প্রাসঙ্গিকতা অনুযায়ী ডকুমেন্ট র্যাঙ্ক করতে TF-IDF-উদ্ভূত সংকেত ব্যবহার করে — যে পেজে একটি কোয়েরি শব্দের উচ্চ TF-IDF স্কোর আছে তা সম্ভবত সত্যিই সেই বিষয় নিয়ে, শুধু শব্দটি ধারণকারী একটি পেজ নয়। SEO-র জন্য কীওয়ার্ড এক্সট্রাকশন একই যুক্তির ওপর নির্ভর করে: একটি ভালো-র্যাঙ্কড পেজের উচ্চ-TF-IDF শব্দগুলো প্রকাশ করে সার্চ ইঞ্জিন পেজটিকে কী নিয়ে বলে ব্যাখ্যা করছে। ডকুমেন্ট সাদৃশ্য গণনা করা হয় প্রতিটি ডকুমেন্টের জন্য একটি TF-IDF ভেক্টর তৈরি করে ভেক্টরগুলোর মধ্যকার কোণের কোসাইন পরিমাপ করে — একই বিষয় আলোচনাকারী দুটি ডকুমেন্টের উচ্চ কোসাইন সাদৃশ্য থাকবে কারণ তাদের উচ্চ-TF-IDF শব্দগুলো মিলে যায়। প্ল্যাজিয়ারিজম শনাক্তকরণ টুল সন্দেহজনকভাবে অনুরূপ অনুচ্ছেদ খুঁজতে একই পদ্ধতি ব্যবহার করে। ব্যবহারিক SEO ব্যবহারের ক্ষেত্রে, এই টুল যে ওয়ার্ড ফ্রিকোয়েন্সি বিশ্লেষণ তৈরি করে তা কার্যত একটি একক-ডকুমেন্ট TF গণনা: stop-word অপসারণের পর উচ্চ-ফ্রিকোয়েন্সি কনটেন্ট শব্দগুলোই সেই প্রার্থী যারা বৃহত্তর কর্পাসের বিপরীতে ওজন করা হলে উচ্চ TF-IDF স্কোর অর্জন করার সম্ভাবনা সবচেয়ে বেশি।
BERT ও তার উত্তরসূরিদের মতো আধুনিক transformer-ভিত্তিক মডেল NLP-কে bag-of-words উপস্থাপনার অনেক বাইরে নিয়ে গেছে। তারা বোঝে যে ‘bank’-এর অর্থ ‘river bank’ ও ‘bank account’-এ ভিন্ন, যে নেতিবাচকতা অর্থ পাল্টে দেয়, এবং যে বাক্য গঠন গুরুত্বপূর্ণ — যার কোনোটিই কাঁচা ওয়ার্ড ফ্রিকোয়েন্সি ধরতে পারে না। তবুও ওয়ার্ড ফ্রিকোয়েন্সি বিশ্লেষণ অপ্রচলিত হয়ে যায়নি। দ্রুত কনটেন্ট অডিট, সম্পাদকীয় পর্যালোচনা, কীওয়ার্ড ডেনসিটি যাচাই এবং ভোকাবুলারি ডাইভার্সিটি বিশ্লেষণের জন্য, একটি ব্রাউজারে মিলিসেকেন্ডে গণনা করা একটি ফ্রিকোয়েন্সি টেবিল একটি transformer inference কাজ চালানোর চেয়ে বহুগুণ সস্তা, কোনো অবকাঠামোর প্রয়োজন হয় না এবং তাৎক্ষণিকভাবে ব্যাখ্যাযোগ্য ফলাফল দেয়। TF-IDF নিজেই full-text search-এর জন্য Elasticsearch ও Apache Solr-এর ভেতরে ব্যাপক প্রোডাকশন ব্যবহারে রয়ে গেছে। আপনার লেখার ফ্রিকোয়েন্সি বণ্টন দেখতে কেমন তা বোঝা হলো উপলব্ধ সবচেয়ে দ্রুত প্রথম-ধাপের রোগনির্ণয় — যা ঠিক এই টুলই সরবরাহ করে।
Frequently asked questions
লেখায় শব্দের ফ্রিকোয়েন্সি কীভাবে গণনা করব?
আপনার লেখাটি বক্সে পেস্ট করুন বা টাইপ করুন। টুলটি সঙ্গে সঙ্গে প্রতিটি শব্দকে টোকেনে ভাগ করে, গণনা করে প্রতিটি কতবার এসেছে এবং সবচেয়ে বেশি থেকে সবচেয়ে কম ফ্রিকোয়েন্ট অনুসারে র্যাঙ্ক করে। উদাহরণস্বরূপ, একটি ৫০০-শব্দের ব্লগ পোস্ট যদি ‘content’ শব্দটি ১২ বার ব্যবহার করে, টেবিল দেখাবে: content — ১২ — ২.৪%। একক শব্দের বদলে bigram বা trigram বিশ্লেষণ করতে phrase-length সিলেক্টর ২ বা ৩-এ পাল্টান। সবকিছু আপনার ব্রাউজারে client-side চলে, তাই কোনো আপলোড নেই, অপেক্ষার সময় নেই এবং আপনি কত লেখা পেস্ট করবেন তার কোনো সীমা নেই। যেসব টুল আপনার লেখা সার্ভারে পাঠায় তাদের বিপরীতে, আপনার কনটেন্ট কখনও আপনার ডিভাইস ছেড়ে যায় না — গোপনীয় ডকুমেন্ট বা অপ্রকাশিত খসড়া বিশ্লেষণের সময় যা কাজে লাগে।
আমার লেখার সবচেয়ে সাধারণ শব্দ কোনটি?
সবচেয়ে সাধারণ শব্দ সবসময় ফ্রিকোয়েন্সি টেবিলে #১ র্যাঙ্কে থাকে। ব্যাকরণিক ফিলারের বদলে অর্থবহ কনটেন্ট শব্দ সামনে আনতে ‘Exclude stop words’ টগল চালু করুন — ‘the’, ‘and’, ‘of’-এর মতো ফাংশন শব্দ ফলাফল থেকে সরে যায়, আর সবচেয়ে ফ্রিকোয়েন্ট কনটেন্ট শব্দটি উপরে উঠে আসে। SEO অডিটের জন্য এটি বিশেষ কার্যকর: stop word ফিল্টার করার পর আপনার প্রধান কীওয়ার্ডটির তালিকার উপরের দিকে ১–২% ডেনসিটিতে থাকা উচিত। যদি এটি শীর্ষ ১০-এ একেবারেই না আসে, তাহলে কনটেন্টটি সেই শব্দের জন্য কম-অপ্টিমাইজড হতে পারে।
আমার লেখায় পুনরাবৃত্ত বা অতিরিক্ত ব্যবহৃত শব্দ কীভাবে খুঁজব?
stop word বাদ দিয়ে আপনার খসড়া পেস্ট করুন। মোট শব্দের ২–৩%-এর বেশি আসা যেকোনো কনটেন্ট শব্দ সম্ভবত অতিরিক্ত ব্যবহৃত। একটি ১,০০০-শব্দের প্রবন্ধের জন্য, ২৫ বা তার বেশি বার আসা একটি শব্দ (≥২.৫%) একটি সমার্থক শব্দের প্রার্থী। প্রতিটি শব্দের পাশের ফ্রিকোয়েন্সি বার এক নজরেই ভারী শব্দগুলো স্পষ্ট করে, প্রতিটি সংখ্যা খুঁটিয়ে দেখতে হয় না। সম্পাদকীয় কাজের জন্য এটি Microsoft Word-এর Ctrl+H খোঁজা-ও-গণনা ওয়ার্কফ্লো-এর চেয়ে দ্রুত, যেখানে প্রতিটি শব্দ আলাদাভাবে যাচাই করতে হয়। লেখকরা প্রবন্ধে মৌখিক অভ্যাস, মার্কেটিং কপিতে পুনরাবৃত্ত বাক্যাংশ এবং ব্লগ পোস্টে কীওয়ার্ড-স্টাফিং প্যাটার্ন জমা দেওয়ার আগে ধরতে এটি ব্যবহার করেন।
COUNTIF দিয়ে Excel-এ ওয়ার্ড ফ্রিকোয়েন্সি কীভাবে গণনা করব?
Excel-এ আপনি COUNTIF ব্যবহার করবেন — যেমন =COUNTIF($A:$A,"design") — কিন্তু তা একবারে একটি শব্দ গণনা করে। একটি পূর্ণ ফ্রিকোয়েন্সি বিশ্লেষণের জন্য প্রথমে আপনার একটি অনন্য শব্দ তালিকা প্রয়োজন (সাধারণত Power Query বা array formula দিয়ে তৈরি), তারপর প্রতিটি অনন্য শব্দের জন্য একটি COUNTIF। এই অনলাইন কাউন্টার সেই সবকিছুর বিকল্প: আপনার লেখা পেস্ট করুন এবং সেকেন্ডে কীওয়ার্ড ডেনসিটি শতাংশসহ একটি সম্পূর্ণ র্যাঙ্ক করা ফ্রিকোয়েন্সি টেবিল পান, কোনো সূত্র নেই, কোনো হাতে কাজ নেই। ফলাফলটি CSV হিসেবে এক্সপোর্ট করুন Excel-এ চার্টিং বা আরও বিশ্লেষণের জন্য খুলতে। নতুন কনটেন্ট বিশ্লেষণের প্রতিবার COUNTIF যুক্তি নতুন করে গড়ার চেয়ে এটি অনেক দ্রুত।
কীওয়ার্ড ডেনসিটি কী এবং কীভাবে গণনা করব?
কীওয়ার্ড ডেনসিটি হলো একটি লেখায় মোট শব্দের যে শতাংশ একটি নির্দিষ্ট শব্দ উপস্থাপন করে। সূত্র: (শব্দের সংখ্যা ÷ মোট শব্দ) × ১০০। SEO-র জন্য একটি প্রধান কীওয়ার্ডের স্বাভাবিক ডেনসিটি সাধারণত ১–২%; ৩–৪%-এর বেশি হলে তা সার্চ ইঞ্জিনের কাছে অতিরিক্ত-অপ্টিমাইজড দেখাতে পারে এবং স্প্যাম ফিল্টার সক্রিয় করতে পারে। এই টুলের Density কলাম প্রতিটি শব্দের শতাংশ দেখায়, যাতে আপনি নিজে গণিত না করেই স্টাফ করা শব্দ চিহ্নিত ও ঠিক করতে পারেন। Ahrefs ও SEMrush-এর মতো বেশিরভাগ SEO প্ল্যাটফর্ম কীওয়ার্ড-স্টাফিং ঝুঁকি চিহ্নিত করে, কিন্তু এখানে একটি দ্রুত ফ্রিকোয়েন্সি যাচাই চালাতে কিছু খরচ হয় না এবং প্রকাশের আগে একই সংকেত দেয়।
দুই- বা তিন-শব্দের বাক্যাংশ (bigram ও trigram) কীভাবে গণনা করব?
Phrase length সিলেক্টর ২ (bigram) বা ৩ (trigram)-এ সেট করুন। টুলটি আপনার সম্পূর্ণ লেখা জুড়ে প্রতিটি পরপর জোড়া বা ত্রয়ী শব্দ ক্রমানুসারে গণনা করে। উদাহরণস্বরূপ, একটি পণ্য বর্ণনার bigram বিশ্লেষণ দেখাতে পারে ‘free shipping’ ৪ বার এবং ‘next-day delivery’ ৩ বার এসেছে — যা ‘shipping’ আলাদাভাবে ৭ বার এসেছে তা জানার চেয়ে কনটেন্ট কৌশলের জন্য অনেক বেশি কার্যকর। bigram ও trigram ফ্রিকোয়েন্সি হলো সেই উপায় যার মাধ্যমেও সার্চ ইঞ্জিন একক কীওয়ার্ডের বাইরে বিষয়ভিত্তিক প্রাসঙ্গিকতার সংকেত চিহ্নিত করে, যা on-page SEO কাজ করা যেকোনো কনটেন্ট টিমের জন্য এই বিশ্লেষণকে উপযোগী করে তোলে।
‘the’, ‘a’, ‘and’-এর মতো সাধারণ শব্দ (stop word) কীভাবে বাদ দেব?
‘Exclude stop words’ চালু করুন। বিল্ট-ইন তালিকাটি সবচেয়ে সাধারণ ইংরেজি ফাংশন শব্দগুলো ঢেকে ফেলে — আর্টিকেল (a, an, the), সমন্বয়কারী সংযোজক (and, but, or, for, so, yet, nor), সাধারণ পূর্বসর্গ (in, on, at, of, to, by, from, with, about, into) এবং সাধারণ সর্বনাম (I, you, he, she, it, we, they)। stop word বাদ দিলে ফ্রিকোয়েন্সি টেবিলে শুধু অর্থবহ কনটেন্ট শব্দ থাকে। এটি কীওয়ার্ড ডেনসিটি বিশ্লেষণের আগের আদর্শ ধাপ — এটি ছাড়া লেখাটি আসলে কী নিয়ে তা নির্বিশেষে ‘the’ ও ‘of’ সবসময় শীর্ষ অবস্থানে প্রাধান্য বিস্তার করত।
ওয়ার্ড ফ্রিকোয়েন্সি গণনা কি case-sensitive?
ডিফল্টভাবে Ignore case চালু থাকে, তাই ‘Word’, ‘WORD’ এবং ‘word’ সবই একই শব্দ হিসেবে গণনা হয় — যা ইংরেজি গদ্যের জন্য প্রায় সবসময়ই কাঙ্ক্ষিত আচরণ। ছোট ও বড় হাতের অক্ষরকে আলাদা টোকেন হিসেবে গণ্য করতে চাইলে Ignore case বন্ধ করুন। কেসিং যখন অর্থ বহন করে তখন এটি কাজে লাগে, যেমন সংক্ষিপ্ত রূপ ‘API’-কে কল্পিত ছোট হাতের ‘api’ থেকে আলাদা করা, বা প্রোগ্রামিং কোড বিশ্লেষণ যেখানে ভেরিয়েবল নাম case-sensitive। case-sensitivity টগল সব phrase length-এ প্রযোজ্য, তাই এটি একক-শব্দ গণনা এবং bigram বা trigram ফ্রিকোয়েন্সি বিশ্লেষণ উভয়ের জন্যই কাজ করে।
Python-এ ওয়ার্ড ফ্রিকোয়েন্সি কীভাবে গণনা করব?
স্ট্যান্ডার্ড Python পদ্ধতি collections.Counter ব্যবহার করে: `from collections import Counter; Counter(text.lower().split())`। এটি শব্দ থেকে সংখ্যার একটি ডিকশনারি দেয়, `.most_common(N)` দিয়ে সবচেয়ে সাধারণ অনুসারে সাজানো। যতিচিহ্ন সামলানো আরও দৃঢ় টোকেনাইজেশনের জন্য `nltk` লাইব্রেরি ব্যবহার করুন: `from nltk.tokenize import word_tokenize; Counter(word_tokenize(text.lower()))`। এই অনলাইন টুল তার তাৎক্ষণিক, কোড-হীন সমতুল্য — আপনার লেখা পেস্ট করুন এবং সেকেন্ডে একই র্যাঙ্ক করা ফ্রিকোয়েন্সি টেবিল পান, কোনো কোড লেখা বা কোনো লাইব্রেরি ইনস্টল করা ছাড়াই। Python pandas বা ডেটা ভিজ্যুয়ালাইজেশন টুলের উপযুক্ত ফরম্যাটে ডেটা দরকার হলে CSV হিসেবে এক্সপোর্ট করুন।
ওয়ার্ড ফ্রিকোয়েন্সি কাউন্টার কি অফলাইনে কাজ করে?
হ্যাঁ — সম্পূর্ণভাবে। পেজটি প্রথমে লোড হওয়ার পর, সমস্ত প্রসেসিং JavaScript ব্যবহার করে আপনার ব্রাউজারে ঘটে। কোনো পর্যায়েই কোনো সার্ভারে কোনো ডেটা পাঠানো হয় না এবং পরবর্তী বিশ্লেষণের জন্য কোনো ইন্টারনেট সংযোগের দরকার হয় না। আপনার লেখা আপনার ডিভাইসেই থাকে, তাই গোপনীয় ডকুমেন্ট, অপ্রকাশিত খসড়া, অভ্যন্তরীণ সার্ভে উত্তর এবং সংবেদনশীল ব্যবসায়িক কপিও বিশ্লেষণ করা নিরাপদ। এটি সার্ভার-ভিত্তিক টুল যেমন অনেক অনলাইন কীওয়ার্ড ডেনসিটি চেকার — যারা জমা দেওয়া লেখা লগ করে — তাদের চেয়ে বেশি প্রাইভেট করে তোলে। এটিকে এমন একটি লোকাল অ্যাপ হিসেবে ভাবুন যা ঘটনাক্রমে আপনার ব্রাউজার ট্যাবে থাকে।
ওয়ার্ড ফ্রিকোয়েন্সি ফলাফল কীভাবে এক্সপোর্ট করব?
প্রতিটি শব্দের র্যাঙ্ক, term, সংখ্যা এবং ডেনসিটি ধারণকারী সম্পূর্ণ ফ্রিকোয়েন্সি টেবিলটি একটি কমা-বিভক্ত ফাইল হিসেবে ডাউনলোড করতে Export CSV-তে ক্লিক করুন। আরও বিশ্লেষণ, চার্টিং বা টিমের সাথে শেয়ার করার জন্য এটি Excel, Google Sheets, Tableau বা যেকোনো ডেটা টুলে খুলুন। শীর্ষ ২০০ সারি ট্যাব-বিভক্ত টেক্সট হিসেবে ক্লিপবোর্ডে কপি করতে Copy table-এ ক্লিকও করতে পারেন, যা সরাসরি একটি স্প্রেডশিটে পেস্ট করার জন্য প্রস্তুত। CSV এক্সপোর্ট প্রতিযোগী বিশ্লেষণ করা কনটেন্ট টিমের জন্য কাজে লাগে — প্রতিযোগীর পেজে একই ফ্রিকোয়েন্সি যাচাই চালান এবং কীওয়ার্ড ফাঁক চিহ্নিত করতে CSV-গুলো পাশাপাশি তুলনা করুন।
ওয়ার্ড কাউন্ট এবং ওয়ার্ড ফ্রিকোয়েন্সির মধ্যে পার্থক্য কী?
ওয়ার্ড কাউন্ট (মোট শব্দ) একটি একক সমষ্টিগত সংখ্যা — প্রতিটি পুনরাবৃত্তিসহ লেখার সমস্ত শব্দের মোট সংখ্যা। ওয়ার্ড ফ্রিকোয়েন্সি একটি প্রতি-শব্দ বিভাজন: প্রতিটি পৃথক শব্দ কতবার এসেছে। একটি ৫০০-শব্দের প্রবন্ধের ওয়ার্ড কাউন্ট ৫০০, কিন্তু তার ফ্রিকোয়েন্সি টেবিল দেখাতে পারে ‘the’ ২৮ বার (৫.৬%), ‘design’ ৯ বার (১.৮%), ‘user’ ৭ বার (১.৪%) এবং প্রতিটি অনন্য শব্দ জুড়ে এভাবে আসে। ওয়ার্ড কাউন্ট আপনাকে দৈর্ঘ্য বলে; ওয়ার্ড ফ্রিকোয়েন্সি ভোকাবুলারি গঠন বলে। দুটোই কাজের — ফরম্যাট মেনে চলতে ওয়ার্ড কাউন্ট, সম্পাদকীয় মান ও SEO অপ্টিমাইজেশনের জন্য ওয়ার্ড ফ্রিকোয়েন্সি।
Microsoft Word-এ ওয়ার্ড ফ্রিকোয়েন্সি কীভাবে যাচাই করব?
Microsoft Word-এ কোনো বিল্ট-ইন ওয়ার্ড ফ্রিকোয়েন্সি টুল নেই। সবচেয়ে কাছাকাছি বিকল্প হলো Ctrl+H (Find & Replace), ‘More’-এ ক্লিক করে তারপর একটি নির্দিষ্ট শব্দের জন্য ‘Find All’ — এটি প্রতিটি উদাহরণ হাইলাইট করে এবং শুধু সেই একটি শব্দের জন্য স্ট্যাটাস বারে একটি সংখ্যা দেখায়। আপনি যে প্রতিটি শব্দ যাচাই করতে চান তার জন্য এটি পুনরাবৃত্তি করতে হবে, যা একটি পূর্ণ ভোকাবুলারি অডিটের জন্য অবাস্তব। বরং এখানে আপনার লেখা পেস্ট করে এক ধাপে প্রতিটি শব্দের একটি সম্পূর্ণ র্যাঙ্ক করা ফ্রিকোয়েন্সি টেবিল পান, সাথে কীওয়ার্ড ডেনসিটি শতাংশ ও CSV এক্সপোর্ট অন্তর্ভুক্ত। Word যা স্বাভাবিকভাবে সমর্থন করে না তা করার এটিই দ্রুততম উপায়।
ফ্রিকোয়েন্সি গণনা ও কীওয়ার্ড ডেনসিটির সূত্র কী?
পরম ফ্রিকোয়েন্সি গণনা: শুধু গণনা করুন লক্ষ্য শব্দটি সম্পূর্ণ লেখায় কতবার এসেছে। আপেক্ষিক ফ্রিকোয়েন্সি (কীওয়ার্ড ডেনসিটি): (সংখ্যা ÷ মোট শব্দ) × ১০০। একটি ২০০-শব্দের লেখায় যেখানে ‘design’ ৬ বার আসে: ফ্রিকোয়েন্সি = ৬, ডেনসিটি = (৬ ÷ ২০০) × ১০০ = ৩.০%। এই টুলের টেবিলে প্রতিটি শব্দের জন্য উভয় মান পাশাপাশি দেখা যায়। bigram-এর জন্য: ঠিক দুই-শব্দের ক্রমটি কতবার পরপর এসেছে তা গণনা করুন, তারপর মোট bigram সংঘটন (মোট শব্দ বিয়োগ ১) দিয়ে ভাগ করে ১০০ দিয়ে গুণ করুন bigram ডেনসিটির জন্য। টুলটি এই সমস্ত স্বয়ংক্রিয়ভাবে গণনা করে — কোনো হাতে গণিতের দরকার নেই।
এই ওয়ার্ড ফ্রিকোয়েন্সি কাউন্টার কি ফ্রি এবং প্রাইভেট?
দুটোতেই হ্যাঁ। টুলটি সম্পূর্ণ ফ্রি, কোনো সাইনআপ নেই, কোনো অ্যাকাউন্ট নেই এবং কোনো ব্যবহার সীমা নেই — যত খুশি লেখা পেস্ট করুন। প্রাইভেসি: সমস্ত প্রসেসিং JavaScript ব্যবহার করে আপনার ব্রাউজারে চলে। আপনার লেখা কখনও কোনো সার্ভারে পাঠানো হয় না, কখনও কোনো ডেটাবেসে সংরক্ষণ হয় না এবং কখনও অ্যানালিটিক্সের জন্য ব্যবহৃত হয় না। এটি ক্লায়েন্ট কপি, আইনি ডকুমেন্ট, অভ্যন্তরীণ রিপোর্ট বা এমন যেকোনো লেখা যা আপনি ইন্টারনেটে প্রেরণ করতে চান না তার সাথে ব্যবহার করা নিরাপদ করে তোলে। wordfreq.info ও অনেক কীওয়ার্ড ডেনসিটি চেকারের মতো টুল লেখা সার্ভার-সাইডে প্রসেস করে — UtiloKit-এর কাউন্টার নকশাগতভাবে সবকিছু লোকাল রাখে।
Related tools
সব টুল দেখুনওয়ার্ড আনস্ক্র্যাম্বলার
এলোমেলো অক্ষর সাজিয়ে সব বৈধ শব্দ বের করুন — ওয়াইল্ডকার্ড, ফিল্টার ও Scrabble পয়েন্টসহ।
Citation Generator
Format references in APA, MLA and Chicago styles — book, journal, website and more.
Anagram Solver
Find all words from any set of letters instantly — wildcard support, Scrabble scores and word-length filter.
ASCII Art Generator
Convert text to ASCII art banners with 7 font styles. One-click copy, Markdown export, works offline.
Character Counter
Count characters, words, sentences & lines in real time. Platform limit bars for Twitter/X, LinkedIn, SMS & Instagram. No upload.
Text Repeater
Repeat any text N times with custom separator (newline, comma, space, pipe, or custom). Copy or download output. No limits, no signup.