Skip to content
টেক্সট থেকে স্পিচ
Tools

টেক্সট থেকে স্পিচ

নতুন

নির্বাচনযোগ্য ভয়েস, রেট ও পিচ সহ টেক্সট জোরে পড়ুন — আপনার ব্রাউজারে।

0 characters
Speed 1.0×
0.5×2.0×
Pitch 1.0
LowHigh
Volume 100%
SilentFull
Read-along pane
Text will appear here as it's read…

Built-in voices, not AI. Uses your device's system voices via the Web Speech API — not cloud AI/neural voices like ElevenLabs or Speechify. MP3 export is not available (the browser doesn't expose the audio stream). Works offline once voices are installed.

Runs entirely in your browser. Nothing is uploaded.

আপনার ব্রাউজারে একটি ফ্রি, আনলিমিটেড টেক্সট টু স্পিচ রিডার

এই টেক্সট টু স্পিচ টুল আপনার নিজের ডিভাইসে বিল্ট-ইন ভয়েস ব্যবহার করে যেকোনো টেক্সট জোরে পড়ে শোনায়। আপনার টেক্সট পেস্ট করুন, একটি ভয়েস বেছে নিন, স্পিড ও পিচ সেট করুন, এবং Play চাপুন — ইনস্টল করার কিছু নেই, সাইন-আপ নেই, এবং শব্দ বা ক্যারেক্টারের কোনো সীমা নেই। এটি একটি অনলাইন TTS রিডার যা সত্যিকার অর্থে ফ্রি ও আনলিমিটেড, কারণ স্পিচ একটি মিটার্ড সার্ভারের বদলে স্থানীয়ভাবে তৈরি হয়।

শোনার জন্য Play চাপুন, বিরতি নিতে Pause, এবং রিসেট করতে Stop। এটি পড়ার সময়, বর্তমান শব্দটি রিড-অ্যালং প্যানে হাইলাইট হয় যাতে আপনি অনুসরণ করতে পারেন, এবং একটি প্রোগ্রেস বার দেখায় আপনি টেক্সটের কতটা এগিয়েছেন। যত্নশীল অধ্যয়নের জন্য ০.৫× গতিতে ধীর করতে বা স্কিম করতে ২× পর্যন্ত দ্রুত করতে Speed স্লাইডার ব্যবহার করুন — আপনার সেটিংস পরের বারের জন্য মনে রাখা হয়।

এটি কীভাবে কাজ করে: Web Speech API ও আপনার ডিভাইসের ভয়েস

এর পেছনে, টুলটি ব্রাউজারের বিল্ট-ইন Web Speech API (speechSynthesis ইন্টারফেস) ব্যবহার করে টেক্সটকে আপনার অপারেটিং সিস্টেম ইতিমধ্যে সরবরাহ করা ভয়েস দিয়ে কথা বলা অডিওতে পরিণত করে। এটি একটি গুরুত্বপূর্ণ সততার বিষয়: এগুলো ক্লাসিক সিস্টেম ভয়েস, ক্লাউড-ভিত্তিক নিউরাল বা 'AI' ভয়েস নয়। ElevenLabs, Speechify বা NaturalReader-এর পেইড টিয়ার থেকে AI ভয়েস বেশি মানবিক শোনায় কিন্তু একটি সার্ভারে চলে এবং একটি অ্যাকাউন্ট ও পেমেন্ট দরকার হয়।

স্থানীয়ভাবে এটি করার সুবিধা যথেষ্ট বড় — রিডারটি ফ্রি, কোনো ব্যবহারের সীমা নেই, আপনার টেক্সট সম্পূর্ণভাবে প্রাইভেট রাখে, এবং আপনার ভয়েস লোড হওয়ার পর অফলাইনেও কাজ করে। ট্রেড-অফ শুধু এটাই যে ভয়েসগুলো প্রিমিয়াম সার্ভিসের চেয়ে সামান্য বেশি রোবোটিক শোনাতে পারে, এবং ঠিক কী কী ভয়েস ও ভাষা পাওয়া যায় তা আপনার ডিভাইসের উপর নির্ভর করে।

একটি ভয়েস, ভাষা, স্পিড ও পিচ বেছে নিন

আপনার চাওয়া ভাষায় তালিকা সংকুচিত করতে ভাষা ফিল্টার ব্যবহার করুন, তারপর আপনার সিস্টেমে ইনস্টল করা প্রতিটি ভয়েস থেকে বেছে নিন। Speed স্লাইডার (০.৫× থেকে ২×) ভাষা শেখা বা স্কিম করার জন্য স্পিচকে ধীর বা দ্রুত করতে দেয়, Pitch স্লাইডার টোন উঁচু বা নিচু করে, এবং একটি Volume কন্ট্রোল আওয়াজ সেট করে। আপনার পছন্দগুলো পরের বারের জন্য স্বয়ংক্রিয়ভাবে সংরক্ষিত হয়।

আরও ভয়েস চান? আপনার অপারেটিং সিস্টেমের স্পিচ সেটিংস থেকে অতিরিক্ত ভাষা ও 'natural' ভয়েস ইনস্টল করুন এবং এগুলো স্বয়ংক্রিয়ভাবে তালিকায় দেখা যাবে। Windows-এ: Settings > Time & Language > Speech। macOS-এ: System Settings > Accessibility > Spoken Content।

লম্বা ডকুমেন্ট পড়ুন ও এটি বলার সাথে সাথে অনুসরণ করুন

যত ইচ্ছা টেক্সট পেস্ট করুন। লম্বা প্যাসেজ স্বয়ংক্রিয়ভাবে বাক্য-আকারের অংশে ভাগ হয়ে ক্রমানুসারে সারিবদ্ধ হয়, যা প্রায় ১৫ সেকেন্ড পর একটি একক লম্বা উক্তি থেমে যাওয়ার সুপরিচিত ব্রাউজার সীমাবদ্ধতা এড়িয়ে যায়। ফলাফল হলো পুরো আর্টিকেল, অধ্যায় ও রিপোর্টের মসৃণ, নিরবচ্ছিন্ন পাঠ।

ওয়ার্ড হাইলাইটিং চালু থাকলে, টুলটি কথিত হওয়ার সময় বর্তমান শব্দ ট্র্যাক করে এবং এটি ভিউতে স্ক্রল করে — একটি ক্যারাওকে-স্টাইল রিড-অ্যালং অভিজ্ঞতা যা আপনার জায়গা ধরে রাখা, নিজের লেখা কানে প্রুফরিড করা, বা শোনার সময় পড়াশোনা করা সহজ করে তোলে।

Speechify, NaturalReader ও অন্যান্য TTS টুলের তুলনায় এটি কেমন

Speechify সবচেয়ে বেশি প্রচারিত TTS অ্যাপ — এটি চমৎকার AI ভয়েস ও একটি মসৃণ মোবাইল অ্যাপ দেয়, কিন্তু ফ্রি টিয়ার প্রতি মাসে ঘণ্টায় সীমাবদ্ধ এবং প্রিমিয়াম প্ল্যানের খরচ বছরে $১৩৯। NaturalReader অনলাইনের একটি ফ্রি টিয়ার আছে যাতে দৈনিক ক্যারেক্টার সীমা আছে, এবং প্রাকৃতিক AI ভয়েসের জন্য একটি পেইড সাবস্ক্রিপশন দরকার। Read&Write (আগে TextHelp) শিক্ষায় জনপ্রিয় কিন্তু প্রতি স্কুল লাইসেন্স অনুযায়ী দাম নেওয়া হয়। Chrome এক্সটেনশন 'Read Aloud' ফ্রি ও সুবিধাজনক কিন্তু এই টুলের মতোই সিস্টেম ভয়েস ব্যবহার করে — শুধু ওয়ার্ড-হাইলাইট রিড-অ্যালং ভিউ ছাড়া।

এই UtiloKit TTS রিডার সম্পূর্ণভাবে ফ্রি, কোনো দৈনিক সীমা ছাড়া, কোনো অ্যাকাউন্ট ছাড়া, এবং কোথাও কোনো ফাইল আপলোড ছাড়া। AI-মানের ভয়েস ও অফলাইন মোবাইল প্লেব্যাক দরকার হলে এটি Speechify-এর বদলি হবে না — কিন্তু একটি খসড়া জোরে পড়া, একটি লম্বা আর্টিকেল অধ্যয়ন করা, বা উচ্চারণ যাচাই করার জন্য, এটি উপলব্ধ সবচেয়ে দ্রুত জিরো-ফ্রিকশন অপশন।

অ্যাক্সেসিবিলিটি, শেখা ও প্রতিদিনের ব্যবহার

টেক্সট জোরে পড়া একটি শক্তিশালী অ্যাক্সেসিবিলিটি ও প্রোডাক্টিভিটি সহায়ক। শব্দ হাইলাইট হওয়ার সময় শোনা ডিসলেক্সিয়া, ADHD বা কম দৃষ্টিশক্তির মানুষদের সাহায্য করতে পারে, এবং এটি প্রুফরিডিংয়ের জন্য দারুণ (স্ক্রিনে দেখে যেসব ভুল আপনি স্কিপ করে যেতেন সেগুলো ধরা পড়ে), নতুন ভাষায় উচ্চারণ শেখার জন্য, বা একটি আর্টিকেলকে আপনি শুনতে পারেন এমন কিছুতে পরিণত করে চোখ বিশ্রাম দেওয়ার জন্য। এটি একটি চিকিৎসা ডিভাইসের বদলে একটি পড়ার সহায়ক, তাই ফলাফল ব্যক্তিভেদে ভিন্ন হয়।

টুলটি একটি সাধারণ প্রোডাক্টিভিটি সহায়ক হিসেবেও সমানভাবে উপযোগী: হাঁটার সময় মিটিং নোট শুনুন, কানে একটি লম্বা ইমেইল রিভিউ করুন, বা পাঠানোর আগে আপনার লেখার একটি চূড়ান্ত প্রুফরিড চালান। এটি আনলিমিটেড হওয়ায়, আপনি এতে পুরো খসড়া দিতে পারেন — শুধু এক প্যারাগ্রাফ নয়।

প্রাইভেট, তাৎক্ষণিক ও ফ্রি

সাইন আপ করার কিছু নেই এবং দেওয়ার কিছু নেই। প্রতিটি শব্দ আপনার নিজের ডিভাইসে আপনার ব্রাউজারের বিল্ট-ইন স্পিচ ইঞ্জিন দিয়ে সংশ্লেষিত হয়, তাই আপনার টেক্সট কখনো আপলোড বা সংরক্ষণ হয় না। আপনি যদি গোপনীয় নোট, মেডিকেল টেক্সট বা এমন কিছু পড়ছেন যা একটি ক্লাউড সার্ভারে পাঠাতে চান না, তাহলে এটি গুরুত্বপূর্ণ। এই টেক্সট টু স্পিচ রিডার বুকমার্ক করুন এবং যখনই লেখাকে স্পিচে পরিণত করতে চান — প্রাইভেটভাবে, তাৎক্ষণিকভাবে ও সীমা ছাড়া — এটি ব্যবহার করুন।

বাজবাজে রোবট থেকে নিউরাল ভয়েস: TTS প্রযুক্তি কীভাবে বিকশিত হলো

সিন্থেটিক স্পিচের সবচেয়ে পুরোনো পদ্ধতি হলো ফরম্যান্ট সিন্থেসিস, যা মানুষের ভোকাল ট্র্যাক্টের একটি গাণিতিক মডেল তৈরি করে এবং সিমুলেটেড রেজোন্যান্সের মধ্য দিয়ে একটি বাজ শব্দের উৎস ফিল্টার করে শব্দ তৈরি করে। ফলাফল ছিল স্পষ্টভাবে কৃত্রিম — সেই ফাটা, একঘেয়ে ভয়েস যা বেশিরভাগ মানুষ প্রাথমিক কম্পিউটারের সাথে যুক্ত করে। DECTalk, ১৯৮৪ সালে মুক্তি পাওয়া, ফরম্যান্ট সিন্থেসিসের সেরা রূপ ছিল: ভাষাবিদ Dennis Klatt-এর সূক্ষ্মভাবে টিউন করা প্যারামিটার একটি ভয়েস তৈরি করেছিল যা চিকিৎসাগতভাবে ব্যবহারের মতো যথেষ্ট স্পষ্ট ছিল। পদার্থবিদ Stephen Hawking ১৯৮৬ সালে DECTalk গ্রহণ করেন এবং প্রায় তিন দশক এটি ধরে রাখেন, আরও অনেক বেশি স্বাভাবিক বিকল্প পাওয়া যাওয়ার পরও — তিনি বলেছিলেন ভয়েসটি সহজভাবে তার পরিচয়ের অংশ হয়ে গিয়েছিল।

কনক্যাটেনেটিভ সিন্থেসিস ১৯৯০ ও ২০০০-এর দশকে ফরম্যান্ট মডেল প্রতিস্থাপন করে একজন আসল বক্তার হাজার হাজার সংক্ষিপ্ত স্পিচ সেগমেন্ট — ফোনিম, ডাইফোন ও ট্রাইফোন — রেকর্ড করে, তারপর রানটাইমে সঠিক সেগমেন্টগুলো একসাথে জোড়া দিয়ে। এই কৌশলটি রোবোটিক বাজ শব্দ নাটকীয়ভাবে কমিয়ে দিয়েছিল, কিন্তু সেগমেন্টগুলোর মধ্যে জোড়াগুলো শ্রবণযোগ্য অসামঞ্জস্য তৈরি করত, এবং প্রতিটি নতুন ভয়েসের জন্য শত শত ঘণ্টা স্টুডিও রেকর্ডিং দরকার হতো। এরপর আসা Hidden Markov Model (HMM) পদ্ধতি, Festival Speech Synthesis System-এর মতো সিস্টেমে ব্যবহৃত, রেকর্ড করা ডেটাবেসের বদলে স্পিচ ডেটার উপর প্রশিক্ষিত স্ট্যাটিস্টিক্যাল মডেল দিয়ে প্রতিস্থাপন করেছিল: মসৃণ ট্রানজিশন, কম মেমরি প্রয়োজনীয়তা, কিন্তু তারপরও চেনা যায় এমন সিন্থেটিক। নির্ণায়ক লাফটি এসেছিল ২০১৬ সালে, যখন Google DeepMind WaveNet প্রকাশ করে — একটি ডিপ কনভোলিউশনাল নিউরাল নেটওয়ার্ক যা মানুষের স্পিচের একটি শেখা মডেল থেকে স্যাম্পল-বাই-স্যাম্পল অডিও ওয়েভফর্ম তৈরি করে। শ্রবণ পরীক্ষায়, WaveNet এমন স্পিচ তৈরি করেছিল যা প্রাকৃতিক স্পিচের এত কাছাকাছি যে আগের সিস্টেমগুলো তুলনায় ভাঙা মনে হতো। নিউরাল TTS-এর যুগ শুরু হয়ে গিয়েছিল।

আধুনিক নিউরাল TTS সিস্টেম WaveNet-এর ভিত্তির উপর গড়ে উঠেছে। Google-এর Tacotron 2 (২০১৭) WaveNet অডিও রেন্ডার করার আগে টেক্সটকে একটি মেল-স্পেক্ট্রোগ্রামে রূপান্তর করা একটি নিউরাল নেটওয়ার্ক যোগ করেছিল, পুরো পাইপলাইনকে এন্ড-টু-এন্ড শিক্ষণযোগ্য করে তুলেছিল। Microsoft-এর FastSpeech (২০১৯) Tacotron-কে ধীর করে তোলা অটোরিগ্রেসিভ বটলনেক সরিয়েছিল, সিন্থেসিস সময় একটি মাত্রার ক্রমে কমিয়ে দিয়েছিল। VITS (২০২১) দুই-স্টেজ আর্কিটেকচারকে একটি একক এন্ড-টু-এন্ড মডেলে সংকুচিত করেছিল, মধ্যবর্তী স্পেক্ট্রোগ্রাম সম্পূর্ণভাবে বাদ দিয়ে এবং আসল মানুষের স্পিচের সাথে ফাঁক আরও কমিয়ে দিয়ে। এই অগ্রগতিগুলো আজকের বেশিরভাগ ডেভেলপার ব্যবহার করেন এমন কমার্শিয়াল API-কে শক্তি দেয়: Amazon Polly (NTTS ভয়েস), Google Cloud TTS, Microsoft Azure Cognitive Services (১৪০+ ভাষা জুড়ে ৪০০+ ভয়েস), ElevenLabs (ছোট স্যাম্পল থেকে সবচেয়ে বাস্তবসম্মত ভয়েস ক্লোনিংয়ের জন্য পরিচিত), এবং OpenAI TTS API (GPT ইনফ্রাস্ট্রাকচারে নির্মিত ছয়টি ভয়েস)।

Web Speech API: ব্রাউজার কীভাবে কথা বলে

Web Speech API একটি W3C স্পেসিফিকেশন, ২০১২ সালে প্রথম খসড়া তৈরি হয়, যা ওয়েব ডেভেলপারদের কাছে দুটি সামর্থ্য প্রকাশ করে: আউটপুটের জন্য টেক্সট-টু-স্পিচ SpeechSynthesis এবং ইনপুটের জন্য স্পিচ-টু-টেক্সট SpeechRecognition। TTS একটি একক কল দিয়ে ট্রিগার হয় — window.speechSynthesis.speak(utterance) — যেখানে utterance-টি একটি SpeechSynthesisUtterance অবজেক্ট যা টেক্সট সাথে প্যারামিটার বহন করে: rate (০.১ থেকে ১০, যেখানে ১ স্বাভাবিক গতি), pitch (০ থেকে ২), volume (০ থেকে ১), lang (একটি BCP-47 ভাষা ট্যাগ যেমন en-US বা fr-FR), এবং speechSynthesis.getVoices()-এর ফেরত দেওয়া তালিকা থেকে একটি বেছে নেওয়া voice অবজেক্ট।

উপলব্ধ ভয়েস সম্পূর্ণভাবে অপারেটিং সিস্টেম ও ব্রাউজারের উপর নির্ভর করে। Windows-এ, API SAPI ভয়েস প্রকাশ করে — 'Natural' লেবেলযুক্ত Microsoft নিউরাল ভয়েস (Aria, Jenny, Guy) যেকোনো জায়গায় উপলব্ধ সবচেয়ে বাস্তবসম্মত ফ্রি ভয়েসগুলোর মধ্যে একটি। macOS ও iOS-এ, এটি Apple-এর TTS ভয়েস প্রকাশ করে, Siri ভয়েসসহ (Accessibility সেটিংসে 'Enhanced' লেবেলযুক্ত)। Android-এ, সংযুক্ত থাকলে Chrome Google-এর অনলাইন TTS ভয়েস ব্যবহার করে। একটি সাধারণ ডেভেলপার ফাঁদ: ব্রাউজার ভয়েস তালিকা লোড শেষ করার আগে getVoices() একটি খালি অ্যারে ফেরত দেয় — সঠিক প্যাটার্ন হলো voiceschanged ইভেন্টও শুনা এবং সেই সময় আবার কোয়েরি করা। প্লেব্যাকের সময় প্রতিটি শব্দ বা বাক্যের সীমানায় ফায়ার হওয়া onboundary ইভেন্ট-ই সেই মেকানিজম যা এই মতো রিড-অ্যালং টুলে ওয়ার্ড-বাই-ওয়ার্ড হাইলাইটিং চালায়: প্রতিটি বাউন্ডারি ইভেন্ট আসন্ন শব্দের ক্যারেক্টার অফসেট বহন করে, UI-কে অডিওর সাথে নিখুঁত সিঙ্কে হাইলাইট এগিয়ে নিতে দেয়।

বাস্তবে কিছু ব্রাউজার-নির্দিষ্ট অদ্ভুততা গুরুত্বপূর্ণ। Safari-তে speechSynthesis.speak() অডিও বাজানোর আগে একটি ব্যবহারকারী-উদ্যোগী জেসচার (একটি ক্লিক বা কীপ্রেস) দরকার হয় — পেজ লোডে প্রোগ্রামেটিকভাবে এটি কল করলে নীরবে ব্লক হয়ে যায়। ডেস্কটপে Chrome কখনো কখনো অনলাইনে থাকলে অতিরিক্ত Google-হোস্টেড TTS ভয়েস লোড করে, OS ভয়েসের পরিপূরক হিসেবে; এই ভয়েসগুলো অফলাইনে অদৃশ্য হয়ে যায়। বেশিরভাগ ব্রাউজারে লম্বা উক্তি প্রায় ১৫ সেকেন্ড পর নীরবে কেটে যায় — একটি ব্যাপকভাবে চেনা বাগ — তাই প্রোডাকশন-মানের TTS টুলগুলোকে পুরো ডকুমেন্ট একটি একক উক্তি হিসেবে পাস করার বদলে টেক্সটকে বাক্য-আকারের অংশে ভাগ করে ক্রমানুসারে সারিবদ্ধ করতে হয়।

অ্যাক্সেসিবিলিটি টুল হিসেবে TTS: স্ক্রিন রিডার, WCAG ও প্রিন্ট ডিজঅ্যাবিলিটি

টেক্সট-টু-স্পিচ হলো স্ক্রিন রিডার-এর ভিত্তি — সেই সহায়ক প্রযুক্তি যা দৃষ্টিহীন বা গুরুতরভাবে সীমিত দৃষ্টিশক্তির মানুষদের কম্পিউটার ও স্মার্টফোন ব্যবহার করতে দেয়। প্রধান স্ক্রিন রিডারগুলো হলো JAWS (Job Access With Speech, Freedom Scientific দ্বারা — দৃষ্টিহীন পেশাজীবীদের মধ্যে সবচেয়ে ব্যাপকভাবে ব্যবহৃত, যদিও এর যথেষ্ট লাইসেন্স ফি আছে), NVDA (NonVisual Desktop Access — ফ্রি ও ওপেন সোর্স, শুধু Windows), Apple-এর বিল্ট-ইন VoiceOver (macOS, iOS, iPadOS), এবং TalkBack (Android)। প্রতিটি একটি TTS ইঞ্জিনকে ডকুমেন্ট ইন্টেলিজেন্সের একটি স্তরের সাথে জোড়া দেয় যা একটি স্ট্যান্ডঅ্যালোন TTS রিডারে নেই: স্ক্রিন রিডার সিমান্টিক HTML স্ট্রাকচার পার্স করে — হেডিং, ল্যান্ডমার্ক, তালিকা, লিংক — এবং ব্যবহারকারীদের ঘোষণা করে। এরা ছবিতে alt টেক্সট, ফর্ম কন্ট্রোলে লেবেল, ও ARIA অ্যাট্রিবিউটে বিবরণ পড়ে। একটি স্ক্রিন রিডার যখন একটি ভালোভাবে তৈরি ওয়েব পেজের মুখোমুখি হয়, তখন এটি কাঁচা টেক্সট রৈখিকভাবে পড়ছে না; এটি একটি সমৃদ্ধ ডকুমেন্ট মডেল নেভিগেট করছে।

Web Content Accessibility Guidelines (WCAG)-এর সাথে সংযোগ সরাসরি। Success Criterion 1.3.1 — Info and Relationships দাবি করে যে ভিজ্যুয়াল উপস্থাপনা দিয়ে জানানো তথ্য (হেডিং, টেবিল স্ট্রাকচার, প্রয়োজনীয়-ফিল্ড ইন্ডিকেটর) প্রোগ্রামেটিকভাবেও নির্ধারণযোগ্য হতে হবে — কারণ স্ক্রিন রিডার শুধু মার্কআপে যা আছে তা ঘোষণা করতে পারে, স্ক্রিনে যা আছে তা নয়। SC 1.4.1 শুধুমাত্র রং দিয়ে তথ্য জানানো নিষেধ করে, একই কারণে। যেসব ডেভেলপার জেনেরিক <div> এলিমেন্টের বদলে সিমান্টিক HTML এলিমেন্ট (<h1><h6>, <nav>, <button>, <label>) দিয়ে তৈরি করেন, তারা কার্যত TTS-এর জন্যই প্রথমে লিখছেন।

দৃষ্টি সমস্যার বাইরেও, TTS অনেক বৃহত্তর প্রিন্ট ডিজঅ্যাবিলিটি জনগোষ্ঠীর সেবা করে। WebAIM Screen Reader User Survey ধারাবাহিকভাবে দেখে প্রায় ৩০ শতাংশ স্ক্রিন রিডার ব্যবহারকারীর কোনো দৃষ্টি সমস্যা নেই — তারা মোটর ডিজঅ্যাবিলিটি (হাত-মুক্ত অপারেশন), জ্ঞানীয় ডিজঅ্যাবিলিটি (টেক্সট প্রসেসিং অসুবিধা), বা অর্জিত পড়ার ডিজঅ্যাবিলিটির জন্য প্রযুক্তির উপর নির্ভর করে। ডিসলেক্সিয়া সাধারণ জনগোষ্ঠীতে সবচেয়ে বেশি উল্লিখিত পড়ার ডিজঅ্যাবিলিটি: ডায়াগনস্টিক মানদণ্ড অনুযায়ী অনুমান ৫ থেকে ১৫ শতাংশ পর্যন্ত। শব্দ ভিজ্যুয়ালি হাইলাইট হওয়ার সময় টেক্সট শোনা — এই টুলের প্রদান করা রিড-অ্যালং মোড — শিক্ষা গবেষণায় দেখানো হয়েছে এমন পাঠকদের ডিকোডিং ও কম্প্রিহেনশনে সাহায্য করে যারা শুধু ছাপা থেকে অর্থ বের করতে সংগ্রাম করেন, কারণ এটি ভিজ্যুয়াল পাথওয়ের পাশাপাশি শ্রবণ প্রসেসিং পাথওয়েকেও সম্পৃক্ত করে।

পড়ার বাইরে ভয়েস সিন্থেসিস: অডিওবুক, IVR ও ভয়েস ক্লোনিংয়ের নৈতিকতা

কমার্শিয়াল TTS অ্যাসিস্টিভ টেকনোলজির অনেক বাইরে চলে গেছে। ঐতিহাসিকভাবে পেশাদার নেরেটরদের রেকর্ডিংয়ের উপর নির্মিত অডিওবুক ইন্ডাস্ট্রি এখন AI নেরেটরের মুখোমুখি যা সপ্তাহের বদলে মিনিটে একটি সম্পূর্ণ বই তৈরি করতে পারে। ACX (Amazon-এর অডিওবুক প্রোডাকশন মার্কেটপ্লেস)-এর মতো প্ল্যাটফর্ম নির্দিষ্ট বিভাগের জন্য AI নেরেশনের অনুমতি দেয়। Spotify পডকাস্টের AI-চালিত ডাবিং ঘোষণা করেছে — হোস্টের ছন্দ ও স্টাইল সংরক্ষণ করে অডিও কনটেন্ট অন্য ভাষায় অনুবাদ ও পুনরায়-ভয়েস করতে নিউরাল TTS প্রয়োগ করে। Murf.ai, Descript-এর Overdub, এবং Adobe Podcast-এর AI voice enhancer-এর মতো টুল স্টুডিও-মানের সিন্থেটিক ভয়েসওভারকে স্বতন্ত্র নির্মাতাদের কাছে সহজলভ্য করে তুলেছে, পডকাস্ট ও এক্সপ্লেইনার-ভিডিও প্রোডাকশন ত্বরান্বিত করেছে।

Interactive Voice Response (IVR) সিস্টেম — সেই টেলিফোন মেনু যা কলারদের কাস্টমার সার্ভিস অপশনের মধ্য দিয়ে গাইড করে — ১৯৮০-এর দশক থেকে TTS ব্যবহার করে আসছে, প্রথমে ফরম্যান্ট ভয়েস দিয়ে এবং পরে কনক্যাটেনেটিভ ও নিউরাল সিস্টেম দিয়ে। প্রাথমিক IVR ভয়েস এতটাই রোবোটিক ছিল যে কোম্পানিগুলো একটি সিস্টেমের প্রয়োজন হতে পারে এমন প্রতিটি বাক্যাংশ আগে থেকে রেকর্ড করত; আধুনিক নিউরাল TTS তাৎক্ষণিকভাবে ডাইনামিক, প্রাসঙ্গিকভাবে উপযুক্ত স্পিচ তৈরি করতে পারে, অনেক বেশি নমনীয় ভয়েস ইন্টারফেস সক্ষম করে। স্মার্ট স্পিকার ও ভয়েস অ্যাসিস্ট্যান্ট (Alexa, Siri, Google Assistant) এই বংশধারার দৃশ্যমান শিখর — সবাই নিউরাল TTS ইঞ্জিন চালায় যা আগে-থেকে-রেকর্ড না করা রেসপন্স তৈরি করে।

ভয়েস ক্লোনিং — একটি সংক্ষিপ্ত অডিও স্যাম্পল থেকে একজন নির্দিষ্ট ব্যক্তির ভয়েসের একটি সিন্থেটিক কপি তৈরি করা — সেই উন্নয়ন যা নৈতিক ঝুঁকিকে সবচেয়ে বেশি কেন্দ্রীভূত করে। ElevenLabs-এর মতো অত্যাধুনিক সিস্টেম মাত্র কয়েক সেকেন্ডের অডিও থেকে বিশ্বাসযোগ্য ক্লোন তৈরি করতে পারে। একজন সংগীতশিল্পীকে ভিন্ন ভাষায় নিজের ভয়েস আবার তৈরি করতে দেওয়া একই সামর্থ্য ডিপফেক অডিও — পাবলিক ফিগারদের কখনো না বলা কথার তৈরি রেকর্ডিং — তৈরি করতেও সক্ষম করে। Adobe-এর Content Authenticity Initiative (CAI) ক্রিপ্টোগ্রাফিকভাবে সিন্থেটিক অডিও ওয়াটারমার্ক করার স্ট্যান্ডার্ড তৈরি করছে যাতে ডাউনস্ট্রিমে উৎস যাচাই করা যায়। পপ কালচারে, রোবোটিক TTS ভয়েস দীর্ঘদিন ধরে কৃত্রিম বুদ্ধিমত্তার একটি শর্টহ্যান্ড হয়ে আছে — HAL 9000-এর ফ্ল্যাট ব্যারিটোন, Moon-এ GERTY-এর সুনিয়ন্ত্রিত টোন, Portal গেমে GLaDOS-এর ব্যাঙ্গাত্মক গানের মতো সুর — একটি সৃজনশীল ট্রোপ যা AI কেমন শোনানো উচিত সে সম্পর্কে জনসাধারণের অনুভূতি প্রতিফলিত করে এবং গঠন করে। বিদ্রূপাত্মক ব্যাপার হলো প্রযুক্তি এখন এতটাই এগিয়ে গেছে যে সেই ইচ্ছাকৃতভাবে কৃত্রিম ভয়েসগুলো এখন একটি ডিজাইন পছন্দ, প্রযুক্তিগত সীমাবদ্ধতা নয়।

Frequently asked questions

টেক্সটকে স্পিচে কীভাবে রূপান্তর করব?

বক্সে আপনার টেক্সট টাইপ বা পেস্ট করুন, একটি ভয়েস বেছে নিন, তারপর Play চাপুন — আপনার ব্রাউজার এটি সঙ্গে সঙ্গে জোরে পড়ে শোনায়। ইনস্টল করার কিছু নেই, তৈরি করার কোনো অ্যাকাউন্ট নেই, এবং কোনো শব্দ সীমা নেই। আপনি প্রথমে স্পিড ও পিচ সামঞ্জস্য করতে পারেন, এবং যেকোনো সময় পজ, রিজিউম বা স্টপ করতে পারেন। যেমন, আপনি শুনতে চান এমন একটি আর্টিকেলের একটি প্যারাগ্রাফ পেস্ট করুন, ভয়েসটি ডিফল্টে রেখে দিন, এবং শব্দে-শব্দে পড়া শুনতে Play চাপুন।

টেক্সট-টু-স্পিচ সফটওয়্যার কী?

টেক্সট-টু-স্পিচ (TTS) সফটওয়্যার একটি সিন্থেটিক ভয়েস ব্যবহার করে লিখিত টেক্সটকে কথিত অডিওতে পরিণত করে। এই টুলটি একটি ফ্রি, ব্রাউজার-ভিত্তিক TTS রিডার: এটি Chrome, Edge, Safari ও Firefox-এ বিল্ট-ইন Web Speech API ব্যবহার করে আপনার ডিভাইসের নিজস্ব ভয়েস থেকে স্পিচ তৈরি করে। কাজটি স্থানীয়ভাবে হওয়ায়, কোনো আপলোড নেই, সাইন-আপ নেই এবং ব্যবহারের কোনো সীমা নেই — যেকোনো টেক্সট পেস্ট করুন এবং এটি জোরে পড়ে দেয়।

নতুনদের জন্য TTS কী?

TTS মানে টেক্সট-টু-স্পিচ — একটি প্রযুক্তি যা লিখিত শব্দকে কথিত অডিওতে রূপান্তর করে। যদি এটি আপনার কাছে নতুন হয়, শুরু করার সবচেয়ে সহজ উপায় হলো এই টুলে একটি বাক্য পেস্ট করে Play চাপা। আপনার ডিভাইস একটি বিল্ট-ইন ভয়েস দিয়ে এটি জোরে পড়ে দেবে। সহজে অনুসরণ করতে গতি ০.৫×-এ ধীর করতে পারেন, একটি পরিষ্কার মনে হয় এমন ভয়েস বেছে নিতে পারেন, এবং প্রতিটি শব্দ কথিত হওয়ার সাথে সাথে ট্র্যাক করতে ওয়ার্ড-হাইলাইট ফিচার ব্যবহার করতে পারেন। এটি ফ্রি, কোনো অ্যাকাউন্ট দরকার নেই, এবং সরাসরি আপনার ব্রাউজারে কাজ করে।

এটি কি ফ্রি ও আনলিমিটেড?

হ্যাঁ — সম্পূর্ণভাবে ফ্রি, কোনো শব্দ বা ক্যারেক্টার সীমা ছাড়া। NaturalReader-এর ফ্রি টিয়ার আপনাকে একটি দৈনিক ক্যারেক্টার কোটায় সীমাবদ্ধ করে। Speechify ফ্রি প্ল্যানে শোনার ঘণ্টা সীমাবদ্ধ করে। Read Aloud ব্রাউজার এক্সটেনশন ভিন্ন ভিন্ন কিন্তু ভালো ভয়েসের জন্য একটি পেইড সাবস্ক্রিপশন দরকার হয়। এই টুল আপনার ডিভাইসের বিল্ট-ইন ভয়েস দিয়ে স্থানীয়ভাবে স্পিচ সংশ্লেষ করে, তাই মিটার করার কিছু নেই: আপনি একটি একক বাক্য বা একটি ৫০-পাতার ডকুমেন্ট বিনামূল্যে ও কোনো দৈনিক কোটা ছাড়াই পড়তে পারেন।

TTS কি এক ধরনের AI, এবং এই টুল কি AI ভয়েস ব্যবহার করে?

এখানে নয়। এই টুল Web Speech API-এর মাধ্যমে আপনার কম্পিউটার বা ফোনে ইতিমধ্যে ইনস্টল করা ক্লাসিক সিস্টেম ভয়েস ব্যবহার করে — ElevenLabs, Speechify, বা NaturalReader-এর পেইড টিয়ারের মতো ক্লাউড-ভিত্তিক নিউরাল বা 'AI' ভয়েস নয়। আধুনিক AI ভয়েস মেশিন লার্নিং ব্যবহার করে এবং বেশি মানবিক শোনায়, কিন্তু একটি সার্ভারে চলে এবং সাধারণত একটি অ্যাকাউন্ট ও পেমেন্ট দরকার হয়। এই পদ্ধতির ট্রেড-অফ সৎ: বিল্ট-ইন ভয়েস সামান্য বেশি রোবোটিক শোনায়, কিন্তু বিনিময়ে টুলটি ফ্রি, আনলিমিটেড, প্রাইভেট ও অফলাইনে কাজ করে।

কী কী ভয়েস পাওয়া যায়?

আপনার ডিভাইসে যা ইনস্টল করা আছে তাই। ভয়েস তালিকাটি সরাসরি আপনার অপারেটিং সিস্টেম ও ব্রাউজার থেকে পড়া হয়, তাই একটি Windows PC, একটি Mac, একটি iPhone ও একটি Android ফোন প্রতিটি ভিন্ন ভিন্ন সেট দেবে। তালিকা সংকুচিত করতে ভাষা ফিল্টার ব্যবহার করুন, তারপর একটি ভয়েস বেছে নিন — নামে সাধারণত ভাষা ও অঞ্চল থাকে, যেমন 'Microsoft Aria — English (United States)' বা 'Google español'। আপনি আপনার OS সেটিংসে আরও ভয়েস যোগ করতে পারেন: Windows-এ Settings > Time & language > Speech-এ যান; macOS-এ System Settings > Accessibility > Spoken Content-এ যান।

আমি কি পড়ার গতি ও পিচ বদলাতে পারি?

হ্যাঁ। Speed স্লাইডার ০.৫× থেকে ২× পর্যন্ত চলে: ভাষা শেখা বা পড়াশোনার সময় অনুসরণ করতে ০.৫–০.৭×-এ নামান, বা লম্বা টেক্সট দ্রুত স্কিম করতে ১.৫–২×-এ ঠেলে দিন। Pitch স্লাইডার (০ থেকে ২) ভয়েসকে গভীর বা উঁচু করে, এবং একটি Volume স্লাইডার আওয়াজ নিয়ন্ত্রণ করে। পরিবর্তনগুলো পরের বার Play চাপার সময় প্রয়োগ হয়, এবং আপনার সেটিংস স্বয়ংক্রিয়ভাবে পরের বারের জন্য সংরক্ষিত হয়।

এটি কীভাবে আরও স্বাভাবিক শোনাব?

কয়েকটি জিনিস সাহায্য করে। প্রথমত, আপনার ভাষার জন্য সবচেয়ে উচ্চ-মানের ভয়েস বেছে নিন — Windows-এ 'Microsoft' ভয়েস (বিশেষ করে 'Natural' ভ্যারিয়েন্ট) খুঁজুন; macOS-এ Siri ভয়েসের মতো 'Enhanced' ভয়েস খুঁজুন; Android-এ Google ভয়েস খুঁজুন। দ্বিতীয়ত, ডিফল্টের বদলে Speed প্রায় ০.৯–১.০×-এ সেট করুন — একটি দ্রুত ভয়েসকে সামান্য ধীর করলে প্রায়ই বেশি স্বাচ্ছন্দ্যময় শোনায়। তৃতীয়ত, ১.০-এর কাছাকাছি Pitch সাধারণত সবচেয়ে স্বাভাবিক শোনায়। Windows-এ ভালো ভয়েস ইনস্টল করতে: Settings > Time & Language > Speech > Add voices। macOS-এ: System Settings > Accessibility > Spoken Content > System Voice > Manage voices।

আমি কি অডিওটি MP3 হিসেবে ডাউনলোড করতে পারি?

না — এবং আমরা এ ব্যাপারে খোলাখুলি। ব্রাউজারের Web Speech API সরাসরি আপনার স্পিকারের মাধ্যমে অডিও বাজায় এবং একটি নির্ভরযোগ্য, ডাউনলোডযোগ্য অডিও স্ট্রিম প্রকাশ করে না, তাই এর থেকে একটি প্রকৃত MP3 এক্সপোর্ট করার কোনো সৎ উপায় নেই। একটি অডিও ফাইল দরকার হলে, বাজানোর সময় একটি স্ক্রিন-রেকর্ডার বা একটি OS অডিও রেকর্ডার দিয়ে আপনার সিস্টেম অডিও রেকর্ড করুন, বা ফাইল এক্সপোর্ট অফার করে এমন একটি ডেডিকেটেড সার্ভার-ভিত্তিক TTS সার্ভিস ব্যবহার করুন। মুহূর্তের জন্য শোনার জন্য, শুধু Play চাপুন।

এটি কি অফলাইনে কাজ করে?

হ্যাঁ। যেহেতু স্পিচটি আপনার ডিভাইসে ইতিমধ্যে ইনস্টল করা ভয়েস দিয়ে তৈরি হয়, পেজ একবার লোড হওয়ার পর ও আপনার ভয়েস উপলব্ধ থাকলে রিডারটি কোনো ইন্টারনেট সংযোগ ছাড়াই কাজ করতে থাকে। মনে রাখবেন Windows ও macOS-এর কিছু 'enhanced' বা 'natural' ভয়েস অপারেটিং সিস্টেম দিয়ে স্ট্রিম করা হয় এবং প্রথম ব্যবহারে একটি সংযোগ দরকার হতে পারে।

আমার টেক্সট কি কোথাও পাঠানো হয়?

না। সবকিছু আপনার ডিভাইসে ঘটে: আপনার টেক্সট সরাসরি আপনার ব্রাউজারের স্থানীয় স্পিচ ইঞ্জিনে পাস হয় এবং কখনো আপলোড, লগ বা শেয়ার হয় না। এটি প্রাইভেট নোট, খসড়া, গোপনীয় ডকুমেন্ট বা এমন যেকোনো কিছুর জন্য নিরাপদ করে তোলে যা আপনি Speechify, NaturalReader অনলাইন বা Google-এর Cloud Text-to-Speech API-এর মতো একটি ক্লাউড সার্ভিসে পেস্ট করতে চান না।

এটি কি লম্বা টেক্সট পড়তে পারে?

হ্যাঁ। লম্বা প্যাসেজ পর্দার পেছনে স্বয়ংক্রিয়ভাবে ছোট বাক্য-আকারের অংশে ভাগ হয়ে ক্রমানুসারে বাজানো হয়, যা প্রায় ১৫ সেকেন্ড পর স্পিচ কেটে যাওয়ার সুপরিচিত ব্রাউজার বাগ এড়িয়ে যায়। আপনি একটি পুরো আর্টিকেল, অধ্যায় বা রিপোর্ট পেস্ট করতে পারেন এবং এটি সরাসরি পড়বে, প্রোগ্রেস বার দেখাবে এটি কতদূর এগিয়েছে।

এটি পড়ার সময় আমি কীভাবে অনুসরণ করব?

ওয়ার্ড হাইলাইট চালু করুন (এটি ডিফল্টভাবে চালু) এবং বর্তমান শব্দটি কথিত হওয়ার সাথে সাথে রিড-অ্যালং প্যানে ক্যারাওকে-স্টাইলে হাইলাইট হয়, স্বয়ংক্রিয়ভাবে ভিউতে স্ক্রল করে। এই রিড-অ্যালং ভিউ লম্বা টেক্সটে আপনার জায়গা ধরে রাখা অনেক সহজ করে তোলে এবং বিশেষভাবে প্রুফরিডিং, অধ্যয়ন, এবং যারা শব্দ একসাথে দেখা ও শোনা থেকে উপকৃত হন তাদের সাহায্য করার জন্য উপযোগী।

টেক্সট-টু-স্পিচ কি ডিসলেক্সিয়ায় সাহায্য করে?

অনেকে মনে করেন এটি করে। শব্দ হাইলাইট হওয়ার সময় টেক্সট শোনা পাঠকদের দেখার পাশাপাশি শুনেও তথ্য প্রসেস করতে দেয়, যা ডিসলেক্সিয়া, ADHD, কম দৃষ্টিশক্তি বা নতুন ভাষা শেখা যেকোনো ব্যক্তির জন্য ক্লান্তি কমাতে ও কম্প্রিহেনশন উন্নত করতে পারে। এটি একটি ব্যাপকভাবে ব্যবহৃত অ্যাক্সেসিবিলিটি সহায়ক — তবে এটি একটি পড়ার সমর্থন, চিকিৎসা চিকিৎসা নয়, এবং ব্যক্তিভেদে ফলাফল ভিন্ন হয়। Speechify-এর মতো টুল এই দর্শকদের কাছে ব্যাপকভাবে মার্কেটিং করে কিন্তু বছরে $১৩৯ খরচ করে; এই টুলটি একই মূল ফাংশন বিনামূল্যে প্রদান করে।

টেক্সট-টু-স্পিচের অসুবিধা কী?

ব্রাউজার-ভিত্তিক TTS-এর সৎ সীমাবদ্ধতা: বিল্ট-ইন সিস্টেম ভয়েস ElevenLabs বা Speechify-এর মতো সার্ভিসের প্রিমিয়াম AI ভয়েসের চেয়ে বেশি রোবোটিক শোনায়; উপলব্ধ ভয়েস ও ভাষা সম্পূর্ণভাবে আপনার ডিভাইসের উপর নির্ভর করে; এটি অস্বাভাবিক নাম, সংক্ষিপ্ত রূপ ও সংখ্যা ভুল উচ্চারণ করতে পারে; এবং এটি একটি MP3 ফাইল এক্সপোর্ট করতে পারে না। তবে সুবিধাগুলোও সমান বাস্তব — এটি ফ্রি, আনলিমিটেড, প্রাইভেট, তাৎক্ষণিক এবং অফলাইনে কাজ করে, যা পেইড ক্লাউড সার্ভিস একসাথে খুব কমই দিতে পারে।