AI ক্যাপশন কেন নিজেই নিজেকে আবার লেখে (আর রিয়েল-টাইম স্পিচ অনুবাদের অন্যান্য রহস্য)
Newey Team

রিয়েল-টাইম স্পিচ অনুবাদ একটি স্ট্রিমিং পাইপলাইন: আপনি কথা বলার সাথে সাথে স্পিচ রিকগনিশন (ASR) অডিওকে টেক্সটে বদলায়, মেশিন ট্রান্সলেশন (MT) সেই টেক্সটকে লক্ষ্য ভাষায় রূপান্তর করে, আর — কণ্ঠ আউটপুটের জন্য — টেক্সট-টু-স্পিচ তা পড়ে শোনায়। আধুনিক সিস্টেম কথা বলার প্রায় 1–4 সেকেন্ডের মধ্যে অনূদিত ক্যাপশন দেখায়, যা পেশাদার মানব সিমালটেনিয়াস দোভাষীর 2–6 সেকেন্ড বিলম্বের সাথে তুলনীয়। পরিষ্কার অডিওতে নির্ভুলতা এখন স্ট্যান্ডার্ড বেঞ্চমার্কে মানব ট্রান্সক্রিপশনের কাছাকাছি — কিন্তু শব্দদূষণ, উচ্চারণভঙ্গি আর বিশেষায়িত পরিভাষা তা প্রবলভাবে নামিয়ে দিতে পারে, আর সেই ক্ষতির বেশিরভাগই একটি ভালো মাইক্রোফোন আর কাস্টম শব্দকোষ দিয়ে পুনরুদ্ধারযোগ্য। ভেতরে ভেতরে পুরো ব্যাপারটা কীভাবে কাজ করে, প্রকৃত অঙ্কসহ, এখানে।
পাইপলাইন: কথা যেভাবে অনূদিত ক্যাপশন হয়ে ওঠে
আজকের বেশিরভাগ প্রোডাকশন সিস্টেম ক্যাসকেডেড: আলাদা আলাদা মডেল শৃঙ্খলে বাঁধা। Google Research-এর বর্ণনায়, স্পিচ অনুবাদ "systems have usually been broken into three separate components: automatic speech recognition to transcribe the source speech as text, machine translation to translate the transcribed text, and text-to-speech synthesis" (সাধারণত তিনটি আলাদা উপাদানে ভাঙা হয়: উৎস কথাকে টেক্সটে ট্রান্সক্রাইব করতে অটোমেটিক স্পিচ রিকগনিশন, ট্রান্সক্রাইব করা টেক্সট অনুবাদে মেশিন ট্রান্সলেশন, আর টেক্সট-টু-স্পিচ সিন্থেসিস)। ক্যাপশনের ক্ষেত্রে তৃতীয় ধাপটি বাদ যায় — অনূদিত টেক্সটটিই পণ্য।
ক্যাসকেডের একটি সুপরিচিত দুর্বলতা আছে, গবেষকরা যাকে বলেন এরর প্রোপাগেশন: রিকগনাইজার কোনো শব্দ ভুল শুনলে অনুবাদক সেই ভুল শব্দটাই বিশ্বস্তভাবে অনুবাদ করে। স্পিচ অনুবাদের একাডেমিক গবেষণা উল্লেখ করে যে ক্যাসকেডেড সিস্টেম "usually criticized for the error propagation between automatic speech recognition and machine translation models" (অটোমেটিক স্পিচ রিকগনিশন ও মেশিন ট্রান্সলেশন মডেলের মধ্যে ত্রুটি ছড়িয়ে পড়ার জন্য সাধারণত সমালোচিত) (Xu et al., 2025)। এই কারণেই রিকগনিশন ধাপটি — আর যা কিছু একে সাহায্য করে, যেমন অডিওর মান ও পরিভাষার ইঙ্গিত — অনুবাদ পাইপলাইনে দ্বিগুণ গুরুত্বপূর্ণ।
সরাসরি অডিও থেকে অনুবাদ করা এন্ড-টু-এন্ড মডেল (Google-এর Translatotron ধারা, আর নতুনতম ভয়েস-টু-ভয়েস সিস্টেম) সেই ক্রমপুঞ্জীভবন এড়ায়, কিন্তু 2026 পর্যন্ত ক্যাসকেডেড পদ্ধতিই এখনো বেশিরভাগ লাইভ ক্যাপশনিং পণ্য চালায়, কারণ প্রতিটি ধাপ অনেক বেশি ডেটায় প্রশিক্ষণযোগ্য।
লাইভ ক্যাপশন কেন নিজেই নিজেকে আবার লেখে
লাইভ ক্যাপশন দেখে থাকলে খেয়াল করেছেন — শব্দ আসে, তারপর বদলে যায়। এটা কোনো ত্রুটি নয় — এটাই স্ট্রিমিং রিকগনিশনের মূল প্রক্রিয়া।
স্ট্রিমিং ASR দুই ধরনের ফলাফল দেয়:
- আংশিক (অন্তর্বর্তী) ফলাফল — এখন পর্যন্ত ইঞ্জিনের সেরা অনুমান, অস্থির ও "subject to change" (পরিবর্তনসাপেক্ষ) হিসেবে চিহ্নিত, যখন অডিও তখনো আসছে। Google Cloud-এর Speech-to-Text এমনকি প্রতিটি আংশিক ফলাফলে একটি
stabilityস্কোর জুড়ে দেয়, যা অনুমান করে সেটি সংশোধিত হওয়ার সম্ভাবনা কতটা। - চূড়ান্ত ফলাফল — স্থায়ী টেক্সট, ইঞ্জিন যথেষ্ট প্রসঙ্গ পাওয়ার পর নির্গত (সাধারণত বিরতি বা বাক্যাংশের সীমানায়)। Azure-এর Speech সার্ভিস একই পার্থক্য করে
Recognizing(মধ্যবর্তী) ওRecognized(চূড়ান্ত) ইভেন্টের মধ্যে।
সংশোধনের কারণ ভাষাতাত্ত্বিক: পরের শব্দগুলো আগের শব্দের অস্পষ্টতা দূর করে। "I scream" আর "ice cream" শুনতে একই, যতক্ষণ না আরও প্রসঙ্গ আসে। অনুবাদ পাইপলাইন এই আচরণ উত্তরাধিকারে পায় — এবং নিজেরটাও যোগ করে, কারণ অনেক ভাষায় ক্রিয়া বা না-বোধক এমন জায়গায় বসে যে অনুবাদককে অপেক্ষা করতে বা আবার লিখতে হয়। ভালো ক্যাপশন সিস্টেম দ্রুত টেক্সট দেখানো আর যে টেক্সট বদলাবে না তা দেখানো-র এই দর-কষাকষি সূক্ষ্মভাবে টিউন করে।
"রিয়েল টাইম" কতটা দ্রুত?
2026 পর্যন্ত ভেন্ডর ডকুমেন্টেশন ও ইঞ্জিনিয়ারিং গাইডের অঙ্ক:
উপাদানভিত্তিক অঙ্ক ইন্ডাস্ট্রি ইঞ্জিনিয়ারিং গাইড থেকে (Fora Soft, Translated); প্রতিকূল সেটআপে বাস্তবের মোট অঙ্ক 2–6 সেকেন্ডে গিয়ে দাঁড়ায়, আর লাইভ ইভেন্টের জন্য ~3 সেকেন্ডের নিচে সাধারণত গ্রহণযোগ্য ধরা হয়।
এবার সেই প্রসঙ্গ, যা মানুষকে অবাক করে: মানব সিমালটেনিয়াস দোভাষীরও একই বিলম্ব থাকে। একাডেমিক পরিমাপটি হলো ear-voice span — শোনা ও বলার মধ্যকার বিলম্ব — আর গবেষণা একে রাখে 2 থেকে 6 সেকেন্ডের মধ্যে, রিপোর্টকৃত গড় প্রায় 2.7 থেকে 4.7 সেকেন্ড (UCL গবেষণা পর্যালোচনা)। ~4 সেকেন্ডের বেশি বিলম্ব মানুষের ক্ষেত্রেও নির্ভুলতা হারানোর সাথে জড়িত। একটি সুটিউনড AI ক্যাপশন পাইপলাইন মানব দোভাষীর লেটেন্সি পরিসরের ঠিক মাঝেই থাকে।
স্পিচ রিকগনিশন আসলে কতটা নির্ভুল?
মানক মেট্রিক হলো word error rate (WER): প্রতিস্থাপন + বাদ পড়া + অনুপ্রবেশ, ভাগ প্রকৃত উচ্চারিত শব্দের সংখ্যা দিয়ে। WER 10% মানে প্রতি দশটি শব্দের একটি কোনো-না-কোনোভাবে ভুল।
"কতটা নির্ভুল?"-এর সৎ উত্তর: পরিস্থিতির ওপর বিপুলভাবে নির্ভর করে।
- পরিষ্কার, স্পষ্ট কথা: OpenAI-এর Whisper পেপার LibriSpeech clean বেঞ্চমার্কে ~2.5–2.7% WER রিপোর্ট করে — সেই বেঞ্চমার্কে মোটামুটি মানব-স্তরের — তবে সাথে উল্লেখ করে যে আরও বৈচিত্র্যময় বাস্তব ডেটাসেটজুড়ে মডেলগুলো এখনো মানুষের প্রায় দ্বিগুণ ভুল করে।
- কথোপকথনমূলক টেলিফোন স্পিচ: Microsoft-এর বিখ্যাত "human parity" ফলাফল 2017 সালে Switchboard বেঞ্চমার্কে 5.1% WER ছুঁয়েছিল — Microsoft-এর নিজেরই সতর্কবার্তাসহ: শব্দদূষিত পরিবেশ, দূরের মাইক্রোফোন আর উচ্চারণভঙ্গিওয়ালা কথা তখনো অসমাধিত।
- দূরের মাইক, ওভারল্যাপিং বক্তা: CHiME-6 চ্যালেঞ্জ (ঘরের মাইক্রোফোনে ডিনার-পার্টির রেকর্ডিং) হলো চোখ খুলে দেওয়া ডেটা পয়েন্ট — বিজয়ী সিস্টেমও ~40% WER করেছিল, আর বেসলাইন ছিল ~51%।
- উচ্চারণভঙ্গি ও উপভাষা: পাঁচটি বড় বাণিজ্যিক ASR সিস্টেম নিয়ে একটি PNAS গবেষণা পায়, কৃষ্ণাঙ্গ আমেরিকান বক্তাদের গড় WER 0.35 বনাম শ্বেতাঙ্গ বক্তাদের 0.19 — যে ফারাকের শিকড় প্রশিক্ষণ-ডেটার কভারেজে। অ-স্থানীয় উচ্চারণভঙ্গিও একই যান্ত্রিকতার মুখে পড়ে।
- মিশ্র-ভাষার কথা: কোড-সুইচিং (কোরিয়ান, হিন্দি ইত্যাদির মধ্যে ইংরেজি শব্দ ঢোকানো) এখনো একটি বড় ব্যর্থতার ক্ষেত্র — ভেন্ডররা একক-ভাষার কথার তুলনায় 30–50% আপেক্ষিক WER বৃদ্ধি রিপোর্ট করে।
উপসংহারটা "AI 97% নির্ভুল"ও নয়, "AI অব্যবহারযোগ্য"ও নয় — বরং একই সিস্টেম ভালো মাইক্রোফোনসহ নিরিবিলি ঘরে প্রায়-নিখুঁত হতে পারে, আবার প্রতিধ্বনিময় হলে আড়াআড়ি কথার মধ্যে বাজেভাবে ভেঙে পড়তে পারে।
অনুবাদের মান তার ওপরে চাপে
MT ধাপের নিজস্ব মান-পরিমাপ আছে — BLEU-এর মতো n-gram ওভারল্যাপ স্কোর আর COMET-এর মতো নিউরাল মেট্রিক, যা মানুষের বিচারের সাথে ভালো মেলে। তবে লাইভ ক্যাপশনের জন্য ব্যবহারিক নিয়মটা সহজ: অনুবাদের মান রিকগনিশনের মানে বাঁধা। নিখুঁতভাবে অনূদিত একটি ভুল-শোনা শব্দও ভুলই থাকে, আর একটি বিকৃত পণ্যের নাম একসাথে প্রতিটি লক্ষ্য ভাষায় বিকৃত হয়।
নির্ভুলতা আসলে যা বাড়ায়
প্রভাবের মোটামুটি ক্রমে:
- মাইক্রোফোন ও দূরত্ব। বেঞ্চমার্ক WER (~3–5%) আর ডিনার-পার্টি WER (~40%)-এর ফারাক মূলত অ্যাকুস্টিকসের। একটি হেডসেট বা হাতের নাগালের মাইক যেকোনো মডেল আপগ্রেডকে হারায়।
- একবারে একজন বক্তা। ওভারল্যাপিং কথা ASR-এর সবচেয়ে কঠিন খোলা সমস্যা — মিটিংয়ের শৃঙ্খলাই একটি নির্ভুলতা-ফিচার।
- কাস্টম ভোকাবুলারি / শব্দকোষ। প্রতিটি বড় ইঞ্জিন প্রত্যাশিত শব্দের দিকে রিকগনিশন ঝোঁকানো সমর্থন করে: Google-এর মডেল অ্যাডাপটেশন ফ্রেজ সেট দিয়ে "proper names or domain-specific words" (নামবাচক বা ডোমেইন-নির্দিষ্ট শব্দ) জোরদার করে, আর Azure-এর ফ্রেজ লিস্ট দেখায় ধ্রুপদি উদাহরণ: "Contoso bank" শব্দটি নিবন্ধনের আগ পর্যন্ত "can't do so bank" হিসেবে চেনা হচ্ছিল। মিটিংয়ের আগে সিস্টেমকে আপনার পণ্যের নাম, উপস্থিতদের নাম আর ইন্ডাস্ট্রি পরিভাষা খাইয়ে দেওয়াই একক সর্বোচ্চ-লিভারেজ সফটওয়্যার সমাধান।
- প্রসঙ্গ। সেশনটা কী নিয়ে তা সিস্টেমকে জানানো (অনকোলজির কিনোট নাকি স্প্রিন্ট রেট্রো) — রিকগনিশন ও অনুবাদ দুটোকেই দ্ব্যর্থক শব্দের সঠিক অর্থ বাছতে সাহায্য করে।
- বক্তার অভ্যাস। পরিমিত গতি আর সম্পূর্ণ বাক্য কাজে দেয় — মানব দোভাষীদের যা সাহায্য করে তা-ই; তাঁরা জোড়ায় কাজ করেন আর প্রতি 20–30 মিনিটে পালা বদলান, ঠিক এই জন্যই যে কাজটা বোধগতভাবে নির্মম (AIIC)।
লাইভ ক্যাপশন কি সত্যিই মানুষকে অনুসরণে সাহায্য করে?
হ্যাঁ — এবং কেবল অনুবাদ জড়িত থাকলেই নয়। Policy Insights from the Behavioral and Brain Sciences-এ একটি গবেষণা পর্যালোচনা পেয়েছে: "more than 100 empirical studies document that captioning a video improves comprehension of, attention to, and memory for the video" (শতাধিক গবেষণায় নথিবদ্ধ — ভিডিওতে ক্যাপশন দিলে বোধগম্যতা, মনোযোগ ও স্মৃতি উন্নত হয়), আর সুবিধা বিশেষভাবে জোরালো তাঁদের জন্য যাঁরা নিজের মাতৃভাষা নয় এমন ভাষায় দেখছেন। এর সাথে প্রবেশযোগ্যতার মাত্রা যোগ করুন — WHO-র হিসাবে কোনো-না-কোনো মাত্রার শ্রবণ ক্ষতিতে থাকা মানুষ 1.5 বিলিয়ন, 2050 নাগাদ 2.5 বিলিয়নে পৌঁছানোর পূর্বাভাস — আর ক্যাপশন আন্তর্জাতিক মিটিংয়ের "থাকলে ভালো" জিনিস থাকে না।
বাস্তবে এর মানে কী
মিটিং বা ইভেন্টের জন্য লাইভ অনুবাদ যাচাই করছেন? এই নিবন্ধ চারটি প্রশ্নে সংকুচিত হয়: মাইক বক্তার কত কাছে? পরিভাষা কি আগে থেকে লোড করা যায়? লেটেন্সি কি মানব-দোভাষীর পরিসরে (2–6 s)? আর প্রতিটি শ্রোতা কি তাঁর দরকারি ভাষাটা পেতে পারেন?
শেষ সেটটাকে ঘিরেই আমরা Newey বানিয়েছি: এটি আপনার মিটিং বা ইভেন্টের অডিও ব্রাউজার থেকে সরাসরি একটি রিকগনিশন-প্লাস-ট্রান্সলেশন পাইপলাইনে স্ট্রিম করে, ওপরের লেটেন্সি পরিসরের মধ্যেই একটি ভাসমান ওভারলেতে ক্যাপশন দেখায়, পরিভাষা সমস্যার জন্য কাস্টম শব্দকোষ ও সেশন কনটেক্সট সমর্থন করে, আর 60টি ভাষায় অনুবাদ করে — একসাথে সর্বোচ্চ 3টি দেখানো যায়, সাথে QR অপশন, যাতে প্রতিটি দর্শক নিজের ফোনে নিজের ভাষা পড়েন। বিটা চলাকালীন বিনামূল্যে, তাই এই নির্ভুলতার দাবিগুলো নিজের মিটিংয়েই পরখ করতে পারেন।
সব বিকল্পের — মানব দোভাষী, প্ল্যাটফর্মের বিল্ট-ইন, আর AI ক্যাপশন — আয়োজকের চোখে দেখা তুলনার জন্য পড়ুন বহুভাষিক মিটিং যেভাবে চালাবেন।
FAQ
AI স্পিচ অনুবাদ কি মানব দোভাষীর মতোই নির্ভুল?
ব্যর্থতার ধরন আলাদা। প্রচলিত পরিভাষাসহ পরিষ্কার অডিওতে আধুনিক ASR স্ট্যান্ডার্ড বেঞ্চমার্কে মানব ট্রান্সক্রিপশনের নির্ভুলতার কাছাকাছি; শব্দদূষিত ঘরে, ভারী উচ্চারণভঙ্গি বা মিশ্র-ভাষার কথায় মানুষ এখনো স্বচ্ছন্দে জেতে। মানুষ চাপের মুখে অর্থ সংকুচিত করে ও অগ্রাধিকার দেয়, আর AI সবকিছু আক্ষরিকভাবে অনুবাদ করে — যে অংশগুলো একজন মানুষ বিচক্ষণভাবে বাদ দিতেন, সেগুলোসহ।
ক্যাপশন কেন এসে আবার বদলে যায়?
স্ট্রিমিং রিকগনাইজার সঙ্গে সঙ্গে অস্থায়ী "আংশিক" ফলাফল দেয়, তারপর যথেষ্ট প্রসঙ্গ এলে "চূড়ান্ত" ফলাফল দিয়ে প্রতিস্থাপন করে (Google ও Azure দুটোই এই দুই-দশার আচরণ ডকুমেন্ট করেছে)। পরের শব্দগুলো সত্যিই বদলে দেয় আগের ধ্বনির মানে।
লাইভ অনূদিত ক্যাপশনে কেমন লেটেন্সি আশা করব?
ভালো অবস্থায় মোটামুটি 1–4 সেকেন্ড। মাপকাঠির জন্য: পেশাদার মানব সিমালটেনিয়াস দোভাষীর ear-voice span 2–6 সেকেন্ড।
WER কী?
Word error rate — প্রকৃত উচ্চারিত কথার তুলনায় রিকগনাইজার যে ভগ্নাংশ শব্দ ভুল করে (প্রতিস্থাপিত, বাদ পড়া বা ঢুকে পড়া)। এটিই স্পিচ রিকগনিশনের মানক নির্ভুলতা-মেট্রিক।
পেছনের শব্দদূষণ কি সত্যিই এতটা গুরুত্বপূর্ণ?
এটাই একক বৃহত্তম ফ্যাক্টর। যে শ্রেণির মডেল পরিষ্কার বেঞ্চমার্কে ~3–5% WER করে, তারাই CHiME-6 দূর-মাইক্রোফোন চ্যালেঞ্জে ~40% WER করেছিল। সবার আগে মাইক্রোফোন ঠিক করুন।
সিস্টেম যেন আমাদের পণ্যের নাম বিকৃত না করে — কী করব?
শব্দকোষ/কাস্টম ভোকাবুলারি ফিচার ব্যবহার করুন। সেশনের আগে ডোমেইন-পরিভাষা নিবন্ধন করাই স্পিচ ইঞ্জিনের ফ্রেজ-বায়াসিং API-গুলোর অস্তিত্বের কারণ, আর অডিওর মানের পরে এটিই সর্বোচ্চ-প্রভাবের সমাধান।
সম্পর্কিত পড়া: বহুভাষিক মিটিং যেভাবে চালাবেন · Zoom অনূদিত ক্যাপশন · Google Meet অনূদিত ক্যাপশন