Speechify নিজে পরিচালিত নয় এমন দুটি বেঞ্চমার্ক সেপ্টেম্বর ২০২৬-এ SpeechifyAI-এর Simba 3.2 মডেলের প্রথম অডিও আসার সময় পরিমাপ করেছে। Coval ২৪ ঘণ্টা জুড়ে (২৪ সেপ্টেম্বর ২০২৬ পর্যন্ত) মিডিয়ান ১০৬ মিলিসেকেন্ড রেকর্ড করে। Voice Arena একই দিনে US English বোর্ডে ১২৩ মিলিসেকেন্ড রেকর্ড করে, যা ১৪টি মডেলের মধ্যে সর্বনিম্ন। এই পোস্টে সংখ্যাগুলো কী বোঝায়, কেন প্রথম অডিও আসার সময়ই প্রধান ল্যাটেন্সি পরিমাপ, এবং নিজের কোড থেকে কীভাবে এটি মাপবেন, তা ব্যাখ্যা করা হয়েছে।
সংখ্যাগুলো
দুটি স্বাধীন পরিমাপ আমাদের নিজস্ব মাপের চেয়ে বেশি, কারণ এতে তাদের রানারের সার্ভার ও আমাদের সার্ভারের মাঝের নেটওয়ার্ক এবং অডিওর শুরুতে থাকা নিস্তব্ধতাও ধরা হয়। প্রতিটিই ওই দিনের সংশ্লিষ্ট বেঞ্চমার্কের ফল। দুই বোর্ডই চলমান, তাই সর্বশেষ তথ্যের জন্য দেখে নিন।
Voice Arena-এর US English বোর্ড, ২৪ সেপ্টেম্বর ২০২৬
উৎস: Voice Arena, ২৪ সেপ্টেম্বর ২০২৬-এ দেখা। বোর্ডে ১৪টি মডেলের সময় মাপা হয়েছে; এখানে দ্রুততম ছয়টি দেখানো হয়েছে।
প্রথম অডিও আসার সময়ই কেন তুলনাযোগ্য
ভয়েস এজেন্ট উত্তর দিলে বা অ্যাপ টেক্সট পড়ে শোনালে, ব্যবহারকারী অপেক্ষা করেন পাঠানো মুহূর্ত থেকে প্রথম শব্দ শোনা পর্যন্ত—এটিই time to first audio।
- শুধু first byte time শুনতে কেমন লাগবে, তা সবসময় বোঝায় না।
- স্ট্রিম নিস্তব্ধতা দিয়ে শুরু হতে পারে, তাই প্রথম শ্রাব্য স্যাম্পল না আসা পর্যন্ত কানে কিছুই পৌঁছায় না। প্রথম অডিও আসার সময় সেই নিস্তব্ধতাও ধরে।
- পুরো অডিও তৈরির সময় শেষ বাইট পর্যন্ত ধরা হয়।
- ফাইল সংরক্ষণের জন্য এটি গুরুত্বপূর্ণ, কিন্তু শুনতে শুরু করার জন্য নয়।
- কথোপকথনে দেরির অবকাশ কম।
- মানুষ সাধারণত কয়েক শ মিলিসেকেন্ডের মধ্যেই সাড়া দেয়। ভয়েস এজেন্টকে এই সময়ের মধ্যেই স্পিচ রিকগনিশন, ভাষা মডেল ও স্পিচ সিন্থেসিস শেষ করতে হয়, তাই প্রতিটি মিলিসেকেন্ডই গুরুত্বপূর্ণ।
মডেল ছোট না করেও Simba 3.2 কীভাবে দ্রুত হয়েছে
Coval-এর ডেটায়, Simba 3.2-এর দৈনিক মিডিয়ান ১৩ সেপ্টেম্বর ২০২৬-এ ৩৭৯ মিলিসেকেন্ড থেকে ১৮ সেপ্টেম্বর ১১৬ মিলিসেকেন্ডে নেমে আসে—পাঁচ দিনে প্রায় ৭০% কম।
মডেলে কোনো পরিবর্তন হয়নি। ওজন একই ছিল; কোনো distillation, quantization বা ছোট “turbo” সংস্করণ ছিল না। উন্নতি এসেছে মডেলের চারপাশের serving path থেকে:
- নতুন serving build, আলাদা GPU-তে; inference stack-এ low-level optimization করা হয়েছে, যাতে অডিও আরও আগে আসে।
- প্ল্যান, অধিকার ও rate-limit check লাইভ না হয়ে cache থেকে আসে; ফলে প্রথম বাইটের অপেক্ষা কমে।
- API gateway GPU-র একই এলাকায় থাকে, আর সংযোগ সব সময় সক্রিয় রাখা হয়।
- শুরুর প্রায় ১০০ মিলিসেকেন্ড নিস্তব্ধতা কমানো হয়েছে। Coval-এ Simba 3.2-এর leading silence ১৪ সেপ্টেম্বর ১০২ মিলিসেকেন্ড থেকে ১৩ মিলিসেকেন্ডে নেমে আসে।
মানে কোনো ছাড় দেওয়া হয়নি। Artificial Analysis টেক্সট-টু-স্পিচ লিডারবোর্ড-এ ২৩ সেপ্টেম্বর ২০২৬-এ Simba 3.2-এর Elo ছিল ১,২৩৭ (±১৪)—বৃহত্তর ৯২টি কণ্ঠের মধ্যে শীর্ষ ৫-এ। এর ওপরে থাকা সবকটির দাম বেশি।
আপনার অ্যাপে কীভাবে সর্বনিম্ন ল্যাটেন্সি পাবেন
- স্ট্রিমিং ব্যবহার করুন।
- POST /v1/audio/stream
- ব্যবহার করুন, যাতে অডিও তৈরি হওয়ার সঙ্গে সঙ্গে পাঠানো যায়;
- POST /v1/audio/speech
- পুরো অডিও তৈরি না হওয়া পর্যন্ত অপেক্ষা করে।
- Simba 3.2 ব্যবহার করুন।
- ইংরেজির জন্য
- model
- হিসেবে
- simba-3.2
- সেট করুন।
- model
- না দিলে API
- simba-3.0
- বেছে নেয়।
- একই সংযোগ পুনর্ব্যবহার করুন।
- একটি HTTP client তৈরি করে শুরুতেই সংযোগ খুলুন, তারপর পরের প্রতিটি অনুরোধে সেটিই ব্যবহার করুন; এতে DNS lookup ও TCP/TLS handshake বারবার লাগবে না।
- প্রতিটি বাক্য প্রস্তুত হলেই পাঠান।
- সামনে ভাষা মডেল থাকলে, প্রতিটি পূর্ণ বাক্য তৈরি হওয়ার সঙ্গে সঙ্গে পাঠান এবং সঠিক ক্রমে চালান।
- প্লেয়ারের জন্য উপযুক্ত ফরম্যাট বেছে নিন।
- audio/pcm
- (২৪ kHz) হলে encoding লাগে না। ব্যান্ডউইথ গুরুত্বপূর্ণ হলে MP3 বা Ogg Opus নিন।
- API-র কাছাকাছি থেকে চালান।
- API US East-এ hosted; তাই কাছের সার্ভার ব্যবহার করলে নেটওয়ার্ক ল্যাটেন্সি কম হবে।
LiveKit Agents দিয়ে বানাচ্ছেন? এই গাইড দিয়ে Speechify প্লাগইনে কণ্ঠ-সহায়ক তৈরি করুন, যেখানে ভাষা মডেল লেখার সঙ্গে সঙ্গে প্রতিটি বাক্য স্ট্রিম হয়। প্রতিটি ধাপের যুক্তি ও কোড latency ডকুমেন্টেশনে রয়েছে।
নিজে কীভাবে মাপবেন
আপনার কোড যেখান থেকে চলছে, সেখান থেকে স্ট্রিমিং response-এর প্রথম chunk আসার সময় মাপুন। পরিষ্কার ফল পেতে:
- শুরুর ১-২টি অনুরোধ বাদ দিন; এতে সংযোগ খোলার সময় ধরা পড়ে।
- প্রতিটি অনুরোধে টেক্সট বদলান, যেমন বাস্তব ট্রাফিকে হয়।
- একটির পর একটি অনুরোধ পাঠান, একসঙ্গে নয়।
- কমপক্ষে ২০টি অনুরোধ মাপুন এবং median (p50) ও p90 রিপোর্ট করুন; শুধু গড় বা সেরা রান ধরে সিদ্ধান্ত নেবেন না।
- PCM দিয়ে মাপুন; Ogg-এ প্রথম কয়েকটি বাইট অডিও নয়, header।
প্রতি স্ট্রিমিং response-এ Server-Timing header-এ ttfb মান থাকে, যা আমাদের অংশের সময় দেখায়; বাকিটা নেটওয়ার্ক ও আপনার stack। latency ডকুমেন্টেশনে Python ও TypeScript script আছে।
প্রায়শই জিজ্ঞাসিত প্রশ্ন
SpeechifyAI-এর Simba 3.2 প্রোডাকশনে US East-এ ১৫ সেপ্টেম্বর ২০২৬-এ মিডিয়ান ৫৬ মিলিসেকেন্ড এবং p90-এ ১০২ মিলিসেকেন্ডে প্রথম অডিও বাইট লেখে। স্বাধীন বেঞ্চমার্কে প্রথম অডিও আসার মিডিয়ান সময় ১০৬ মিলিসেকেন্ড (Coval, ২৪ ঘণ্টা) ও ১২৩ মিলিসেকেন্ড (Voice Arena, ২৪ সেপ্টেম্বর), যেখানে তাদের নেটওয়ার্ক ও শুরুর নিস্তব্ধতাও ধরা হয়।
Voice Arena-এর US English বোর্ডে ২৪ সেপ্টেম্বর ২০২৬-এ SpeechifyAI-এর Simba 3.2 ১৪টি মডেলের মধ্যে সবচেয়ে কম মিডিয়ান সময় (১২৩ মিলিসেকেন্ড) পেয়েছে; এর পরেই Inworld Realtime TTS 2 Research Preview (১৬৮.৫ মিলিসেকেন্ড)। বেঞ্চমার্ক চলমান, তাই র্যাঙ্কিং দেখার তারিখ দেখে নিন।
হ্যাঁ। POST /v1/audio/stream HTTP-তে অডিও স্ট্রিম করে (PCM, MP3, Ogg Opus বা AAC ফরম্যাটে), অডিও তৈরি হওয়ার সঙ্গে সঙ্গে। PCM-এ ল্যাটেন্সি সবচেয়ে কম, কারণ encoding লাগে না।
না। SpeechifyAI হলো Speechify-এর ডেভেলপার API, যার বিলিং Speechify রিডিং অ্যাপ থেকে আলাদা। রিডার সাবস্ক্রিপশনে API ব্যবহার অন্তর্ভুক্ত নয়। API প্ল্যান মাসিক, বার্ষিক বাধ্যবাধকতা নেই: ফ্রি প্ল্যানে মাসে ৫ লাখ অক্ষর, কার্ড ছাড়াই; এরপর Starter $১০ (প্রতি ১০ লক্ষ অক্ষর $১০), Pro $৯৯ ($৮), Scale $৪৯৯ ($৬)।
SpeechifyAI-এ Simba 3.2 চেষ্টা করুন: একটি ফ্রি API key তৈরি করুন এবং উপরের সংখ্যাগুলোর সঙ্গে আপনার প্রথম অনুরোধ মিলিয়ে দেখুন।

