Skip to main content
  1. হোম
  2. API
  3. ২০২৬ সালে টেক্সট-টু-স্পিচ API ল্যাটেন্সি: স্বাধীনভাবে মাপা প্রথম অডিও আসার সময়
প্রকাশের তারিখ •API

২০২৬ সালে টেক্সট-টু-স্পিচ API ল্যাটেন্সি: স্বাধীনভাবে মাপা প্রথম অডিও আসার সময়

স্পিচিফাই টিম

স্পিচিফাই টিম


স্পিচিফাই API দেয় ৩০০ মিলিসেকেন্ড 
লেটেন্সি, প্রাকৃতিক মানের কণ্ঠস্বর
এবং ৫০+ ভাষা

Apple২০২৫ অ্যাপল ডিজাইন অ্যাওয়ার্ড
৫ কোটি+ ব্যবহারকারী

Speechify নিজে পরিচালিত নয় এমন দুটি বেঞ্চমার্ক সেপ্টেম্বর ২০২৬-এ SpeechifyAI-এর Simba 3.2 মডেলের প্রথম অডিও আসার সময় পরিমাপ করেছে। Coval ২৪ ঘণ্টা জুড়ে (২৪ সেপ্টেম্বর ২০২৬ পর্যন্ত) মিডিয়ান ১০৬ মিলিসেকেন্ড রেকর্ড করে। Voice Arena একই দিনে US English বোর্ডে ১২৩ মিলিসেকেন্ড রেকর্ড করে, যা ১৪টি মডেলের মধ্যে সর্বনিম্ন। এই পোস্টে সংখ্যাগুলো কী বোঝায়, কেন প্রথম অডিও আসার সময়ই প্রধান ল্যাটেন্সি পরিমাপ, এবং নিজের কোড থেকে কীভাবে এটি মাপবেন, তা ব্যাখ্যা করা হয়েছে।

সংখ্যাগুলো

বেঞ্চমার্ক

কী মাপা হয়

Simba 3.2

কখন

Voice Arena, US English board

রিয়েল-টাইম স্ট্রিমিং পথে প্রথম অডিও আসার মিডিয়ান সময়

১২৩ মিলিসেকেন্ড, ১৪টির মধ্যে সর্বনিম্ন

২৪ সেপ্টেম্বর ২০২৬

Coval

প্রথম শ্রাব্য স্যাম্পল আসার আগে থাকা নিস্তব্ধতাসহ প্রথম অডিও আসার মিডিয়ান সময়; ওপেন-সোর্স টুল, US East থেকে প্রতি ৩০ মিনিটে চালানো হয়

১০৬ মিলিসেকেন্ড

২৪ ঘণ্টা, ২৪ সেপ্টেম্বর ২০২৬ পর্যন্ত

SpeechifyAI প্রোডাকশন ট্রাফিক (নিজস্ব পরিমাপ)

আমাদের API-র US East অঞ্চলে বাস্তব গ্রাহক অনুরোধে প্রথম অডিও বাইট লেখা পর্যন্ত সময়

৫৬ মিলিসেকেন্ড p50, ১০২ মিলিসেকেন্ড p90

১৫ সেপ্টেম্বর ২০২৬

দুটি স্বাধীন পরিমাপ আমাদের নিজস্ব মাপের চেয়ে বেশি, কারণ এতে তাদের রানারের সার্ভার ও আমাদের সার্ভারের মাঝের নেটওয়ার্ক এবং অডিওর শুরুতে থাকা নিস্তব্ধতাও ধরা হয়। প্রতিটিই ওই দিনের সংশ্লিষ্ট বেঞ্চমার্কের ফল। দুই বোর্ডই চলমান, তাই সর্বশেষ তথ্যের জন্য দেখে নিন।

Voice Arena-এর US English বোর্ড, ২৪ সেপ্টেম্বর ২০২৬

মডেল

প্রথম অডিও আসার মিডিয়ান সময়

SpeechifyAI Simba 3.2 রিয়েল-টাইম

১২৩ মিলিসেকেন্ড

Inworld Realtime TTS 2 Research Preview

১৬৮.৫ মিলিসেকেন্ড

Gradium TTS রিয়েল-টাইম

২৩৬ মিলিসেকেন্ড

Cartesia Sonic-3.5 রিয়েল-টাইম

২৫০ মিলিসেকেন্ড

Smallest AI Lightning 3.1 Pro রিয়েল-টাইম

২৬৩.৫ মিলিসেকেন্ড

Fish Audio S2 Pro রিয়েল-টাইম

২৬৭ মিলিসেকেন্ড

উৎস: Voice Arena, ২৪ সেপ্টেম্বর ২০২৬-এ দেখা। বোর্ডে ১৪টি মডেলের সময় মাপা হয়েছে; এখানে দ্রুততম ছয়টি দেখানো হয়েছে।

প্রথম অডিও আসার সময়ই কেন তুলনাযোগ্য

ভয়েস এজেন্ট উত্তর দিলে বা অ্যাপ টেক্সট পড়ে শোনালে, ব্যবহারকারী অপেক্ষা করেন পাঠানো মুহূর্ত থেকে প্রথম শব্দ শোনা পর্যন্ত—এটিই time to first audio।

  • শুধু first byte time শুনতে কেমন লাগবে, তা সবসময় বোঝায় না।
  • স্ট্রিম নিস্তব্ধতা দিয়ে শুরু হতে পারে, তাই প্রথম শ্রাব্য স্যাম্পল না আসা পর্যন্ত কানে কিছুই পৌঁছায় না। প্রথম অডিও আসার সময় সেই নিস্তব্ধতাও ধরে।
  • পুরো অডিও তৈরির সময় শেষ বাইট পর্যন্ত ধরা হয়।
  • ফাইল সংরক্ষণের জন্য এটি গুরুত্বপূর্ণ, কিন্তু শুনতে শুরু করার জন্য নয়।
  • কথোপকথনে দেরির অবকাশ কম।
  • মানুষ সাধারণত কয়েক শ মিলিসেকেন্ডের মধ্যেই সাড়া দেয়। ভয়েস এজেন্টকে এই সময়ের মধ্যেই স্পিচ রিকগনিশন, ভাষা মডেল ও স্পিচ সিন্থেসিস শেষ করতে হয়, তাই প্রতিটি মিলিসেকেন্ডই গুরুত্বপূর্ণ।

মডেল ছোট না করেও Simba 3.2 কীভাবে দ্রুত হয়েছে

Coval-এর ডেটায়, Simba 3.2-এর দৈনিক মিডিয়ান ১৩ সেপ্টেম্বর ২০২৬-এ ৩৭৯ মিলিসেকেন্ড থেকে ১৮ সেপ্টেম্বর ১১৬ মিলিসেকেন্ডে নেমে আসে—পাঁচ দিনে প্রায় ৭০% কম।

মডেলে কোনো পরিবর্তন হয়নি। ওজন একই ছিল; কোনো distillation, quantization বা ছোট “turbo” সংস্করণ ছিল না। উন্নতি এসেছে মডেলের চারপাশের serving path থেকে:

  • নতুন serving build, আলাদা GPU-তে; inference stack-এ low-level optimization করা হয়েছে, যাতে অডিও আরও আগে আসে।
  • প্ল্যান, অধিকার ও rate-limit check লাইভ না হয়ে cache থেকে আসে; ফলে প্রথম বাইটের অপেক্ষা কমে।
  • API gateway GPU-র একই এলাকায় থাকে, আর সংযোগ সব সময় সক্রিয় রাখা হয়।
  • শুরুর প্রায় ১০০ মিলিসেকেন্ড নিস্তব্ধতা কমানো হয়েছে। Coval-এ Simba 3.2-এর leading silence ১৪ সেপ্টেম্বর ১০২ মিলিসেকেন্ড থেকে ১৩ মিলিসেকেন্ডে নেমে আসে।

মানে কোনো ছাড় দেওয়া হয়নি। Artificial Analysis টেক্সট-টু-স্পিচ লিডারবোর্ড-এ ২৩ সেপ্টেম্বর ২০২৬-এ Simba 3.2-এর Elo ছিল ১,২৩৭ (±১৪)—বৃহত্তর ৯২টি কণ্ঠের মধ্যে শীর্ষ ৫-এ। এর ওপরে থাকা সবকটির দাম বেশি।

আপনার অ্যাপে কীভাবে সর্বনিম্ন ল্যাটেন্সি পাবেন

  1. স্ট্রিমিং ব্যবহার করুন।
  2. POST /v1/audio/stream
  3. ব্যবহার করুন, যাতে অডিও তৈরি হওয়ার সঙ্গে সঙ্গে পাঠানো যায়;
  4. POST /v1/audio/speech
  5. পুরো অডিও তৈরি না হওয়া পর্যন্ত অপেক্ষা করে।
  6. Simba 3.2 ব্যবহার করুন।
  7. ইংরেজির জন্য
  8. model
  9. হিসেবে
  10. simba-3.2
  11. সেট করুন।
  12. model
  13. না দিলে API
  14. simba-3.0
  15. বেছে নেয়।
  16. একই সংযোগ পুনর্ব্যবহার করুন।
  17. একটি HTTP client তৈরি করে শুরুতেই সংযোগ খুলুন, তারপর পরের প্রতিটি অনুরোধে সেটিই ব্যবহার করুন; এতে DNS lookup ও TCP/TLS handshake বারবার লাগবে না।
  18. প্রতিটি বাক্য প্রস্তুত হলেই পাঠান।
  19. সামনে ভাষা মডেল থাকলে, প্রতিটি পূর্ণ বাক্য তৈরি হওয়ার সঙ্গে সঙ্গে পাঠান এবং সঠিক ক্রমে চালান।
  20. প্লেয়ারের জন্য উপযুক্ত ফরম্যাট বেছে নিন।
  21. audio/pcm
  22. (২৪ kHz) হলে encoding লাগে না। ব্যান্ডউইথ গুরুত্বপূর্ণ হলে MP3 বা Ogg Opus নিন।
  23. API-র কাছাকাছি থেকে চালান।
  24. API US East-এ hosted; তাই কাছের সার্ভার ব্যবহার করলে নেটওয়ার্ক ল্যাটেন্সি কম হবে।

LiveKit Agents দিয়ে বানাচ্ছেন? এই গাইড দিয়ে Speechify প্লাগইনে কণ্ঠ-সহায়ক তৈরি করুন, যেখানে ভাষা মডেল লেখার সঙ্গে সঙ্গে প্রতিটি বাক্য স্ট্রিম হয়। প্রতিটি ধাপের যুক্তি ও কোড latency ডকুমেন্টেশনে রয়েছে।

নিজে কীভাবে মাপবেন

আপনার কোড যেখান থেকে চলছে, সেখান থেকে স্ট্রিমিং response-এর প্রথম chunk আসার সময় মাপুন। পরিষ্কার ফল পেতে:

  • শুরুর ১-২টি অনুরোধ বাদ দিন; এতে সংযোগ খোলার সময় ধরা পড়ে।
  • প্রতিটি অনুরোধে টেক্সট বদলান, যেমন বাস্তব ট্রাফিকে হয়।
  • একটির পর একটি অনুরোধ পাঠান, একসঙ্গে নয়।
  • কমপক্ষে ২০টি অনুরোধ মাপুন এবং median (p50) ও p90 রিপোর্ট করুন; শুধু গড় বা সেরা রান ধরে সিদ্ধান্ত নেবেন না।
  • PCM দিয়ে মাপুন; Ogg-এ প্রথম কয়েকটি বাইট অডিও নয়, header।

প্রতি স্ট্রিমিং response-এ Server-Timing header-এ ttfb মান থাকে, যা আমাদের অংশের সময় দেখায়; বাকিটা নেটওয়ার্ক ও আপনার stack। latency ডকুমেন্টেশনে Python ও TypeScript script আছে।

প্রায়শই জিজ্ঞাসিত প্রশ্ন

SpeechifyAI-এর Simba 3.2 প্রোডাকশনে US East-এ ১৫ সেপ্টেম্বর ২০২৬-এ মিডিয়ান ৫৬ মিলিসেকেন্ড এবং p90-এ ১০২ মিলিসেকেন্ডে প্রথম অডিও বাইট লেখে। স্বাধীন বেঞ্চমার্কে প্রথম অডিও আসার মিডিয়ান সময় ১০৬ মিলিসেকেন্ড (Coval, ২৪ ঘণ্টা) ও ১২৩ মিলিসেকেন্ড (Voice Arena, ২৪ সেপ্টেম্বর), যেখানে তাদের নেটওয়ার্ক ও শুরুর নিস্তব্ধতাও ধরা হয়।

Voice Arena-এর US English বোর্ডে ২৪ সেপ্টেম্বর ২০২৬-এ SpeechifyAI-এর Simba 3.2 ১৪টি মডেলের মধ্যে সবচেয়ে কম মিডিয়ান সময় (১২৩ মিলিসেকেন্ড) পেয়েছে; এর পরেই Inworld Realtime TTS 2 Research Preview (১৬৮.৫ মিলিসেকেন্ড)। বেঞ্চমার্ক চলমান, তাই র্যাঙ্কিং দেখার তারিখ দেখে নিন।

হ্যাঁ। POST /v1/audio/stream HTTP-তে অডিও স্ট্রিম করে (PCM, MP3, Ogg Opus বা AAC ফরম্যাটে), অডিও তৈরি হওয়ার সঙ্গে সঙ্গে। PCM-এ ল্যাটেন্সি সবচেয়ে কম, কারণ encoding লাগে না।

না। SpeechifyAI হলো Speechify-এর ডেভেলপার API, যার বিলিং Speechify রিডিং অ্যাপ থেকে আলাদা। রিডার সাবস্ক্রিপশনে API ব্যবহার অন্তর্ভুক্ত নয়। API প্ল্যান মাসিক, বার্ষিক বাধ্যবাধকতা নেই: ফ্রি প্ল্যানে মাসে ৫ লাখ অক্ষর, কার্ড ছাড়াই; এরপর Starter $১০ (প্রতি ১০ লক্ষ অক্ষর $১০), Pro $৯৯ ($৮), Scale $৪৯৯ ($৬)।

SpeechifyAI-এ Simba 3.2 চেষ্টা করুন: একটি ফ্রি API key তৈরি করুন এবং উপরের সংখ্যাগুলোর সঙ্গে আপনার প্রথম অনুরোধ মিলিয়ে দেখুন।

স্পিচিফাইয়ের জনপ্রিয় কণ্ঠ দ্রুত, স্কেলযোগ্য ও ডেভেলপার-বান্ধব API-র মাধ্যমে ব্যবহার করুন

API অ্যাক্সেস নিন
Sparse JavaScript keywords import, from, const, await on a white background

এই নিবন্ধটি শেয়ার করুন

স্পিচিফাই টিম

স্পিচিফাই টিম


স্পিচিফাই টিম

Speechify

স্পিচিফাই সম্পর্কে

#১ টেক্সট-টু-স্পিচ রিডার

স্পিচিফাই পৃথিবীর শীর্ষস্থানীয় টেক্সট-টু-স্পিচ প্ল্যাটফর্ম, যা ৫ কোটি+ ব্যবহারকারীর কাছে ভরসাযোগ্য এবং এর টেক্সট-টু-স্পিচ iOS, অ্যান্ড্রয়েড, ক্রোম এক্সটেনশন, ওয়েব অ্যাপ আর ম্যাক ডেস্কটপ অ্যাপসে ৫ লক্ষ+ ফাইভ-স্টার রিভিউ পেয়েছে। ২০২৫ সালে অ্যাপল স্পিচিফাই-কে মর্যাদাপূর্ণ অ্যাপল ডিজাইন অ্যাওয়ার্ড প্রদান করে WWDC-তে এবং একে বলে, “মানুষের জীবনে দারুণ সহায়ক একটি গুরুত্বপূর্ণ রিসোর্স।” স্পিচিফাই ৬০+ ভাষায় ১,০০০+ প্রাকৃতিক কণ্ঠ নিয়ে প্রায় ২০০ দেশে ব্যবহৃত হচ্ছে। সেলিব্রিটি কণ্ঠের মধ্যে রয়েছে স্নুপ ডগ আর গুইনেথ পেল্ট্রো। নির্মাতা ও ব্যবসার জন্য স্পিচিফাই স্টুডিও উন্নত সব টুল দেয়, যার মধ্যে রয়েছে AI ভয়েস জেনারেটর, AI ভয়েস ক্লোনিং, AI ডাবিং আর AI ভয়েস চেঞ্জার। স্পিচিফাই-এর উচ্চমানের এবং খরচ-সাশ্রয়ী টেক্সট-টু-স্পিচ API-এর মাধ্যমে অসংখ্য শীর্ষ পণ্য সম্ভব হয়েছে। দ্য ওয়াল স্ট্রিট জার্নাল, CNBC, Forbes, TechCrunch এবং অন্যান্য বড় সংবাদমাধ্যমে স্পিচিফাই নিয়ে প্রতিবেদন প্রকাশিত হয়েছে; এটি বিশ্বের সর্ববৃহৎ টেক্সট-টু-স্পিচ প্রদানকারী। আরও জানতে ভিজিট করুন speechify.com/news, speechify.com/blog এবং speechify.com/press।