"আমাদের মডেলটা নিজেরাই হোস্ট করা উচিত, এতে সস্তা পড়বে" — সফটওয়্যারের জগতে এই মুহূর্তে সবচেয়ে আত্মবিশ্বাসের সঙ্গে বলা ভুল কথাগুলোর একটি। কখনো কখনো এটি সত্যি। সাধারণত যিনি বলছেন তিনি এপিআইয়ের প্রতি-টোকেন দামের সঙ্গে GPU-র ঘণ্টাপ্রতি দাম মিলিয়ে দেখে থেমে গেছেন।

তুলনাটা এর চেয়ে আকর্ষণীয়, আর সৎ উত্তরটা এমন কিছু সংখ্যার ওপর নির্ভর করে যা বেশিরভাগ টিম মাপেইনি। কীভাবে হিসাব করবেন, আর যে তিনটি পরিস্থিতিতে হিসাব যা-ই বলুক নিজে হোস্ট করাই সঠিক — সবই এখানে।

দুটি বিকল্প, নির্দিষ্ট করে

এপিআই। আপনি একটি প্রোভাইডারকে লেখা পাঠান, লেখা ফেরত পান। টোকেনপ্রতি টাকা দেন, ইনপুট ও আউটপুট আলাদা। হার্ডওয়্যারের মালিক নন, সার্ভিং স্ট্যাক চালাতে হয় না, আর এই ত্রৈমাসিকের সেরা মডেলটাই পান।

নিজে হোস্ট করা। আপনি নিজের GPU-তে একটি ওপেন-ওয়েট মডেল চালান — সাধারণত Llama, Qwen, Mistral, Gemma আর DeepSeek পরিবারের কিছু — vLLM, TGI বা Ollama-র মতো সার্ভিং রানটাইম দিয়ে। কেউ ব্যবহার করুক বা না করুক, হার্ডওয়্যার আর বিদ্যুতের দাম আপনি দেন।

শেষের ওই কথাটাতেই আসল টাকা।

যে হিসাবটা মানুষ বাদ দেয়

এপিআই আপনার ব্যবহারের বিল করে। GPU আপনার মালিকানার বিল করে।

কেবল এই অসামঞ্জস্যই বেশিরভাগ ক্ষেত্রে সিদ্ধান্ত ঠিক করে দেয়। চালানোর যোগ্য হতে হলে আপনার GPU-কে ব্যস্ত থাকতে হবে, আর "ব্যস্ত" মানে বেশিরভাগ টিমের ধারণার চেয়ে অনেক বেশি কিছু: অফিস সময়ে চল্লিশজনের ব্যবহার করা একটি অভ্যন্তরীণ টুল কার্ডটিকে দিনের প্রায় তিন-চতুর্থাংশ আর গোটা সপ্তাহান্ত বসিয়ে রাখে। ওই বসে থাকা সময়ের পুরো দামই আপনি দিচ্ছেন।

হিসাবটা এভাবে করুন:

  1. এক মাসের প্রকৃত টোকেন পরিমাণ মাপুন। আপনার অনুমান নয় — আপনার লগ। ইনপুট আর আউটপুট আলাদা করে, কারণ আউটপুটের বিল সাধারণত কয়েক গুণ বেশি।
  2. যে মডেলটি সত্যিই ব্যবহার করতেন তার এপিআই দাম দিয়ে গুণ করুন। সৎ থাকুন: কাজটা ছোট, সস্তা মডেলে হয়ে গেলে তার সঙ্গেই তুলনা করুন, ফ্ল্যাগশিপের সঙ্গে নয়।
  3. হার্ডওয়্যার বিকল্পের পুরো দাম ধরুন। GPU ভাড়া বা কেনা-প্লাস-অবচয়, যে হোস্টে বসবে, বিদ্যুৎ, ওয়েটের জন্য স্টোরেজ, সঙ্গে এমন একটি সার্ভিং স্ট্যাক যা কেউ রক্ষণাবেক্ষণ করে।
  4. তারপর হার্ডওয়্যারের খরচকে আপনার প্রকৃত ব্যবহারের হার দিয়ে ভাগ করুন। ১৫% সময় ব্যস্ত থাকা কার্ডের প্রতি কার্যকর ঘণ্টার দাম তার ঘোষিত ঘণ্টাপ্রতি দামের প্রায় সাত গুণ।

চার নম্বর ধাপটাই বাদ পড়ে, আর সাধারণত ওটাই উত্তর ঠিক করে দেয়।

ফলাফলের সাধারণ চেহারা:

আপনার পরিস্থিতি

সাধারণত সঠিক

খাপছাড়া বা কম পরিমাণ

এপিআই। GPU ভরাতেই পারবেন না।

স্থির, বেশি, চব্বিশ ঘণ্টার পরিমাণ

নিজে হোস্ট করা প্রতিযোগিতায় আসে

পরীক্ষা-নিরীক্ষা, বা পণ্য এখনো বাজার পায়নি

এপিআই। অনুমানের জন্য হার্ডওয়্যার কিনবেন না।

ঘনভাবে সাজানো যায় এমন ব্যাচ কাজ

নিজে হোস্ট করা — ব্যস্ততা আপনার নিয়ন্ত্রণে

আইনত যে ডেটা বাইরে যেতে পারে না

নিজে হোস্ট করা, আর তখন খরচ প্রশ্নই নয়

নিজে হোস্ট করার তিনটি সত্যিকারের ভালো কারণ

১. ডেটা বাইরে যেতে পারে না। আইনি, চুক্তিগত বা নিয়ন্ত্রক বাধ্যবাধকতা। রোগীর তথ্য, নিয়ন্ত্রকের অধীন আর্থিক ডেটা, তৃতীয় পক্ষের প্রক্রিয়াকরণ নিষিদ্ধ করা কোনো ক্লায়েন্ট চুক্তি। এটি খরচের সিদ্ধান্তই নয়, আর প্রযোজ্য হলে এটিই শেষ কথা।

সৎ সতর্কতাটি লক্ষ করুন: বড় প্রোভাইডাররা জিরো-রিটেনশন স্তর আর ডেটা-প্রসেসিং চুক্তি দেয়, যা এমন অনেক নীতির শর্ত পূরণ করে যেগুলোর জন্য মানুষ ভাবে নিজে হোস্ট করতেই হবে। GPU কেনার আগে চুক্তিটা পড়ুন — বাধাটা প্রায়ই ভয়ের চেয়ে নরম।

২. অনুমেয়, বেশি, ধারাবাহিক পরিমাণ। স্থির চাপই নিজের হার্ডওয়্যারকে দক্ষ করে তোলে। ডকুমেন্ট প্রক্রিয়াকরণ পাইপলাইন, বাল্ক শ্রেণিবিন্যাস, কিউ করে পূর্ণ ব্যবহারে চালানো যায় এমন যেকোনো কিছু। আপনার কাজ যত বেশি ব্যাচ জবের মতো আর যত কম চ্যাট ইন্টারফেসের মতো, নিজে হোস্ট করা তত ভালো।

৩. এপিআই যা দেবে না, তেমন কিছু দরকার। মালিকানাধীন ডেটায় গভীর ফাইন-টিউনিং, অস্বাভাবিক স্যাম্পলিং নিয়ন্ত্রণ, মডেল অপরিবর্তিত থাকার নিশ্চয়তা — প্রোভাইডার কোনো মডেল ভার্সন বাতিল করা সত্যিকারের একটি পরিচালন ঝুঁকি, যদি আপনার প্রম্পট সেটির জন্য টিউন করা থাকে — বা এয়ার-গ্যাপড ডিপ্লয়মেন্ট।

তিনটি খারাপ কারণ

"এতে সস্তা পড়বে।" কেবল বেশি ও স্থির ব্যবহারে। আগে চার নম্বর ধাপের হিসাব করুন। যে টিমগুলো ফিরে আসে, তাদের বেশিরভাগই ঠিক এই কারণটাই বলে।

"এটি বেশি নিরাপদ।" হতে পারে, তবে কেবল যদি আপনি সত্যিই সুরক্ষিত করেন। হার্ডেন না করা সার্ভারে খোলা ইনফারেন্স এন্ডপয়েন্টসহ নিজে হোস্ট করা মডেল ডেটা-প্রসেসিং চুক্তির অধীনে থাকা স্বনামধন্য এপিআইয়ের চেয়েও খারাপ। নিজে হোস্ট করা দায়িত্বটা আপনার কাঁধে সরায়; দায়িত্ব মুছে দেয় না। দেখুন Linux সার্ভার সুরক্ষিত করার গাইড

"ভেন্ডর লক-ইন এড়াব।" আংশিক সত্যি, আর এটি একটি ভেন্ডর নির্ভরতার বদলে একটি পরিচালন নির্ভরতা দেয়। এখন মডেল আপডেট, সার্ভিং-স্ট্যাক আপগ্রেড, GPU ড্রাইভার সামঞ্জস্য আর ক্ষমতা পরিকল্পনা — সবই আপনার। এটি একবারের মাইগ্রেশন নয়, একটি টিমের সমান চলমান কাজ।

নিজে হোস্ট করতে আসলে কী লাগে

সিদ্ধান্ত যদি এখনো নিজে হোস্ট করাই হয়, তাহলে বাজারের তালিকা এটি।

GPU মেমোরিই সব ঠিক করে। মডেলের ওয়েট এঁটে যেতে হবে, সঙ্গে প্রতিটি সমসাময়িক রিকোয়েস্টের KV ক্যাশ। মোটামুটি হিসাব: ৪-বিটে কোয়ান্টাইজ করা ৭–৮B মডেল ১৬ জিবিতে স্বচ্ছন্দে আঁটে; ৪-বিটে ৭০B মডেলের জন্য চাই প্রায় ৪০–৪৮ জিবি; পূর্ণ ১৬-বিট নির্ভুলতায় চালালে এই সংখ্যাগুলো মোটামুটি দ্বিগুণ। কোয়ান্টাইজেশনই প্রধান হাতিয়ার, আর এতে কিছুটা মান কমে — কতটা তা কাজের ধরনের ওপর নির্ভর করে, তাই ধরে না নিয়ে পরীক্ষা করুন।

একটি সার্ভিং রানটাইম, ডেমো স্ক্রিপ্ট নয়। প্রোডাকশনের জন্য vLLM বা TGI — এরা কন্টিনিউয়াস ব্যাচিং করে, যা একবারে একটি রিকোয়েস্ট সামলানো আর ত্রিশটি সামলানোর পার্থক্য। Ollama ডেভেলপমেন্টের জন্য চমৎকার, আর চাপের মুখে যেটি চাই সেটি নয়।

দায়িত্ব নেওয়ার মতো একজন। মডেল আপডেট, ড্রাইভার ও CUDA সামঞ্জস্য, মনিটরিং, ক্ষমতা পরিকল্পনা, আর এন্ডপয়েন্ট উত্তর দেওয়া বন্ধ করলে অন-কল থাকার ব্যবস্থা। এই খরচটি তুলনায় কখনো আসে না আর কখনো শেষও হয় না।

যে হার্ডওয়্যার সত্যিই পাওয়া যায়। GPU-র সরবরাহ আর দাম বছরের পর বছর অস্থির। আপনি বাস্তবে যা পাবেন, আর যে সময়সীমার মধ্যে পাবেন, তারই দাম ধরুন। সেই পর্যায়ে শেয়ার্ড মেশিনের বড় অংশ নয়, একটি ডেডিকেটেড মেশিন দরকার।

লেটেন্সি, যা দুই দিকেই কাটে

ঢাকা থেকে কোনো প্রোভাইডারের অঞ্চলে এপিআই কল করলে সত্যিকারের নেটওয়ার্ক লেটেন্সি যোগ হয় — মডেল একটি টোকেনও তৈরি করার আগেই প্রায়ই ১০০–৩০০ মিলিসেকেন্ড। একই নেটওয়ার্কে থাকা স্থানীয় GPU সেটি পুরোপুরি মুছে দেয়, যা ইন্টারঅ্যাক্টিভ যেকোনো কিছুর জন্য গুরুত্বপূর্ণ।

কিন্তু ব্যস্ত স্থানীয় GPU লাইন ধরায়। একসঙ্গে অনেক রিকোয়েস্টে, ক্ষমতার সীমায় থাকা নিজে-হোস্ট করা এন্ডপয়েন্ট পর্দার আড়ালে স্থিতিস্থাপকভাবে বেড়ে যাওয়া এপিআইয়ের চেয়ে অনেক ধীর হতে পারে। স্থানীয়টি নিচের দিকে জেতে, ওপরের দিকে হারে।

আপনার পণ্যের সঙ্গে মেলে এমন মাপকাঠিটাই মাপুন: মানুষ অপেক্ষা করছে এমন যেকোনো কিছুর জন্য প্রথম টোকেন আসার সময়, আর ব্যাচ কাজের জন্য মোট থ্রুপুট

বেশিরভাগ টিম শেষ পর্যন্ত যেখানে পৌঁছায়

কোনো একটিতে নয়। দুটোতেই — কাজ অনুযায়ী ভাগ করে।

বাস্তবে যে ধাঁচটি কাজ করে: ছোট, নিজে-হোস্ট করা বা সস্তা মডেল সামলায় বেশি পরিমাণের সহজ কাজ — শ্রেণিবিন্যাস, তথ্য বের করা, ট্যাগ করা, রাউটিং — আর এপিআই সামলায় অল্প পরিমাণের সত্যিকারের কঠিন যুক্তিনির্ভর কাজ। প্রায়ই এতে ৯০% কল যায় সস্তা পথে, আর ৯০% মূল্য আসে দামি পথ থেকে।

এর পূর্বশর্ত হলো শুরু থেকেই মডেল কলের ওপর একটি বিমূর্ত স্তর, যাতে একটি কাজকে এক দিক থেকে আরেক দিকে সরানো রিফ্যাক্টর নয়, কেবল কনফিগ পরিবর্তন হয়। এটি আগেভাগে বানান; শুরুতে সস্তা, পরে দামি।

সিদ্ধান্তের পথ

  1. ডেটা কোথায় যাবে তার ওপর কি কঠিন আইনি বা চুক্তিগত বাধা আছে? → নিজে হোস্ট করুন। শেষ।
  2. এক মাসের প্রকৃত টোকেন ব্যবহার কি মেপেছেন? → না মেপে থাকলে এপিআই ব্যবহার করুন আর মাপুন। অনুমানের ওপর এই সিদ্ধান্ত নেওয়া যায় না।
  3. GPU কি অর্ধেকেরও বেশি সময় ব্যস্ত থাকবে? → না হলে এপিআই।
  4. সার্ভিং স্ট্যাকের দায়িত্ব চলমানভাবে নেওয়ার মতো কেউ আছেন? → না থাকলে এপিআই।
  5. কাজটি কি ইন্টারঅ্যাক্টিভ নয়, ব্যাচ করা যায়? → নিজে হোস্ট করার পক্ষে যুক্তি অনেকটাই জোরালো হয়।
  6. এখনো পরিষ্কার নয়? → এখন এপিআই, ছয় মাস পর সত্যিকারের সংখ্যা নিয়ে আবার ভাবুন। এদিকে ভুল হলে খেসারত একটি বিল; ওদিকে ভুল হলে খেসারত বসে থাকা হার্ডওয়্যার আর মনোযোগ হারানো একটি টিম।

যে খরচগুলো তুলনায় কখনো আসে না

এই সিদ্ধান্তের স্প্রেডশিট সংস্করণ দুটি সংখ্যা মেলায়। আসলটিতে আরও চারটি আছে, আর বাস্তবে সেগুলোই সিদ্ধান্ত ঠিক করে দেয়।

মডেল আপডেট এখন আপনার প্রকল্প। এপিআইতে সীমানা এগোলে আপনি সেটি পেয়ে যান। নিজে হোস্ট করলে ভালো একটি ওপেন মডেল মানে একটি মাইগ্রেশন: নিজের প্রম্পটের বিপরীতে মান আবার যাচাই, যা টিউন করা ছিল তা আবার টিউন, থ্রুপুট আবার মাপা, আবার ডিপ্লয়। এটি সত্যিকারের কাজ, বছরে কয়েকবার — আর বাদ দিলে চুপচাপ পিছিয়ে পড়া।

ব্যবহারের হার স্থির নয়। সর্বোচ্চ চাপের মাপে নেওয়া GPU গড় চাপে বসে থাকে, আর গড়ের মাপে নেওয়া GPU সর্বোচ্চ চাপে লাইন ধরায়। স্থিতিস্থাপক স্কেলিং ঠিক এই জিনিসটাই আপনি ছেড়ে দিয়েছেন। বেশিরভাগ টিম শেষ পর্যন্ত প্রয়োজনের চেয়ে বেশি নিয়ে বসে থাকে, যাতে কার্যকর খরচ সেই হিসাবের চেয়েও খারাপ হয় যা দিয়ে কেনাটার যৌক্তিকতা দেখানো হয়েছিল।

কোয়ান্টাইজেশনে মান কমে, অসমভাবে। শ্রেণিবিন্যাসে ৪-বিট মডেল প্রায়ই পূর্ণ নির্ভুলতার মডেল থেকে আলাদা করা যায় না, আর বহুধাপের যুক্তিতে লক্ষণীয়ভাবে খারাপ। ক্ষতিটা কাজের ধরনের ওপর নির্ভর করে, তাই জানার একমাত্র উপায় নিজের কাজের ওপর মূল্যায়ন করা — অর্থাৎ একটি মূল্যায়ন সেট বানানো, যা নিজেই একটি প্রকল্প।

কেউ একজন অন-কল থাকছেন। রাত ২টায় উত্তর দেওয়া বন্ধ করা ইনফারেন্স এন্ডপয়েন্ট এখন আপনার আউটেজ। এপিআইতে সেটি অন্য কারও, আর তাঁদের একটি স্ট্যাটাস পেজ আর একটি টিম আছে।

এর কোনোটিই নিজে হোস্ট করাকে ভুল প্রমাণ করে না। এটি কেবল সৎ তুলনাটিকে দাঁড় করায় "এপিআইয়ের খরচ" বনাম "হার্ডওয়্যার এবং একজন ইঞ্জিনিয়ারের চলমান মনোযোগ" হিসেবে — আর দ্বিতীয় পদটি একবার লিখে ফেললে প্রতি-টোকেনের হিসাব যতটা বোঝায়, ব্রেক-ইভেন তার চেয়ে অনেক দূরে সরে যায়।

সচরাচর জিজ্ঞাসা

নিজে LLM হোস্ট করা কি এপিআই ব্যবহারের চেয়ে সস্তা? কেবল বেশি ও ধারাবাহিক ব্যবহারে। এপিআই ব্যবহারের বিল করে; GPU মালিকানার বিল করে। তুলনার আগে হার্ডওয়্যারের খরচকে আপনার প্রকৃত ব্যবহারের হার দিয়ে ভাগ করুন — দিনের তিন-চতুর্থাংশ বসে থাকা কার্ডের প্রতি কার্যকর ঘণ্টার দাম তার ঘোষিত দামের কয়েক গুণ।

স্থানীয়ভাবে মডেল চালাতে কোন GPU লাগবে? প্যারামিটার আর কোয়ান্টাইজেশনের ওপর নির্ভর করে। মোটামুটি: ৪-বিটে ৭–৮B মডেলের জন্য ১৬ জিবি VRAM, ৪-বিটে ৭০B-র জন্য ৪০–৪৮ জিবি, আর পূর্ণ নির্ভুলতায় এর প্রায় দ্বিগুণ। KV ক্যাশের জন্য বাড়তি জায়গা রাখুন, যা সমসাময়িকতা আর কনটেক্সট দৈর্ঘ্যের সঙ্গে বাড়ে।

ওপেন মডেল কি এখন যথেষ্ট ভালো? বেশিরভাগ প্রোডাকশন কাজের জন্য হ্যাঁ — শ্রেণিবিন্যাস, তথ্য বের করা, সারসংক্ষেপ, কাঠামোবদ্ধ আউটপুট, সহজ কোড। কঠিন বহুধাপের যুক্তিতে ফ্রন্টিয়ার মডেলের সঙ্গে ব্যবধান এখনো চোখে পড়ে, আর ঠিক সেই কাজটাই এপিআইতে রাখা উচিত।

নিজে হোস্ট করা কি বেশি নিরাপদ? কেবল যদি ঠিকভাবে সুরক্ষিত করেন। উন্মুক্ত ইনফারেন্স এন্ডপয়েন্টসহ হার্ডেন না করা সার্ভার জিরো-রিটেনশন চুক্তির অধীন স্বনামধন্য প্রোভাইডারের চেয়েও খারাপ। নিজে হোস্ট করা দায়িত্বটা আপনার কাঁধে সরিয়ে দেয়।

নিজের হার্ডওয়্যার না নিয়ে হোস্ট করা এপিআই মডেল কি ফাইন-টিউন করা যায়? প্রায়ই যায়, আর নিজের হার্ডওয়্যার লাগবে ধরে নেওয়ার আগে এটি দেখে নেওয়া উচিত। প্রোভাইডারের ফাইন-টিউনিং অনেক ক্ষেত্রেই কাজ চালায়, পরিচালন খরচের ভগ্নাংশে; নিজে হোস্ট করা দরকার হয় গভীরতর কাস্টমাইজেশনে, বা যেখানে ওয়েটগুলোই ভেতরে রাখতে হবে।

CPU-তে মডেল চালানো কেমন? ছোট মডেল, ব্যাচ কাজ আর কম রিকোয়েস্টের ক্ষেত্রে চলে, আর ডেভেলপমেন্টের জন্য সত্যিই কাজের। কোনো মাপেই ইন্টারঅ্যাক্টিভ ব্যবহারের জন্য নয় — থ্রুপুট এক ধাপ কম, আর ব্যবহারকারী সেটি টের পান।