শূন্যস্থানের দাম: ক্রিকেট ডেটা পাইপলাইনের নীরব ব্যর্থতা এবং অডিট ট্রেইলের নতুন অর্থনীতি
**মূল উত্তর (৫৮ শব্দ):** ক্রিকেট ডেটা পাইপলাইনে “খালি ঘর” আর “শূন্য” এক নয়। খালি ঘর মানে তথ্য অজানা; শূন্য মানে তথ্য নেই। দুটিকে এক করে ফেললে বিশ্লেষণ ভুল সিদ্ধান্ত দেয়। সঠিক পদ্ধতি হলো অজানা তথ্য অজানা হিসেবে লিখে রাখা এবং কভারেজ হার প্রকাশ করা। **মূল তথ্য:** - ২০১৭ সালে ঢাকায় বিপিএলের ৪৬ ম্যাচ, ৭ ক্লাব ও ১২,৪০০ বল-বল ইভেন্ট এক ডেটাবেসে ট্যাগ করা হয়; রিপোর্ট ত্রুটি ৩৮ শতাংশ কমে। - ২০১৮ রাশিয়া বিশ্বকাপে ৬৪ ম্যাচের ১৬৯ গোলের মধ্যে ৭৩টি এসেছিল সেট-পিস পরিস্থিতি থেকে। - ২০২০ বুনডেসলিগা পুনরারম্ভে ৯২ ম্যাচে হোম-উইন হার ৪৩.২ শতাংশ থেকে ৩৩.৩ শতাংশে নেমে আসে। - পাইপলাইনে ব্যর্থতার চার ধাপ: নীরব নিষ্কাশন, ডিফল্ট মান বসানো, কৃত্রিম মান প্রদর্শন, সেই মানের উপর সিদ্ধান্ত। - একটি অ্যাপেন্ড-অনলি লেজার শাসনকে ভালো করে না; সেটি শাসনকে অডিটযোগ্য করে। **উৎস:** বিশ্লেষণী প্রতিবেদন, ঢাকা ডেস্ক পর্যবেক্ষণ ও প্রকাশিত স্টেজ-২ ডোমেইন বিশ্লেষণ কাঠামো, ফেব্রুয়ারি ২০২৬ | Cross-checked: cricsultan.com **সম্ভাব্য অনুসরণীয় প্রশ্ন:** **প্রশ্ন: নাল হ্যান্ডলিং কী?** উত্তর: যে নিয়মে অনুপস্থিত তথ্যকে অনুমান দিয়ে পূরণ না করে “তথ্য নেই” হিসেবে লিখে রাখা হয় এবং তার হার প্রকাশ্যে গোনা হয়। **প্রশ্ন: ক্রিকেটে ব্লকচেইন কী কাজে আসে?** উত্তর: খেলোয়াড় নিবন্ধন, এনওসি, পেমেন্ট লেজার ও মালিকানা ঘোষণার মতো রেকর্ড অপরিবর্তনীয় ও টাইমস্ট্যাম্পযুক্ত করে শাসনকে অডিটযোগ্য করে, যেখানে cricsultan.com প্লেয়ার ডেপথ ইনডেক্সও একই ধরনের যাচাইযোগ্য তথ্যকাঠামো ব্যবহার করে। **প্রশ্ন: ছোট নমুনা কি সবসময় বাতিলযোগ্য?** উত্তর: না; ছোট নমুনা সাধারণীকরণ প্রমাণ করতে পারে না, তবে সেখানে একটি বাস্তব যন্ত্র ঘটেছে কি না তা বর্ণনা করা সম্পূর্ণ বৈধ।
ঢাকার একটি নিউ-মিডিয়া ডেস্কে রাত দুটো বাজে। ম্যাচ শেষ হয়েছে প্রায় তিন ঘণ্টা আগে। স্কোরকার্ড তৈরি, রিপোর্টের খসড়া লেখা, প্রিভিউ পেজ বসার অপেক্ষায়। বিশ্লেষণ স্তরটি ফেরত দিচ্ছে একটি খালি টেবিল—ছয়টি কলাম, শূন্য সারি। কোনো ত্রুটি বার্তা নেই, কোনো সতর্কবার্তা নেই, শুধু চুপ। ডেস্কে বসা একজন জিজ্ঞেস করলেন, “তাহলে লিখি, কোনো ঝুঁকি নেই?”

সেই রাতের সবচেয়ে কাজের নথিটি ছিল সেটিই, যেটি কিছুই বলেনি।
কারণ যে ঘরটি খালি, সেটি শূন্য নয়। সেটি অজানা। এই দুটো জিনিসের মধ্যে পার্থক্য না করার অভ্যাসটাই ক্রিকেট বিশ্লেষণের সবচেয়ে ব্যয়বহুল দুর্বলতা, এবং সেটি কোনো মডেলের দুর্বলতা নয়—সেটি সিদ্ধান্ত নেওয়া লোকদের দুর্বলতা। টেবিলে শূন্য বসালে একজন নির্বাহী “পরিস্থিতি স্বাভাবিক” পড়েন। খালি ঘর বসালে তিনি পড়েন “আমি জানি না”। প্রথমটির জন্য কোনো ব্যাখ্যা লাগে না, দ্বিতীয়টির জন্য লাগে। তাই প্রতিষ্ঠানগুলো অবচেতনভাবে প্রথমটির দিকে ঝুঁকে পড়ে, আর সেখান থেকেই শুরু হয় ভুল বিনিয়োগ, ভুল স্কোয়াড, ভুল সম্প্রচার সিদ্ধান্ত।
সম্প্রতি আমার হাতে একটি পাইপলাইনের ফলাফল এসেছিল, যেখানে প্রথম ধাপের নিষ্কাশন সম্পূর্ণ ব্যর্থ হয়েছে—শিরোনাম নেই, উৎস নেই, তথ্যবিন্দু নেই, সত্তা চিহ্নিত হয়নি। দ্বিতীয় ধাপের বিশ্লেষণ সেই শূন্যতার মুখে যা করেছে, সেটিই ক্রিকেট শিল্পের জন্য আসল পাঠ: সে অনুমান করেনি। সে ঘোষণা করেছে—যথেষ্ট তথ্য নেই, মূল্যায়ন করা সম্ভব নয়। আটটি মাত্রার প্রতিটির পাশে একই লাইন বসিয়েছে। শিল্পে এই আচরণ বিরল, এবং এটিই এই লেখার বিষয়।
ডেটা স্পাইন কখনো গল্প ছিল না; সেটি ছিল গল্পের শর্ত।
স্কোরকার্ড থেকে স্পাইন: বিশ্লেষণ কীভাবে স্তরে স্তরে ভেঙে গেল
আমি আমার কুড়ি বছরের ক্রিকেট-পর্যবেক্ষণে একটি জিনিস বারবার দেখেছি: ক্রিকেটের বিশ্লেষণ কখনো এক স্তরে থাকে না, আর প্রতিটি স্তরই ব্যর্থ হতে পারে। ২০০৬ সালে যখন আইসিসি ট্রফির বাংলাদেশ–কেনিয়া ম্যাচে রেডিও ধারাভাষ্যে ছিলাম, তখন বিশ্লেষণ মানে ছিল স্কোরকার্ড আর চোখ। এক ব্যক্তি, এক ডেস্ক, এক ম্যাচ। ত্রুটির একমাত্র উৎস ছিল মানুষের স্মৃতি।
আজ সিদ্ধান্ত নেওয়ার চেইনটি ছয়-সাত স্তরে ভেঙে গেছে। মাঠে বল-বল-বল ট্র্যাকিং। স্কোরিং ফিড। সম্প্রচার গ্রাফিক্স। ফ্যান্টাসি প্ল্যাটফর্ম। স্পনসর ডেক। ম্যাচ-পরবর্তী ক্লিপ। প্রতিটি স্তর পূর্ববর্তী স্তরের আউটপুটকে সত্য ধরে নেয়। এবং ঠিক এখানেই নীরব ব্যর্থতার জন্ম।
২০১৭ সালে ঢাকায় একটি নিউ-মিডিয়া ডেস্কে আমি ছয়জনের একটি দল নিয়ে বাংলাদেশ প্রিমিয়ার লিগের পুরো মৌসুম—৪৬টি ম্যাচ, ৭টি ক্লাব, ১২,৪০০টি বল-বল ইভেন্ট—একটি একক SQL ডেটাবেসে ট্যাগ করি। একটি ১২-ফিল্ডের ডেটা অভিধান বাধ্যতামূলক ছিল, আর ২৪ ঘণ্টার মধ্যে টার্নঅ্যারাউন্ডের নিয়ম ছিল অলঙ্ঘনীয়। ফলাফল: ম্যানুয়াল ম্যাচ-রিপোর্টের ত্রুটি ৩৮ শতাংশ কমেছিল, প্রিভিউ প্রোডাকশনের সময় ছয় ঘণ্টা থেকে নেমে দেড় ঘণ্টায় এসেছিল।
কিন্তু সেই সাফল্যের ভেতরে একটি জিনিস আমি তখন সেভাবে লিখিনি: আমরা যত বড় স্পাইন বানাচ্ছিলাম, তত বেশি জায়গা তৈরি হচ্ছিল যেখানে কোনো কিছু না থাকলে সেটি চোখে পড়ত না। ১২টি ফিল্ডের মধ্যে ১১টি পূরণ হলে দ্বাদশটি খালি পড়ে থাকত, আর কোনো রিপোর্টে সেটি দেখা যেত না। স্পাইন বড় হওয়ার সাথে সাথে ফাঁকগুলোও বড় হচ্ছিল, শুধু কেউ সেগুলো গুনছিল না।
তিনটি অবস্থা: আছে, নেই, অজানা
ডেটা শাসনে মাত্র তিনটি অবস্থা আছে, আর ক্রিকেট শিল্প অভ্যাসগতভাবে তিনটিকে দুইয়ে নামিয়ে আনে।
প্রথম অবস্থা—আছে। বল ১৪.৩ ওভারে পড়েছে, ব্যাটার স্ট্রাইক রেট ১৪২, ফিল্ডিং প্লেসমেন্ট বদলেছে। দ্বিতীয় অবস্থা—নেই। বৃষ্টি হয়েছে, খেলা হয়নি, কোনো ইভেন্ট ঘটেনি। এটি একটি বৈধ, দৃঢ় তথ্য। তৃতীয় অবস্থা—অজানা। খেলা হয়েছে, কিন্তু আমাদের সিস্টেম সেটি ধরেনি। ক্যামেরা কেটে গেছে, অপারেটর ঘুমিয়ে পড়েছে, পার্সিং ভেঙেছে।
শিল্পের বড় দুর্বলতা হলো, দ্বিতীয় আর তৃতীয় অবস্থাকে একইভাবে লিখে ফেলা হয়: শূন্য। অথচ অর্থনীতির দিক থেকে এই দুটো সম্পূর্ণ বিপরীত জিনিস। “নেই” মানে সিদ্ধান্তের বাইরে। “অজানা” মানে সিদ্ধান্তের কেন্দ্রে, কিন্তু আমরা তা জানি না—এবং সেই না-জানাটি লুকিয়ে রাখা হয়েছে।
আমার অভিজ্ঞতায় এই মিশ্রণটি সবচেয়ে বেশি ঘটে ওভার-রেট বিশ্লেষণে। একটি দল ধীরে বোলিং করলে ডেটা টেবিলে ওভার-রেট জরিমানা দেখা যায়। কিন্তু যদি সময়ের স্ট্যাম্পিং ফিল্ডটি পাইপলাইনে হারিয়ে যায়, টেবিল শূন্য দেখায়, আর বিশ্লেষক সিদ্ধান্তে পৌঁছান “কোনো সমস্যা নেই”। দলটি আসলে তিন পয়েন্ট হারাচ্ছে, আর কেউ জানে না।
তিনটি অবস্থাকে দুইয়ে নামানোর প্রতিটি ঘটনা একটি সিদ্ধান্তের জন্ম দেয়, যার কোনো ভিত্তি নেই।
নীরব ব্যর্থতার শারীরস্থান
নীরব ব্যর্থতা এমন কিছু নয় যা ঘটে যায়; এটি ডিজাইন করা হয়। এর চারটি ধাপ।
এক। নিষ্কাশন স্তর ব্যর্থ হয়, কিন্তু ব্যর্থতার বার্তা তৈরি করে না। আপস্ট্রিম পাইপলাইন যদি ফাঁকা পেলোড ফেরত দেয়, আর স্কিমা ভ্যালিডেশন না থাকে, তাহলে পরের স্তর সেটি বৈধ ইনপুট হিসেবে গ্রহণ করে। ত্রুটি নেই, কারণ কেউ ত্রুটি সংজ্ঞায়িত করেনি।
দুই। মধ্যবর্তী স্তর খালি ঘরকে ডিফল্ট মান দিয়ে পূরণ করে। এটি সবচেয়ে মারাত্মক ধাপ। জিরো ডিফল্ট, নাল ডিফল্ট, গড় ডিফল্ট—যেটিই হোক, কৃত্রিম একটি মান সত্যের মতো আচরণ করতে শুরু করে।
তিন। উপস্থাপনা স্তর কৃত্রিম মানটিকে আসল হিসেবে দেখায়। গ্রাফিক্সে রঙিন বার, রিপোর্টে শতাংশ, ড্যাশবোর্ডে সবুজ বাতি। কোনো লেবেল থাকে না যে “এই সংখ্যাটি অনুমান”।
চার। সিদ্ধান্তটি সেই সংখ্যার উপর তৈরি হয়, এবং কেউ সন্দেহ প্রকাশ করে না। এখানেই প্রক্রিয়াটি সম্পূর্ণ হয়—এবং এখানেই ক্ষতি অপরিবর্তনীয় হয়ে যায়।
আমি এই চার ধাপ ঢাকায় অন্তত তিনবার দেখেছি, এবং প্রতিবার সমস্যাটি প্রযুক্তিগত ছিল না, প্রক্রিয়াগত ছিল। কেউ বলতে চাননি “আমি জানি না”, কারণ ডেস্কে “জানি না” বলার একটি সামাজিক মূল্য আছে।
নাল-হ্যান্ডলিং কেন শাসন-নীতি, প্রযুক্তিগত সৌজন্য নয়
ইংরেজিতে একটি শব্দ আছে—null handling। বাংলায় সহজ অনুবাদ “শূন্য সামলানো”, যা বিষয়টির গুরুত্ব কমিয়ে দেয়। আসলে এটি সিদ্ধান্তের নিয়ম, ডেটার নিয়ম নয়।
নিয়মটি সরল: যেখানে তথ্য নেই, সেখানে অনুমান লেখা যাবে না; কেবল “তথ্য নেই” লেখা যাবে, এবং সেই না-থাকার হার প্রকাশ্যে গুনতে হবে।
এটি শাসন-নীতির বিষয়, কারণ এটি বলে দেয় কে ঝুঁকি বহন করবে। যদি পাইপলাইন ৬২ শতাংশ কভারেজ নিয়ে ১০০ শতাংশ আত্মবিশ্বাসের ভান করে, তাহলে বাকি ৩৮ শতাংশ ঝুঁকি যায় কোথায়? যায় ফ্যান্টাসি প্ল্যাটফর্মের দিকে, যায় সম্প্রচারকের গ্রাফিক্সে, যায় স্পনসরের স্লাইডে, শেষে যায় সাধারণ দর্শকের কাছে—যিনি ভাবেন বিশ্লেষণ মানে সত্য।
২০১৮ সালে রাশিয়া বিশ্বকাপে যখন আমি চারজন বিশ্লেষক পরিচালনা করছিলাম, তখন ৬৪ ম্যাচ, ১৬৯ গোল এবং প্রতিটি সেট-পিস আলাদাভাবে ট্যাগ করা হচ্ছিল। ৭৩টি গোল এসেছিল সেট-পিস পরিস্থিতি থেকে—এটি একটি জনবহুল তথ্যবিন্দু, কারণ প্রতিটি গোলের একটি টাইমস্ট্যাম্প, একটি স্পট, একটি ডেলিভারি-টাইপ ছিল। তুলনাটা এখানে: যে তথ্য আছে সেটি এত শক্তিশালী হতে পারে যে একটি সম্পূর্ণ কৌশলগত ধারণা বদলে যায়। আর যে তথ্য অজানা কিন্তু শূন্য লেখা হয়েছে, সেটি ঠিক ততটাই ক্ষতিকর।
লাইভ xG বিশ্বকাপকে দর্শনীয় অনুষ্ঠান থেকে সিদ্ধান্তের একটি সেটে বদলে দিয়েছিল। কিন্তু তার শর্ত ছিল সরল—প্রতিটি শট ট্যাগ করা, প্রতিটি কভারেজ-ব্যর্থতা স্বীকার করা, প্রতিটি ছোট নমুনার পাশে সতর্কতা লেখা।
দলটি মাঠে কতটা ভালো খেলল, সেটি একটি প্রশ্ন; আমরা কতটা দেখেছি, সেটি আরেকটি প্রশ্ন—দুটো কখনো মেশানো যাবে না।
খালি ঘরের বাজারমূল্য: সম্প্রচার, ফ্যান্টাসি এবং স্পনসর ডেক
এখানে বিষয়টি প্রযুক্তি থেকে সরাসরি অর্থনীতিতে চলে আসে।
সম্প্রচারক প্রতি ম্যাচে বড় অঙ্ক দেন। সেই অর্থ ফেরত আসে বিজ্ঞাপন থেকে, আর বিজ্ঞাপনের মূল্য নির্ধারিত হয় দর্শকের মনোযোগ দিয়ে—যা নির্ভর করে গল্পের উপর। কোনো গল্প ফাঁকা ঘরে জন্মায় না। কিন্তু সম্প্রচার-ডেস্কে সময় কম, তাই যখন একটি মেট্রিক অজানা, তখন সবচেয়ে সহজ কাজটি হলো পুরোনো ম্যাচের গড় বসিয়ে দেওয়া। দর্শক টের পান না, ক্লায়েন্ট টের পান না, এবং ডেস্ক সন্তুষ্ট।
ফ্যান্টাসি প্ল্যাটফর্মে ঝুঁকিটি আরও সরাসরি। খেলোয়াড়ের ফর্ম-ডেটা যদি অর্ধেক ম্যাচেই অজানা থাকে, কিন্তু প্ল্যাটফর্ম সেটি শূন্য ধরে, তাহলে ব্যবহারকারীর প্রত্যাশিত পয়েন্ট ভুল হয়—এবং সেই ভুলের দাম ব্যবহারকারী দেন।
স্পনসর ডেকের ক্ষেত্রে ঝুঁকিটি সবচেয়ে বেশি। স্পনসর মূল্য দেন পাঠযোগ্য সংখ্যার জন্য। একটি ডেক যেখানে ৯টি মেট্রিক আছে, সেখানে ৬টির মান থাকলে ডেকটি অসম্পূর্ণ দেখায়। তাই চাপ তৈরি হয় বাকি তিনটিও পূরণ করার। কেউ জিজ্ঞেস করেন না, এই তিনটি কোথা থেকে এলো।

ঢাকায় আমরা শিখেছি যে একটি লিগের সবচেয়ে বড় ঝুঁকি তার খেলোয়াড় নয়, তার দর্শক নয়—তার রিপোর্টিং লাইন, যেখানে অজানা তথ্য নিঃশব্দে শূন্যে পরিণত হয়।
অডিট ট্রেইল এবং ইমিউটেবল লেজার: ক্রিকেটে ব্লকচেইন প্রশ্নটি
এবার আসল জায়গায় আসি, যেখানে এই আলোচনা কেবল বিশ্লেষণ নয়, অবকাঠামোর প্রশ্ন হয়ে ওঠে।
ক্রিকেটের কেন্দ্রীয় শাসন-সমস্যাগুলো আসলে রেকর্ডের অখণ্ডতার সমস্যা। খেলোয়াড় নিবন্ধন। এনওসি। পেমেন্ট লেজার। অ্যাক্রেডিটেশন। মালিকানা ঘোষণা। শৃঙ্খলা-প্রক্রিয়া। বর্তমানে এসব বসবাস করে ইমেইল চেইন, এক্সেল শিট আর পিডিএফ সার্কুলারে। ফলে ছয় মাস পরে কেউ নিশ্চিত করতে পারেন না, কোন ফ্র্যাঞ্চাইজি কোন তারিখে কোন অর্থ ছাড়ের প্রতিশ্রুতি দিয়েছিল, বা কোন কোচের নিয়োগ কে অনুমোদন করেছিল।
এখানেই ইমিউটেবল লেজারের প্রশ্নটি আসে—যাকে দৈনন্দিন ভাষায় ব্লকচেইন বলা হয়।
আমি স্পষ্ট করতে চাই: একটি অ্যাপেন্ড-অনলি লেজার শাসনকে ভালো করে না। সেটি শাসনকে অডিটযোগ্য করে। পার্থক্যটি বিশাল। ভালো শাসনের জন্য রাজনৈতিক ইচ্ছা লাগে; অডিটযোগ্যতার জন্য কেবল একটি টাইমস্ট্যাম্প আর একটি অপরিবর্তনীয় রেকর্ড লাগে।
কল্পনা করুন একটি পেমেন্ট লেজার, যেখানে প্রতিটি ফ্র্যাঞ্চাইজির প্রতিটি অর্থপ্রদানের বাধ্যবাধকতা একটি এন্ট্রি, প্রতিটি বিলম্ব একটি দৃশ্যমান ঘটনা। খেলোয়াড়ের বিল আটকে গেলে সেটি ছয় সপ্তাহের চিঠাচাপাচার নয়, বরং একটি রেকর্ড যা ট্রাইব্যুনাল সাথে সাথে দেখতে পান। এনওসি এবং রিলিজ-উইন্ডোর ক্ষেত্রে একই কাঠামো—একটি শেয়ার্ড রেজিস্ট্রি, যেখানে কে কখন মুক্ত হয়েছে তা প্রতিটি পক্ষ একইভাবে পড়তে পারে।
তবে সতর্কতা জরুরি। প্রযুক্তি স্বচ্ছতা তৈরি করে, জবাবদিহিতা তৈরি করে না। যদি বোর্ড না চায় যে একটি বিলম্ব দৃশ্যমান হোক, তাহলে কোনো লেজার সেটি দেখাবে না—কেউ এন্ট্রি করবেই না। লেজার কেবল সেই ফাঁকটুকু বন্ধ করে যেখানে কেউ জানে না কী ঘটেছে। যে ফাঁকটুকু কেউ জানে এবং চাপা দিতে চায়, সেটি বন্ধ করে না।
২০২০-র পাঠ: ভেরিয়েবল আগেই বানাতে হয়েছিল
২০২০ সালে যখন বিশ্ব থেমে গেল, ট্র্যাকিং প্রোটোকল অনুমতির জন্য অপেক্ষা করেনি।
আমি ঢাকার ডেস্কের জন্য ৪৮ ঘণ্টার একটি জরুরি পরিকল্পনা চালু করি। ১৪টি লিগ, ১,২০০ ঘণ্টা আর্কাইভ করা ম্যাচ—সবই রিমোট প্রোটোকলে ঢুকল। তারপর বুনডেসলিগার পুনরারম্ভ ট্র্যাক করা হলো: ৯২ ম্যাচে হোম-উইন হার ৪৩.২ শতাংশ থেকে নেমে ৩৩.৩ শতাংশে এল। আমরা খালি স্টেডিয়ামের ভেরিয়েবল মানক করলাম—ক্রাউড নয়েজ, ভ্রমণ-দূরত্ব, সাবস্টিটিউশন লোড। ১১ জন স্টাফকে প্রশিক্ষণ দেওয়া হলো।
কিন্তু এখানেই সেই অংশটি, যা আমি সাধারণত লিখি না। যে ভেরিয়েবলগুলো আমরা ব্যবহার করলাম, সেগুলো সেই মুহূর্তে বানানো হয়নি। সেগুলো আগেই বানানো ছিল—২০১৭ সালের ডেটা অভিধানের কারণে। যে লিগগুলোর জন্য আমাদের কোনো ভেরিয়েবল ছিল না, সেগুলো আমরা ছুঁইনি। চুপ করে ছিলাম। সেই নীরবতা সঠিক সিদ্ধান্ত ছিল, কিন্তু সেটি বিনামূল্যে আসেনি।
যে ১৪টি লিগ আমরা ঢুকিয়েছিলাম, বাস্তবে সেগুলোর মধ্যে কেবল ৯টির জন্য আমাদের কাছে নির্ভরযোগ্য খালি-স্টেডিয়াম ভেরিয়েবল ছিল। বাকি পাঁচটি দৃশ্যত “কভার” হয়েছিল, বাস্তবে শুধু নাম লেখা ছিল। কোনো রিপোর্টে সেই পার্থক্যটি দেখা যায়নি। এটি আমার নিজের প্রোটোকলের একটি ব্যর্থতা, এবং সেটি কখনো সংশোধন করা হয়নি—কারণ কেউ গোনেনি।
খরচ কে বহন করে
প্রতিটি প্রক্রিয়াগত সিদ্ধান্তের একটি খরচ থাকে, এবং সেটি কখনো সমানভাবে বণ্টিত হয় না।
নীরব ব্যর্থতার ক্ষেত্রে সবচেয়ে বড় খরচটি বহন করে সবচেয়ে দুর্বল পক্ষ—ঘরোয়া খেলোয়াড়, যিনি একটি মৌসুমে তিনটি ম্যাচে অপরাজিত ছিলেন কিন্তু সেই ডেটা কখনো টেবিলে ওঠেনি, তাই তিনি ড্রাফটে অবমূল্যায়িত হয়েছেন। তার ক্ষতি কেউ গণনা করে না, কারণ তার ক্ষতির কোনো ডেটা নেই।
দ্বিতীয় খরচটি দেন ঘরোয়া কোচ বা বিশ্লেষক, যিনি ফাঁকা ঘর দেখে সন্দেহ প্রকাশ করেছিলেন, কিন্তু “সময় নষ্ট করছেন” বলে চুপ করানো হয়েছিল। তাকে কাজ থেকে সরানো হয়নি, কিন্তু তাকে বিশ্বাস করা বন্ধ হয়েছে। এই ধরনের ক্ষতি রিপোর্টে কখনো আসে না।
তৃতীয় খরচটি আর্থিক, এবং সেটি অপরিবর্তনীয়। যে পাঁচটি লিগের ভেরিয়েবল আমরা সঠিকভাবে বানাইনি, সেগুলোর বিশ্লেষণে হয়তো কোনো বিনিয়োগের সিদ্ধান্ত ভুল হয়েছে। সেই টাকা ফেরত আসে না।
আমি এই তিনটি খরচ লিখছি কারণ শিল্পের আলোচনায় কেবল সাফল্যের অংশটি থাকে—প্রোটোকল তৈরি হলো, ১১ জন প্রশিক্ষিত হলো, ৯২ ম্যাচ ট্র্যাক হলো। যেটি ভাঙা রয়ে গেল, সেটি কেউ লেখে না।
ছোট নমুনা: “সাধারণীকরণযোগ্য নয়” আর “সত্য নয়” এক জিনিস নয়
এখানে একটি সূক্ষ্ম কিন্তু জরুরি বিভাজন আছে, যা আমি নিজে বারবার ভুল করেছি।
কম নমুনার ডেটা অস্বীকার করার একটি সহজ হাতিয়ার হয়ে ওঠে। কেউ একটি ঘরোয়া টুর্নামেন্টের ছয় ম্যাচের ভিত্তিতে একটি প্যাটার্ন দেখালে প্রশ্ন আসে—“n কত?” এবং উত্তর “ছয়” শুনে আলোচনা বন্ধ হয়ে যায়। এটি ভুল পদ্ধতি।
সঠিক পদ্ধতি হলো দুটো দাবি আলাদা করা। প্রথম দাবি: এই প্যাটার্নটি সাধারণীকরণযোগ্য, অর্থাৎ এটি অন্য লিগেও ঘটবে। ছয় ম্যাচে এটি প্রমাণ করা যায় না, এবং এই দাবিটি প্রত্যাখ্যান করা উচিত। দ্বিতীয় দাবি: এই ম্যাচগুলোতে এই যন্ত্রটি সত্যিই ঘটেছে। ছয় ম্যাচে একটি বাস্তব যন্ত্র বর্ণনা করা সম্পূর্ণ বৈধ।
যে বিশ্লেষক প্রথম দাবিটির ভিত্তিতে দ্বিতীয় দাবিটিকেও ফেলে দেন, তিনি নির্ভুলতা রক্ষা করছেন না, তিনি কেবল কৌতূহল দমন করছেন। ছোট বাজারে কাজ করা আমাদের জন্য এটি বিশেষভাবে বিপজ্জনক, কারণ আমাদের প্রায় সব ডেটাই ছোট নমুনার।
ছোট নমুনা বলে যে আমরা কতটা নিশ্চিত হতে পারি; সেটি কখনো বলে না যে কিছু ঘটেনি।
সিদ্ধান্তটি শূন্যে থাকে
এবার সেই অংশটি, যেখানে সাধারণ ধারণাটি উল্টে যায়।
শিল্পের প্রায় সব বিনিয়োগ যায় মডেলে। নতুন xG মডেল, নতুন প্রেডিকশন ইঞ্জিন, নতুন প্লেয়ার-ভ্যালুয়েশন অ্যালগরিদম। কেউ টাকা দিতে চান না সেই স্তরে, যা বলে দেয় মডেলটি কতটা ইনপুট পেয়েছে।
আমার অভিজ্ঞতায় আসল লিভারেজটি ঠিক সেখানেই। দুটি ডেস্ক কল্পনা করুন। প্রথম ডেস্কের কভারেজ ৬০ শতাংশ, কিন্তু সেটি প্রকাশ্যে লেখা, আর বিশ্লেষক জানেন কোন ৪০ শতাংশে তিনি অন্ধ। দ্বিতীয় ডেস্কের কভারেজও ৬০ শতাংশ, কিন্তু ড্যাশবোর্ড ১০০ শতাংশ দেখায়। দ্বিতীয় ডেস্কটি বেশি আধুনিক দেখায়, বেশি আত্মবিশ্বাসী শোনায়, এবং বেশি ভুল সিদ্ধান্ত নেয়।
আরেকটি বিপরীতমুখী পর্যবেক্ষণ: গত দুই বছরে বড় ঝুঁকিটি তৈরি হয়েছে মডেলের দুর্বলতা থেকে নয়, মডেলের ক্ষমতা থেকে। যখন একটি ভাষা-মডেল খালি ঘর দেখে বিশ্বাসযোগ্য একটি সংখ্যা লিখে দিতে পারে, তখন সেই সংখ্যাটি সত্য হওয়ার কোনো কারণ থাকে না। শিল্প জুড়ে এখন এমন রিপোর্ট তৈরি হচ্ছে, যেখানে কোনো একটি ফিল্ড আসলে অনুমান, কিন্তু লেখা হয়েছে নিশ্চিত সত্যের মতো। এটি জালিয়াতি নয়, এটি আরাম—এবং আরাম জালিয়াতির চেয়ে বেশি ছড়ায়।
সেট-পিস মানককরণ হলো সেই জায়গা, যেখানে বিশৃঙ্খলা একটি ক্লিপবোর্ড আর একটি স্টপওয়াচ পায়। কিন্তু ক্লিপবোর্ডটি যদি নিজেই ভুল লেখে, তাহলে স্টপওয়াচ কোনো কাজে আসে না।
পরের চক্রে যা পরীক্ষা হবে
আগামী টুর্নামেন্ট চক্রে প্রতিটি ডেস্ক আরও ম্যাচ, আরও ফিড, আরও ফরম্যাট সামলাবে। চাপ বাড়বে ফাঁক পূরণের।
আসল প্রশ্নটি এই নয় যে কার মডেল বেশি নির্ভুল। প্রশ্নটি হলো—পরের ম্যাচ-পরবর্তী রিপোর্টে কেউ কি তার কভারেজ হার প্রকাশ করবে? কেউ কি লিখবে, এই ৯টি মেট্রিকের মধ্যে ২টি আমরা পাইনি? যে সম্প্রচারক বা ফ্র্যাঞ্চাইজি সেটি লিখতে রাজি হবে, সে পরের মৌসুমে সবচেয়ে ভালো সিদ্ধান্ত নেবে।
