Q-এর মূল্য দশ পয়েন্ট আর E-এর এক। ওই একটিমাত্র তথ্যের আড়ালে লুকিয়ে আছে ভাষার একটি ছোট তত্ত্ব, তথ্য নিয়ে একটি যুক্তি, আর একটি কারণ, কেন খেলাটির টাইল সেট স্প্যানিশে ইংরেজির চেয়ে আলাদা দেখায়।
ইংরেজিতে লেখা ও সম্পাদিত। এই বাংলা সংস্করণটি যন্ত্রানুবাদের মাধ্যমে তৈরি; যেখানে নির্ভুলতা গুরুত্বপূর্ণ, সেখানে ইংরেজি মূলটিই প্রামাণ্য। ইংরেজিতে মূল লেখাটি পড়ুন →
প্রথম চালেই আপনি যে স্কোরিং নিয়মের মুখোমুখি হন, তা কোনো নান্দনিক পছন্দ নয়। এটি একটি পরিমাপ। 1930-এর দশকের গোড়ায় আলফ্রেড মোশার বাটস নামে এক বেকার স্থপতি এমন একটি শব্দ-খেলা বানাতে বসেন যা বিশুদ্ধ ভাগ্যও নয়, বিশুদ্ধ শব্দভান্ডারও নয়, আর প্রতিটি অক্ষরের দাম ঠিক করার জন্য তাঁর দরকার ছিল একটি নীতিনিষ্ঠ উপায়। তাই তিনি তা-ই করলেন যা একজন প্রকৌশলী করেন: তিনি গুনলেন। বাটস হিসাব রাখলেন তাঁর সময়ের ছাপা উৎসগুলোতে প্রতিটি অক্ষর কত ঘন ঘন আসে, যার মধ্যে প্রধান ছিল The New York Times-এর প্রথম পাতা, সঙ্গে Herald Tribune আর The Saturday Evening Post। 1
ওই হিসাব থেকে তিনি একসঙ্গে দুটি সংখ্যা পড়ে নিলেন। সংখ্যা, অর্থাৎ প্রতিটি টাইল থলেতে কয়টি যায়, তা বাস্তব লেখায় অক্ষরটি কতটা প্রচলিত তার সঙ্গে তাল মেলায়। মূল্য চলে উল্টো দিকে: অক্ষর যত বিরল, তা ব্যবহার করা চাল তত বেশি পাওয়া উচিত। প্রচলিত স্বরবর্ণগুলো পায় মাত্র এক পয়েন্ট; যে অক্ষরগুলো কেবল ধার-করা শব্দে আর অভিধানের বেখাপ্পা কোণে ভেসে ওঠে, সেগুলো পায় খেলার সর্বোচ্চ মূল্য। ইংরেজি খেলায় সেই সর্বোচ্চ হলো দশ পয়েন্ট, আর কেবল Q ও Z তা বহন করে; BBC যেমন একবার বলেছিল, বাটস “calculated a value for each tile by measuring how frequently each letter appeared on the front page of the New York Times” (New York Times-এর প্রথম পাতায় প্রতিটি অক্ষর কত ঘন ঘন এসেছে তা মেপে প্রতিটি টাইলের মূল্য হিসাব করেছিলেন)। 2
অক্ষরগুলো সারি বেঁধে সাজান, আর নকশাটি নিজেই প্রকাশ পায়। বাস্তব জগতে ঘনত্ব যত কমে, পয়েন্ট-মূল্য প্রায় একটানা তত বাড়ে। E সর্বত্র এবং সস্তা; Z আর Q প্রায় কোথাও নেই এবং দামি।
| অক্ষর | থলেতে টাইল | পয়েন্ট-মূল্য | ইংরেজিতে ঘনত্ব |
|---|---|---|---|
| E | 12 | 1 | ≈ 12.7% |
| A | 9 | 1 | ≈ 8.2% |
| N | 6 | 1 | ≈ 6.7% |
| D | 4 | 2 | ≈ 4.3% |
| B | 2 | 3 | ≈ 1.5% |
| K | 1 | 5 | ≈ 0.8% |
| X | 1 | 8 | ≈ 0.15% |
| Q | 1 | 10 | ≈ 0.12% |
| Z | 1 | 10 | ≈ 0.07% |
সংখ্যা ও মূল্যগুলো প্রমিত ইংরেজি সেটের; 3 ঘনত্বের পরিসংখ্যানগুলো সাধারণ ইংরেজি লেখার প্রচলিত আনুমানিক হিসাব। 4 WordChess এই ঐতিহ্য মেনে পয়েন্ট-মূল্যযুক্ত টাইল আর ঘনত্ব-অনুপাতে সাজানো একটি টাইল সেট ব্যবহার করে (ইংরেজিতে 100টি টাইল: 98টি অক্ষর আর 2টি ব্ল্যাঙ্ক), যদিও থলে থেকে টাইল তোলার বদলে প্রত্যেক খেলোয়াড়ের হাতে থাকে একটি সম্পূর্ণ সেট, খেলাটির নকশা-নথি থেকে মাপা।
এখানেই একটি পরিচ্ছন্ন ধারণা একটি কঠিন সীমাবদ্ধতার মুখোমুখি হয়। মূল্য যদি নিছক বিরলতাকেই পুরস্কৃত করত, তাহলে আদর্শ থলেটি Q আর Z-এ ঠাসা থাকত, বিপুল পয়েন্ট দাবি করার অপেক্ষায়। কিন্তু থলেটি একই সঙ্গে এমন একটি হাত, যা থেকে আপনাকে আসলে খেলতে হবে। সাতটি উচ্চ-মূল্যের অদ্ভুত অক্ষর তুলুন, আর আপনি জমে বসে থাকবেন, একটি বৈধ শব্দও বানাতে পারবেন না। তাই সংখ্যা মূল্যের বিপরীতে টানে: ভাষা যে অনুপাতে অক্ষরগুলো ব্যবহার করে, থলেতে মোটামুটি সেই অনুপাতেই সেগুলো রাখতে হবে, নইলে খেলা থমকে যায়।
এ কারণেই Q ঠিক একটি, আর এ কারণেই তার প্রায়-অবিচ্ছেদ্য সঙ্গী U নিজের জন্য চারটি টাইল পায়: একটি Q, আর থলেতে চারটি U, যাতে সে একটি খুঁজে পাওয়ার সুযোগ পায়। নিঃসঙ্গ Q মূল্যবান কারণ সেটি প্রায় খেলার অযোগ্য, আর আদৌ খেলার যোগ্য কেবল এজন্য যে থলের বাকি টাইলগুলো জীবনের নিজস্ব অনুপাতে বণ্টিত হয়েছিল। দুর্লভতা পুরস্কার ঠিক করে; ঘনত্ব খেলাকে সচল রাখে।
একটি টাইলের দাম ঠিক হয় অক্ষরটি কত কম আসে তা দিয়ে, কিন্তু থলের ভেতরের জিনিস ঠিক হয় সেটি কত বেশি আসে তা দিয়ে। দুটি শক্তি আসলে একই তথ্য, সামনে থেকে আর পেছন থেকে পড়া।
একটি ন্যায্য টাইল সেট যদি একটি ভাষার অক্ষর-ঘনত্বের আলোকচিত্র হয়, তাহলে ভাষা বদলালে আলোকচিত্রও বদলাতে বাধ্য। বদলায়ও, চোখে পড়ার মতো করে। WordChess 22টি ভাষায় চলে, আর প্রতিটির জন্য তার টাইল সেট নতুন করে গড়া হয়, কারণ ইংরেজির জন্য সুর-করা একটি বণ্টন অন্যত্র সোজাসুজি ভুল। 3
উত্তর আমেরিকার বাইরে বিক্রি হওয়া স্প্যানিশ সেটগুলো K আর W পুরোপুরি বাদ দেয়; এই অক্ষরগুলো স্প্যানিশে কেবল আমদানি-করা শব্দে আসে, তাই একটি বিশ্বস্ত থলে তাদের কোনো টাইলই দেয় না। 5 ইতালীয় আরও এক ধাপ এগিয়ে J, K, W, X আর Y বাদ দেয়, এমন অক্ষর যা দেশীয় ইতালীয় বানানের অংশ নয় এবং কেবল ধার-করা শব্দে দেখা দেয়। 5 ইংরেজি থলে যে অক্ষরগুলোকে মাথাপিছু এক-দুটি টাইলে সীমিত রাখে, অন্য ভাষায় সেগুলো বিরল নয়, একেবারে অনুপস্থিত। বিরলতা কোনো অক্ষরের ধর্ম নয়। এটি একটি অক্ষরের ধর্ম একটি নির্দিষ্ট ভাষার ভেতরে।
বাটস, এর জন্য কোনো পরিভাষা না জেনেই, এমন কিছু মাপছিলেন যা প্রায় পনেরো বছর পরে একজন গণিতবিদ আনুষ্ঠানিক রূপ দেবেন। 1948 সালে ক্লড শ্যানন একটি সুনির্দিষ্ট দাবির ওপর তথ্যতত্ত্বের ভিত্তি স্থাপন করেন: একটি প্রতীক যত অনিশ্চিত, সেটি তত বেশি তথ্য বহন করে। যে অক্ষর আপনি আন্দাজ করতে পারতেন, তা আপনাকে সামান্যই বলে; একটি অপ্রত্যাশিত অক্ষর বলে অনেক কিছু। বিরলতা মানেই তথ্য, আর তথ্য মাপা হয় বিটে। 6
1951 সালের তাঁর প্রবন্ধ Prediction and Entropy of Printed English (ছাপা ইংরেজির পূর্বাভাস ও এনট্রপি)-তে শ্যানন ওই পরিমাণটি ওজন করতে বসেন। অক্ষরগুলোকে বিচ্ছিন্নভাবে ধরলে ইংরেজি দাঁড়ায় প্রতি অক্ষরে মোটামুটি চার বিটে; কিন্তু পাঠককে প্রসঙ্গ ব্যবহার করতে দিন, এই তথ্য যে একটি q প্রায় নিশ্চিতভাবে একটি u-এর প্রতিশ্রুতি দেয়, যে খুব কম শব্দ v-তে শেষ হয়, আর আসল হার ধসে পড়ে। শ্যাননের পূর্বাভাস-পরীক্ষাগুলো সাধারণ ইংরেজির এনট্রপিকে প্রতি অক্ষরে 0.6 থেকে 1.3 বিটের মধ্যে কোথাও স্থাপন করে। 6 আমরা যা লিখি তার বেশিরভাগই বাহুল্য; অপ্রত্যাশিত অক্ষরগুলোই আসল কাজটা করে।
একই হিসাব এর আগেই একটি পুরোনো সংকেতকে রূপ দিয়েছিল। স্যামুয়েল মোর্স আর আলফ্রেড ভেইল যখন 1840-এর দশকে তাঁদের বর্ণমালা তৈরি করেন, বলা হয় ভেইল একটি ছাপাখানার টাইপ-কেস পরীক্ষা করে দেখেছিলেন কোন অক্ষরগুলো সবচেয়ে বেশি ব্যবহৃত হয়, তারপর সেই অক্ষরগুলোকে দিয়েছিলেন সবচেয়ে ছোট সংকেত: E-এর জন্য একটিমাত্র বিন্দু, T-এর জন্য একটিমাত্র ড্যাশ। 7 ঘন ঘন আসা অক্ষরের জন্য ছোট সংকেত; প্রচলিত টাইলের জন্য সস্তা পয়েন্ট; অনুমেয়র জন্য কম বিট। মোর্স তারে পাঠানোর সময় কমিয়েছিলেন, বাটস একটি খেলার ভারসাম্য রেখেছিলেন, শ্যানন অন্তর্নিহিত সংখ্যাটির নাম দিয়েছিলেন, কিন্তু তিনজনই পড়ছিলেন একই হিসাবের খাতা। দেখা যাচ্ছে, একটি অক্ষরের মূল্য সবসময়ই ছিল একটি পরিমাপ: সেটি আপনাকে কতটা চমকে দিতে পারে।