একটি শব্দ খেলার জন্য বৈধ স্ট্রিংয়ের একটি তালিকা যথেষ্ট নয়। এটি প্রতিটি স্ট্রিংয়ের অর্থবলতে হবে, আর অর্থ সংরক্ষণ করা সবচেয়ে কঠিন কাজ।
WordChess খেলা হয় ২৫×২৫ বোর্ডে, যেখানে 148,941-শব্দ ইংরেজি শব্দকোষ6, গড় ৮.৬ অক্ষরের প্রবেশ, কিছু ২৫ অক্ষর পর্যন্ত। এটি সহজ অংশ। বৈধ শব্দের তালিকা মূলত এমন স্ট্রিংয়ের একটি সেট যা খেলা গ্রহণ করবে। মজার অংশ হলো খেলোয়াড়কে বোর্ডের স্ট্রিংটির অর্থবলানো, এবং একই সাথে বিশ-দুইটি ভাষায় তা করা।
শব্দকোষকাররা একটি স্পষ্ট রেখা আঁকেন লেম্মা এবং এর বক্রিত রূপ। লেম্মা হলো সেই শিরোনাম যা আপনি খুঁজে দেখেন, run, house, be। এর চারপাশে ঘোরে একটি পৃষ্ঠতলীয় রূপের প্যারাডাইম: runs, ran, running। প্রতিটি রূপ একই মূল অর্থ বহন করে, তবে ভিন্ন ভিন্ন বাক্যগঠনগত ভূমিকার জন্য সাজানো।3 একটি অভিধান তার গদ্য লেম্মার জন্য ব্যয় করে এবং ছায়াগুলিকে বাড়ি দেখানোর কাজে ছেড়ে দেয়।
একটি শব্দ কতগুলো ছায়া ফেলে তা ভাষার ওপর নির্ভর করে। ইংরেজি ভাষা analytic: এটি শব্দক্রম ও ছোট ছোট সহায়ক শব্দের ওপর নির্ভর করে, তাই একটি ক্রিয়ার সাধারণত বেশি কিছু রূপ থাকে না। ফিনnish is agglutinative, এটি একটি মূল শব্দের সাথে প্রত্যয় যুক্ত করে অর্থ গড়ে তোলে। একটি একক ফিনnish বিশেষ্য কিছু পনেরোটি বিভক্তির জন্য বদলায়, একবচন ও বহুবচনে, মালিকানাধীন সমাপ্তি এবং ক্লিটিক্স উপরে জমা হয়; ভিন্ন রূপের ব্যবহারিক সংখ্যা হাজার হাজারে পৌঁছায়।4 হাঙ্গেরিয়ান একটি পুরো ইংরেজি বাক্যাংশ, আমার বাড়িতে, একটি শব্দে, házamban.5
জ্ঞানদ্রব্যগুলো আসে Wiktionary, যে মুক্ত অভিধান যেকোনো মানুষ সম্পাদনা করতে পারে। এটি বিশাল এবং বহুভাষিক: এই প্রকল্প একশোটিরও বেশি সক্রিয় ভাষা সংস্করণ এবং কোটি কোটি প্রবেশের মধ্যে বিস্তৃত, যা পরিশ্রমিকদের দ্বারা সহযোগিতামূলকভাবে লেখা হয়েছে, কোনো বেতনপ্রাপ্ত সম্পাদকীয় বোর্ডের দ্বারা নয়।1 ২২টি ভাষায় চলা একটি খেলার জন্য, আচ্ছাদনের ক্ষেত্রে অন্য কোনো মুক্ত শব্দকোষ এতটা কাছাকাছি আসে না।
কিন্তু কাগজে আচ্ছাদন মানে পড়া যায় এমন আচ্ছাদন নয়। Wiktionary বিভক্ত রূপগুলো এমনভাবে সংরক্ষণ করে যা মানব সম্পাদকদের একই জ্ঞানদ্রব্য দশ হাজারবার লেখা থেকে মুক্ত রাখে। একটি জ্ঞানদ্রব্য পুরোপুরি বর্ণনা করার পরিবর্তে, একটি অ-লিমা প্রবেশ একটি form-of টেমপ্লেট, একটি ছোট নির্দেশক বহন করে, যা কার্যত বলে, "এটি সেই লিমাটির একটি নির্দিষ্ট ব্যাকরণগত রূপ।"2 The entry for smoulders এটি গদ্য নয়; এটি একটি টেমপ্লেট যা "smoulder-এর তৃতীয় পুরুষ একবচন সরল বর্তমান কাল" হিসেবে রেন্ডার হয়।1
এই নির্দেশিকাগুলো কোনো গোলমাল নয়। ইংরেজি উইকশনারিতে, প্রায় ১.২৭ মিলিয়ন সংজ্ঞার মধ্যে, প্রায় ৪৭৮,০০০টি, অর্থাৎ এক-তৃতীয়াংশেরও বেশি, লেখা-আকারের অর্থের পরিবর্তে "form of" সংজ্ঞা।1 তথ্য সেখানে আছে। এটি শুধু ভাঁজ করা অবস্থায় আছে।
সুতরাং, যে চ্যালেঞ্জটি গুরুত্বপূর্ণ ছিল তা কখনোই "শব্দটি অনুপস্থিত" ছিল না। এটি ছিল যে শব্দটির অর্থ একটি টেমপ্লেটের ভেতরে বসে ছিল, যা একটি সাধারণ পার্সার ফেলে দিত। WordChess-এর সংজ্ঞাগুলো তৈরি করা হয়েছিল raw Wiktionary dumps and expanding the inflection templates ভাষা অনুযায়ী পড়ে, পার্সারকে শেখানো হয়েছিল যে প্রতিটি নির্দেশিকা কী বোঝায় এবং সেটি একটি সরল গ্লসে পুনর্লিখন করা হয়েছিল।6
প্রতিটি ভাষা বিভিন্ন যন্ত্রপাতির পেছনে তার রূপ লুকিয়ে রাখে। স্প্যানিশ ক্রিয়া রূপগুলো লুকিয়ে রাখে {{forma verbo}}, যা "এক্স-এর ক্রিয়া রূপ" হিসেবে সমাধান করা হয়। জার্মান ব্যবহার করে {{Grundformverweis Dekl/Konj}} বিকলিত ও সংযুক্ত রূপগুলোর জন্য। ফিনিশ নির্ভর করে {{taivutusmuoto}}. রুশ ভাষায় প্রায়শই কোনো ফর্ম টেমপ্লেট সংরক্ষণ করা হয় না, বক্রবিন্যাসিত শব্দটি একটি খালি রিডাইরেক্ট (собаки → собака) যা অনুসরণ করে একটি "ফর্ম অফ" গ্লস পুনরুদ্ধার করতে হয়।6 প্রতিটি নিয়ম মেনে চললে, কভারেজ উল্লেখযোগ্যভাবে বৃদ্ধি পায়।
| ভাষা | আগে | পরে | বৃদ্ধি |
|---|---|---|---|
| জার্মান | 45% | 92% | +47 |
| ডাচ | 58% | 90% | +32 |
| ফিনিশ | 54% | 74% | +20 |
| রুশ | 20% | 70% | +50 |
| গ্রিক | 15% | 57% | +42 |
এই প্রজেক্টের ডিজাইন এবং বিল্ড নোট থেকে পরিমাপ করা হয়েছে। শতকরা হার হলো অভিধানের এন্ট্রির সেই অংশ যা ব্যবহারযোগ্য সংজ্ঞা বা সমাধানকৃত "ফর্ম অফ" গ্লস বহন করে।
তথ্যটি কখনোই অনুপস্থিত ছিল না। এটি একটি পয়েন্টারে ভাঁজ করা ছিল, এবং মেশিনকে শব্দটি বুঝিয়ে দেওয়া মানে ছিল সেটি আনফোল্ড করার শেখা।
এখন খেলাটি কী ধারণ করে, সে বিষয়ে সৎ হওয়া গুরুত্বপূর্ণ। যখন WordChess দেখায় যে собаки হলো собакаএর একটি রূপ, "কুকুর," তখন এটি কিছুই বুঝে নিতে পারেনি। এটি একটি মানব সম্পাদক পিছনে রেখে যাওয়া একই পয়েন্টার অনুসরণ করে একটি স্ট্রিংকে অন্য একটি স্ট্রিং, একটি গ্লস (অর্থব্যাখ্যা), এর সাথে ম্যাপ করেছে। এটি হলো lemmatization, যা প্রাকৃতিক ভাষা প্রসেসিংয়ের (NLP) মূল চালিকাশক্তি: একটি সারফেস ফর্মকে (বহিঃস্থ রূপ) এর বেস ফর্মে (মূল রূপ) রূপান্তর করা, যাতে একটি মেশিনের কাছে ট্র্যাক করার জন্য আলাদা জিনিসের সংখ্যা কমে যায়।7
এটি একটি বাস্তব এবং উপযোগী ধরনের জ্ঞান। এটি খেলাটিকে অথেন্স বা আমস্টারডামে কোনো শব্দকোষবিদ নিয়োগ না করেই "এই শব্দটি কী?" প্রশ্নের উত্তর দেওয়ার সুযোগ দেয়। কিন্তু এটি হলো লুকআপ হিসেবে জ্ঞান, অর্থ হিসেবে জ্ঞান নয়। গ্লস হলো একটি প্রতিশ্রুতি যে, একজন ব্যক্তি এটি পড়ে শব্দটি চিনতে পারবে। মেশিনটি সেই প্রতিশ্রুতি ধরে রাখে; পাঠকই অর্থ সরবরাহ করেন।
কিছু ভাষা এমন এক সীমায় পৌঁছায় যা কোনো পার্সার তুলে দিতে পারে না, কারণ ডেটাটি মূলতই সেখানে বিস্তারিতভাবে উপস্থিত নেই। হাঙ্গেরিয়ান এন্ট্রিগুলোতে প্রায়শই শুধুমাত্র একটি এটিমোলজি (শব্দগত উৎস) এবং একটি অনুবাদ টেবিল থাকে, কোনো সংজ্ঞা টেক্সট থাকে না, তাই এমনকি একজন নিখুঁত পাঠকও খালি হাতে ফিরে আসেন। সবচেয়ে কঠিন ক্ষেত্রগুলো সেখানে জমা হয় যেখানে ভাষাবিজ্ঞান সবচেয়ে কঠিন: ফিনিশ এবং হাঙ্গেরিয়ান মতো অ্যাগ্লুটিনেটিভ (সংযোজিত) ভাষা, যা বিশাল প্যারাডাইম (রূপবিন্যাস) তৈরি করে, এবং সিরিলিক ও গ্রিক লিপি, যেখানে কমিউনিটির কভারেজ শুরু থেকেই তুলনামূলকভাবে কম। গ্রিক ভাষা ১৫% থেকে ৫৭% পর্যন্ত উন্নীত হয়েছে; যে এটি জার্মান ভাষার ৯২% এর চেয়ে অনেক পিছিয়ে থাকা একটি তথ্য, এটি সোর্সের (উৎসের) বিষয়, কোডের নয়। 6