PlayPendium
WordChess · Food for Thought

২২টি ভাষায় একটি মেশিনকে ১৪৯,০০০টি শব্দ শেখানো

একটি শব্দ খেলার জন্য বৈধ স্ট্রিংয়ের একটি তালিকা যথেষ্ট নয়। এটি প্রতিটি স্ট্রিংয়ের অর্থবলতে হবে, আর অর্থ সংরক্ষণ করা সবচেয়ে কঠিন কাজ।

01 · The লেমা এবং তার ছায়া

একটি শব্দ, এবং তার সব রূপ

WordChess খেলা হয় ২৫×২৫ বোর্ডে, যেখানে 148,941-শব্দ ইংরেজি শব্দকোষ6, গড় ৮.৬ অক্ষরের প্রবেশ, কিছু ২৫ অক্ষর পর্যন্ত। এটি সহজ অংশ। বৈধ শব্দের তালিকা মূলত এমন স্ট্রিংয়ের একটি সেট যা খেলা গ্রহণ করবে। মজার অংশ হলো খেলোয়াড়কে বোর্ডের স্ট্রিংটির অর্থবলানো, এবং একই সাথে বিশ-দুইটি ভাষায় তা করা।

শব্দকোষকাররা একটি স্পষ্ট রেখা আঁকেন লেম্মা এবং এর বক্রিত রূপ। লেম্মা হলো সেই শিরোনাম যা আপনি খুঁজে দেখেন, run, house, be। এর চারপাশে ঘোরে একটি পৃষ্ঠতলীয় রূপের প্যারাডাইম: runs, ran, running। প্রতিটি রূপ একই মূল অর্থ বহন করে, তবে ভিন্ন ভিন্ন বাক্যগঠনগত ভূমিকার জন্য সাজানো।3 একটি অভিধান তার গদ্য লেম্মার জন্য ব্যয় করে এবং ছায়াগুলিকে বাড়ি দেখানোর কাজে ছেড়ে দেয়।

একটি শব্দ কতগুলো ছায়া ফেলে তা ভাষার ওপর নির্ভর করে। ইংরেজি ভাষা analytic: এটি শব্দক্রম ও ছোট ছোট সহায়ক শব্দের ওপর নির্ভর করে, তাই একটি ক্রিয়ার সাধারণত বেশি কিছু রূপ থাকে না। ফিনnish is agglutinative, এটি একটি মূল শব্দের সাথে প্রত্যয় যুক্ত করে অর্থ গড়ে তোলে। একটি একক ফিনnish বিশেষ্য কিছু পনেরোটি বিভক্তির জন্য বদলায়, একবচন ও বহুবচনে, মালিকানাধীন সমাপ্তি এবং ক্লিটিক্স উপরে জমা হয়; ভিন্ন রূপের ব্যবহারিক সংখ্যা হাজার হাজারে পৌঁছায়।4 হাঙ্গেরিয়ান একটি পুরো ইংরেজি বাক্যাংশ, আমার বাড়িতে, একটি শব্দে, házamban.5

০২ · সবার লেখা একটি অভিধান

জ্ঞানদ্রব্য কোথায় থাকে

জ্ঞানদ্রব্যগুলো আসে Wiktionary, যে মুক্ত অভিধান যেকোনো মানুষ সম্পাদনা করতে পারে। এটি বিশাল এবং বহুভাষিক: এই প্রকল্প একশোটিরও বেশি সক্রিয় ভাষা সংস্করণ এবং কোটি কোটি প্রবেশের মধ্যে বিস্তৃত, যা পরিশ্রমিকদের দ্বারা সহযোগিতামূলকভাবে লেখা হয়েছে, কোনো বেতনপ্রাপ্ত সম্পাদকীয় বোর্ডের দ্বারা নয়।1 ২২টি ভাষায় চলা একটি খেলার জন্য, আচ্ছাদনের ক্ষেত্রে অন্য কোনো মুক্ত শব্দকোষ এতটা কাছাকাছি আসে না।

কিন্তু কাগজে আচ্ছাদন মানে পড়া যায় এমন আচ্ছাদন নয়। Wiktionary বিভক্ত রূপগুলো এমনভাবে সংরক্ষণ করে যা মানব সম্পাদকদের একই জ্ঞানদ্রব্য দশ হাজারবার লেখা থেকে মুক্ত রাখে। একটি জ্ঞানদ্রব্য পুরোপুরি বর্ণনা করার পরিবর্তে, একটি অ-লিমা প্রবেশ একটি form-of টেমপ্লেট, একটি ছোট নির্দেশক বহন করে, যা কার্যত বলে, "এটি সেই লিমাটির একটি নির্দিষ্ট ব্যাকরণগত রূপ।"2 The entry for smoulders এটি গদ্য নয়; এটি একটি টেমপ্লেট যা "smoulder-এর তৃতীয় পুরুষ একবচন সরল বর্তমান কাল" হিসেবে রেন্ডার হয়।1

এই নির্দেশিকাগুলো কোনো গোলমাল নয়। ইংরেজি উইকশনারিতে, প্রায় ১.২৭ মিলিয়ন সংজ্ঞার মধ্যে, প্রায় ৪৭৮,০০০টি, অর্থাৎ এক-তৃতীয়াংশেরও বেশি, লেখা-আকারের অর্থের পরিবর্তে "form of" সংজ্ঞা।1 তথ্য সেখানে আছে। এটি শুধু ভাঁজ করা অবস্থায় আছে।

03 · A parsing problem, not a data gap

The gloss is unfolding the template

সুতরাং, যে চ্যালেঞ্জটি গুরুত্বপূর্ণ ছিল তা কখনোই "শব্দটি অনুপস্থিত" ছিল না। এটি ছিল যে শব্দটির অর্থ একটি টেমপ্লেটের ভেতরে বসে ছিল, যা একটি সাধারণ পার্সার ফেলে দিত। WordChess-এর সংজ্ঞাগুলো তৈরি করা হয়েছিল raw Wiktionary dumps and expanding the inflection templates ভাষা অনুযায়ী পড়ে, পার্সারকে শেখানো হয়েছিল যে প্রতিটি নির্দেশিকা কী বোঝায় এবং সেটি একটি সরল গ্লসে পুনর্লিখন করা হয়েছিল।6

প্রতিটি ভাষা বিভিন্ন যন্ত্রপাতির পেছনে তার রূপ লুকিয়ে রাখে। স্প্যানিশ ক্রিয়া রূপগুলো লুকিয়ে রাখে {{forma verbo}}, যা "এক্স-এর ক্রিয়া রূপ" হিসেবে সমাধান করা হয়। জার্মান ব্যবহার করে {{Grundformverweis Dekl/Konj}} বিকলিত ও সংযুক্ত রূপগুলোর জন্য। ফিনিশ নির্ভর করে {{taivutusmuoto}}. রুশ ভাষায় প্রায়শই কোনো ফর্ম টেমপ্লেট সংরক্ষণ করা হয় না, বক্রবিন্যাসিত শব্দটি একটি খালি রিডাইরেক্ট (собаки → собака) যা অনুসরণ করে একটি "ফর্ম অফ" গ্লস পুনরুদ্ধার করতে হয়।6 প্রতিটি নিয়ম মেনে চললে, কভারেজ উল্লেখযোগ্যভাবে বৃদ্ধি পায়।

টেমপ্লেট সম্প্রসারণের আগে → পরে সংজ্ঞা কভারেজ
ভাষাআগেপরেবৃদ্ধি
জার্মান45%92%+47
ডাচ58%90%+32
ফিনিশ54%74%+20
রুশ20%70%+50
গ্রিক15%57%+42

এই প্রজেক্টের ডিজাইন এবং বিল্ড নোট থেকে পরিমাপ করা হয়েছে। শতকরা হার হলো অভিধানের এন্ট্রির সেই অংশ যা ব্যবহারযোগ্য সংজ্ঞা বা সমাধানকৃত "ফর্ম অফ" গ্লস বহন করে।

তথ্যটি কখনোই অনুপস্থিত ছিল না। এটি একটি পয়েন্টারে ভাঁজ করা ছিল, এবং মেশিনকে শব্দটি বুঝিয়ে দেওয়া মানে ছিল সেটি আনফোল্ড করার শেখা।

০৪ · মেশিনের কাছে "একটি শব্দ জানা" কী বোঝায়

একটি স্ট্রিং, এবং তার সম্পর্কে একটি বাক্য

এখন খেলাটি কী ধারণ করে, সে বিষয়ে সৎ হওয়া গুরুত্বপূর্ণ। যখন WordChess দেখায় যে собаки হলো собакаএর একটি রূপ, "কুকুর," তখন এটি কিছুই বুঝে নিতে পারেনি। এটি একটি মানব সম্পাদক পিছনে রেখে যাওয়া একই পয়েন্টার অনুসরণ করে একটি স্ট্রিংকে অন্য একটি স্ট্রিং, একটি গ্লস (অর্থব্যাখ্যা), এর সাথে ম্যাপ করেছে। এটি হলো lemmatization, যা প্রাকৃতিক ভাষা প্রসেসিংয়ের (NLP) মূল চালিকাশক্তি: একটি সারফেস ফর্মকে (বহিঃস্থ রূপ) এর বেস ফর্মে (মূল রূপ) রূপান্তর করা, যাতে একটি মেশিনের কাছে ট্র্যাক করার জন্য আলাদা জিনিসের সংখ্যা কমে যায়।7

এটি একটি বাস্তব এবং উপযোগী ধরনের জ্ঞান। এটি খেলাটিকে অথেন্স বা আমস্টারডামে কোনো শব্দকোষবিদ নিয়োগ না করেই "এই শব্দটি কী?" প্রশ্নের উত্তর দেওয়ার সুযোগ দেয়। কিন্তু এটি হলো লুকআপ হিসেবে জ্ঞান, অর্থ হিসেবে জ্ঞান নয়। গ্লস হলো একটি প্রতিশ্রুতি যে, একজন ব্যক্তি এটি পড়ে শব্দটি চিনতে পারবে। মেশিনটি সেই প্রতিশ্রুতি ধরে রাখে; পাঠকই অর্থ সরবরাহ করেন।

দেয়াল কোথায়

কিছু ভাষা এমন এক সীমায় পৌঁছায় যা কোনো পার্সার তুলে দিতে পারে না, কারণ ডেটাটি মূলতই সেখানে বিস্তারিতভাবে উপস্থিত নেই। হাঙ্গেরিয়ান এন্ট্রিগুলোতে প্রায়শই শুধুমাত্র একটি এটিমোলজি (শব্দগত উৎস) এবং একটি অনুবাদ টেবিল থাকে, কোনো সংজ্ঞা টেক্সট থাকে না, তাই এমনকি একজন নিখুঁত পাঠকও খালি হাতে ফিরে আসেন। সবচেয়ে কঠিন ক্ষেত্রগুলো সেখানে জমা হয় যেখানে ভাষাবিজ্ঞান সবচেয়ে কঠিন: ফিনিশ এবং হাঙ্গেরিয়ান মতো অ্যাগ্লুটিনেটিভ (সংযোজিত) ভাষা, যা বিশাল প্যারাডাইম (রূপবিন্যাস) তৈরি করে, এবং সিরিলিক ও গ্রিক লিপি, যেখানে কমিউনিটির কভারেজ শুরু থেকেই তুলনামূলকভাবে কম। গ্রিক ভাষা ১৫% থেকে ৫৭% পর্যন্ত উন্নীত হয়েছে; যে এটি জার্মান ভাষার ৯২% এর চেয়ে অনেক পিছিয়ে থাকা একটি তথ্য, এটি সোর্সের (উৎসের) বিষয়, কোডের নয়। 6

সোর্স ও নোটস
  1. উইকিপিডিয়া, "Wiktionary", স্কেল, মাল্টিলিঙ্গুয়াল স্ট্রাকচার, সহযোগী সম্পাদনা, এবং "form of" সংজ্ঞার গণনা (সহ smoulders উদাহরণ)। en.wikipedia.org/wiki/Wiktionary
  2. উইকশনারি, "Wiktionary:Form-of templates", নন-লেমা এন্ট্রিগুলো সংজ্ঞা লাইনে একটি লেমার (মূল শব্দের) দিকে কীভাবে ফিরিয়ে পাঠায়। en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. উইকিপিডিয়া, "Lemma (morphology)", লেমা হিসেবে উদ্ধৃতি রূপ; বিকলিত রূপগুলোর প্যারাডাইম। en.wikipedia.org/wiki/Lemma_(morphology)
  4. উইকিপিডিয়া, "Finnish noun cases", প্রায় পনেরোটি বিভক্তি, একবচন ও বহুবচনে, যখন মালিকানাধীন সuffix এবং ক্লিটিক উপরে জমা হয়। en.wikipedia.org/wiki/Finnish_noun_cases. Broader context: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), বিশ্লেষণী বনাম সংযুক্ত প্রকারবিভাগ; házamban example. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess সংজ্ঞা পাইপলাইন, প্রতিটি ভাষার জন্য টেমপ্লেট-এক্সপানশন নিয়ম (স্প্যানিশ {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, রুশ রিডাইরেক্ট) এবং কভারেজ সংখ্যা। এই প্রকল্পের ডিজাইন এবং বিল্ড নোট থেকে পরিমাপ করা।
  7. উইকিপিডিয়া, "লেমমাটাইজেশন", এনএলপি-তে বক্রবোধক রূপগুলিকে একটি মূল রূপে হ্রাস করা। en.wikipedia.org/wiki/Lemmatization
  8. উইকশনারিতে আরও পড়া, [1011.1368] উইকশনারি এন্ট্রি কাঠামোর একটি রিলেশনাল ডাটাবেস স্কিমাতে টেবিল এবং সম্পর্কে রূপান্তর। arxiv.org.
  9. উইকশনারিতে আরও পড়া, ইংরেজি উইকশনারি এন্ট্রিতে ব্যবহারকারীর আগ্রহের পূর্বাভাস হিসেবে সিইফার শব্দভাণ্ডার স্তর। doi.org.
  10. লেমমাটাইজেশনে আরও পড়া, বাইওলেমমাটাইজার: বায়োমেডিকেল টেক্সটের মরফোলজিক্যাল প্রসেসিংয়ের জন্য একটি লেমমাটাইজেশন টুল - পিএমসি। ncbi.nlm.nih.gov.
Was this worth reading?
← Back to WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Inspirations · © 2026