- Word2Vec বন্টনমূলক অনুমানের উপর ভিত্তি করে শব্দকে উচ্চ-মাত্রিক ভেক্টরে রূপান্তরিত করে, যেখানে অর্থের উৎস হলো প্রসঙ্গ।
- মডেলটি দুটি প্রধান আর্কিটেকচার ব্যবহার করে: কনটেক্সট থেকে টার্গেট ওয়ার্ড অনুমান করার জন্য CBOW এবং টার্গেট ওয়ার্ড থেকে কনটেক্সট অনুমান করার জন্য Skip-Gram।
- শব্দার্থিক সম্পর্কগুলোকে ভেক্টর স্পেসে রৈখিক অফসেট হিসেবে ধারণ করা হয়, যা গাণিতিক প্রক্রিয়ার মাধ্যমে ভাষাগত সাদৃশ্য স্থাপন সম্ভব করে তোলে।
কখনো ভেবে দেখেছেন, আমরা যখন কথা বলি তখন একটি যন্ত্র আসলে কীভাবে আমাদের কথার অর্থ বোঝে? ব্যাপারটা এমন নয় যে আমরা একটি কম্পিউটারের হাতে শুধু একটি অভিধান ধরিয়ে দিলেই সে শব্দের সূক্ষ্ম অর্থ বুঝে নেবে। বহুদিন ধরে যন্ত্রগুলো শব্দকে কেবল বিচ্ছিন্ন প্রতীক হিসেবেই দেখত , যার অর্থ হলো একটি “কুকুর” এবং একটি “বিড়াল” এর মধ্যে যেমন পার্থক্য ছিল, তেমনই একটি “মাইক্রোওয়েভ” এর মধ্যেও ছিল। Word2Vec-এর আগমনের সাথে সাথে এই সবকিছু বদলে যায়। এটি ন্যাচারাল ল্যাঙ্গুয়েজ প্রসেসিং-এর ক্ষেত্রে একটি যুগান্তকারী উদ্ভাবন, যা কম্পিউটারকে শব্দগুলোকে একটি গাণিতিক পরিসরে বিন্যস্ত করার সুযোগ দেয় , যেখানে শব্দের নৈকট্যের ওপর ভিত্তি করে অর্থ নির্ধারিত হয়।
মূলতঃ Word2Vec ‘বন্টনমূলক অনুমান’- এর উপর ভিত্তি করে তৈরি। সহজ ভাষায় বলতে গেলে, একটি শব্দের পারিপার্শ্বিক শব্দ দেখে তার অর্থ বোঝা যায়। যদি দুটি শব্দ প্রায়শই একই শব্দের সাথে ব্যবহৃত হয়, তবে সম্ভবত তাদের অর্থও একই রকম। বিপুল পরিমাণ টেক্সট বিশ্লেষণ করে Word2Vec শব্দগুলোকে উচ্চ-মাত্রিক ভেক্টরে রূপান্তরিত করে , যা এমন একটি শব্দার্থিক মানচিত্র তৈরি করে যেখানে ভাষাগত সম্পর্কগুলো সাধারণ জ্যামিতিতে পরিণত হয়।
পুরাতন রীতি: গণনা-ভিত্তিক পদ্ধতি

Word2Vec আসার আগে, আমরা গণনা-ভিত্তিক পদ্ধতির উপর নির্ভর করতাম। এর সবচেয়ে সাধারণ সংস্করণটি ছিল সহ-ঘটনা ম্যাট্রিক্স (co-occurrence matrices) , যেখানে কেবল গণনা করা হতো শব্দ A, শব্দ B-এর কাছাকাছি কতবার এসেছে। যদিও এটি সহজবোধ্য ছিল, এই ম্যাট্রিক্সগুলো বিশাল আকার ধারণ করত এবং শূন্যে পূর্ণ হয়ে যেত, যার ফলে এগুলোর গণনা করা দুঃস্বপ্নের মতো হয়ে দাঁড়াত। এই সমস্যা সমাধানের জন্য, গবেষকরা সংযোগ আরও ভালোভাবে পরিমাপ করতে পজিটিভ পয়েন্টওয়াইজ মিউচুয়াল ইনফরমেশন (PPMI) বা ল্যাটেন্ট সেমান্টিক অ্যানালাইসিস (LSA)- এর মতো কৌশল ব্যবহার করেছেন , যা সিঙ্গুলার ভ্যালু ডিকম্পোজিশন (SVD) ব্যবহার করে ডেটাকে সংকুচিত করে এবং ডকুমেন্টের মধ্যে লুকানো "বিষয়" উন্মোচন করে।
Word2Vec আসলে কীভাবে কাজ করে

Word2Vec সমস্যাটিকে গণনার কাজ হিসেবে না দেখে, ভবিষ্যদ্বাণীমূলক কাজ হিসেবে বিবেচনা করে প্রচলিত ধারণাকেই পাল্টে দিয়েছে। শুধু শব্দ গণনা করার পরিবর্তে, এটি এমবেডিং শেখার জন্য একটি অগভীর, দুই-স্তরবিশিষ্ট নিউরাল নেটওয়ার্ক ব্যবহার করে। মডেলটি একটি বিশাল টেক্সট কর্পাসের উপর দিয়ে একটি উইন্ডো স্লাইড করে, যা একটি কেন্দ্রীয় শব্দ এবং তার চারপাশের প্রসঙ্গের উপর মনোযোগ দেয়। সঠিক প্রতিবেশী শব্দগুলোর ভবিষ্যদ্বাণী করার সম্ভাবনাকে সর্বোচ্চ করার জন্য ভেক্টরগুলোকে বারবার সমন্বয় করার মাধ্যমে , মডেলটি স্বাভাবিকভাবেই ভেক্টর স্পেসে অর্থগতভাবে সাদৃশ্যপূর্ণ শব্দগুলোকে একে অপরের কাছাকাছি নিয়ে আসে।
প্রশিক্ষণের দুটি উপায়: সিবিওডব্লিউ বনাম স্কিপ-গ্রাম

- কন্টিনিউয়াস ব্যাগ-অফ-ওয়ার্ডস (CBOW): এটিকে একটি ‘শূন্যস্থান পূরণ’ অনুশীলন হিসেবে ভাবুন। মডেলটি তার চারপাশের প্রাসঙ্গিক শব্দগুলো দেখে এবং চেষ্টা করে... অনুপস্থিত কেন্দ্রীয় শব্দটি অনুমান করুনসাধারণত এতে দ্রুত অনুশীলন করা যায় এবং যেসব শব্দ প্রায়ই ব্যবহৃত হয়, সেগুলোর জন্য এটি দারুণ কার্যকর।
- স্কিপ-গ্রাম: এটি বিপরীত পদ্ধতি। মডেলটি একটি কেন্দ্রীয় শব্দ নেয় এবং চেষ্টা করে... পারিপার্শ্বিক প্রেক্ষাপট অনুমান করুনযদিও এতে বেশি সময় লাগে, স্কিপ-গ্রাম সামলানোর ক্ষেত্রে অনেক ভালো। বিরল শব্দ এবং বিরল শব্দার্থিক সম্পর্কগুলো শনাক্ত করা।
প্রশিক্ষণকে কার্যকর করা: নেতিবাচক নমুনায়ন

প্রতিবার উইন্ডো সরানোর সময় একটি বিশাল শব্দভান্ডারের প্রতিটি শব্দের সম্ভাবনা গণনা করা অত্যন্ত ধীরগতির হবে । এটি এড়াতে, Word2Vec নেগেটিভ স্যাম্পলিং ব্যবহার করে । অভিধানের প্রতিটি শব্দ আপডেট করার পরিবর্তে, মডেলটি শুধুমাত্র টার্গেট শব্দটি এবং এলোমেলোভাবে নির্বাচিত অল্প কিছু “নেগেটিভ” উদাহরণ আপডেট করে। এটি শেখা এমবেডিংগুলির গুণমান নষ্ট না করেই গণনার ভার ব্যাপকভাবে কমিয়ে দেয় এবং মডেলটি যাতে অলস না হয়ে পড়ে, তা নিশ্চিত করতে প্রায়শই শব্দের ফ্রিকোয়েন্সি ডিস্ট্রিবিউশনের উপর ভিত্তি করে স্যাম্পল নেয় ।
শব্দার্থিক স্থানের জাদু
প্রশিক্ষণটি সম্পন্ন হলে, এর ফলস্বরূপ একটি শব্দার্থিক পরিসর পাওয়া যায় যেখানে আপনি শব্দগুলোর উপর গাণিতিক হিসাব করতে পারেন। সবচেয়ে আকর্ষণীয় আবিষ্কারগুলোর মধ্যে একটি হলো, এই সম্পর্কগুলো প্রায়শই রৈখিক হয় । উদাহরণস্বরূপ, যদি আপনি “King” এর ভেক্টর থেকে “Man” বিয়োগ করেন এবং “Woman” যোগ করেন, তাহলে পরিসরে প্রাপ্ত বিন্দুটি “Queen” এর ভেক্টরের অবিশ্বাস্যভাবে কাছাকাছি হবে। এটি দেখায় যে মডেলটি সাধারণ ভেক্টর পাটিগণিতের মাধ্যমে লিঙ্গ এবং রাজকীয়তার বিমূর্ত ধারণাটি ধারণ করতে পেরেছে।
সাধারণ শব্দের বাইরে: সম্প্রসারণ এবং রূপভেদ
Word2Vec-এর সাফল্য একগুচ্ছ এক্সটেনশনের জন্ম দেয়। Doc2Vec এই ধারণাটিকে আরও প্রসারিত করে সম্পূর্ণ অনুচ্ছেদ বা ডকুমেন্টকে একক ভেক্টর হিসেবে উপস্থাপন করে, যা উন্নত ডকুমেন্ট ক্লাসিফিকেশনের সুযোগ করে দেয়। এরপর আসে Top2Vec , যা লেবেলযুক্ত ডেটার প্রয়োজন ছাড়াই স্বয়ংক্রিয়ভাবে টপিক খুঁজে বের করার জন্য HDBSCAN-এর মতো ক্লাস্টারিং অ্যালগরিদমের সাথে ডকুমেন্ট এমবেডিং-কে একত্রিত করে । এমনকি জীববিজ্ঞানও BioVec-এর মাধ্যমে এর অংশীদার হয় , যা ডিএনএ এবং প্রোটিন সিকোয়েন্সে এই নীতিগুলো প্রয়োগ করে জৈব-রাসায়নিক প্যাটার্ন বুঝতে সাহায্য করে ।
ফলাফল মূল্যায়ন
আমরা কীভাবে জানব যে মডেলটি আসলেই “স্মার্ট”? এর দুটি প্রধান উপায় আছে। ইন্ট্রিনসিক ইভ্যালুয়েশন বা অভ্যন্তরীণ মূল্যায়নে মডেলের অভ্যন্তরীণ বৈশিষ্ট্যগুলো দেখা হয়। এক্ষেত্রে বেঞ্চমার্ক ব্যবহার করে দেখা হয় যে, মডেলটির সিমিলারিটি স্কোর মানুষের বিচার-বিবেচনার সাথে মেলে কিনা বা এটি অ্যানালজি টেস্ট সমাধান করতে পারে কিনা । এক্সট্রিনসিক ইভ্যালুয়েশন বা বাহ্যিক মূল্যায়ন আরও বেশি বাস্তবসম্মত; এতে এম্বেডিংগুলোকে সেন্টিমেন্ট অ্যানালাইসিস বা টেক্সট ক্লাসিফিকেশনের মতো বাস্তব জগতের কোনো কাজে প্রয়োগ করে দেখা হয় যে, সামগ্রিক পারফরম্যান্সের উন্নতি হয় কিনা। যদিও BERT বা ELMo-এর মতো নতুন মডেলগুলো কনটেক্সচুয়াল এম্বেডিং (অর্থাৎ বাক্যের উপর ভিত্তি করে একটি শব্দের ভেক্টর পরিবর্তিত হয়) প্রদান করে, Word2Vec এখনও স্ট্যাটিক ওয়ার্ড রিপ্রেজেন্টেশনের মূল ভিত্তি হিসেবে রয়ে গেছে ।
মানব ভাষার বিশৃঙ্খলাকে একটি সুসংগঠিত জ্যামিতিক পরিসরে রূপান্তরিত করার মাধ্যমে, এই কৌশলগুলো মেশিনকে কোসাইন সিমিলারিটি এবং ভেক্টর অফসেটের সাহায্যে অর্থের সন্ধান করতে সক্ষম করে। নেগেটিভ স্যাম্পলিং-এর কার্যকারিতা থেকে শুরু করে স্কিপ-গ্রাম এবং সিবিওডব্লিউ-এর বহুমুখিতা পর্যন্ত, ভাষাগত প্রেক্ষাপটকে গাণিতিক স্থানাঙ্কে রূপান্তর করার ক্ষমতা সার্চ ইঞ্জিন থেকে শুরু করে অনুবাদ সরঞ্জাম পর্যন্ত সবকিছু তৈরির পদ্ধতিকে মৌলিকভাবে পরিবর্তন করে দিয়েছে।
