Foundationপ্রথম নীতি থেকে
LEVEL 1 · How Computers Represent Information

Unicode

ইউনিকোড

প্রতিটা ভাষার প্রতিটা অক্ষরের জন্য একটা universal code point মানচিত্র — 'কোন অক্ষর' প্রশ্নটাকে 'কীভাবে byte-এ লেখা হবে' প্রশ্ন থেকে আলাদা করে।

ASCII আর অসংখ্য অসামঞ্জস্যপূর্ণ code page-এর বিশৃঙ্খলা সমাধানে, Unicode একটা সিদ্ধান্তে সব ভাষার প্রতিটা অক্ষরকে একটা একক, বৈশ্বিক [[code-point|code point]] নম্বর (U+XXXX) দেয় — বাংলা, চীনা, আরবি, emoji, সব একই মানচিত্রে।

~১১ লক্ষ সম্ভাব্য code point — 17টা “plane”-এ ভাগ করা, যার মধ্যে Basic Multilingual Plane (BMP, U+0000U+FFFF) সবচেয়ে বেশি ব্যবহৃত অক্ষর ধরে (বাংলা ব্লকসহ), আর supplementary plane-এ emoji-র মতো নতুন সংযোজন থাকে।

গুরুত্বপূর্ণ পার্থক্য যা Unicode স্পষ্ট করে: “কোন অক্ষর” (code point) আর “byte-এ কীভাবে সংরক্ষিত হবে” (encoding) সম্পূর্ণ আলাদা প্রশ্ন। একই code point [[utf-8]], UTF-16, বা UTF-32-এ ভিন্ন byte sequence হিসেবে লেখা যায় — ঠিক যেমন একই সংখ্যা binary, decimal, বা hex-এ ভিন্নভাবে লেখা যায় (positional number systems লেসনের সরাসরি সমান্তরাল)।