We Measured It: Amharic Costs 6× More Than English in AI — Here's Exactly Why
አንድ ዓረፍተ ነገር በ15 ቋንቋ ተርጉመን ቶከኑን ለክተናል። እንግሊዝኛ 12፣ ቻይንኛ 10፣ አማርኛ 73። ለምን? ምክንያቱን አገኘነው — እና በአንድ ቀላል ሕግ ይገለጻል፦ አንድ የግዕዝ ፊደል = 2 ቶከን።

ተመሳሳይ ዓረፍተ ነገር። አሥራ አምስት ቋንቋ። አንድ መለኪያ።
በክፍል 5 አማርኛ በ AI ውስጥ ውድ መሆኑን ጠቅሰን ነበር። ዛሬ ግን ገምተን አልተውነውም — በእውነተኛ የቶከን መቁጠሪያ ለክተነዋል። ውጤቱም ከጠበቅነው በላይ ነው። 🧮
🔬 ሙከራው
አንድ ዓረፍተ ነገር መረጥን፦
“ሰላም፣ እንዴት ነህ? እኔ ሰው ሰራሽ አስተውሎት እየተማርኩ ነው።”
ወደ 15 ቋንቋ ተርጉመን በእውነተኛ ቶከናይዘር (o200k_base — ዘመናዊ ሞዴሎች የሚጠቀሙበት) ለካነው። ውጤቱ ይህ ነው፦
📊 ውጤቱ — ከርካሹ ወደ ውዱ
- 🥇 ቻይንኛ፦ 10 ቶከን — ከእንግሊዝኛም ይረክሳል!
- እንግሊዝኛ፦ 12 · ስፓኒሽ፦ 12 · ሩሲያኛ፦ 12
- ፈረንሳይኛ፦ 15 · ስዋሂሊ፦ 15 · ጀርመንኛ፦ 16
- ጃፓንኛ፦ 17 · ኮሪያኛ፦ 17 · ሶማልኛ፦ 18
- ዐረብኛ፦ 19 · አፋን ኦሮሞ፦ 19 · ሂንዲ፦ 20
- 🔻 ትግርኛ፦ 70
- 🔻 አማርኛ፦ 73 — ከእንግሊዝኛ 6.1 እጥፍ
አየኸው? አማርኛና ትግርኛ ብቻቸውን ናቸው ወደላይ የወጡት። ሌሎቹ ሁሉ ከ10 እስከ 20 ውስጥ ናቸው። ልዩነቱ ትንሽ አይደለም — የተለየ ዓለም ነው።
እና ልብ በል፦ አፋን ኦሮሞና ሶማልኛ ርካሽ ናቸው — 19 እና 18። ለምን? በላቲን ፊደል ስለሚጻፉ። ችግሩ የቋንቋው ሳይሆን የፊደሉ ነው።
🔍 ለምን? — ምክንያቱን አገኘነው
ይህ የጽሑፉ ልብ ነው። አንድ ቃል ስንመረምር ግልጽ ሆነ።
ቶከናይዘሩ የአማርኛ ቃላት አያውቅም። ስለዚህ ቃሉን ወደ ጥሬ ባይት (bytes) ይሰብረዋል።
ተመልከት፦
- “peace” (እንግሊዝኛ) = 1 ቶከን። ሙሉ ቃሉ አንድ ቶከን ነው።
- “ሰላም” (አማርኛ) = 6 ቶከን። ሦስት ፊደል፣ ስድስት ቶከን።
- “computer” = 1 ቶከን · “ኮምፒውተር” = 12 ቶከን
- “education” = 1 ቶከን · “ትምህርት” = 10 ቶከን
🧩 ቀላሉ ሕግ — ይህን አስታውስ
ቁጥሮቹን ስንመረምር ግልጽ ንድፍ ወጣ፦
አንድ የግዕዝ ፊደል = 2 ቶከን
ፈትሸነዋል፦
- “ሀ” = 1 ፊደል → 2 ቶከን
- “ሰላም” = 3 ፊደል → 6 ቶከን
- “ኢትዮጵያ” = 5 ፊደል → 10 ቶከን
- “የኢትዮጵያ ብሔራዊ ባንክ” = 13 ፊደል → 28 ቶከን
ሁልጊዜ 2 እጥፍ። ስለዚህ የአማርኛ ጽሑፍህን ፊደል ቁጠርና በ2 አባዛ — ግምታዊ የቶከን ብዛትህ ያ ነው።
💡 ለምን በትክክል 2?
ምክንያቱ በኮምፒውተር የፊደል አጻጻፍ (UTF-8) ውስጥ ነው፦
- የላቲን ፊደል “a” = 1 ባይት
- የዐረብኛ “م” = 2 ባይት
- የግዕዝ “ሀ” = 3 ባይት
- የቻይንኛ “中” = 3 ባይት
ቻይንኛም 3 ባይት ነው — ግን ቻይንኛ ርካሽ ነው! ለምን?
ምክንያቱም ቶከናይዘሩ የቻይንኛ ቃላትን ተምሮ ስለያዘ ነው። አንድ ሙሉ የቻይንኛ ቃል በአንድ ቶከን ይወከላል። አማርኛ ግን በሥልጠና መረጃው ውስጥ በጣም ጥቂት ስለሆነ ቶከናይዘሩ አልተማረውም — ስለዚህ ወደ ጥሬ ባይት ይወርዳል።
ማለት ችግሩ የግዕዝ ፊደል “ከባድ” ስለሆነ አይደለም። በኢንተርኔት ላይ ያለው አማርኛ ጥቂት ስለሆነ ነው። ይህ ደግሞ ሊስተካከል የሚችል ነው።
💰 በገንዘብ ሲሰላ
አንድ እውነተኛ የዜና አንቀጽ ወስደን ለካነው። ተመሳሳይ ትርጉም፦
- እንግሊዝኛ፦ 38 ቶከን (32 ቃላት)
- አማርኛ፦ 218 ቶከን (23 ቃላት) — 5.7 እጥፍ
በምሳሌያዊ ተመን (1 ዶላር ለአንድ ሚሊዮን ቶከን)፦ 1,000 እንደዚህ ያሉ አንቀጾች ብታስኬድ፦
- እንግሊዝኛ፦ 0.04 ዶላር
- አማርኛ፦ 0.22 ዶላር
ትንሽ ይመስላል። ግን በሚሊዮን ሲባዛ — ከኢትዮጵያ በዶላር ስትከፍል — ልዩነቱ ይታያል።
📉 ግን ትልቁ ችግር ገንዘብ አይደለም
እዚህ ጋ ተጠንቀቅ። ብዙ ሰው የማያስበው ነጥብ ነው።
የኮንቴክስት ዊንዶው ትዝ ይልሃል? በመዝገበ ቃላቱ እንዳልነው — ሞዴሉ በአንድ ጊዜ ሊይዘው የሚችለው መጠን።
200,000 ቶከን ኮንቴክስት ያለው ሞዴል ስንት ቃል ይይዛል?
- 🇬🇧 እንግሊዝኛ፦ ወደ 168,000 ቃል
- 🇪🇹 አማርኛ፦ ወደ 21,000 ቃል ብቻ
ማለት አማርኛ የእንግሊዝኛውን 13% ብቻ ይይዛል።
በተግባር ምን ማለት ነው? የ50,000 ቃል መጽሐፍ፦
- በእንግሊዝኛ ≈ 59,500 ቶከን → በቀላሉ ይገባል
- በአማርኛ ≈ 474,000 ቶከን → ፈጽሞ አይገባም
ስለዚህ አንድ የአማርኛ መጽሐፍ ሰጥተህ “አጠቃልለው” ማለት አትችልም። ይህ የገንዘብ ሳይሆን የአቅም ገደብ ነው።
🛠️ ምን ማድረግ ትችላለህ? — ተግባራዊ
- 1. ረጅም አማርኛ አትለጥፍ። አሥር ገጽ ሰጥተህ ስለ አንድ አንቀጽ አትጠይቅ። የሚመለከተውን ብቻ ቁረጥ።
- 2. መመሪያውን በእንግሊዝኛ ጻፍ። ይህ ዘዴ ይሠራል፦ ትእዛዝህን በእንግሊዝኛ ጻፍ፣ መልሱን በአማርኛ ጠይቅ። የመግቢያ ወጪህ በእጅጉ ይቀንሳል።
- 3. ውይይትህን አሳጥር። አዲስ ርዕስ ሲጀምር አዲስ ውይይት ክፈት። ረጅም የአማርኛ ውይይት ኮንቴክስቱን በፍጥነት ይሞላል።
- 4. ለረጅም ሰነድ RAG ተጠቀም። RAG የሚመለከተውን ክፍል ብቻ ስለሚያወጣ ሙሉውን መጽሐፍ ማስገባት አያስፈልግም። ለአማርኛ RAG ምርጫ ሳይሆን አስፈላጊ ነው።
- 5. ውጤቱን አጠር አድርገህ ጠይቅ። “በአጭሩ” ወይም “በአምስት ነጥብ” የሚል ጨምር። የውጤት ቶከንም ይከፈልበታል።
🇪🇹 ትልቁ ስዕል
ይህ ቁጥር የፍትሐዊነት ጉዳይ ነው።
አንድ ኢትዮጵያዊ ተማሪ በአማርኛ AI ሲጠቀም፣ ከአሜሪካዊ ተማሪ ስድስት እጥፍ ይከፍላል — ተመሳሳይ ሐሳብ ለመግለጽ። እና ሞዴሉ የሚይዘው መረጃም ስምንተኛ እጥፍ ያንሳል።
ይህ ማንም ሆን ብሎ የሠራው አድልዎ አይደለም። የመረጃ እጥረት ውጤት ነው። ቶከናይዘር የሚማረው ካየው ነው። አማርኛ በኢንተርኔት ላይ ጥቂት ስለሆነ አልተማረውም።
እና መፍትሔው ግልጽ ነው፦ በአማርኛ መጻፍ። ብዙ አማርኛ በኢንተርኔት ላይ ሲኖር፣ የሚቀጥሉት ቶከናይዘሮች ይማሩታል። ያኔ ወጪው ይወርዳል።
በክፍል 8 እንዳልነው — የአማርኛ መረጃ መሰብሰብና ማደራጀት ብሔራዊ ሀብት ነው። ይህ ልኬት ለምን እንደሆነ በቁጥር ያሳያል።
🎓 ማጠቃለያ — ሦስት ቁጥር አስታውስ
- 2 — አንድ የግዕዝ ፊደል ስንት ቶከን እንደሆነ
- 6 — አማርኛ ከእንግሊዝኛ ስንት እጥፍ እንደሚያስከፍል
- 13% — የኮንቴክስት ዊንዶው ስንት ያህል ብቻ እንደምትጠቀም
እነዚህን ካወቅህ ወጪህን መቆጣጠር ትችላለህ። እና የሚገርመው — ችግሩ የቋንቋችን ሳይሆን የመገኘቱ ነው። አፋን ኦሮሞ በላቲን ስለሚጻፍ ርካሽ ነው። ቻይንኛ ብዙ መረጃ ስላለው ርካሽ ነው።
አማርኛ ውድ የሆነው ጥቂት ስለሆነ ነው። ያ ደግሞ በእኛ እጅ ነው። 🙂
In brief (English): We measured this rather than estimated it. Taking one sentence — "Hello, how are you? I am learning artificial intelligence." — translated into 15 languages and encoded with a real tokenizer (o200k_base), the results were: Chinese 10, English 12, Spanish 12, Russian 12, French 15, Swahili 15, German 16, Japanese 17, Korean 17, Somali 18, Arabic 19, Afaan Oromo 19, Hindi 20 — and Tigrinya 70, Amharic 73. Amharic costs 6.1× English for identical meaning. The cause: the tokenizer has no learned Amharic vocabulary, so Ge'ez text falls back to raw byte encoding. "peace" is 1 token; "ሰላም" is 6. "computer" is 1 token; "ኮምፒውተር" is 12. The pattern is exact and testable: one Ge'ez character = 2 tokens, verified across single letters, words and phrases. Notably, Chinese characters are also 3 UTF-8 bytes yet remain cheap, because the tokenizer learned Chinese vocabulary — and Afaan Oromo and Somali are cheap because they use Latin script. The problem is not the language, it is its scarcity in training data. The bigger constraint is not cost but capacity: a 200,000-token context window holds roughly 168,000 English words but only 21,000 Amharic words — 13%. A 50,000-word book is ~59,500 tokens in English but ~474,000 in Amharic, meaning it cannot fit at all. Practical mitigations: write instructions in English and request Amharic output, keep sessions short, trim inputs, request concise outputs, and treat RAG as necessary rather than optional for Amharic documents.
ዘዴ / Method: ሁሉም ቁጥሮች በቢና ዜና በ tiktoken ቤተ መጻሕፍት፣ በ o200k_base ኢንኮዲንግ የተለኩ ናቸው። የተለያዩ ሞዴሎች የተለያየ ቶከናይዘር ስለሚጠቀሙ ቁጥሮቹ በትንሹ ሊለያዩ ይችላሉ — አጠቃላይ ንድፉ ግን አንድ ነው። ሙከራውን ራስህ መድገም ትችላለህ።
🏢 ህንፃ አለዎት?
BinaSmart — ሙሉ የህንፃ አስተዳደር ሲስተም በ24 ሰዓት።


