BinaSmart ዜና 💼 Own a company?
ቴክኖሎጂ

AI From A to Z, Part 5: Why Is AI Weak in Amharic?

60 ሚሊዮን ተናጋሪ ያለው ቋንቋ ነው። ግን አንድ የአማርኛ ቃል ለ AI ማንበብ ከእንግሊዝኛ እስከ 10 እጥፍ ያስከፍላል። ለምን? አምስቱ እውነተኛ ምክንያቶች፣ ተግባራዊ መፍትሔዎችና በኢትዮጵያ እየተሠራ ያለው ሥራ።

ቢና ዜና ዴስክ·3 Sept 2026·10 ደቂቃ ንባብ

ይህ የስምንት ክፍል ተከታታይ ጽሑፍ አምስተኛው ነው። እስካሁን አጠቃላይ ነገሮችን አየን። አሁን ወደ እኛ ጉዳይ እንመለስ፦ AI አማርኛን ምን ያህል ያውቃል? እና ለምንድን ነው በእንግሊዝኛ ጎበዝ ሆኖ በአማርኛ የሚደናቀፈው?

አንድ ቀላል ሙከራ

አንድ ጥያቄ ሁለት ጊዜ ጠይቅ — አንድ ጊዜ በእንግሊዝኛ፣ አንድ ጊዜ በአማርኛ። ተመሳሳይ ጥያቄ።

በአብዛኛው የእንግሊዝኛው መልስ የበለጠ ጥልቀት ያለው፣ የተደራጀና ትክክለኛ ይሆናል። የአማርኛው መልስ ደግሞ አጠር ያለ፣ አንዳንዴ ሰዋሰው የተሳሳተ፣ አልፎ አልፎም እንግዳ የሆነ ቃል የያዘ ይሆናል።

ይህ አጋጣሚ አይደለም። አምስት ግልጽ ምክንያቶች አሉት — እና ሁሉም ሊስተካከሉ የሚችሉ ናቸው።

ምክንያት አንድ፦ የመረጃ ብዛት

በክፍል 1 እንዳልነው AI የሚማረው በኢንተርኔት ላይ ካለው ጽሑፍ ነው። ጥያቄው ግን ይህ ነው፦ በኢንተርኔት ላይ ስንት አማርኛ አለ?

አማርኛ ወደ 60 ሚሊዮን ተናጋሪ አለው። ይህ ትንሽ ቁጥር አይደለም — ከጣሊያንኛ ወይም ከኮሪያኛ ተናጋሪዎች ጋር ተቀራራቢ ነው። ግን በኢንተርኔት ላይ ያለው የአማርኛ ጽሑፍ መጠን ከእንግሊዝኛ ጋር ሲነጻጸር ከመቶኛ ክፍልፋይ በታች ነው።

ልዩነቱ በተናጋሪ ብዛት ሳይሆን በተጻፈ ዲጂታል ጽሑፍ ብዛት ላይ ነው። እኛ አማርኛን በብዛት እንናገራለን፤ በኢንተርኔት ላይ ግን በዚያው መጠን አንጽፍም። AI ደግሞ የሚማረው ከተጻፈው ብቻ ነው።

ምክንያት ሁለት፦ የ"ቶከን" ቀረጥ

ይህ በጣም ጥልቅ የሆነው ግን ብዙም የማይታወቀው ምክንያት ነው። ትንሽ ትዕግሥት ይጠይቃል፤ ግን ሁሉንም ነገር ያብራራል።

AI ጽሑፍን በቀጥታ አያነብም። መጀመሪያ ወደ ትናንሽ ቁርጥራጮች ይከፍለዋል — እነዚህ "ቶከን" (token) ይባላሉ። ሞዴሉ የሚያስበውና የሚከፈለው በቶከን ነው።

በእንግሊዝኛ አንድ ቃል በአማካይ አንድ ወይም አንድ ተኩል ቶከን ነው። ቃላቱ በሞዴሉ መዝገበ ቃላት ውስጥ የየራሳቸው ቦታ አላቸው።

የግዕዝ ፊደላት ግን በአብዛኞቹ ሞዴሎች መዝገበ ቃላት ውስጥ የራሳቸው ቦታ የላቸውም። ስለዚህ ሥርዓቱ ወደ "ባይት" ደረጃ ወርዶ ይከፋፍላቸዋል። ውጤቱ፦ አንድ የግዕዝ ፊደል ብቻውን ሦስት ቶከን ይሆናል።

አንድ የአማርኛ ቃል አምስት ፊደል ካለው፣ 15 ቶከን ሊሆን ይችላል። በጥናቶች የተለካው ቁጥር ይህን ያረጋግጣል፦ ለአማርኛ ያልተዘጋጁ ሞዴሎች በአንድ ቃል እስከ 13.8 ቶከን ይጠቀማሉ። ለአማርኛ የተዘጋጀ ሞዴል ግን 1.46 ቶከን ብቻ። ወደ አሥር እጥፍ ልዩነት።

ይህ ሦስት ውጤት አለው፦

  • ወጪ። በአማርኛ መጻፍ ከእንግሊዝኛ ብዙ እጥፍ ያስከፍላል። ለንግድ አገልግሎት ሲሆን ልዩነቱ ይታያል
  • ቦታ። እያንዳንዱ ሞዴል በአንድ ጊዜ ሊይዘው የሚችለው የቶከን ብዛት ገደብ አለው። በአማርኛ ያ ገደብ በጣም ቀድሞ ይሞላል። ረጅም የአማርኛ ሰነድ ስትሰጠው በቶከን ገደቡ ምክንያት ሊቆረጥ ይችላል
  • ግንዛቤ። ይህ ትልቁ ነው። ቃሉ ትርጉም ወደሌላቸው ቁርጥራጮች ስለሚከፋፈል ሞዴሉ የቃሉን ትርጉም በቅጡ አይዝም። ልክ አንድ ዓረፍተ ነገር ፊደል በፊደል እየተነጠለ እንደሚነበብልህ ነው

አንድ ተጨባጭ ምሳሌ፦ ድምፅን ወደ ጽሑፍ የሚቀይረው Whisper የሚባለው ሥርዓት በአንድ ጊዜ 30 ሰከንድ ድምፅ ይሰማል። በአማርኛ ግን የቶከን አቅሙ በ24 ሰከንድ ገደማ ይሞላል — ማለት ድምፁ ገና ሳያልቅ መጻፍ ያቆማል። ችግሩ የመስማት ችሎታ ሳይሆን የቶከን ቀረጥ ነው።

ምክንያት ሦስት፦ አማርኛ ራሱ ከባድ ነው

አማርኛ ሴማዊ ቋንቋ ነው። ትርጉም የሚገነባው ቅጥያ በመደራረብ ነው። አንድ የአማርኛ ቃል በእንግሊዝኛ ሙሉ ዓረፍተ ነገር ሊሆን ይችላል።

ለምሳሌ "አልነገርኳትም" — አንድ ቃል። በእንግሊዝኛ "I did not tell her" — አምስት ቃል። በዚህ አንድ ቃል ውስጥ ማን እንደሆነ፣ ለማን እንደሆነ፣ ጊዜው መቼ እንደሆነና አሉታዊ መሆኑ ሁሉ ተጠቅልሏል።

በእንግሊዝኛ ቅርጽ ላይ የተሠለጠነ ሞዴል ይህን መፍታት ይቸግረዋል። አንድ ቃል የሚይዘውን ይህን ያህል መረጃ ስለማይጠብቅ በስህተት ይተረጉመዋል።

ምክንያት አራት፦ የፊደል መደራረብ

ይህ ለእኛ የተለመደ ነው፤ ለማሽን ግን ቅዠት ነው።

በአማርኛ አንድ ድምፅ በብዙ ፊደል ይጻፋል፦ ሀ · ሃ · ኀ · ሐ · ሓ ወይም አ · ዐ · ኣ ወይም ሰ · ሠ ወይም ጸ · ፀ

ሰው ሲያነብ ልዩነቱ አይታወቀውም። ማሽን ግን "ሰላም" እና "ሠላም" ሁለት ፍጹም የተለያዩ ቃላት አድርጎ ነው የሚያያቸው። ምንም ግንኙነት እንዳላቸው አያውቅም።

በኢንተርኔት ላይ ያለው አማርኛ ደግሞ ወጥ የሆነ አጻጻፍ የለውም — አንዱ ጸሐፊ በአንድ መንገድ፣ ሌላው በሌላ መንገድ ይጽፋል። ስለዚህ ቀድሞውኑ ትንሽ የሆነው መረጃ ተከፋፍሎ ይበልጥ ይመነምናል።

ምክንያት አምስት፦ የጽሑፉ ጥራት

በኢንተርኔት ላይ ካለው አማርኛ ውስጥ ብዙው በማሽን ከእንግሊዝኛ የተተረጎመ ነው። ሌላው ከወረቀት በስካን የተወሰደና በስህተት የተነበበ ነው።

ውጤቱ ግልጽ ነው፦ ሞዴሉ የተማረው ከደካማ አማርኛ ነው። ስለዚህ ደካማ አማርኛ ይመልሳል። ችግሩ የመጠን ብቻ ሳይሆን የጥራት ጭምር ነው።

ታዲያ በተግባር ምን ማድረግ ትችላለህ?

አንደኛ፦ በእንግሊዝኛ ጠይቅ፣ በአማርኛ አስመልስ። ጥያቄውን በእንግሊዝኛ ጻፍና በመጨረሻ "Answer in Amharic" ጨምር። ሞዴሉ ማሰቢያውን በጠንካራው ቋንቋ ይሠራል፤ መልሱን ብቻ ይተረጉማል። እንግሊዝኛህ ፍጹም መሆን የለበትም።

ሁለተኛ፦ ምሳሌ ስጠው። ይህ በአማርኛ ላይ ከሁሉ የሚሠራው ዘዴ ነው። የምትፈልገውን ዓይነት አማርኛ አንድ አንቀጽ ለጥፍለትና "በዚህ ዘይቤ ቀጥል" በለው። ካንተ ከሰጠኸው ጥሩ አማርኛ ይኮርጃል።

ሦስተኛ፦ አጻጻፍህን ወጥ አድርግ። በአንድ ጽሑፍ ውስጥ "ሰላም"ና "ሠላም" አትቀላቅል። ወጥነት ውጤቱን ያሻሽላል።

አራተኛ፦ ረጅም የአማርኛ ሰነድ ከፋፍለህ ስጠው። በቶከን ቀረጥ ምክንያት ረጅም ሰነድ በአንድ ጊዜ ላይይዘው ይችላል።

አምስተኛ፦ ኦፊሴላዊ አማርኛን በሰው አስፈትሽ። ውል፣ የመንግሥት ደብዳቤ፣ የሕግ ሰነድ — AI ረቂቅ ይጻፍልህ፤ የመጨረሻውን ግን አማርኛ የሚችል ሰው ያንብበው። ትንሽ የሚመስል የቃል ስህተት በውል ውስጥ ትልቅ ችግር ይፈጥራል።

እየተሻሻለ ነው — እና በኢትዮጵያ ውስጥም እየተሠራ ነው

መልካሙ ዜና ችግሩ ቋሚ አለመሆኑ ነው። ሦስቱም መንስኤዎች — መረጃ፣ ቶከንና ጥራት — ሊሠሩባቸው የሚችሉ ናቸው። እየተሠራም ነው፦

  • ለአማርኛ የተዘጋጁ ቶከናይዘሮች። ተመራማሪዎች የግዕዝ ፊደላት የራሳቸው ቦታ እንዲኖራቸው ሲያደርጉ ውጤቱ አስደናቂ ነው — ከ13.8 ወደ 1.46 ቶከን በአንድ ቃል። በተመሳሳይ ሙከራ አንድ የትግርኛ ዓረፍተ ነገር ከ21 ቶከን ወደ 6 ቶከን ወርዷል
  • EthioNLP እና EthioLLM። ለአማርኛ፣ ለግዕዝ፣ ለአፋን ኦሮሞ፣ ለሶማሊኛና ለትግርኛ የተዘጋጁ ሞዴሎችና የመለኪያ መረጃዎች — በይፋ ክፍት ሆነው ወጥተዋል
  • የኢትዮጵያ አርቲፊሻል ኢንተለጀንስ ኢንስቲትዩት። አማርኛ፣ አፋን ኦሮሞ፣ ሶማሊኛና ትግርኛ የሚማርበትና ድምፅን ወደ ጽሑፍ የሚቀይር መተግበሪያ አውጥቷል
  • መደመር የአርቲፊሻል ኢንተለጀንስ ዩኒቨርሲቲ። በሚኒስትሮች ምክር ቤት በመጋቢት 2026 (እ.ኤ.አ.) ጸድቋል

ትልቁ ነጥብ

ይህ የምቾት ጉዳይ ብቻ አይደለም።

AI ሰዎች ዕውቀት የሚያገኙበት ዋና በር እየሆነ ከሄደ፣ በአማርኛ ደካማ መሆኑ ማለት 60 ሚሊዮን ሰው ሁለተኛ ደረጃ አገልግሎት ያገኛል ማለት ነው። ጠበቃው፣ አስተማሪው፣ ገበሬው፣ ተማሪው — ሁሉም እንግሊዝኛ በሚችሉት ልክ ብቻ ይጠቀማሉ።

መፍትሔው ግን በከፊል በእጃችን ነው። ሞዴሎቹ የሚማሩት ከምንጽፈው ነው። በአማርኛ የተጻፈ ጥሩ ጽሑፍ በኢንተርኔት ላይ በበዛ ቁጥር፣ የሚቀጥለው ትውልድ ሞዴል አማርኛን በተሻለ ያውቀዋል። በአማርኛ መጻፍ፣ የድሮ ሰነዶችን ዲጂታል ማድረግ፣ ትክክለኛ አጻጻፍ መጠቀም — እነዚህ ትንሽ የሚመስሉ ግን የሚቆጠሩ ተግባራት ናቸው።

ማጠቃለያ — ሦስት ዓረፍተ ነገር

  • AI በአማርኛ የሚደክመው ቋንቋችን ስለከበደ ብቻ ሳይሆን በኢንተርኔት ላይ የተጻፈ አማርኛ ስለጠፋ ነው
  • ዛሬ ልታደርገው የምትችለው፦ በእንግሊዝኛ ጠይቅ በአማርኛ አስመልስ፣ እና ጥሩ የአማርኛ ምሳሌ ስጠው
  • በአማርኛ መጻፍ ራሱ የወደፊቱን ሞዴል የማሠልጠን ሥራ ነው

በሚቀጥለው ክፍል

እስካሁን AI ምን እንደሆነ፣ እንዴት እንደሚሠራ፣ የት እንደሚሳሳትና ከቋንቋችን ጋር ያለውን ግንኙነት አየን።

አሁን ወደ ተግባር፦ በሥራህ ላይ በትክክል እንዴት ትጠቀመዋለህ? ለነጋዴ፣ ለአስተማሪ፣ ለጤና ባለሙያ፣ ለገበሬ፣ ለተማሪ — ተጨባጭ ምሳሌዎች። ክፍል 6 ላይ እናያለን።

ምንጮች፦ EthioNLP — “EthioLLM: Multilingual Large Language Models for Ethiopian Languages”፤ “Optimized Text Embedding Models and Benchmarks for Amharic Passage Retrieval” (2025)፤ “The Token Tax: Systematic Bias in Multilingual Tokenization”፤ Amharic LLaMA (2024)፤ የኢትዮጵያ አርቲፊሻል ኢንተለጀንስ ኢንስቲትዩት። ይህ ተከታታይ ጽሑፍ በቢና ዜና ይወጣል። ጥያቄ ካለህ በአስተያየት አካፍለን።

🏢 ህንፃ አለዎት?

BinaSmart — ሙሉ የህንፃ አስተዳደር ሲስተም በ24 ሰዓት።

ይጀምሩ →

ተጨማሪ ያንብቡ · Read more