Agent Architectures, Part 5: Evaluation — How Do You Know It Actually Works?
ኤጀንት መገንባት ስለሚቻልበት መንገድ ሁሉም ይጽፋል። በእውነት እየሠራ መሆኑን ስለማወቅ ግን ማንም አይጽፍም። ‹‹ሞከርኩት፣ ሠራ›› ፈተና አይደለም። ፕሮጀክቶች የሚሞቱበት ቦታ ይህ ነው።

የመርካቶው ሱቅ ባለቤት ኤጀንቱን ሠራው። ሦስት ጥያቄ ጠየቀው። ሦስቱንም በትክክል መለሰ። ‹‹በቃ፣ ሠርቷል›› ብሎ ለደንበኞቹ ከፈተው። ☕
ከሁለት ሳምንት በኋላ አንድ ደንበኛ ደወለ። ‹‹ኤጀንቱ የሲሚንቶ ዋጋ 900 ብር ነው አለኝ። መጣሁ፤ 1,400 ሆነ።››
ምን ተፈጠረ? ኤጀንቱ አልተበላሸም። ከመጀመሪያውም አልተፈተነም።
ሦስት ጥያቄ ፈተና አይደለም
ይህን በግልጽ እናስቀምጠው፤ ምክንያቱም አብዛኛው ሰው እዚህ ላይ ይሳሳታል።
ኤጀንት ሠርተህ ጥቂት ጥያቄ ጠይቀህ ትክክል ሲመልስ — ያ ስሜት ጥሩ ነው። ግን ያረጋገጥከው ነገር ይህ ብቻ ነው፦ በዚያ ቅጽበት ላሰብካቸው ሦስት ጥያቄዎች ሠርቷል።
እና ችግሩ እዚህ ነው። አንተ የምትጠይቀው ኤጀንቱ ሊመልሳቸው የሚችሉ ጥያቄዎችን ነው። ደንበኛ ግን ያንተን ንድፍ አያውቅም። የሚጠይቀው የሚያስፈልገውን ነው።
ስለዚህ የመጀመሪያው ሕግ ይህ ነው፦ ራስህ የሠራኸውን ራስህ መፈተን አትችልም። ስለ አራተኛው ክስተት ስንጽፍ ያየነው ያው ነው — AIን የፈተሸው AI ስለነበር አንድ ስብስብ ዘሎ አለፈ።
የፈተና ስብስብ መገንባት
መፍትሔው ቀላል ነው፤ ግን ሥራ ይጠይቃል። የተመዘገበ የፈተና ስብስብ ያስፈልግሃል።
ማለት አንድ ፋይል — ጥያቄዎችና የሚጠበቁ መልሶች። ኤጀንቱን በምትቀይርበት ጊዜ ሁሉ ያንን ፋይል ታስኬደዋለህ።
ጥያቄዎቹ ከየት ይመጣሉ? ከደንበኞችህ። ራስህ አታስባቸው። የቴሌግራም ቻናልህን ወይም የዋትስአፕ መልእክቶችህን ተመልከት — ሰዎች በእውነት የጠየቁትን ውሰድ። ያ በጣም ይሻላል፤ ምክንያቱም እውነተኛ ቋንቋ ነው።
ስንት ይበቃል? ሃምሳ ገደማ። ብዙ ሰው ‹‹ትንሽ ነው›› ይላል፤ ግን ሃምሳ በእውነት የተመረጠ ጥያቄ ከአምስት መቶ በዘፈቀደ ከተሰበሰበ ይሻላል። እና ሃምሳ በአንድ ከሰዓት በኋላ ይሰበሰባል።
የትኞቹ ጥያቄዎች መግባት አለባቸው
እዚህ ጋ ትኩረት ስጥ። ስብስቡ ቀላል ጥያቄዎችን ብቻ ከያዘ ምንም አያረጋግጥም።
ተራ ጥያቄዎች። በየቀኑ የሚመጡት። ‹‹የሲሚንቶ ዋጋ ስንት ነው?›› እነዚህ ሁልጊዜ መሥራት አለባቸው።
የተወሳሰቡ ጥያቄዎች። ሁለትና ሦስት ነገር በአንድ ውስጥ የያዙ። በክፍል 2 እንዳየነው እነዚህ ናቸው ተራ ፍለጋን የሚያወድቁት።
ኤጀንቱ ማወቅ የሌለበት ጥያቄዎች። ይህ ወሳኝ ነው። ‹‹ነገ የዶላር ምንዛሪ ስንት ይሆናል?›› — ትክክለኛው መልስ ‹‹አላውቅም›› ነው። ኤጀንትህ በዚህ ላይ ቁጥር ቢሰጥ ወድቋል።
የተሳሳተ ግምት የያዙ ጥያቄዎች። ‹‹ባለፈው ሳምንት የላክሽልኝን ሲሚንቶ መቼ ነው የምትተካልኝ?›› — ምንም ካልተላከ ኤጀንቱ ግምቱን ማረም አለበት እንጂ መቀጠል የለበትም።
ሁለት ቋንቋ የተቀላቀለባቸው። በኢትዮጵያ ሰዎች እንዲህ ነው የሚጽፉት — ‹‹ዋጋው ስንት new stock መጣ?›› ስብስብህ ንጹሕ አማርኛ ብቻ ከያዘ እውነተኛውን ሁኔታ አልፈተንክም።
ምን ትለካለህ?
‹‹ትክክል ወይስ ስሕተት›› ብቻ በቂ አይደለም። አራት ነገር ተመልከት።
ትክክለኛነት። መልሱ እውነት ነው?
ምንጭ። መልሱ ከየት መጣ? ኤጀንቱ የተሳሳተ ሰነድ አውጥቶ ትክክለኛ መልስ ቢሰጥ — ያ ዕድል ነው እንጂ ሥርዓት አይደለም። ቀጣዩ ጊዜ ይወድቃል።
‹‹አላውቅም›› ማለት መቻል። ከሃምሳው ጥያቄ ጥቂቶቹ መልስ የሌላቸው መሆን አለባቸው። ኤጀንትህ በሁሉም ላይ መልስ ከሰጠ — ያ ጥሩ ምልክት ሳይሆን መጥፎ ምልክት ነው።
ወጪና ፍጥነት። አንድ መልስ ስንት ቶከን በላ? ስንት ሰከንድ ወሰደ? በአማርኛ ይህ በተለይ ይቆጠራል።
መቼ ታስኬደዋለህ
ይህ ክፍል ነው ብዙ ጊዜ የሚዘነጋው።
ስብስቡን አንዴ አስኪደህ ‹‹ሠራ›› ማለት በቂ አይደለም። በየለውጡ ማስኬድ አለብህ — መመሪያውን ስትቀይር፣ አዲስ ሰነድ ስትጨምር፣ አዲስ መሣሪያ ስታገናኝ።
እና ከሁሉ የሚያስፈልገው ጊዜ ይህ ነው፦ ሞዴሉ ሲቀየር።
ኩባንያዎቹ ሞዴል ሲያሻሽሉ ‹‹የተሻለ ሆኗል›› ይላሉ። በአጠቃላይ እውነት ሊሆን ይችላል። ግን ላንተ ሥራ የተሻለ መሆኑን የሚነግርህ ማንም የለም። አዲሱ ሞዴል በሌላ ነገር ተሽሎ ባንተ ጉዳይ ላይ ሊወድቅ ይችላል።
የፈተና ስብስብ ከሌለህ — ያንን አታውቀውም። ደንበኛ እስኪደውል ድረስ።
ማን ይፈትሸዋል?
ሃምሳ ጥያቄ በእጅ መገምገም ሥራ ነው። ስለዚህ ብዙ ሰው AIን ይጠቀማል — አንድ ሞዴል የሌላውን መልስ እንዲገመግም።
ያ ይሠራል፤ ግን ገደብ አለው። በክፍል 4 እንዳልነው ገምጋሚው ተመሳሳይ ዓይነት ሞዴል ከሆነ ተመሳሳይ ስሕተት ያመልጠዋል።
ተግባራዊ መፍትሔ፦ AI ሁሉንም ይገምግም፤ አንተ ግን በየሳምንቱ አሥር ናሙና በዓይንህ እይ። ብዙ ጊዜ አይወስድም፤ እና AI የሚያመልጠውን ትይዛለህ።
ለኢትዮጵያ ገንቢዎች
ሁለት ነገር ልጨምር።
የመጀመሪያው — የፈተና ስብስብህ በአማርኛ መሆን አለበት። በእንግሊዝኛ ፈትነህ በአማርኛ ማሠማራት የተለመደ ስሕተት ነው። ሞዴሎች በአማርኛ የተለየ ባህሪ አላቸው። በክፍል 5 እንዳየነው — ስም መለየት፣ ቁጥር ማንበብ፣ ቀን መረዳት ሁሉም በአማርኛ ይለያያሉ።
ሁለተኛው — የገንዘብ ጉዳዮችን ለብቻ ፈትን። ዋጋ፣ ክፍያ፣ ተመላሽ። እነዚህ ላይ ስሕተት ሲፈጠር ደንበኛ ያጣሃል። አምስተኛው ንድፍ — በአረጋጋጭ የተጠበቀ — እዚህ ላይ ግዴታ ነው።
የሚቀረው ሐሳብ
ኤጀንት መገንባት አሁን ቀላል ሆኗል። በጥቂት ቀን ማድረግ ትችላለህ።
በእውነት እየሠራ መሆኑን ማወቅ ግን ቀላል አልሆነም። እና ልዩነቱ በዚያ ላይ ነው።
ብዙ ፕሮጀክቶች የሚሞቱት በመጥፎ ኮድ አይደለም። የሚሞቱት ማንም ሳያውቀው ስለሚበላሹ ነው — እና ሲታወቅ ደግሞ ደንበኛው ቀድሞ ሄዷል።
ሃምሳ ጥያቄ። አንድ ፋይል። በየለውጡ አስኪደው። ያ ነው ልዩነቱ። 🙂
➡️ በሚቀጥለው ክፍል
ክፍል 6 (የመጨረሻው)፦ ማስኬድና ወጪ። ኤጀንት መገንባት ግማሽ ሥራ ነው። 24 ሰዓት ማስኬድ ሌላው ግማሽ ነው። በወር ስንት ያስወጣል? ምን ይበላሻል? እና በኢትዮጵያ ሁኔታ — መብራት ሲጠፋ ምን ይሆናል?
In brief (English): Part 5 of a six-part Amharic series on agent architectures, covering the stage most writing on agents skips entirely: how you know the thing actually works. Testing an agent with a few questions proves only that it handled the questions you happened to think of — and you naturally ask questions it can answer, while customers ask what they need. The remedy is a recorded evaluation set: a file of questions with expected answers, re-run on every change. Source the questions from real customer messages rather than inventing them, and around fifty well-chosen cases beats five hundred collected at random. The set must include ordinary questions, compound questions that break simple retrieval, questions the agent should not be able to answer — where the correct response is "I don't know" — questions containing false premises the agent must correct rather than accept, and mixed Amharic-English phrasing, since that is how Ethiopians actually write. Measure four things: factual accuracy; which source the answer came from, because a right answer from the wrong document is luck rather than a system; whether the agent can decline; and cost and latency per answer, which matters especially in Amharic. Run the set on every change — and above all when the underlying model is upgraded, since a model that improves generally may regress on your specific task and nothing will tell you except a customer. On grading, LLM-as-judge works but shares blind spots with the model being judged, so the practical approach is automated grading plus a weekly manual review of about ten samples. Two Ethiopia-specific notes: the evaluation set must be in Amharic, since model behaviour differs by language, and money-related cases — prices, payments, refunds — should be tested separately and gated by an independent verifier.
ይህ ጽሑፍ የትምህርት ዓላማ ያለው ነው። የግምገማ አሠራር በ AI ምህንድስና ማኅበረሰብ ውስጥ የተመሠረተ ልምድ ነው።
🏢 ህንፃ አለዎት?
BinaSmart — ሙሉ የህንፃ አስተዳደር ሲስተም በ24 ሰዓት።


