ខណៈដែលអ្នកប្រតិបត្តិ AI ផ្លាស់ពីគំរូសាកល្បងទៅជាការដាក់ពិតនៅពិភពលោក ការស្គាល់អំពីអាកប្បកិរិយារបស់ពួកគេ ការត្រួតពិនិត្យសមត្ថភាពរបស់ពួកគេ និងការវាយតម្លៃតាមប្រព័ន្ធលំដាប់លំដោយលទ្ធផលរបស់ពួកគេក្លាយជារឿងសំខាន់។
បន្ទាប់ពីបានបញ្ចប់មេរៀននេះ អ្នកនឹងដឹង/យល់ដឹងពី៖
គោលបំណងគឺផ្គូផ្គងអ្នកជាមួយចំណេះដឹងដើម្បីបម្លែងអ្នកប្រតិបត្តិ “ប្រអប់ខ្មៅ” របស់អ្នកទៅជាប្រព័ន្ធត្រចៀកបាន គ្រប់គ្រងបាន និងទុកចិត្តបាន។
សម្គាល់៖ ការដាក់ប្រើអ្នកប្រតិបត្តិ AI ដែលសុវត្ថិភាព និងគួរឱ្យទុកចិត្តមានសារៈសំខាន់។ សូមមើលមេរៀន ការបង្កើតអ្នកប្រតិបត្តិ AI គួរឱ្យទុកចិត្ត ផងដែរ។
ឧបករណ៍ observability ដូចជា Langfuse ឬ Microsoft Foundry ធម្មតាបង្ហាញការប្រតិបត្តិនៃអ្នកប្រតិបត្តិជាគន្លង និងជាបន្ទាត់។
បើគ្មានការយល់ដឹង អ្នកប្រតិបត្តិ AI អាចមានអារម្មណ៍ដូចជា “ប្រអប់ខ្មៅ” - ស្ថានភាពខាងក្នុង និងការពិចារណារបស់វាភ្លឺគួរយល់ព្រម ពិបាកក្នុងការរកមូលហេតុបញ្ហា ឬបង្កើតសមត្ថភាពល្អប្រសើរ។ ជាមួយការយល់ដឹង អ្នកប្រតិបត្តិក្លាយជាថ្នាំប្លាស្ទិច ដែលផ្តល់ភាពច្បាស់លាស់ដែលសំខាន់សម្រាប់ការបង្កើតទុកចិត្ត និងធានាថាវាដំណើរការតាមដែលគោរព។
ការផ្លាស់ប្តូរអ្នកប្រតិបត្តិ AI ទៅបរិយាកាសផលិត ត្រូវបានណែនាំអោយមានបញ្ហា និងតម្រូវការថ្មីៗ។ មិនមែនជា “អ្វីដែលល្អក្នុងការមាន” ទេ ប៉ុន្តែជាអនុភាពសំខាន់៖
ដើម្បីត្រួតពិនិត្យ និងយល់ដឹងអំពីអាកប្បកិរិយាអ្នកប្រតិបត្តិ មានមាត្រដ្ឋាន និងសញ្ញាផ្សេងៗគួរត្រូវតាមដាន។ ខណៈដែលមាត្រដ្ឋានច្បាស់លាស់ អាចខុសប្លែកទៅតាមគោលបំណងអ្នកប្រតិបត្តិ ប្រភេទមួយចំនួនគឺមានសារៈសំខាន់ជាសកល។
គឺខាងក្រោមគឺជាមាត្រដ្ឋានធម្មតាដែលឧបករណ៍ observability តាមដាន៖
ល្បឿនចម្លើយ៖ តើយ៉ាងលឿនប៉ុន្មានដែលអ្នកប្រតិបត្តិឆ្លើយតប? ពេលរងចាំយូរអាចប៉ះពាល់អវិជ្ជមានដល់បទពិសោធន៍អ្នកប្រើ។ អ្នកគួរវាស់ល្បឿនចម្លើយសម្រាប់កិច្ចការនិងជំហាននិមួយៗដោយតាមដានការប្រតិបត្តិអ្នកប្រតិបត្តិ។ ឧទាហរណ៍ អ្នកប្រតិបត្តិដែលចំណាយ ២០ វិនាទីសម្រាប់ហៅម៉ូឌែលទាំងអស់ អាចបន្ថែមល្បឿនដោយប្រើម៉ូឌែលលឿនជាង ឬហៅម៉ូឌែលជាជួរពីរដំណើរការ។
ថ្លៃដើម៖ តើការចំណាយប៉ុន្មានក្នុងមួយការប្រតិបត្តិ? អ្នកប្រតិបត្តិ AI ពឹងផ្អែកលើការហៅ LLM ដែលត្រូវបង់ថ្លៃតាមប្រូគ្រីមឬការហៅ API ខាងក្រៅ។ ការប្រើឧបករណ៍ជាញឹកញាប់ ឬការសុំពាក្យជាច្រើនអាចបន្ថែមការចំណាយយ៉ាងរហ័ស។ ឧទាហរណ៍ ប្រសិនបើអ្នកប្រតិបត្តិហៅ LLM ប្រាំដងសម្រាប់កែលម្អគុណភាពតិចតួច អ្នកគួរត្រូវពិនិត្យថាតម្លៃនោះសមរម្យទេ ឬអ្នកអាចកាត់បន្ថយការហៅ ឬប្រើម៉ូឌែលថោកជាង។ ការត្រួតពិនិត្យពេលពិតក៏ជួយរកឃើញការកើនឡើងមិនគួរឱ្យរំពឹង (ឧ. កំហុសបង្កឱ្យ API ឆ្វែរក្នុងច្រើន)។
កំហុសសំណើរ៖ តើអ្នកប្រតិបត្តិបរាជ័យប៉ុន្មានសំណើ? វាអាចរួមបញ្ចូលកំហុស API ឬការហៅឧបករណ៍បរាជ័យ។ ដើម្បីធ្វើឱ្យអ្នកប្រតិបត្តិកាន់តែរឹងមាំក្នុងការផលិត អ្នកអាចរៀបចំ fallback ឬ retry។ ឧ. ប្រសិនបើអ្នកផ្គត់ផ្គង់ LLM A ធ្លាក់ចុះ អ្នកប្ដូរទៅផ្គត់ផ្គង់ LLM B ជាជំនួយ។
មតិយោបល់អ្នកប្រើ៖ ការប្រតិបត្តិវាយតម្លៃដោយផ្ទាល់ពីអ្នកប្រើផ្តល់នូវគំនិតមានតម្លៃ។ វាអាចរួមបញ្ចូលការវាយតម្លៃច្បាស់លាស់ (👍ចុះសោ / 👎ឡើងក្រោម, ⭐1-5 ផ្កាយ) ឬមតិយោបល់អត្ថបទ។ មតិយោបល់អវិជ្ជាជ័យជាប្រចាំគួរត្រូវជំរុញអ្នកដោយសញ្ញាថា អ្នកប្រតិបត្តិកំពុងមិនដំណើរការតាមរង់ចាំ។
មតិយោបល់អ្នកប្រើដោយពុំច្បាស់លាស់៖ អាកប្បកិរិយាអ្នកប្រើផ្តល់មតិយោបល់ឥតផ្ទាល់ ប្រសិនបើគ្មានអ្វីច្បាស់លាស់។ វាអាចរួមបញ្ចូលការស្វែងរកសំណួរឡើងវិញភ្លាមៗ សំណួរដដែល ឬចុចប៊ូតុង retry។ ឧ. ប្រសិនបើអ្នកឃើញថាអ្នកប្រើស្នាក់សំណួរដដែលជាបន្តបន្ទាប់ នេះជាសញ្ញាថា អ្នកប្រតិបត្តិកំពុងមិនដំណើរការតាមរង់ចាំ។
ភាពត្រឹមត្រូវ: តើអ្នកប្រតិបត្តិបញ្ចេញលទ្ធផលត្រឹមត្រូវ ឬដែលគេចង់បាននៅប៉ុន្មានដង? និងនិយមន័យភាពត្រឹមត្រូវខុសគ្នា (ឧ. ការដោះស្រាយបញ្ហាត្រឹមត្រូវ ការយកព័ត៌មានបានត្រឹមត្រូវ ការពេញចិត្តអ្នកប្រើ) ជំហានដំបូងគឺកំណត់ថា តើជោគជ័យមានរូបរាងយ៉ាងដូចម្តេចសម្រាប់អ្នកប្រតិបត្តិ។ អ្នកអាចតាមដានភាពត្រឹមត្រូវតាមការត្រួតពិនិត្យស្វ័យប្រវត្តិ លំហាត់វាយតម្លៃ ឬស្លាកបញ្ចប់កិច្ចការ។ ឧ. សម្គាល់ខ្សែថា “ជោគជ័យ” ឬ “បរាជ័យ”។
មាត្រដ្ឋានវាយតម្លៃស្វ័យប្រវត្តិ: អ្នកអាចកំណត់ evals ស្វ័យប្រវត្តិផងដែរ។ ឧ. អ្នកអាចប្រើ LLM ដើម្បីពិន្ទុលទ្ធផលរបស់អ្នកប្រតិបត្តិ ឧ. តើវាជំនួយឬត្រឹមត្រូវ ឬមិនត្រឹមត្រូវ។ មានបណ្ណាល័យប្រភពបើកខ្លះៗជួយអ្នកពិន្ទុខណៈសមត្ថភាពខុសៗគ្នារបស់អ្នកប្រតិបត្តិ។ ឧ. RAGAS សម្រាប់អ្នកប្រតិបត្តិ RAG ឬ LLM Guard សម្រាប់ចាប់អត្ថបទគ្រោះថ្នាក់ ឬបញ្ចូល prompt injection។
ក្នុងការអនុវត្ត ជំនាញរួមរវាងមាត្រដ្ឋានទាំងនេះផ្តល់ការគ្របដណ្តប់ល្អបំផុតសម្រាប់សុខភាពអ្នកប្រតិបត្តិ AI។ នៅវគ្គនេះ កំណត់ត្រាឧទាហរណ៍ យើងនឹងបង្ហាញអ្នកពីរូបរាងមាត្រដ្ឋានទាំងនេះក្នុងឧទាហរណ៍ពិត ប៉ុន្តែមុនដំបូង យើងនឹងរៀនពីរបៀបផ្ទាល់វាយតម្លៃទូទៅមើលទៅយ៉ាងដូចម្តេច។
ដើម្បីប្រមូលទិន្នន័យតាមដាន អ្នកត្រូវតែវាស់ម៉ាស៊ីនកូដរបស់អ្នក។ គោលបំណងគឺវាស់ម៉ាស៊ីនកូដអ្នកប្រតិបត្តិដើម្បីបញ្ចេញខ្សែ និងមាត្រដ្ឋាន ដែលអាចចាប់បាន ដំណើរការបាន និងបង្ហាញដោយវេទិកាការយល់ដឹង។
OpenTelemetry (OTel): OpenTelemetry បានក្លាយជាគំរូឧស្សាហកម្មសម្រាប់ការយល់ដឹង LLM។ វាប្រគល់ API, SDK, និងឧបករណ៍សម្រាប់បង្កើត ប្រមូល និងនាំចេញទិន្នន័យ telemetry។
មានបណ្ណាល័យវាស់ម៉ាស៊ីនជាច្រើន ដែលបានបិទបាំង Framework អ្នកប្រតិបត្តិដែលមាន និងធ្វើឱ្យងាយស្រួលនាំចេញ OpenTelemetry spans ទៅឧបករណ៍ observability មួយ។ Microsoft Agent Framework បានបញ្ចូលជាមួយ OpenTelemetry ដោយផ្ទាល់។ ក្រោមនេះគឺជាឧទាហរណ៍នៃការវាស់ម៉ាស៊ីនអ្នកប្រតិបត្តិ MAF៖
from agent_framework.observability import get_tracer, get_meter
tracer = get_tracer()
meter = get_meter()
with tracer.start_as_current_span("agent_run"):
# ការប្រតិបត្តិរបស់ភ្នាក់ងារត្រូវបានរាតត្បាតដោយស្វ័យប្រវត្តិ
pass
កំណត់ត្រាឧទាហរណ៍ example notebook ក្នុងជំពូកនេះនឹងបង្ហាញពីរបៀបវាស់ម៉ាស៊ីនអ្នកប្រតិបត្តិ MAF របស់អ្នក។
ការបង្កើត Span ដែរដោយដៃ៖ ខណៈដែលបណ្ណាល័យវាស់ម៉ាស៊ីនផ្តល់មូលដ្ឋានល្អ អាចមានករណីដែលត្រូវការព័ត៌មានលម្អិត ឬផ្ទាល់ខ្លួនបន្ថែម។ អ្នកអាចបង្កើត span ដើម្បីបន្ថែមលូហ្គិចកម្មវិធីផ្ទាល់ខ្លួន។ ជាពិសេសវាអាចបរិច្ឆេទសំគាល់ span ដែលបង្កើតដោយស្វ័យប្រវត្តិ ឬដែរដោយដៃជាមួយលក្ខណៈពិសេសផ្ទាល់ខ្លួន (ហៅថា tags រឺ metadata)។ លក្ខណៈពិសេសទាំងនេះអាចរួមបញ្ចូលទិន្នន័យពាណិជ្ជកម្ម ការគណនាសម្របសម្រួល ឬបរិបទណាមួយដែលមានប្រយោជន៍សម្រាប់កែសម្រួល ឬវិភាគ ដូចជា user_id, session_id, ឬ model_version។
ឧទាហរណ៍ការបង្កើត traces និង spans ដែរដោយដៃជាមួយ Langfuse Python SDK:
from langfuse import get_client
langfuse = get_client()
span = langfuse.start_span(name="my-span")
span.end()
ការយល់ដឹងផ្តល់ឱ្យយើងមាត្រដ្ឋាន ប៉ុន្តែការវាយតម្លៃគឺជាដំណើរវិភាគទិន្នន័យនោះ (និងអនុវត្តន៍តេស្ដ) ដើម្បីកំណត់ថាអ្នកប្រតិបត្តិ AI ដំណើរការបានល្អប៉ុណ្ណា និងធ្វើដូចម្តេចបានប្រសើរឡើង។ ឆ្លៀតថា ប្រសិនបើអ្នកមានខ្សែ និងមាត្រដ្ឋាន នឹងប្រើវាដើម្បីវាយតម្លៃអ្នកប្រតិបត្តិនិងធ្វើសេចក្តីសម្រេចយ៉ាងដូចម្តេច?
ការវាយតម្លៃជាប្រចាំមានសារៈសំខាន់ ព្រោះអ្នកប្រតិបត្តិ AI ជាភាគច្រើនមិនមានលទ្ធផលថ្កោលថ្កាន និងអាចអភិវឌ្ឍ (តាមការ update ឬការប្រែប្រួលលក្ខណៈម៉ូដែល)– ប្រសិនបើគ្មានការវាយតម្លៃ អ្នកនឹងមិនដឹងថា “អ្នកប្រតិបត្តិឆ្លាតវៃ” របស់អ្នកកំពុងធ្វើការល្អ ឬត្រូវបានកាត់បន្ថយ។
មានការវាយតម្លៃពីរប្រភេទសម្រាប់អ្នកប្រតិបត្តិ AI៖ វាយតម្លៃតាមបណ្ដាញ (online evaluation) និង វាយតម្លៃក្រៅបណ្ដាញ (offline evaluation)។ ទាំងពីរមានតម្លៃ និងគ្នាផ្គូផ្គង។ យើងភាគច្រើនចាប់ផ្តើមជាមួយវាយតម្លៃក្រៅបណ្ដាញ មុនពេលដាក់អ្នកប្រតិបត្តិអ្វីមួយចូលប្រើប្រាស់។

វាគឺជាការវាយតម្លៃអ្នកប្រតិបត្តិក្នុងបរិយាកាសគ្រប់គ្រង បានធម្មតារបៀបប្រើឯកសារពិសោធន៍ មិនមែនសំណួរអ្នកប្រើបន្តផ្ទាល់ឡើយ។ អ្នកប្រើឯកសារតំនើបដែលអ្នកដឹងលទ្ធផលឬអាកប្បកិរិយាត្រឹមត្រូវ ហើយបន្ទាប់មកដំណើរការអ្នកប្រតិបត្តិហៅលើឯកសារនោះ។
ឧទាហរណ៍ ប្រសិនបើអ្នកកសាងអ្នកប្រតិបត្តិដោះស្រាយបញ្ហាគណិតវិទ្យាពាក្យ អ្នកអាចមាន ឯកសារតេស្ត មាន ១០០បញ្ហាជាមួយចម្លើយបានស្គាល់។ វាយតម្លៃក្រៅបណ្ដាញធម្មតាជាការងារធ្វើនៅពេលអភិវឌ្ឍន៍ (និងអាចនៅក្នុង CI/CD pipeline) ដើម្បីពិនិត្យការកែលម្អ ឬការការពារបញ្ហា។ អត្ថប្រយោជន៍គឺវា អាចធ្វើរៀងរាល់ពេល និងអ្នកអាចទទួលបានមាត្រដ្ឋានភាពត្រឹមត្រូវច្បាស់លាស់ ព្រោះអ្នកមានភាពជាការពិតផែនដី។ អ្នកអាចចម្លងសំណួរអ្នកប្រើ និងវាស់ការឆ្លើយតបអ្នកប្រតិបត្តិប្រឆាំងនឹងចម្លើយល្អឥតខ្ចោះ ឬប្រើមាត្រដ្ឋានស្វ័យប្រវត្តិតាមការពិពណ៌នាខាងលើ។
បញ្ហាសំខាន់នៃការវាយតម្លៃក្រៅបណ្ដាញគឺការធានាថាឯកសារតេស្តរបស់អ្នកគ្របដណ្តប់គ្រប់គ្រាន់ និងនៅសមស្រប – អ្នកប្រតិបត្តិអាចដំណើរការល្អលើឯកសារតេស្តថេរ យ៉ាងណាក៏ដោយអាចជួបសំណួរបែបខុសគ្នាច្រើននៅក្នុងផលិតកម្ម។ ដូច្នេះ អ្នកគួរតែអាប់ដេតឯកសារតេស្តជាមួយករណីគ្រាប់កាត់ឬឧទាហរណ៍ថ្មីៗដែលបង្ហាញពីបរិបទពិភពលោកពិត។ ការលម្អិតការមិនប្រាកដប្រជា “smoke test” តូច និងវាយតម្លៃធំជារួមគួរត្រូវបានប្រើ៖ ករណីតូចសម្រាប់ពិនិត្យឆាប់រហ័ស និងករណីធំសម្រាប់មាត្រដ្ឋានបច្ចុប្បន្នទូទៅ។

នេះបង្ហាញពីការវាយតម្លៃអ្នកប្រតិបត្តិក្នុងបរិយាកាសពិតម៉ាស៊ីន ដូចជា ក្នុងការប្រើប្រាស់ពិតជាពេលដំណើរការ។ វាយតម្លៃតាមបណ្ដាញបង្កការត្រួតពិនិត្យសមត្ថភាពអ្នកប្រតិបត្តិលើប្រតិបត្តិការអ្នកប្រើពិត និងវិភាគលទ្ធផលក្នុងរយៈពេលបន្តបន្ទាប់។
ឧទាហរណ៍ អ្នកអាចតាមដានអត្រាជោគជ័យ លទ្ធផលពេញចិត្តអ្នកប្រើ ឬមាត្រដ្ឋានផ្សេងទៀតលើចរាចរណ៍ផ្ទាល់។ គុណសម្បត្តិនៃវាយតម្លៃតាមបណ្ដាញគឺវា ចាប់យកអ្វីដែលអ្នកមិនអាចរំពឹងទុកក្នុងបរិយាកាសប្រព័ន្ធសាកល្បង – អ្នកអាចមើលឃើញការប្រែប្រួលម៉ូដែលរយៈពេលវែង (ប្រសិនបើប្រសិទ្ធភាពអ្នកប្រតិបត្តិកាត់បន្ថយដោយសារតែទ្រង់ទ្រាយបញ្ចូលផ្លាស់ប្ដូរ) និងចាប់យកសំណួរឬស្ថានការណ៍មិនរំពឹងទុកដែលមិនមានក្នុងទិន្នន័យតេស្ត។ វាបង្ហាញរូបភាពពិតប្រាកដថាតើអ្នកប្រតិបត្តិដំណើរការយ៉ាងដូចម្តេចនៅវាលពិត។
វាយតម្លៃតាមបណ្ដាញជាញឹកញាប់ទាក់ទាញមតិយោបល់អ្នកប្រើពុំច្បាស់លាស់ និងច្បាស់លាស់ ដូចបានសន្ទនា និងប្រហែលទៅវាយតម្លៃវាយតម្លៃស្រមោល ឬ A/B (ដែលជាការរត់អ្នកប្រតិបត្តិជាលក្ខណៈថ្មីៗជាជុំទាំងជាមួយជាមួយ)។ បញ្ហាគឺថាវាអាចពិបាកក្នុងការទទួលស្លាកឲ្យទាន់ពេលសម្រាប់ប្រតិបត្តិការផ្ទាល់ – អ្នកប្រហែលជាអះអាងលើមតិយោបល់អ្នកប្រើ ឬមាត្រដ្ឋានក្រោយ (ដូចជា តើអ្នកប្រើបានចុចលទ្ធផលឬអត់)។
ការវាយតម្លៃតាមបណ្ដាញ និងក្រៅបណ្ដាញមិនផ្ទុយគ្នាទេ; វាផ្តល់ជំនួយគ្នាយ៉ាងខ្លាំង។ អត្ថន័យពីការត្រួតពិនិត្យតាមបណ្ដាញ (ឧ. ប្រភេទសំណួរប្រុសៗមួយដែលអ្នកប្រតិបត្តិធ្វើបានអន់) អាចប្រើសម្រាប់បន្ថែម និងកែលម្អឯកសារតេស្តក្រៅបណ្ដាញ។ ផ្ទុយទៅវិញ អ្នកប្រតិបត្តិដែលបង្ហាញលទ្ធផលល្អក្នុងតេស្តក្រៅបណ្ដាញអាចដាក់ចូលប្រើប្រាស់ និងត្រួតពិនិត្យតាមបណ្ដាញបានយ៉ាងទុកចិត្ត។
ជាក់ស្តែង ក្រុមជាច្រើនយករង្វិល៖
វាយតម្លៃក្រៅបណ្ដាញ -> ដាក់ចូលប្រើ -> ត្រួតពិនិត្យតាមបណ្ដាញ -> ប្រមូលករណីបរាជ័យថ្មី -> បន្ថែមទៅឯកសារតេស្តក្រៅបណ្ដាញ -> ពង្រឹងអ្នកប្រតិបត្តិ -> ស្គាល់ថែមទៀត។
នៅពេលអ្នកដាក់អាជីវកម្មអ្នកប្រតិបត្តិ AI ទៅផលិត អ្នកអាចជួបប្រទះបញ្ហាប្រភេទផ្សេងៗ។ ខាងក្រោមជាបញ្ហាទូទៅ និងដំណោះស្រាយអាចមាន៖
| បញ្ហា | ដំណោះស្រាយអាចធ្វើ |
|---|---|
| អ្នកប្រតិបត្តិ AI មិនអាចធ្វើបានការងារយ៉ាងរឹងមាំ | - កែលម្អការបញ្ជាប់ដែលផ្តល់ទៅអ្នកប្រតិបត្តិ AI; ត្រូវច្បាស់លាស់អំពីគោលបំណង។ - កំណត់ទីតាំងត្រូវបំបែកកិច្ចការ ទៅកិច្ចការតូចៗ ហើយរៀបចំជាក្រុមអ្នកប្រតិបត្តិ។ |
| អ្នកប្រតិបត្តិ AI ឆ្លងកាត់វដ្តបន្តបន្ទាប់ | - វាយតម្លៃលក្ខខណ្ឌបញ្ចប់ ឲ្យអ្នកប្រតិបត្តិដឹងពេលឈប់ដំណើរការ។ - សម្រាប់កិច្ចការស្មុគស្មាញដែលទាមទារ ការគិតវិធីសាស្រ្ត និងរៀបចំផែនការ ប្រើម៉ូឌែលធំដែលមានជំនាញចំពោះការគិតវិធីសាស្រ្ត។ |
| តែមុខងារឧបករណ៍ AI មិនប្រសើរបានល្អ | - ពិនិត្យ និងផ្ទៀងផ្ទាត់លទ្ធផលឧបករណ៍ក្រៅប្រព័ន្ធអ្នកប្រតិបត្តិ។ - កែលម្អប៉ារ៉ាម៉ែត្រត្រូវបានកំណត់ សំណួរ និងឈ្មោះឧបករណ៍។ |
| ប្រព័ន្ធអ្នកប្រតិបត្តិច្រើនមិនមានសុវត្ថិភាព និងច្បាស់លាស់ | - កែលម្អសំណួរដែលផ្តល់ទៅអ្នកប្រតិបត្តិរាល់រូប ដើម្បីធានាតម្រូវខុសគ្នា និងច្បាស់លាស់ពីគ្នា។ - បង្កើតប្រព័ន្ធជាន់ខ្ពស់ប្រើ “routing” ឬអ្នកគ្រប់គ្រងដើម្បីកំណត់អ្នកប្រតិបត្តិត្រឹមត្រូវ។ |
បញ្ហាច្រើនទាំងនេះអាចបញ្ជាក់បានល្អជាងនេះប្រសិនបើមានអន្តរកម្ម observability។ ខ្សែ និងមាត្រដ្ឋានដែលយើងបានពិភាក្សាមុននេះជួយកំណត់ចំណុចពិសេសក្នុងដំណើរការអ្នកប្រតិបត្តិ ធ្វើឲ្យការកែសម្រួល និងកំណត់គោលដៅកាន់តែមានប្រសិទ្ធភាព។
នៅទីនេះមានយុទ្ធសាស្រ្តខ្លះៗក្នុងការគ្រប់គ្រងចំណាយនៃការបញ្ចូនភ្នាក់ងារតំបន់ AI ទៅក្នុងការផលិត:
ការប្រើម៉ូដែលតូច: ម៉ូដែលភាសាតូចៗ (SLMs) អាចអនុវត្តបានល្អនៅលើករណីប្រើប្រាស់ភ្នាក់ងារមួយចំនួន ហើយនឹងកាត់បន្ថយចំណាយយ៉ាងច្រើន។ ដូចដែលបានបញ្ជាក់មុននេះ សំណុំរចនាសម្ព័ន្ធប្រព័ន្ធវាយតម្លៃដើម្បីកំណត់ និងប្រៀបធៀបប្រសិទ្ធភាពប្រៀបធៀបនឹងម៉ូដែលធំជាផ្លូវការជាវិធីល្អបំផុតដើម្បីយល់ថា SLM នឹងអនុវត្តបានល្អប៉ុណ្ណា នៅលើករណីប្រើប្រាស់របស់អ្នក។ សូមពិចារណាការប្រើ SLM សម្រាប់ភារកិច្ចសាមញ្ញដូចជាការបែងចែកបំណងឬការដកយកព៉ារ៉ាម៉ែត្រ ខណៈពេលដែលរក្សាម៉ូដែលធំសម្រាប់ការគិតប្រារព្ធដ៏ស្មុគស្មាញ។
ការប្រើម៉ូដែលរ៉ូតឺរ: យុទ្ធសាស្រ្តដូចគ្នាគឺការប្រើម៉ូដែលនានា និងទំហំផ្សេងៗគ្នា។ អ្នកអាចប្រើ LLM/SLM ឬមុខងារដែលមិនមានម៉ាស៊ីនបម្រើដើម្បីរ៉ូតការស្នើសុំដោយផ្អែកលើភាពស្មុគស្មាញទៅម៉ូដែលសមស្របបំផុត។ វានឹងជួយកាត់បន្ថយចំណាយ ខណៈពេលដែលធានាប្រសិទ្ធភាពលើភារកិច្ចត្រឹមត្រូវ។ ឧទាហរណ៍ រ៉ូតសំណួរងាយៗទៅម៉ូដែលតូច និងលឿន ប៉ុន្តែប្រើម៉ូដែលធំមានថ្លៃសម្រាប់ភារកិច្ចគិតប្រារព្ធដ៏ស្មុគស្មាញ។
ចូលរួមក្នុង Microsoft Foundry Discord ដើម្បីជួបជាមួយអ្នករៀនផ្សេងទៀត ចូលរួមម៉ោងការិយាល័យ និងទទួលបានចម្លើយចំពោះសំណួរអំពីភ្នាក់ងារ AI របស់អ្នក។
ការបដិសេធ: ឯកសារនេះត្រូវបានបម្លែងភាសា ដោយប្រើសេវាបម្លែងភាសា AI Co-op Translator។ ទោះយើងខ្ញុំមានក្តីប្រាថ្នាឱ្យបានច្បាស់លាស់ តែសូមយល់ដឹងថាការបម្លែងដោយស្វ័យប្រវត្តិក៏អាចមានកំហុសឬភាពមិនត្រឹមត្រូវ។ ឯកសារដើមជាភាសាទីតាំងគួរត្រូវបានគេប្រើជាប្រភពច្បាស់លាស់។ សម្រាប់ព័ត៌មានសំខាន់ៗ សូមណែនាំឱ្យប្រើប្រាស់ការប្រែដោយមនុស្សជំនាញ។ យើងខ្ញុំមិនទទួលខុសត្រូវចំពោះការយល់ច្រឡំ ឬការបកស្រាយខុសបន្ទាប់ពីការប្រើប្រាស់ការបម្លែងនេះនោះទេ។