ai-agents-for-beginners

ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ AI ਏਜੰਟਸ: ਨਿਰੀਖਣਯੋਗਤਾ ਅਤੇ ਮੁਲਾਂਕਣ

ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ AI ਏਜੰਟਸ

ਜਿਵੇਂ ਹੀ AI ਏਜੰਟ ਪ੍ਰਯੋਗਾਤਮਕ ਪ੍ਰੋਟੋਟਾਈਪ ਤੋਂ ਅਸਲ ਦੁਨੀਆ ਦੇ ਐਪਲੀਕੇਸ਼ਨ ਵੱਲ ਵਧਦੇ ਹਨ, ਉਨ੍ਹਾਂ ਦੇ ਵਿਹਾਰ ਨੂੰ ਸਮਝਣ ਦੀ ਸਮਰੱਥਾ, ਉਨ੍ਹਾਂ ਦੇ ਪ੍ਰਦਰਸ਼ਨ ਦੀ ਜ਼ਾਂਚ ਕਰਨ ਅਤੇ ਉਨ੍ਹਾਂ ਦੇ ਨਤੀਜਿਆਂ ਦਾ ਪ੍ਰਣਾਲੀਬੱਧ ਤੌਰ ‘ਤੇ ਮੁਲਾਂਕਣ ਕਰਨ ਦੀ ਜ਼ਰੂਰਤ ਮਹੱਤਵਪੂਰਨ ਹੋ ਜਾਂਦੀ ਹੈ।

ਸਿੱਖਣ ਦੇ ਲਕੜ

ਇਸ ਪਾਠ ਨੂੰ ਪੂਰਾ ਕਰਨ ਤੋਂ ਬਾਅਦ, ਤੁਸੀਂ ਇਹ ਜਾਣੋਗੇ ਕਿ/ਸਮਝੋਗੇ:

ਲਕੜ ਇਹ ਹੈ ਕਿ ਤੁਹਾਨੂੰ ਇਹ ਗਿਆਨ ਪ੍ਰਦਾਨ ਕਰਨਾ ਕਿ ਤੁਸੀਂ ਆਪਣੇ “ਕਾਲੇ ਬਕਸੇ” ਵਾਲੇ ਏਜੰਟਸ ਨੂੰ ਪਾਰਦਰਸ਼ੀ, ਪ੍ਰਬੰਧਨਯੋਗ ਅਤੇ ਭਰੋਸੇਯੋਗ ਪ੍ਰਣਾਲੀਆਂ ਵਿੱਚ ਬਦਲ ਸਕੋ।

ਨੋਟ: ਸੁਰੱਖਿਅਤ ਅਤੇ ਭਰੋਸੇਯੋਗ AI ਏਜੰਟ ਤੈਅ ਕਰਨਾ ਜ਼ਰੂਰੀ ਹੈ। ਭਰੋਸੇਯੋਗ AI ਏਜੰਟ ਬਣਾਉਣ ਪਾਠ ਵੀ ਵੇਖੋ।

ਟਰੇਸ ਅਤੇ ਸਪੈਨ

ਨਿਰੀਖਣਯੋਗਤਾ ਦੇ ਸੰਦ ਜਿਵੇਂ ਕਿ Langfuse ਜਾਂ Microsoft Foundry ਆਮ ਤੌਰ ‘ਤੇ ਏਜੰਟ ਚਲਾਉਣ ਨੂੰ ਟਰੇਸ ਅਤੇ ਸਪੈਨ ਵਜੋਂ ਦਰਸਾਉਂਦੇ ਹਨ।

Langfuse ਵਿੱਚ ਟਰੇਸ ਟ੍ਰੀ

ਬਿਨਾਂ ਨਿਰੀਖਣਯੋਗਤਾ ਦੇ, ਇੱਕ AI ਏਜੰਟ “ਕਾਲਾ ਬਕਸਾ” ਲੱਗਦਾ ਹੈ - ਇਸ ਦੀਆਂ ਅੰਦਰੂਨੀ ਸਥਿਤੀ ਅਤੇ ਤਰਕ ਸਪਸ਼ਟ ਨਹੀਂ ਹੁੰਦੀਆਂ, ਜਿਸ ਕਾਰਨ ਮੁੱਦੇ ਦੀ ਤਸ਼ਖੀਸ ਕਰਨਾ ਜਾਂ ਪ੍ਰਦਰਸ਼ਨ ਸਧਾਰਣਾ ਔਖਾ ਹੋ ਜਾਂਦਾ ਹੈ। ਨਿਰੀਖਣਯੋਗਤਾ ਨਾਲ, ਏਜੰਟ “ਸ਼ੀਸ਼ੇ ਦੀ ਡੱਬੀ” ਬਣ ਜਾਂਦੇ ਹਨ, ਜੋ ਪਾਰਦਰਸ਼ਤਾ ਦਿੰਦੇ ਹਨ ਜੋ ਭਰੋਸਾ ਬਣਾਉਣ ਅਤੇ ਉਨ੍ਹਾਂ ਦਾ ਲਕੜ ਅਨੁਸਾਰ ਚੱਲਣ ਨੂੰ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਜ਼ਰੂਰੀ ਹੈ।

ਪ੍ਰੋਡਕਸ਼ਨ ਵਾਤਾਵਰਨਾਂ ਵਿੱਚ ਨਿਰੀਖਣਯੋਗਤਾ ਮਹੱਤਵਪੂਰਨ ਕਿਉਂ ਹੈ

AI ਏਜੰਟਸ ਨੂੰ ਪ੍ਰੋਡਕਸ਼ਨ ਵਾਤਾਵਰਨ ਵਿੱਚ ਦਾਖਲ ਕਰਨਾ ਨਵੇਂ ਚੁਣੌਤੀਆਂ ਅਤੇ ਜ਼ਰੂਰਤਾਂ ਲਿਆਉਂਦਾ ਹੈ। ਨਿਰੀਖਣਯੋਗਤਾ ਹੁਣ “ਚੰਗਾ ਹੋਣਾ” ਨਹੀਂ, ਬਲਕਿ ਇੱਕ ਆਵਸ਼ਯਕ ਸਮਰੱਥਾ ਹੈ:

ਟਰੈਕ ਕਰਨ ਲਈ ਮੁੱਖ ਮੈਟਰਿਕਸ

ਏਜੰਟ ਵਿਹਾਰ ਦੀ ਨਿਗਰਾਨੀ ਅਤੇ ਸਮਝ ਲਈ ਕਈ ਪ੍ਰਕਾਰ ਦੇ ਮੈਟਰਿਕਸ ਅਤੇ ਸੰਕੇਤ ਟਰੈਕ ਕੀਤੇ ਜਾਣ ਚਾਹੀਦੇ ਹਨ। ਜਦੋਂ ਕਿ ਵਿਸ਼ੇਸ਼ ਮੈਟਰਿਕਸ ਏਜੰਟ ਦੇ ਉਦਦੇਸ਼ ‘ਤੇ ਨਿਰਭਰ ਕਰ ਸਕਦੇ ਹਨ, ਪਰ ਕੁਝ ਸਾਰਵਭੌਮ ਹਨ।

ਇੱਥੇ ਕੁਝ ਸਭ ਤੋਂ ਆਮ ਮੈਟਰਿਕਸ ਹਨ ਜੋ ਨਿਰੀਖਣਯੋਗਤਾ ਦੇ ਸੰਦ ਟਰੈਕ ਕਰਦੇ ਹਨ:

ਲੈਟੰਸੀ: ਏਜੰਟ ਕਿੰਨਾ ਤੇਜ਼ੀ ਨਾਲ ਜਵਾਬ ਦਿੰਦਾ ਹੈ? ਲੰਮੇ ਇੰਤਜ਼ਾਰ ਨਾਲ ਉਪਭੋਗਤਾ ਅਨੁਭਵ ਪ੍ਰਭਾਵਤ ਹੁੰਦਾ ਹੈ। ਤੁਸੀਂ ਏਜੰਟ ਚਲਾਉਣ ਦਾ ਟਰੇਸ ਕਰਕੇ ਟਾਸਕਾਂ ਅਤੇ ਵਿਅਕਤੀਗਤ ਕਦਮਾਂ ਲਈ ਲੈਟੰਸੀ ਮਾਪ ਸਕਦੇ ਹੋ। ਉਦਾਹਰਨ ਵਜੋਂ, ਜੇ ਏਜੰਟ ਸਾਰੇ ਮਾਡਲ ਕਾਲਾਂ ਲਈ 20 ਸਕਿੰਟ ਲੈਂਦਾ ਹੈ ਤਾਂ ਇਸ ਨੂੰ ਇੱਕ ਤੇਜ਼ ਮਾਡਲ ਵਰਤ ਕੇ ਜਾਂ ਮਾਡਲ ਕਾਲਾਂ ਨੂੰ ਸਮਾਂਤਰ ਚਲਾ ਕੇ ਤੇਜ਼ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।

ਲਾਗਤਾਂ: ਪ੍ਰਤੀ ਏਜੰਟ ਰਨ ਖਰਚਾ ਕਿੰਨਾ ਹੈ? AI ਏਜੰਟ LLM ਕਾਲਾਂ ਜਾਂ ਬਾਹਰੀ API’ਜ਼ ‘ਤੇ ਨਿਰਭਰ ਕਰਦੇ ਹਨ ਜੋ ਪ੍ਰਤੀ ਟੋਕੇਨ ਜਾਂ ਪ੍ਰਤੀ ਕਾਲ ਬਿੱਲ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਬਹੁਤ ਵਾਰੀ ਟੂਲ ਦੀ ਵਰਤੋਂ ਜਾਂ ਬਹੁਤੇ ਪ੍ਰਾਂਪਟ्स ਨਾਲ ਲਾਗਤ ਤੇਜ਼ੀ ਨਾਲ ਵਧ ਸਕਦੀ ਹੈ। ਉਦਾਹਰਨ ਲਈ, ਜੇ ਏਜੰਟ ਮਾਰਜਿਨਲ ਕੁਆਲਟੀ ਸੁਧਾਰ ਲਈ LLM ਨੂੰ ਪੰਜ ਵਾਰੀ ਕਾਲ ਕਰਦਾ ਹੈ, ਤਾਂ ਇਸ ਦਾ ਖ਼ਰਚਾ ਸਹੀ ਹੈ ਜਾਂ ਤੁਸੀਂ ਕਾਲਾਂ ਦੀ ਗਿਣਤੀ ਘਟਾ ਸਕਦੇ ਹੋ ਜਾਂ ਸਸਤੇ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋ ਕੇ ਇਸ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣਾ ਚਾਹੀਦਾ ਹੈ। ਰੀਅਲ ਟਾਈਮ ਨਿਰੀਖਣ ਅਣਉਮੀਦਤ ਵਾਧਿਆਂ (ਜਿਵੇਂ ਕਿ ਬੱਗ ਕਾਰਨ ਬਹੁਤ ਜ਼ਿਆਦਾ API ਲੂਪ) ਦਾ ਪਤਾ ਲਗਾਉਣ ਵਿੱਚ ਵੀ ਮਦਦ ਕਰਦਾ ਹੈ।

ਰਿਕਵੇਸਟ ਤ੍ਰੁਟੀਆਂ: ਏਜੰਟ ਕਿੰਨੀਆਂ ਬੇਕਾਰ ਮੰਗਾਂ ਕਰਦਾ ਹੈ? ਇਹ ਵਿੱਚ API ਦੀਆਂ ਗਲਤੀਆਂ ਜਾਂ ਫੇਲ ਹੋਏ ਟੂਲ ਕਾਲ ਸ਼ਾਮਲ ਹੋ ਸਕਦੇ ਹਨ। ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਆਪਣੇ ਏਜੰਟ ਨੂੰ ਇਨ੍ਹਾਂ ਦੇ ਖਿਲਾਫ ਮਜ਼ਬੂਤ ਬਣਾਉਣ ਲਈ ਤੁਸੀਂ ਫਾਲਬੈਕ ਜਾਂ ਦੁਹਰਾਵਾਂ ਸੈੱਟ ਕਰ ਸਕਦੇ ਹੋ। ਉਦਾਹਰਨ ਲਈ ਜੇ LLM ਪ੍ਰਦਾਤਾ A ਡਾਊਨ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਬੈਕਅਪ ਵਜੋਂ LLM ਪ੍ਰਦਾਤਾ B ‘ਤੇ ਸਵਿੱਚ ਕਰ ਲੈਂਦੇ ਹੋ।

ਉਪਭੋਗਤਾ ਪ੍ਰਤੀਕਿਰਿਆ: ਸਿੱਧਾ ਉਪਭੋਗਤਾ ਮੁਲਾਂਕਣ ਕੀਮਤੀ ਜਾਣਕਾਰੀ ਦਿੰਦਾ ਹੈ। ਇਸ ਵਿੱਚ ਸਾਫ਼ ਸੂਚਕਾਂਕ (👍ਥੰਬਜ਼-ਅੱਪ/👎ਥੰਬਜ਼-ਡਾਊਨ, ⭐1-5 ਤਾਰਿਆਂ) ਜਾਂ ਲਿਖਤੀ ਟਿੱਪਣੀਆਂ ਸ਼ਾਮਲ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਲਗਾਤਾਰ ਨਕਾਰਾਤਮਕ ਪ੍ਰਤੀਕਿਰਿਆ ਤੁਹਾਨੂੰ ਸੂਚਿਤ ਕਰੇਗੀ ਕਿ ਏਜੰਟ ਮੁਲਾਂਕਣ ਪੂਰਾ ਜਾਂ ਡੂੰਘਾ ਸਮਝਣ ਵਿੱਚ ਵਿੱਫਲ ਹੈ।

ਅਪਰੋਕਸ਼ ਉਪਭੋਗਤਾ ਪ੍ਰਤੀਕਿਰਿਆ: ਉਪਭੋਗਤਾ ਦੀਆਂ ਆਦਤਾਂ ਸਿੱਧੇ ਮੁਲਾਂਕਣ ਬਿਨਾਂ ਵੀ ਅਪਰੋਕਸ਼ ਪ੍ਰਤੀਕਿਰਿਆ ਪੈਦਾ ਕਰਦੀਆਂ ਹਨ। ਇਸ ਵਿੱਚ ਤੁਰੰਤ ਸਵਾਲ ਦੁਬਾਰਾ ਪੁੱਛਣਾ, ਪੁੱਛੀਆਂ ਗਈਆਂ ਚੀਜ਼ਾਂ ਨੂੰ ਦੁਹਰਾਉਣਾ ਜਾਂ ਰੀਟ੍ਰਾਈ ਬਟਨ ‘ਤੇ ਕਲਿੱਕ ਕਰਨਾ ਸ਼ਾਮਲ ਹੋ ਸਕਦਾ ਹੈ। ਉਦਾਹਰਨ ਲਈ ਜੇ ਤੁਸੀਂ ਵੇਖਦੇ ਹੋ ਕਿ ਉਪਭੋਗਤਾ ਵਾਰ-ਵਾਰ ਇੱਕੋ ਸਵਾਲ ਪੁੱਛ ਰਹੇ ਹਨ, ਇਹ ਸੰਕੇਤ ਹੈ ਕਿ ਏਜੰਟ ਉਮੀਦ ਦੇ ਅਨੁਕੂਲ ਕੰਮ ਨਹੀਂ ਕਰ ਰਿਹਾ।

ਸਹੀਪਨ: ਏਜੰਟ ਕਿੰਨੀ ਵਾਰੀ ਸਹੀ ਜਾਂ ਮਨਪਸੰਦ ਨਤੀਜੇ ਪੈਦਾ ਕਰਦਾ ਹੈ? ਸਹੀਪਨ ਦੀਆਂ ਪਰਿਭਾਸ਼ਾਵਾਂ ਵੱਖ-ਵੱਖ ਹੋ ਸਕਦੀਆਂ ਹਨ (ਜਿਵੇਂ ਸਮੱਸਿਆ-ਹੱਲ ਕਰਨ ਦੀ ਸਹੀਤਾ, ਜਾਣਕਾਰੀ ਪ੍ਰਾਪਤੀ ਸਹੀਤਾ, ਉਪਭੋਗਤਾ ਸੰਤੁਸ਼ਟੀ)। ਪਹਿਲਾ ਕਦਮ ਇਹ ਤੈਅ ਕਰਨਾ ਹੈ ਕਿ ਤੁਹਾਡੇ ਏਜੰਟ ਲਈ ਸਫਲਤਾ ਕਿਹੜੀ ਹੈ। ਤੁਸੀਂ ਸਹੀਪਨ ਨੂੰ ਆਟੋਮੈਟਿਕ ਜਾਂਚਾਂ, ਮੁਲਾਂਕਣ ਸਕੋਰਾਂ ਜਾਂ ਟਾਸਕ ਪੂਰਾ ਕਰਨ ਵਾਲੇ ਲੇਬਲਾਂ ਰਾਹੀਂ ਟਰੈਕ ਕਰ ਸਕਦੇ ਹੋ। ਉਦਾਹਰਨ ਲਈ, ਟਰੇਸ ਨੂੰ “ਸਫਲ” ਜਾਂ “ਫੇਲ” ਵਜੋਂ ਨਿਸ਼ਾਨਿਤ ਕਰਨਾ।

ਆਟੋਮੈਟਿਕ ਮੁਲਾਂਕਣ ਮੈਟਰਿਕਸ: ਤੁਸੀਂ ਆਟੋਮੈਟਿਕ ਮੁਲਾਂਕਣ ਵੀ ਸੈੱਟ ਕਰ ਸਕਦੇ ਹੋ। ਉਦਾਹਰਨ ਲਈ, ਤੁਸੀਂ ਇੱਕ LLM ਨੂੰ ਏਜੰਟ ਦੇ ਆਉਟਪੁਟ ਨੂੰ ਸਕੋਰ ਕਰਨ ਲਈ ਵਰਤ ਸਕਦੇ ਹੋ ਕਿ ਇਹ ਮਦਦਗਾਰ, ਸਹੀ ਜਾਂ ਨਹੀਂ ਹੈ। ਕਈ ਖੁੱਲ੍ਹੇ ਸਰੋਤ ਲਾਇਬਰੇਰੀਆਂ ਵੀ ਹਨ ਜੋ ਏਜੰਟ ਦੇ ਵੱਖ-ਵੱਖ ਪੱਖਾਂ ਨੂੰ ਸਕੋਰ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦੀਆਂ ਹਨ। ਜਿਵੇਂ RAGAS RAG ਏਜੰਟ ਲਈ ਜਾਂ LLM Guard ਹਾਨਿਕਾਰਕ ਭਾਸ਼ਾ ਜਾਂ ਪ੍ਰਾਂਪਟ ਇੰਜੈਕਸ਼ਨ ਦਾ ਪਤਾ ਲਗਾਉਣ ਲਈ।

ਵਾਸਤਵ ਵਿੱਚ, ਇਹਨਾਂ ਮੈਟਰਿਕਸ ਦਾ ਮਿਲਾਪ AI ਏਜੰਟ ਦੀ ਸਿਹਤ ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਕਵਰੇਜ ਦਿੰਦਾ ਹੈ। ਇਸ ਅਧਿਆਇ ਦੇ ਉਦਾਹਰਣ ਨੋਟਬੁੱਕ ਵਿੱਚ, ਅਸੀਂ ਤੁਹਾਨੂੰ ਵੇਖਾਵਾਂਗੇ ਕਿ ਇਹ ਮੈਟਰਿਕਸ ਅਸਲੀ ਉਦਾਹਰਣਾਂ ਵਿੱਚ ਕਿਵੇਂ ਦਿਖਦੇ ਹਨ ਪਰ ਪਹਿਲਾਂ ਅਸੀਂ ਇਹ ਜਾਣਾਂਗੇ ਕਿ ਆਮ ਤੌਰ ‘ਤੇ ਮੁਲਾਂਕਣ ਕਿਵੇਂ ਕਰਦੇ ਹਨ।

ਆਪਣੇ ਏਜੰਟ ਦੀ ਇੰਸਟ੍ਰੂਮੈਂਟੇਸ਼ਨ ਕਰੋ

ਟਰੇਸਿੰਗ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ ਲਈ, ਤੁਹਾਨੂੰ ਆਪਣਾ ਕੋਡ ਇੰਸਟ੍ਰੂਮੈਂਟ ਕਰਨਾ ਪਵੇਗਾ। ਲਕੜ ਇਹ ਹੈ ਕਿ ਏਜੰਟ ਕੋਡ ਇੰਸਟ੍ਰੂਮੈਂਟ ਕੀਤਾ ਜਾਵੇ ਤਾਂ ਜੋ ਟਰੇਸ ਅਤੇ ਮੈਟਰਿਕਸ ਜਾਰੀ ਹੋਣ ਜੋ ਕਿ ਨਿਰੀਖਣਯੋਗਤਾ ਪਲੇਟਫਾਰਮ ਦੁਆਰਾ ਕੈਪਚਰ, ਪ੍ਰਕਿਰਿਆਤਮਕ ਅਤੇ ਵਿਜ਼ੂਲਾਈਜ਼ ਕੀਤੇ ਜਾ ਸਕਣ।

OpenTelemetry (OTel): OpenTelemetry ਨੇ LLM ਨਿਰੀਖਣਯੋਗਤਾ ਲਈ ਉਦਯੋਗ ਦਾ ਮਾਪਦੰਡ ਵਜੋਂ ਜਗ੍ਹਾ ਬਣਾਈ ਹੈ। ਇਹ ਟੈਲੀਮੇਟਰੀ ਡਾਟਾ ਤਿਆਰ ਕਰਨ, ਇਕੱਠਾ ਕਰਨ ਅਤੇ ਐਕਸਪੋਰਟ ਕਰਨ ਲਈ APIs, SDKs ਅਤੇ ਟੂਲਸ ਦਾ ਸਮੂਹ ਮੁਹੱਈਆ ਕਰਦਾ ਹੈ।

ਕਈ ਇੰਸਟ੍ਰੂਮੈਂਟੇਸ਼ਨ ਲਾਇਬ੍ਰੇਰੀਆਂ ਮੌਜੂਦਾ ਏਜੰਟ ਫਰੇਮਵਰਕ ਨੂੰ ਰੈਪ ਕਰਦੀਆਂ ਹਨ ਅਤੇ OpenTelemetry ਸਪੈਨ ਨੂੰ ਨਿਰੀਖਣਯੋਗਤਾ ਸੰਦਾਂ ਵੱਲ ਨਿਰਯਾਤ ਕਰਨਾ ਆਸਾਨ ਬਣਾ ਦਿੰਦੀਆਂ ਹਨ। Microsoft Agent Framework ਕੁਦਰਤੀ ਤੌਰ ‘ਤੇ OpenTelemetry ਨਾਲ ਇੰਟਿਗ੍ਰੇਟ ਕਰਦਾ ਹੈ। ਹੇਠਾਂ MAF ਏਜੰਟ ਦੀ ਇੰਸਟ੍ਰੂਮੈਂਟੇਸ਼ਨ ਦਾ ਉਦਾਹਰਨ ਹੈ:

from agent_framework.observability import get_tracer, get_meter

tracer = get_tracer()
meter = get_meter()

with tracer.start_as_current_span("agent_run"):
    # ਏਜੰਟ ਨਿਭਾਵਟ ਸਵੈਚਾਲਿਤ ਤੌਰ 'ਤੇ ਟਰੇਸ ਕੀਤੀ ਜਾਂਦੀ ਹੈ
    pass

ਇਸ ਅਧਿਆਇ ਵਿੱਚ ਉਦਾਹਰਣ ਨੋਟਬੁੱਕ ਤੁਹਾਨੂੰ ਦਿਖਾਏਗੀ ਕਿ ਆਪਣਾ MAF ਏਜੰਟ ਕਿਵੇਂ ਇੰਸਟ੍ਰੂਮੈਂਟ ਕਰਨਾ ਹੈ।

ਮੈਨੂਅਲ ਸਪੈਨ ਬਣਾਉਣਾ: ਜਦੋਂ ਕਿ ਇੰਸਟ੍ਰੂਮੈਂਟੇਸ਼ਨ ਲਾਇਬ੍ਰੇਰੀਆਂ ਇੱਕ ਚੰਗਾ ਬੇਸਲਾਈਨ ਦਿੰਦੀਆਂ ਹਨ, ਪਰ ਅਕਸਰ ਮਾਮਲੇ ਹੁੰਦੇ ਹਨ ਜਿੱਥੇ ਹੋਰ ਵਿਸਥਾਰਤੀ ਜਾਂ ਕਸਟਮ ਜਾਣਕਾਰੀ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਤੁਸੀਂ ਖੁਦ ਸਪੈਨ ਤਿਆਰ ਕਰਕੇ ਕਸਟਮ ਐਪਲੀਕੇਸ਼ਨ ਲਾਜ਼ਮ ਸ਼ਾਮਲ ਕਰ ਸਕਦੇ ਹੋ। ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਗੱਲ ਇਹ ਹੈ ਕਿ ਆਟੋਮੈਟਿਕ ਜਾਂ ਮੈਨੂਅਲ ਤਰੀਕੇ ਨਾਲ ਬਣਾਏ ਗਏ ਸਪੈਨ ਨੂੰ ਕਸਟਮ ਐਟ੍ਰਿਬਿਊਟਸ (ਜਿਨ੍ਹਾਂ ਨੂੰ ਟੈਗਜ਼ ਜਾਂ ਮੈਟਾਡੇਟਾ ਵੀ ਕਹਿੰਦੇ ਹਨ) ਨਾਲ ਸੰਪੰਨ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ। ਇਹ ਐਟ੍ਰਿਬਿਊਟ ਆਮ ਤੌਰ ‘ਤੇ ਕਾਰੋਬਾਰੀ-ਖਾਸ ਡਾਟਾ, ਦਰਮਿਆਨਾ ਗਣਨਾਵਾਂ ਜਾਂ ਕਿਸੇ ਵੀ ਸੰਦਰਭ ਨੂੰ ਸ਼ਾਮਲ ਕਰ ਸਕਦੇ ਹਨ ਜੋ ਡਿਗਗਿੰਗ ਜਾਂ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਲਾਭਦਾਇਕ ਹੋ ਸਕਦਾ ਹੈ, ਜਿਵੇਂ user_id, session_id, ਜਾਂ model_version

Langfuse Python SDK ਨਾਲ ਮੁਹੱਈਆ ਟਰੇਸ ਅਤੇ ਸਪੈਨ ਹੱਥੋਂ ਬਣਾਉਣ ਦਾ ਉਦਾਹਰਨ:

from langfuse import get_client
 
langfuse = get_client()
 
span = langfuse.start_span(name="my-span")
 
span.end()

ਏਜੰਟ ਮੁਲਾਂਕਣ

ਨਿਰੀਖਣਯੋਗਤਾ ਸਾਡੇ ਲਈ ਮੈਟਰਿਕਸ ਦਿੰਦੀ ਹੈ, ਪਰ ਮੁਲਾਂਕਣ ਉਸ ਡਾਟਾ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰਨ ਦੀ ਪ੍ਰਕਿਰਿਆ ਹੈ (ਅਤੇ ਟੈਸਟ ਕਰਨਾ) ਕਿ ਏਜੰਟ ਕਿੰਨਾ ਚੰਗਾ ਕੰਮ ਕਰ ਰਿਹਾ ਹੈ ਅਤੇ ਇਸ ਨੂੰ ਕਿਵੇਂ ਸੁਧਾਰਿਆ ਜਾ ਸਕਦਾ ਹੈ। ਦੂਜੇ ਸ਼ਬਦਾਂ ਵਿੱਚ, ਜਦ ਤੁਹਾਡੇ ਕੋਲ ਉਹ ਟਰੇਸ ਅਤੇ ਮੈਟਰਿਕਸ ਹੁੰਦੇ ਹਨ, ਤਾਂ ਤੁਸੀਂ ਉਨ੍ਹਾਂ ਨੂੰ ਏਜੰਟ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਅਤੇ ਫੈਸਲੇ ਲੈਣ ਲਈ ਕਿਵੇਂ ਵਰਤਦੇ ਹੋ?

ਨਿਯਮਤ ਮੁਲਾਂਕਣ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ ਕਿਉਂਕਿ AI ਏਜੰਟ ਅਕਸਰ ਅਨਿਰਧਾਰਤ ਹੁੰਦੇ ਹਨ ਅਤੇ ਵਿਕਸਿਤ ਹੋ ਸਕਦੇ ਹਨ (ਅੱਪਡੇਟ ਜਾਂ ਮਾਡਲ ਵਿਹਾਰ ਵਿੱਚ ਡ੍ਰਿਫਟਿੰਗ ਰਾਹੀਂ) – ਬਿਨਾਂ ਮੁਲਾਂਕਣ ਦੇ, ਤੁਸੀਂ ਨਹੀਂ ਜਾਣੋਗੇ ਕਿ ਤੁਹਾਡੇ “ਸਮਾਰਟ ਏਜੰਟ” ਵਾਸਤਵ ਵਿੱਚ ਆਪਣਾ ਕੰਮ ਚੰਗੀ ਤਰ੍ਹਾਂ ਕਰ ਰਿਹਾ ਹੈ ਜਾਂ ਨਹੀਂ ਜਾਂ ਪਿੱਛੇ ਰਹਿ ਗਿਆ ਹੈ।

AI ਏਜੰਟਸ ਲਈ ਮੁਲਾਂਕਣ ਦੇ ਦੋ ਸ਼੍ਰੇਣੀਆਂ ਹਨ: ਆਨਲਾਈਨ ਮੁਲਾਂਕਣ ਅਤੇ ਆਫਲਾਈਨ ਮੁਲਾਂਕਣ। ਦੋਵਾਂ ਕੀਮਤੀ ਹਨ ਅਤੇ ਇੱਕ ਦੂਜੇ ਨੂੰ ਪੂਰਾ ਕਰਦੇ ਹਨ। ਅਸੀਂ ਆਮ ਤੌਰ ‘ਤੇ ਆਫਲਾਈਨ ਮੁਲਾਂਕਣ ਨਾਲ ਸ਼ੁਰੂ ਕਰਦੇ ਹਾਂ, ਕਿਉਂਕਿ ਇਹ ਕੋਈ ਵੀ ਏਜੰਟ ਤੈਅ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਘੱਟੋ-ਘੱਟ ਜਰੂਰੀ ਕਦਮ ਹੈ।

ਆਫਲਾਈਨ ਮੁਲਾਂਕਣ

Langfuse ਵਿੱਚ ਡਾਟਾਸੈੱਟ ਆਈਟਮ

ਇਹ ਸਮਰੱਥਿਤ ਵਾਤਾਵਰਨ ਵਿੱਚ ਏਜੰਟ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਨਾਲ ਸੰਬੰਧਤ ਹੈ, ਆਮ ਤੌਰ ‘ਤੇ ਟੈਸਟ ਡਾਟਾਸੈੱਟ ਦੀ ਵਰਤੋਂ ਕਰਕੇ, ਜਿੰਦਗੀ ਦੇ ਉਪਭੋਗਤਾ ਪ੍ਰਸ਼ਨਾਂ ਨਹੀਂ। ਤੁਸੀਂ ਉਹਨਾਂ ਚੁਣੇ ਹੋਏ ਡਾਟਾਸੈੱਟ ਨੂੰ ਵਰਤਦੇ ਹੋ ਜਿੱਥੇ ਤੁਸੀਂ ਜਾਣਦੇ ਹੋ ਕਿ ਉਮੀਦਵਾਰ ਨਤੀਜਾ ਜਾਂ ਸਹੀ ਵਿਹਾਰ ਕੀ ਹੈ ਅਤੇ ਫਿਰ ਆਪਣੇ ਏਜੰਟ ਨੂੰ ਉਨ੍ਹਾਂ ‘ਤੇ ਚੱਲਾਉਂਦੇ ਹੋ।

ਉਦਾਹਰਨ ਲਈ, ਜੇ ਤੁਸੀਂ ਗਣਿਤ ਸ਼ਬਦ-ਸਮੱਸਿਆ ਏਜੰਟ ਬਣਾਇਆ ਹੈ, ਤਾਂ ਤੁਹਾਡੇ ਕੋਲ 100 ਸਮੱਸਿਆਵਾਂ ਨਾਲ ਜਾਣੇ-ਪਹਚਾਣੇ ਜਵਾਬਾਂ ਦਾ ਟੈਸਟ ਡਾਟਾਸੈੱਟ ਹੋ ਸਕਦਾ ਹੈ। ਆਫਲਾਈਨ ਮੁਲਾਂਕਣ ਵਿਕਾਸ ਦੌਰਾਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ (ਅਤੇ CI/CD ਪਾਈਪਲਾਈਨਾਂ ਦਾ ਹਿੱਸਾ ਵੀ ਹੋ ਸਕਦਾ ਹੈ) ਸੁਧਾਰ ਜਾਂ ਰਿਗ੍ਰੈਸ਼ਨ ਤੋੜਣ ਦੀ ਜਾਂਚ ਕਰਨ ਲਈ। ਫਾਇਦਾ ਇਹ ਹੈ ਕਿ ਇਹ ਦੋਹਰਾਉਣਯੋਗ ਹੈ ਅਤੇ ਤੁਹਾਡੇ ਕੋਲ ਗਰਾਊਂਡ ਟਰੂਥ ਹੋਣ ਕਾਰਨ ਤੁਸੀਂ ਸਾਫ਼-ਸੁਥਰੇ ਸਹੀਪਨ ਮੈਟਰਿਕਸ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦੇ ਹੋ। ਤੁਸੀਂ ਉਪਭੋਗਤਾ ਪ੍ਰਸ਼ਨਾਂ ਦਾ ਸਿਮੂਲੇਸ਼ਨ ਵੀ ਕਰ ਸਕਦੇ ਹੋ ਅਤੇ ਏਜੰਟ ਦੇ ਜਵਾਬਾਂ ਨੂੰ ਆਦਰਸ਼ ਜਵਾਬਾਂ ਤੋਂ ਮਿਲਾ ਕੇ ਜਾਂ ਉਪਰੋਕਤ ਢੰਗ ਨਾਲ ਆਟੋਮੈਟਿਕ ਮੈਟਰਿਕਸ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਮਾਪ ਸਕਦੇ ਹੋ।

ਆਫਲਾਈਨ ਮੁਲਾਂਕਣ ਵਿੱਚ ਮੁੱਖ ਚੁਣੌਤੀ ਇਹ ਹੈ ਕਿ ਤੁਹਾਡਾ ਟੈਸਟ ਡਾਟਾਸੈੱਟ ਵਿਆਪਕ ਹੋਵੇ ਅਤੇ ਸਬੰਧਤ ਬਣਿਆ ਰਹੇ – ਏਜੰਟ ਇੱਕ ਨਿਸ਼ਚਿਤ ਟੈਸਟ ਸੈੱਟ ‘ਤੇ ਚੰਗਾ ਕਰ ਸਕਦਾ ਹੈ ਪਰ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਬਹੁਤ ਵੱਖਰੇ ਸਵਾਲਾਂ ਦਾ ਸਾਹਮਣਾ ਕਰ ਸਕਦਾ ਹੈ। ਇਸ ਲਈ, ਤੁਹਾਨੂੰ ਟੈਸਟ ਸੈੱਟ ਨੂੰ ਨਵੇਂ ਐਜ ਕੈਸ ਅਤੇ ਅਸਲੀ ਦੁਨੀਆ ਦੇ ਪਟਰਨਾਂ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਕੇ ਅੱਪਡੇਟ ਕਰਦਾ ਰਹਿਣਾ ਚਾਹੀਦਾ ਹੈ। ਛੋਟੇ “ਸਮੋਕ ਟੈਸਟ” ਕੇਸਜ਼ ਅਤੇ ਵੱਡੇ ਮੁਲਾਂਕਣ ਸੈੱਟ ਦਾ ਮਿਕਸ ਲਾਭਕਾਰੀ ਹੈ: ਛੋਟੇ ਸੈੱਟ ਤੇਜ਼ ਜਾਂਚ ਲਈ ਅਤੇ ਵੱਡੇ ਵਿਆਪਕ ਪ੍ਰਦਰਸ਼ਨ ਮੈਟਰਿਕਸ ਲਈ।

ਆਨਲਾਈਨ ਮੁਲਾਂਕਣ

ਨਿਰੀਖਣਯੋਗਤਾ ਮੈਟਰਿਕਸ ਸਰਵੇਖਣ

ਇਹ ਮਤਲਬ ਹੈ ਕਿ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਜਾਂ ਜਿੰਦਗੀ ਦੇ ਵਰਤੋਂਵਾਲੇ ਵਾਤਾਵਰਨ ਵਿੱਚ ਖ਼ਰੀਅਤ ਅਸਲ ਸਮੇਂ ਵਿੱਚ ਏਜੰਟ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨਾ। ਆਨਲਾਈਨ ਮੁਲਾਂਕਣ ਅਸਲੀ ਉਪਭੋਗਤਾ ਇੰਟਰਐਕਸ਼ਨਾਂ ‘ਤੇ ਏਜੰਟ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਦੀ ਨਿਗਰਾਨੀ ਅਤੇ ਨਿਰੰਤਰ ਵਿਸ਼ਲੇਸ਼ਣ ਸ਼ਾਮਲ ਕਰਦਾ ਹੈ।

ਉਦਾਹਰਨ ਲਈ, ਤੁਸੀਂ ਸਫਲਤਾ ਦਰਾਂ, ਉਪਭੋਗਤਾ ਸੰਤੁਸ਼ਟੀ ਸਕੋਰ ਜਾਂ ਹੋਰ ਮੈਟਰਿਕਸ ਜੀਵੰਤ ਟ੍ਰੈਫਿਕ ਉੱਤੇ ਟਰੈਕ ਕਰ ਸਕਦੇ ਹੋ। ਆਨਲਾਈਨ ਮੁਲਾਂਕਣ ਦਾ ਫਾਇਦਾ ਇਹ ਹੈ ਕਿ ਇਹ ਉਹਨਾਂ ਗੱਲਾਂ ਨੂੰ ਕੈਪਚਰ ਕਰਦਾ ਹੈ ਜੋ ਤੁਸੀਂ ਲੈਬ ਸੈਟਿੰਗ ਵਿੱਚ ਉਮੀਦ ਨਹੀਂ ਕਰ ਸਕਦੇ - ਤੁਸੀਂ ਸਮੇਂ ਦੇ ਨਾਲ ਮਾਡਲ ਡ੍ਰਿਫਟ (ਜੇ ਏਜੰਟ ਦੀ ਪ੍ਰਭਾਵਸ਼ੀਲਤਾ ਇਨਪੁਟ ਪੈਟਰਨਾਂ ਦੇ ਬਦਲਾਅ ਨਾਲ ਘਟਦੀ ਹੈ) ਨਿਰੀਖਣ ਕਰ ਸਕਦੇ ਹੋ ਅਤੇ ਅਣਉਮੀਦਤ ਬਿਨੈ ਜਾਂ ਸਥਿਤੀਆਂ ਜਿਹੜੀਆਂ ਤੁਹਾਡੇ ਟੈਸਟ ਡਾਟਾ ਵਿੱਚ ਨਹੀਂ ਸਨ, ਪਛਾਣ ਸਕਦੇ ਹੋ। ਇਹ ਏਜੰਟ ਦੇ ਜੰਗਲ ਵਿੱਚ ਵਿਹਾਰ ਦਾ ਸੱਚਾ ਚਿੱਤਰ ਮੁਹੱਈਆ ਕਰਦਾ ਹੈ।

ਆਨਲਾਈਨ ਮੁਲਾਂਕਣ ਅਕਸਰ ਅਪਰੋਕਸ਼ ਅਤੇ ਸਿੱਧਾ ਉਪਭੋਗਤਾ ਪ੍ਰਤੀਕਿਰਿਆ ਇਕੱਠਾ ਕਰਦਾ ਹੈ, ਜਿਵੇਂ ਕਿ ਗੱਲ ਕੀਤੀ ਗਈ ਹੈ, ਅਤੇ ਸੰਭਵ ਹੈ ਕਿ ਸ਼ੈਡੋ ਟੈਸਟ ਜਾਂ A/B ਟੈਸਟ ਚਲਾਏ ਜਾ ਰਹੇ ਹੋਣ (ਜਿੱਥੇ ਏਜੰਟ ਦਾ ਨਵਾਂ ਵਰਜ਼ਨ ਪੁਰਾਣੇ ਨਾਲ ਤੁਲਨਾ ਲਈ ਸਮਾਂਤਰ ਚੱਲ ਰਿਹਾ ਹੋਵੇ)। ਚੁਣੌਤੀ ਇਹ ਹੈ ਕਿ ਜੀਵੰਤ ਇੰਟਰਐਕਸ਼ਨਾਂ ਲਈ ਭਰੋਸੇਯੋਗ ਲੇਬਲ ਜਾਂ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕਰਨਾ ਔਖਾ ਹੋ ਸਕਦਾ ਹੈ – ਤੁਸੀਂ ਉਪਭੋਗਤਾ ਪ੍ਰਤੀਕਿਰਿਆ ਜਾਂ ਡਾਊਨਸਟਰੀਮ ਮੈਟਰਿਕਸ (ਜਿਵੇਂ ਕਿ ਉਪਭੋਗਤਾ ਨੇ ਨਤੀਜਾ ਕਲਿੱਕ ਕੀਤਾ ਕਿ ਨਹੀਂ) ‘ਤੇ ਨਿਰਭਰ ਕਰ ਸਕਦੇ ਹੋ।

ਦੋਹਾਂ ਦਾ ਮਿਲਾਪ

ਆਨਲਾਈਨ ਅਤੇ ਆਫਲਾਈਨ ਮੁਲਾਂਕਣ ਆਪਸ ਵਿੱਚ ਵਿਰੋਧੀ ਨਹੀਂ ਹਨ; ਉਨ੍ਹਾਂ ਦੀ ਵੱਧ ਭਲੀ ਭਾਂਤੀ ਪੂਰੀ ਕਰਦੇ ਹਨ। ਆਨਲਾਈਨ ਨਿਗਰਾਨੀ ਤੋਂ ਪ੍ਰਾਪਤ ਜਾਣਕਾਰੀਆਂ (ਜਿਵੇਂ ਕਿ ਉਪਭੋਗਤਾ ਦੇ ਨਵੇਂ ਪ੍ਰਕਾਰ ਦੇ ਸਵਾਲ ਜਿੱਥੇ ਏਜੰਟ ਖਰਾਬ ਕਰਦਾ ਹੈ) ਨੂੰ ਆਫਲਾਈਨ ਟੈਸਟ ਡਾਟਾਸੈੱਟ ਨੂੰ ਵਧਾਉਣ ਅਤੇ ਸੁਧਾਰਨ ਲਈ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ। ਇਸਦੇ ਉਲਟ, ਜਿਹੜੇ ਏਜੰਟ ਆਫਲਾਈਨ ਟੈਸਟਾਂ ਵਿੱਚ ਚੰਗੇ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦੇ ਹਨ, ਉਹਨਾਂ ਨੂੰ ਫਿਰ ਜ਼ਿਆਦਾ ਵਿਸ਼ਵਾਸ ਨਾਲ ਆਨਲਾਈਨ ਤੈਅ ਅਤੇ ਨਿਗਰਾਨੀ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ।

ਵਾਸਤੇ, ਬਹੁਤ ਟੀਮਾਂ ਇੱਕ ਲੂਪ ਅਪਣਾਉਂਦੀਆਂ ਹਨ:

ਆਫਲਾਈਨ ਮੁਲਾਂਕਣ ਕਰੋ -> ਤੈਅ ਕਰੋ -> ਆਨਲਾਈਨ ਨਿਗਰਾਨੀ ਕਰੋ -> ਨਵੇਂ ਫੇਲ ਕੇਸ ਇਕੱਠੇ ਕਰੋ -> ਆਫਲਾਈਨ ਡਾਟਾਸੈੱਟ ਵਿੱਚ ਸ਼ਾਮਲ ਕਰੋ -> ਏਜੰਟ ਨੂੰ ਸੁਧਾਰੋ -> ਦੁਹਰਾਓ

ਆਮ ਸਮੱਸਿਆਵਾਂ

ਜਦ ਤੁਸੀਂ AI ਏਜੰਟ ਨੂੰ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਤੈਅ ਕਰਦੇ ਹੋ, ਤੁਹਾਨੂੰ ਵੱਖ-ਵੱਖ ਚੁਣੌਤੀਆਂ ਦਾ ਸਾਹਮਣਾ ਹੋ ਸਕਦਾ ਹੈ। ਇੱਥੇ ਕੁਝ ਆਮ ਸਮੱਸਿਆਵਾਂ ਅਤੇ ਉਨ੍ਹਾਂ ਦੇ ਸੰਭਾਵਿਤ ਹੱਲ ਦਿੱਤੇ ਗਏ ਹਨ:

ਸਮੱਸਿਆ ਸੰਭਾਵਿਤ ਹੱਲ
AI ਏਜੰਟ ਟਾਸਕ ਨੂੰ ਲਗਾਤਾਰ ਸਹੀ ਤਰੀਕੇ ਨਾਲ ਨਹੀਂ ਕਰ ਰਿਹਾ - AI ਏਜੰਟ ਨੂੰ ਦਿੱਤੇ ਗਏ ਪ੍ਰਾਂਪਟ ਨੂੰ ਸੁਧਾਰੋ; ਮਕਸਦ ਸਪਸ਼ਟ ਕਰੋ।
- ਇਹ ਪਛਾਣੋ ਕਿ ਕਿੱਥੇ ਟਾਸਕ ਨੂੰ ਉਪ-ਟਾਸਕਾਂ ਵਿੱਚ ਵੰਡਣਾ ਅਤੇ ਕਈ ਏਜੰਟਾਂ ਦੁਆਰਾ ਹਲ ਕਰਨਾ ਮਦਦਗਾਰ ਹੋ ਸਕਦਾ ਹੈ।
AI ਏਜੰਟ ਲਗਾਤਾਰ ਲੂਪ ਵਿੱਚ ਫਸ ਰਿਹਾ ਹੈ - ਇਹ ਯਕੀਨੀ ਬਣਾਓ ਕਿ ਤੁਹਾਡੇ ਕੋਲ ਸਪਸ਼ਟ ਬੰਦ ਕਰਨ ਦੇ ਨਿਯਮ ਹਨ ਤਾਂ ਜੋ ਏਜੰਟ ਨੂੰ ਪਤਾ ਲੱਗੇ ਕਿ ਕਦੋਂ ਪ੍ਰਕਿਰਿਆ ਰੋਕਣੀ ਹੈ।
- ਪਿਚੀਦਾ ਟਾਸਕਾਂ ਲਈ ਜੋ ਤਰਕ ਅਤੇ ਯੋਜਨਾ ਬਣਾਉਂਦੇ ਹਨ, ਇੱਕ ਵੱਡਾ ਮਾਡਲ ਵਰਤੋ ਜੋ ਤਰਕ ਨਾਲ ਸਬੰਧਿਤ ਕੰਮਾਂ ਲਈ ਮੁਹਾਰਤ ਰੱਖਦਾ ਹੋਵੇ।
AI ਏਜੰਟ ਟੂਲ ਕਾਲਾਂ ਚੰਗੇ ਤਰੀਕੇ ਨਾਲ ਕੰਮ ਨਹੀਂ ਕਰ ਰਹੇ - ਏਜੰਟ ਸਿਸਟਮ ਤੋਂ ਬਾਹਰ ਟੂਲ ਦੇ ਆਉਟਪੁਟ ਦੀ ਜਾਂਚ ਅਤੇ ਪ੍ਰਮਾਣਿਕਤਾ ਕਰੋ।
- ਪਰਿਭਾਸ਼ਤ ਪੈਰਾਮੀਟਰ, ਪ੍ਰਾਂਪਟਸ ਅਤੇ ਟੂਲਾਂ ਦੇ ਨਾਮ ਨੂੰ ਸੁਧਾਰੋ।
ਮਲਟੀ-ਏਜੰਟ ਸਿਸਟਮ ਲਗਾਤਾਰ ਸਹੀ ਤਰੀਕੇ ਨਾਲ ਨਹੀਂ ਚੱਲ ਰਿਹਾ - ਹਰ ਏਜੰਟ ਨੂੰ ਦਿੱਤੇ ਪ੍ਰਾਂਪਟ ਨੂੰ ਸੁਧਾਰੋ ਤਾਂ ਜੋ ਉਹ ਵਿਸ਼ੇਸ਼ ਅਤੇ ਇਕ ਦੂਜੇ ਤੋਂ ਵੱਖ-ਵੱਖ ਹੋਣ।
- “ਰੂਟਿੰਗ” ਜਾਂ ਕੰਟਰੋਲਰ ਏਜੰਟ ਵਰਤ ਕੇ ਹਾਇਰਾਰਕੀ ਸਿਸਟਮ ਬਣਾਓ ਕਿ ਕਿਹੜਾ ਏਜੰਟ ਸਹੀ ਹੈ।

ਬਹੁਤ ਸਾਰੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਨਿਰੀਖਣਯੋਗਤਾ ਦੇ ਹੋਣ ਨਾਲ ਬਿਹਤਰ ਪਛਾਣਿਆ ਜਾ ਸਕਦਾ ਹੈ। ਅੱਗੇ ਦਿੱਤੇ ਟਰੇਸ ਅਤੇ ਮੈਟਰਿਕਸ ਉਹ ਥਾਂਦਸੂਚਤ ਕਰਦੇ ਹਨ ਜਿੱਥੇ ਏਜੰਟ ਕੰਮ ਵਿੱਚ ਸਮੱਸਿਆਵਾਂ ਹਨ, ਜਿਸ ਨਾਲ ਡਿਗਗਿੰਗ ਅਤੇ ਅਪਟੀਮਾਈਜ਼ੇਸ਼ਨ ਬਹੁਤ ਪ੍ਰਭਾਵਸ਼ੀਲ ਹੁੰਦੇ ਹਨ।

ਲਾਗਤਾਂ ਦਾ ਪ੍ਰਬੰਧਨ

ਇੱਥੇ AI ਏਜੰਟਾਂ ਨੂੰ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਤਾਇਨਾਤ ਕਰਨ ਦੇ ਖਰਚਿਆਂ ਨੂੰ ਮੈਨੇਜ ਕਰਨ ਲਈ ਕੁਝ ਰਣਨੀਤੀਆਂ ਹਨ:

ਛੋਟੇ ਮਾਡਲਾਂ ਦੀ ਵਰਤੋਂ: ਛੋਟੇ ਭਾਸ਼ਾ ਮਾਡਲ (SLMs) ਕੁਝ ਏਜੰਟਿਕ ਉਪਯੋਗ-ਕੇਸਾਂ ਵਿੱਚ ਚੰਗਾ ਪ੍ਰਦਰਸ਼ਨ ਕਰ ਸਕਦੇ ਹਨ ਅਤੇ ਖਰਚੇ ਨੂੰ ਕਾਫੀ ਘਟਾ ਦੇਣਗੇ। ਜਿਵੇਂ ਪਹਿਲਾਂ ਦੱਸਿਆ ਗਿਆ, ਮੁਲਾਂਕਣ ਪ੍ਰਣਾਲੀ ਬਣਾਉਣ ਜੋ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਵੱਡੇ ਮਾਡਲਾਂ ਨਾਲ ਤੁਲਨਾ ਕਰੇ, ਇਹ ਸਿਖਣ ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਤਰੀਕਾ ਹੈ ਕਿ ਇੱਕ SLM ਤੁਹਾਡੇ ਉਪਯੋਗ ਕੇਸ ‘ਤੇ ਕਿੰਨਾ ਚੰਗਾ ਕੰਮ ਕਰੇਗਾ। ਸਰਲ ਕੰਮਾਂ ਜਿਵੇਂ ਕਿ ਮਨਸਾ ਵਰਗੀ ਕਿੱਤਾਬਤ ਜਾਂ ਪੈਰਾਮੀਟਰ ਨਿਕਾਸ ਲਈ SLMs ਦੀ ਵਰਤੋਂ ਕਰਨ ਬਾਰੇ ਸੋਚੋ, ਜਦਕਿ ਮੁਸ਼ਕਲ ਤਰੱਕੀਸ਼ੀਲ ਕਾਰਜਾਂ ਲਈ ਵੱਡੇ ਮਾਡਲਾਂ ਨੂੰ ਰੱਖੋ।

ਰਾਊਟਰ ਮਾਡਲ ਦੀ ਵਰਤੋਂ: ਇੱਕ ਸਮਾਨ ਰਣਨੀਤੀ ਇਹ ਹੈ ਕਿ ਵੱਖ-ਵੱਖ ਮਾਡਲਾਂ ਅਤੇ ਆਕਾਰਾਂ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਜਾਵੇ। ਤੁਸੀਂ ਇੱਕ LLM/SLM ਜਾਂ ਸਰਵਰ ਰਹਿਤ ਫੰਕਸ਼ਨ ਵਰਤ ਕੇ ਜਟਿਲਤਾ ਅਨੁਸਾਰ ਬਿਹਤਰ ਸਭ ਤੋਂ ਫਿੱਟ ਮਾਡਲਾਂ ਨੂੰ ਬੇਨਤੀਆਂ ਭੇਜ ਸਕਦੇ ਹੋ। ਇਹ ਖਰਚੇ ਘਟਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰੇਗਾ ਅਤੇ ਸਹੀ ਕਾਰਜਾਂ ‘ਤੇ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਯਕੀਨੀ ਬਨਾਏਗਾ। ਉਦਾਹਰਨ ਲਈ, ਸਧਾਰਣ ਪ੍ਰਸ਼ਨਾਂ ਨੂੰ ਛੋਟੇ ਤੇ ਤੇਜ਼ ਮਾਡਲਾਂ ਕੋਲ ਰਾਹ ਦਿਓ, ਅਤੇ ਸਿਰਫ ਜਟਿਲ ਤਰੱਕੀਸ਼ੀਲ ਕੰਮਾਂ ਲਈ ਮਹਿੰਗੇ ਵੱਡੇ ਮਾਡਲਾਂ ਦੀ ਵਰਤੋਂ ਕਰੋ।

ਜਵਾਬਾਂ ਨੂੰ ਕੈਸ਼ ਕਰਨਾ: ਆਮ ਬੇਨਤੀਆਂ ਅਤੇ ਕਾਰਜਾਂ ਦੀ ਪਛਾਣ ਕਰਕੇ ਅਤੇ ਉਨ੍ਹਾਂ ਦੇ ਜਵਾਬ ਪਹਿਲਾਂ ਹੀ ਆਪਣੇ ਏਜੰਟਿਕ ਸਿਸਟਮ ਵਿਚੋਂ ਜਾਣ ਤੋਂ ਪਹਿਲਾਂ ਪ੍ਰਦਾਨ ਕਰਨਾ, ਸਮਾਨ ਬੇਨਤੀਆਂ ਦੀ ਮਾਤਰਾ ਘਟਾਉਣ ਦਾ ਚੰਗਾ ਤਰੀਕਾ ਹੈ। ਤੁਸੀਂ ਇੱਕ ਫਲੋ ਵੀ ਲਾਗੂ ਕਰ ਸਕਦੇ ਹੋ ਜੋ ਇਹ ਪਛਾਣਦਾ ਹੈ ਕਿ ਕੋਈ ਬੇਨਤੀ ਤੁਹਾਡੇ ਕੈਸ਼ ਕੀਤੇ ਨਿਵੇਦਨਾਂ ਨਾਲ ਕਿੰनी ਮਿਲਦੀ ਹੈ, ਅਤੇ ਇਸ ਲਈ ਹੋਰ ਬੁਨਿਆਦੀ AI ਮਾਡਲਾਂ ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹੋ। ਇਹ ਥਾਂਤਕਾਰੀ ਰਣਨੀਤੀ ਅਕਸਰ ਪੁੱਛੇ ਜਾਣ ਵਾਲੇ ਸਵਾਲਾਂ ਜਾਂ ਆਮ ਵਰਕਫਲੋਜ਼ ਲਈ ਖਰਚੇ ਵਿੱਚ ਕਾਫੀ ਕਮੀ ਕਰ ਸਕਦੀ ਹੈ।

ਆਓ ਵੇਖੀਏ ਕਿ ਇਹ ਕਿਵੇਂ ਪ੍ਰੈਕਟਿਸ ਵਿੱਚ ਕੰਮ ਕਰਦਾ ਹੈ

ਇਸ ਸੈਕਸ਼ਨ ਦੇ ਉਦਾਹਰਣ ਨੋਟਬੁੱਕ ਵਿੱਚ, ਅਸੀਂ ਵੇਖਾਂਗੇ ਕਿ ਕਿਵੇਂ ਅਸੀਂ ਪਰਿ਷ਰਵੇਖਣ ਟੂਲਾਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਆਪਣੇ ਏਜੰਟ ਦੀ ਨਿਗਰਾਨੀ ਅਤੇ ਮੁਲਾਂਕਣ ਕਰ ਸਕਦੇ ਹਾਂ।

ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ AI ਏਜੰਟਾਂ ਬਾਰੇ ਹੋਰ ਸਵਾਲ ਹਨ?

Microsoft Foundry Discord ਵਿੱਚ ਸ਼ਾਮਲ ਹੋਵੋ, ਜਿੱਥੇ ਤੁਸੀਂ ਹੋਰ ਸਿੱਖਣ ਵਾਲਿਆਂ ਨਾਲ ਮਿਲ ਸਕਦੇ ਹੋ, ਆਫਿਸ ਘੰਟਿਆਂ ਵਿੱਚ ਹਾਜ਼ਰੀ ਲਾ ਸਕਦੇ ਹੋ ਅਤੇ ਆਪਣੇ AI ਏਜੰਟਾਂ ਦੇ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਲੈ ਸਕਦੇ ਹੋ।

ਪਹਿਲਾ ਪਾਠ

Metacognition Design Pattern

ਅਗਲਾ ਪਾਠ

Agentic Protocols


ਅਸਵੀਕਾਰੋਪਣ: ਇਸ ਦਸਤਾਵੇਜ਼ ਦਾ ਅਨੁਵਾਦ ਏਆਈ ਅਨੁਵਾਦ ਸੇਵਾ Co-op Translator ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾਵਾਂ ਲਈ ਯਤਨਸ਼ੀਲ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਰੱਖੋ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸਮੱਤਿਆਵਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਆਪਣੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਕ ਸਰੋਤ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਰੂਰੀ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਇਸ ਅਨੁਵਾਦ ਦੇ ਉਪਯੋਗ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੀਆਂ ਕਿਸੇ ਵੀ ਗਲਤਫਹਿਮੀਆਂ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆਵਾਂ ਲਈ ਜਵਾਬਦੇਹ ਨਹੀਂ ਹਾਂ।