julián medina

סוכנים

כיצד להעריך סוכן AI לפני שילובו בפעולה שלך

מאת Julián Medina · מנהל SourcingUp ויוצר CommerceUp

בדוק אותו עם משימות מייצגות וקריטריוני קבלה מוגדרים לפני הפעלתו. כללתי מידע לא שלם, כלים שנכשלים ומצבים הדורשים התייעצות עם אדם.

הרכיבו קבוצה של מקרים

אספתי דוגמאות נפוצות, חריגים ידועים ובקשות מחוץ לתחום. עבור כל מקרה, רשמתי איזו תוצאה תהיה מקובלת ואיזו פעולה לא אמורה להתרחש. זה מאפשר להשוות שינויים ללא תלות ברושם שהותיר הבדיקה האחרונה. שמור גם את הנתונים וההגדרות שבהם נעשה שימוש.

מדדתי את שארית העבודה

ספור משימות שהושלמו כהלכה, שגיאות, התערבויות ותיקונים. סוכן יכול לסיים יותר מדי משימות ולהשאיר את הצוות עם יותר מדי מאמץ ביקורתי. בדוגמה של סיווג שאילתות, חשוב גם לתקן את הקטגוריה וגם לזהות שהודעה מעורפלת דורשת עדכון.

אנסה שוב כשהמערכת תשתנה

מודל חדש, הוראה או אינטגרציה יכולים לשנות התנהגות. חזרתי על המקרים הרלוונטיים והוספתי את הכשלים שנמצאו בפעולה. הערכה הופכת אפוא לדרך לשמר את הלמידה. המטרה היא לדעת איפה אתה יכול לעבוד ואיפה אתה צריך תמיכה, לא להראות שאתה אף פעם לא נכשל.

כדי ליישם את זה בפועל

מאיפה המראה הזה?

מדריך מאת Julián Medina. התרחישים המוצעים הם המחשה; הם אינם מייצגים תוצאות מדודות של לקוחות. העבודה שלי ב-SourcingUp.