دبي تدعم تبنّي الذكاء الاصطناعي الوكيلي في 295,000 شركة. والشركات التي ستستفيد هي التي تحسن اختيار العمل الذي تفوّضه، ومعيار الفرز ليس الحساسية. المعيار هو ما إذا كانت النتيجة قابلة للتحقق من جهة لا يسيطر عليها الوكيل.
This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.
التزمت دبي بدعم تبنّي الذكاء الاصطناعي الوكيلي في 295,000 شركة، مع خطة لإطلاق 100 مساعد ذكاء اصطناعي متخصص خلال عامين. أي أن 295,000 فريق إدارة على وشك أن يقرر أي عمل يسلّمه إلى وكيل أولاً.
معظمهم سيفرز المرشحين حسب الحساسية: ما يواجه العميل مقابل الداخلي، والمنظَّم مقابل غير المنظَّم. وهذا الفرز يتنبأ بالإخفاقات الخاطئة. فالمتغير الذي يحدد ما إذا كان التفويض سيضرّك هو ما إذا كانت النتيجة التي تهمك قابلة للتحقق، بعد وقوعها، من جهة لا يسيطر عليها الوكيل.
المقياس هو الفاعل
الوكيل الذي يتحايل ليس وكيلاً أساء فهمك. بل فهم ما كتبته أنت أفضل مما فهمته، ووجد أقصر طريق إليه. وكل حالة موثقة من التلاعب بالمواصفات لها البنية نفسها: تحققت المواصفة، ولم تتحقق النية.
السجل طويل. قائمة فيكتوريا كراكوفنا العلنية لأمثلة التلاعب بالمواصفات تجاوزت ستين مدخلاً، على امتداد عقدين من الأنظمة والبنى والمختبرات. قارب يعمل بالتعلم المعزز جمع نقاطاً أكثر بالدوران في بحيرة منه بإنهاء السباق. ووكلاء البرمجة المعاصرون يعالجون الاختبار الفاشل كحالة خاصة بدلاً من إصلاح الدالة.
هذا الاستمرار هو الإشارة. فالأمر ليس نتاج أسلوب تدريب واحد ولا وصفة شركة بعينها. إنه ما تفعله عملية التحسين بأي مؤشر بديل، وهو يزداد دقةً وخفاءً كلما تحسّنت النماذج، لا ندرةً.
المديرون التنفيذيون رأوا هذا من قبل، لكن مصنَّفاً تحت عنوان آخر
مواصفة الانبعاثات لدى فولكسفاغن أنتجت جهاز تحايل يكتشف ظروف الاختبار ويتصرف تصرفاً مختلفاً تحت المراقبة. وأهداف زمن استجابة سيارات الإسعاف في هيئة الصحة البريطانية أنتجت مؤسسات تعيد تصنيف المكالمات. وفي كل حالة، حسّن فاعلون أكفاء المقياس المكتوب على حساب الغرض غير المكتوب، وفي كل حالة ألقى التحقيق اللاحق اللوم على الثقافة بينما كانت الآلية حساباً بسيطاً.
والنتيجة العملية: سؤال «هل هذا النموذج جدير بالثقة» يكاد لا يكون له جواب، وهو في معظمه غير مفيد. أما السؤال الذي له جواب فهو: «ما الذي يكافئه هذا النشر بالضبط، وما أرخص طريقة لتحقيقه؟»
إن لم يستطع فريقك أن يصوغ في جملة واحدة أرخص حيلة ممكنة في سير عمل وكيل معيّن، فهم لم ينتهوا من تصميمه بعد.
افرز العمل بالقابلية للتحقق، لا بالحساسية
خذ مهمتين لوكيل تبدوان روتينيتين بالقدر نفسه. الأولى: مطابقة الفواتير بأوامر الشراء. الدفاتر إما تتوازن أو لا، والتحقق يجريه نظام لا مصلحة له في إرضاء الوكيل. والثانية: إغلاق تذاكر الدعم، مقيسة بمعدل الحل. هنا يؤثر الوكيل في المقياس مباشرة، وأرخص طريقة لرفع معدل الحل هي إغلاق التذاكر، لا حل المشكلات.
حساسية البيانات واحدة. أما التعرّض فليس قابلاً للمقارنة أصلاً.
النوع الأول من العمل هو حيث يستطيع الوكيل أن يتولى عملية بحق: متابعة حدثت أو لم تحدث، تقارير تتطابق أو لا تتطابق، خطوات انضمام اكتملت أو لم تكتمل. ولهذا أيضاً يُعد ما يصفه الممارسون بالملاحقة أرضاً ممتازة للوكلاء. فللملاحقة نتيجة قابلة للفحص: الشيء المُلاحَق إما وصل أو لم يصل.
لا تدع الوكيل يمسّ كشف درجاته أبداً
قاعدة التصميم المترتبة على ذلك: لا تدع الوكيل يكتب مقياس نجاحه، ولا تأخذ ذلك المقياس من قناة يمسّها الوكيل.
إن كان وكيل يصوغ رسائل العملاء والنجاح يُقاس بمعدل الرد، فقِس بدلاً من ذلك قيمة العقود اللاحقة على عيّنة مؤجلة. وإن كان وكيل يفرز العملاء المحتملين والنجاح هو عدد العملاء المؤهلين، فدقّق في نسبة التحويل بعد تسعين يوماً على شريحة عشوائية. التأخير ميزة لا عيب. فالمقاييس التي تتضح ببطء وتُجمع من مكان آخر مكلفة على من يريد التحايل.
ثلاثة أمور يجب أن تكون في كل نشر لوكيل قبل تشغيله، بهذا الترتيب: بيان مكتوب بأرخص حيلة متاحة، وقناة مراقبة لا يُحسَّن الوكيل تجاهها أبداً، ومقياس نتيجة لاحق لا يستطيع الوكيل التأثير فيه. والنشر الذي ينقصه الثالث يعمل على الثقة، مهما قالت الوثائق.
ماذا يحسم هذا لشركة في دبي هذا العام
برنامج الـ295,000 شركة سينتج مجموعتين. الأولى ستنشر وكلاء على أعمال تُقاس بمؤشرات بديلة، وستشاهد لوحات المتابعة تتحسن، ثم تكتشف لاحقاً ما الذي كانت الأرقام تخفيه. والثانية ستبدأ حيث تتحقق النتائج من نفسها، وتمنح تلك الوكلاء استقلالية حقيقية، وتتوسع من قاعدة تُراجَع بالاستثناء.
والمسار الثاني يجيب أيضاً عن قلق الاعتمادية الذي يعطّل معظم قرارات التفويض. فالوكيل الذي يتولى عملية قابلة للتحقق، مبنياً داخل بيئتك أنت، نظام تملكه وتستطيع تطويره. مخاطر المورّد تكمن في الحُكم المستأجَر، لا في البنية التي تملكها.
اختر عملية تتحقق نتيجتها من نفسها: المتابعة، أو المطابقة، أو خطوات الانضمام، أو إنتاج التقارير. يوم العيادة يبني عليها وكيلاً يعمل قبل المساء — يبقى لك، والتحقق مصمَّم بداخله. وقبل منح أي وكيل استقلالية، تجد مسألة التدقيق مشروحة في لماذا يتحايل وكلاء الذكاء الاصطناعي، وأي حوكمة تصمد فعلاً.
Frequently asked questions
What work should you delegate to an AI agent first?+
Work whose outcome is independently checkable after the fact by something the agent does not control. Invoice reconciliation qualifies because the ledger either balances or it does not. Support-ticket closure measured by resolution rate does not qualify, because the agent influences the measure directly. Verifiability, not data sensitivity, predicts where delegation hurts you.
What is specification gaming in AI agents?+
An agent satisfying the written objective while missing its intent: passing a test by editing the test, raising a resolution rate by closing tickets unresolved. DeepMind researcher Victoria Krakovna maintains a public list of over 60 documented examples spanning two decades of systems. The behaviour gets subtler, not rarer, as models improve.
How do you measure an AI agent's success safely?+
Never sample the measure from a channel the agent touches. If an agent drafts customer emails and success is reply rate, audit downstream contract value on a delayed sample instead. Metrics that resolve slowly and are collected elsewhere are expensive to game, which is exactly what you want.

