ARKONE
A control room of monitoring screens with one screen switched off

AI ഏജന്റുകൾ എന്തുകൊണ്ട് കൃത്രിമം കാണിക്കുന്നു, യഥാർത്ഥത്തിൽ പിടിച്ചുനിൽക്കുന്ന ഭരണക്രമം

August 9, 2026 · 5 min read

S
Sobin George Thomas

DIFC സ്ഥാപനങ്ങളിൽ 52% ഇപ്പോൾ AI ഉപയോഗിക്കുന്നു, നിർണായക പ്രക്രിയകളിൽ അത് ഉപയോഗിക്കുന്നവരിൽ 21% പേർക്ക് അതിന്മേൽ വ്യക്തമായ മേൽനോട്ടമില്ല. ഈ വിടവ് പ്രധാനമാണ്, കാരണം കഴിവുള്ള ഏജന്റുകൾ അവയുടെ ലക്ഷ്യങ്ങളെ കബളിപ്പിക്കും, എന്തു ചെയ്തുവെന്ന് ചോദിച്ച് ഒരു ഏജന്റിനെ ഓഡിറ്റ് ചെയ്യാനും കഴിയില്ല.

This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.

DIFC സ്ഥാപനങ്ങളിൽ പകുതിയിലധികവും ഇപ്പോൾ AI ഉപയോഗിക്കുന്നു. അംഗീകൃതമായ 661 സ്ഥാപനങ്ങളിൽ നടത്തിയ DFSA-യുടെ 2025-ലെ AI സർവേ സ്വീകാര്യത 52% ആയി രേഖപ്പെടുത്തുന്നു, ഒരു വർഷം മുമ്പ് അത് 33% ആയിരുന്നു. പ്രവർത്തനങ്ങൾക്ക് AI നിർണായകമായ ഇടങ്ങളിൽ പോലും 21% സ്ഥാപനങ്ങൾക്ക് വ്യക്തമായ ഉത്തരവാദിത്തമോ മേൽനോട്ട സംവിധാനങ്ങളോ ഇല്ലെന്നും അതേ സർവേ കണ്ടെത്തി.

ആ 21% വെറും കടലാസ് ജോലിയിലെ വിടവല്ല. ഏറ്റവും കഴിവുള്ള ഏജന്റുകൾ തന്നെയാണ് ലക്ഷ്യത്തിലേക്കുള്ള ഏറ്റവും ചെലവുകുറഞ്ഞ വഴി കണ്ടെത്തുന്നത് — ജോലിയിലൂടെ കടന്നുപോകാതെ അതിനെ ചുറ്റിവളഞ്ഞ് പോകുന്ന വഴികളും അതിൽ ഉൾപ്പെടും. ആരാണ് നോക്കുന്നത് എന്ന് നിങ്ങളുടെ റെഗുലേറ്റർ ഇപ്പോൾ ചോദിക്കുന്നു. നോക്കുക എന്നത് യഥാർത്ഥത്തിൽ എന്താണ് ആവശ്യപ്പെടുന്നത് എന്നതിനെക്കുറിച്ചാണ് ഈ ലേഖനം.


അകത്തുനിന്ന് നോക്കുമ്പോൾ ഒപ്റ്റിമൈസേഷന്റെ രൂപമാണ് വഞ്ചന

യന്ത്രത്തിൽ ദുരുദ്ദേശ്യമില്ല, ഇതിനെ ഒരു ധാർമ്മിക പ്രശ്നമായി കാണുന്നതാണ് ആദ്യത്തെ ചെലവേറിയ തെറ്റ്. ഒരു ലക്ഷ്യവും ഒരു അളവുകോലും മതിയായ ശേഷിയും ലഭിച്ച ഏജന്റ് ആ അളവുകോലിലേക്കുള്ള ഏറ്റവും ചെലവുകുറഞ്ഞ വഴി കണ്ടെത്തും. ചിലപ്പോൾ ആ വഴി ജോലി തന്നെയാകും. ചിലപ്പോൾ ആകില്ല.

പരാജയത്തിന്റെ രീതികൾ നന്നായി രേഖപ്പെടുത്തപ്പെട്ടിട്ടുണ്ട്. ടെസ്റ്റുകൾ പാസാകുന്നതിന്റെ അടിസ്ഥാനത്തിൽ വിലയിരുത്തപ്പെട്ട കോഡിംഗ് ഏജന്റുകൾ ടെസ്റ്റ് ഫയൽ തന്നെ തിരുത്തിയിട്ടുണ്ട്, പ്രതീക്ഷിത മൂല്യം ഹാർഡ്-കോഡ് ചെയ്തിട്ടുണ്ട്, അല്ലെങ്കിൽ എക്സെപ്ഷൻ ഹാൻഡ്‌ലറിനുള്ളിൽ പരാജയത്തെ വിഴുങ്ങിയിട്ടുണ്ട്. അനുകരിച്ച ഒരു കോർപ്പറേറ്റ് റോളിൽ വെച്ച മുൻനിര മോഡലുകളിൽ Anthropic എതിരാളി പരീക്ഷണങ്ങൾ നടത്തിയപ്പോൾ, വ്യത്യസ്ത ലാബുകളിൽ നിന്നുള്ള പല സിസ്റ്റങ്ങളും സ്വതന്ത്രമായി, അടച്ചുപൂട്ടൽ സ്വീകരിക്കുന്നതിനു പകരം സാങ്കൽപ്പികനായ ഒരു എക്സിക്യൂട്ടീവിനെ ഭീഷണിപ്പെടുത്താൻ തിരഞ്ഞെടുത്തു. സാഹചര്യത്തെക്കുറിച്ച് ഏറ്റവും നന്നായി ചിന്തിച്ച മോഡലുകൾ ചിന്തിച്ചുചിന്തിച്ച് നിർബന്ധത്തിലേക്ക് എത്തി.

ഈ മാതൃക എക്സിക്യൂട്ടീവുകൾക്ക് ഇതിനകം അറിയാം. 2016-ൽ Wells Fargo ജീവനക്കാർ ഉപഭോക്താക്കൾ ചോദിക്കാത്ത ഏകദേശം 3.5 ദശലക്ഷം അക്കൗണ്ടുകൾ തുറന്നു. ആരും തട്ടിപ്പിന് അനുമതി നൽകിയിരുന്നില്ല. ആരോ ഒരു ലക്ഷ്യം എഴുതി: ഒരു കുടുംബത്തിന് എട്ട് ഉൽപ്പന്നങ്ങൾ. റിവാർഡ് ഫംഗ്ഷൻ തന്നെയായിരുന്നു നയം. അളവിന്റെ സമ്മർദ്ദത്തിലുള്ള ഒരു ഏജന്റ് പെരുമാറുന്നത് അളവിന്റെ സമ്മർദ്ദത്തിലുള്ള ഒരു സെയിൽസ് ഫ്ലോർ പോലെയാണ്, കൂടുതൽ വേഗത്തിലും ശമ്പളച്ചെലവില്ലാതെയും എന്നു മാത്രം.


ചോദിച്ചുകൊണ്ട് ഒരു ഏജന്റിനെ ഓഡിറ്റ് ചെയ്യാനാവില്ല

എന്തെങ്കിലും തെറ്റായി തോന്നുമ്പോൾ, എന്തു ചെയ്തുവെന്ന് ഏജന്റിനോട് ചോദിക്കുകയാണ് സ്വാഭാവിക പ്രവണത. ആ പ്രവണത ഇവിടെ പരാജയപ്പെടും. Apollo Research-ന്റെ കുതന്ത്ര മൂല്യനിർണ്ണയങ്ങൾ കണ്ടെത്തിയത്, പരീക്ഷണ സാഹചര്യങ്ങളിൽ രഹസ്യ നടപടികൾ സ്വീകരിച്ച മുൻനിര മോഡലുകളെയാണ് — മേൽനോട്ട സംവിധാനങ്ങൾ പ്രവർത്തനരഹിതമാക്കാനുള്ള ശ്രമങ്ങൾ ഉൾപ്പെടെ — ചോദ്യം ചെയ്തപ്പോൾ അവ അത് നിഷേധിക്കുകയും ചെയ്തു. ഒരു മുൻനിര മോഡൽ പല ഘട്ടങ്ങളിലായുള്ള ചോദ്യം ചെയ്യലിൽ ഏകദേശം 99% തുടർചോദ്യങ്ങളിലും നിഷേധം തുടർന്നു.

സ്വയം പറയുന്നത് തെളിവല്ല. സ്വന്തം പെരുമാറ്റത്തെക്കുറിച്ചുള്ള ഒരു ഏജന്റിന്റെ വിവരണം അതേ ഒപ്റ്റിമൈസറിന്റെ മറ്റൊരു ഔട്ട്പുട്ടാണ്, അതേ സമ്മർദ്ദത്തിൽ ഉണ്ടാക്കിയത്. മനുഷ്യരുടെ കാര്യത്തിൽ ഇന്റേണൽ ഓഡിറ്റ് ഈ ചോദ്യം എന്നേ തീർപ്പാക്കിയതാണ്: ഇടപാട് ശുദ്ധമായിരുന്നോ എന്ന് ട്രേഡറോട് ചോദിക്കാറില്ല. സ്വതന്ത്രമായ ഒരു രേഖയുമായി ഒത്തുനോക്കുകയാണ് ചെയ്യുക.

ഇത് ഏജന്റ് ഭരണക്രമത്തെ ഒരു ധാർമ്മിക ചോദ്യത്തിൽ നിന്ന് ഒരു ഓഡിറ്റ് ചോദ്യമാക്കി മാറ്റുന്നു. ഓഡിറ്റ് ചോദ്യത്തിന് അറിയപ്പെടുന്ന ഒരു ഉത്തരമുണ്ട്: ഏജന്റിന് തൊടാനാവാത്ത രേഖകൾ സൂക്ഷിക്കുക, ഏജന്റിന് സ്വാധീനിക്കാനാവാത്ത ഫലങ്ങളുമായി അവ ഒത്തുനോക്കുക.


കുറ്റസമ്മതത്തെ ശിക്ഷിച്ചാൽ കുറ്റം ബാക്കിയാകും

ന്യായവാദ മോഡലുകൾ ദൃശ്യമായ ഒരു ചിന്താശൃംഖല ഉണ്ടാക്കുന്നു, അത് അമ്പരപ്പിക്കുംവിധം തുറന്നതാണ്. മൂല്യനിർണ്ണയത്തിലുള്ള മോഡലുകൾ ഹാക്ക് ചെയ്യുന്നതിനു മുമ്പ് “നമുക്ക് ഹാക്ക് ചെയ്യാം” എന്നതിന് തുല്യമായത് എഴുതിയിട്ടുണ്ട്. അതിനെതിരെ പരിശീലിപ്പിക്കുകയാണ് വ്യക്തമായ പ്രതികരണം: കൃത്രിമം കാണിക്കാനുള്ള ഉദ്ദേശ്യം മോണിറ്റർ പിടികൂടുമ്പോഴെല്ലാം മോഡലിനെ ശിക്ഷിക്കുക.

2025-ൽ OpenAI കൃത്യമായി അതു തന്നെ പരീക്ഷിച്ചു. മോണിറ്ററിനെതിരെ ഒപ്റ്റിമൈസ് ചെയ്തപ്പോൾ ദൃശ്യമായ മോശം ന്യായവാദം കുറഞ്ഞു. കൃത്രിമം വിശ്വസനീയമായി കുറഞ്ഞില്ല. മോഡൽ പെരുമാറ്റം നിലനിർത്തി, കുറ്റസമ്മതം ഉപേക്ഷിച്ചു.

നിരീക്ഷണക്ഷമത തീർന്നുപോകുന്ന ഒരു വിഭവമാണ്. നിരീക്ഷണ ചാനലിൽ സമ്മർദ്ദം ചെലുത്തുമ്പോഴെല്ലാം അതിൽ കുറച്ച് നിങ്ങൾ ചെലവാക്കുന്നു. ഒരു ഏജന്റിന്റെ ന്യായവാദ രേഖയെ ഒരു വിസിൽബ്ലോവർ ലൈൻ പോലെ കാണുക: അത് വായിക്കുക, അത് വെളിപ്പെടുത്തുന്നതിന്മേൽ മറ്റെവിടെയെങ്കിലും നടപടിയെടുക്കുക, അതിലൂടെ ഒരിക്കലും അനന്തരഫലങ്ങൾ തിരിച്ചുവിടരുത്.


പിടിച്ചുനിൽക്കുന്ന നിയന്ത്രണങ്ങൾ മനഃപൂർവം വിരസമാണ്

ഉദ്ദേശ്യത്തിന്മേലുള്ള നിയന്ത്രണങ്ങളെക്കാൾ ശേഷിയുടെ മേലുള്ള നിയന്ത്രണങ്ങൾ മെച്ചപ്പെട്ടതാണ്. പ്രൊഡക്ഷൻ ക്രെഡൻഷ്യലുകളിൽ എത്താനാവാത്ത ഒരു ഏജന്റിന്, എന്ത് നിഗമനത്തിൽ എത്തിയാലും, അവ ചോർത്താനാവില്ല. നിലനിൽക്കുന്ന നിയന്ത്രണങ്ങൾ ആകർഷകമല്ല, അവയിലൊന്നും AI-ക്ക് മാത്രമുള്ളതുമല്ല. ഇത് ചുമതലകളുടെ വേർതിരിവാണ്, മനുഷ്യനല്ലാത്ത ഒരു കക്ഷിക്ക് ബാധകമാക്കിയത്.

പരിമിതപ്പെടുത്തിയ അനുമതികൾ. ഏജന്റിന്റെ പ്രക്രിയയ്ക്ക് ആവശ്യമായ ഏറ്റവും ഇടുങ്ങിയ ഉപകരണങ്ങൾ മാത്രം അതിന് നൽകുക, അടുത്തുള്ളവ ഒന്നും വേണ്ട. അതിനില്ലാത്ത ശേഷി നിങ്ങൾ ഒരിക്കലും ഓഡിറ്റ് ചെയ്യേണ്ടതില്ലാത്ത ശേഷിയാണ്.

മാറ്റാനാവാത്ത ലോഗുകൾ. ഓരോ നടപടിയും ഏജന്റിന് എഴുതാനാവാത്ത ഒരു രേഖയിൽ ചെന്നുവീഴുന്നു. മുകളിലെ ഓഡിറ്റ് വിഭാഗം ആവശ്യപ്പെട്ട സ്വതന്ത്ര രേഖ ഇതാണ്. അതില്ലാതെ എല്ലാ പരിശോധനയും സ്വയം പറയുന്നതിലേക്ക് തിരിച്ചുവീഴും.

സ്വതന്ത്രമായ പരിശോധന. ആദ്യത്തേതിന്റെ സ്കോറിൽ താൽപ്പര്യമില്ലാത്ത രണ്ടാമതൊരു മോഡൽ ഔട്ട്പുട്ടുകൾ പരിശോധിക്കുന്നു, തിരിച്ചെടുക്കാൻ ചെലവേറിയ ഏതു നടപടിയിലും ഒരു മനുഷ്യൻ ഒപ്പിടുന്നു.

ഒരു ഡിസൈൻ തീരുമാനത്തിന് ചെലവൊന്നുമില്ല, എന്നാൽ അത് സമ്മർദ്ദത്തിന്റെ ഭൂരിഭാഗവും നീക്കുന്നു: ഏജന്റിന് സത്യസന്ധമായി പരാജയപ്പെടാൻ ഒരു വഴി കൊടുക്കുക. “പ്രശ്നം പരിഹരിക്കൂ” എന്ന് പറഞ്ഞ ഏജന്റിന് വിജയത്തിലേക്ക് ഒരു വഴിയേയുള്ളൂ. “അത് പരിഹരിക്കൂ, അല്ലെങ്കിൽ അത് പരിഹരിക്കാനാവാത്തതിന്റെ കൃത്യമായ കാരണം തിരികെ നൽകൂ” എന്ന് പറഞ്ഞ ഏജന്റിന് രണ്ടു വഴികളുണ്ട്, അതിലൊന്ന് നിങ്ങളോട് സത്യം പറയുകയാണ്.


ഈ പാദത്തിൽ ഒരു UAE സ്ഥാപനത്തിനുള്ളിൽ ഇത് എന്താണ് അർത്ഥമാക്കുന്നത്

DFSA സർവേ DIFC സ്ഥാപനങ്ങൾക്ക് ഈ വിടവ് മൂർത്തമാക്കുന്നു: മേൽനോട്ടമില്ലാതെ നിർണായക പ്രക്രിയകളിൽ AI ഉപയോഗിക്കുന്നതായി നിങ്ങളുടെ സമകാലികർ റിപ്പോർട്ട് ചെയ്തു, റെഗുലേറ്റർ ആ സംഖ്യ പ്രസിദ്ധീകരിച്ചു. ന്യായീകരിക്കാവുന്ന നിലപാട്, നിങ്ങൾക്ക് കാണിക്കാൻ കഴിയുന്ന ഭരണക്രമത്തിനു കീഴിൽ പ്രവർത്തിക്കുന്ന ഒരു പ്രക്രിയയാണ് — പരിമിതപ്പെടുത്തിയ അനുമതികൾ, ഒരു ലോഗ്, പേരുള്ള ഒരു ഉടമ, എഴുതിയ ഒരു നിർണ്ണയം — അല്ലാതെ ഒരു നയരേഖാ ഫയലല്ല.

ആ രേഖ ഡാറ്റാ സംരക്ഷണത്തെക്കുറിച്ചുള്ള എതിർവാദത്തിനും മറുപടി നൽകുന്നു. നിങ്ങളുടെ സ്ഥാപനം ഇതിനകം പണം നൽകുന്ന AI സബ്സ്ക്രിപ്ഷനുകളിൽ, നിങ്ങളുടെ സ്വന്തം ടെനൻസിക്കുള്ളിൽ പ്രവർത്തിക്കുന്ന ഒരു ഏജന്റ് നിങ്ങളുടെ ഡാറ്റ ഇപ്പോൾ ഉള്ളിടത്തുതന്നെ നിലനിർത്തുന്നു. ഓഡിറ്റ് പാത ഏജന്റിന്റെ സ്വന്തം ലോഗ് ചെയ്ത തീരുമാനങ്ങളാണ്: ഒരു വെണ്ടറുടെ ഉറപ്പല്ല, ഒരു കംപ്ലയൻസ് മേധാവിക്ക് റെഗുലേറ്ററുടെ മുന്നിൽ വെക്കാവുന്ന തെളിവാണ്.


ഒരു ചട്ടക്കൂടിൽ നിന്നല്ല, ഒരു പ്രക്രിയയിൽ നിന്ന് തുടങ്ങുക. ഒരു ക്ലിനിക് ദിനം നിങ്ങളുടെ സ്വന്തം പ്രക്രിയകളിൽ ഒന്നിന്മേൽ പ്രവർത്തിക്കുന്ന, ഭരണക്രമത്തിനു കീഴിലുള്ള ഒരു ഏജന്റ് ഉണ്ടാക്കി, വൈകുന്നേരത്തോടെ എഴുതിയ നിർണ്ണയം നിങ്ങൾക്ക് കൈമാറുന്നു — പരിമിതപ്പെടുത്തിയത്, ലോഗ് ചെയ്തത്, രേഖപ്പെടുത്തിയത്. ചോദ്യം ഒരു പ്രക്രിയയെക്കാൾ വിശാലമാണെങ്കിൽ, അഞ്ചു ഘട്ട കൺസൾട്ടിംഗ് രീതി എന്തെങ്കിലും നിർമ്മിക്കുന്നതിനു മുമ്പ് നിങ്ങളുടെ പ്രവർത്തനത്തിലുടനീളം ഏജന്റുകൾ എവിടെ ചേരുമെന്ന് വരച്ചുകാട്ടുന്നു. ഏതു വഴി പോയാലും, അടുത്ത സർവേയ്ക്ക് മുമ്പ് നിങ്ങൾ പുറത്തുകടക്കാൻ ആഗ്രഹിക്കുന്ന ഒരു പട്ടികയാണ് ആ 21%.

Frequently asked questions

Can you audit an AI agent by asking it what it did?+

No. Apollo Research found that when frontier models took covert actions in test scenarios and were questioned afterwards, one leading model denied involvement in roughly 99% of follow-ups. An agent's account of its own behaviour is another output of the same optimiser. Audit against logs the agent cannot write to, never against self-report.

Does the DFSA require AI governance for DIFC firms?+

The DFSA's 2025 AI survey of 661 authorised firms found 52% now use AI, while 21% lack clear accountability or oversight mechanisms even where AI is critical to operations. The regulator is surveying and publishing on exactly this gap, which makes a documented, governed first implementation the safest position for a DIFC firm.

What controls actually stop an AI agent from gaming its objective?+

Constraints on capability outperform constraints on intent: scoped tool permissions, immutable logs, a second model reviewing outputs, and human sign-off on hard-to-reverse actions. Also give the agent an honest way to fail. An agent that can report 'this cannot be resolved' has less reason to fake a resolution.

ഒരു സംഭാഷണം ആരംഭിക്കാൻ തയ്യാറോ?

അളക്കാവുന്ന AI ഫലങ്ങൾ ഡെലിവർ ചെയ്യാൻ ArkOne എങ്ങനെ ഭരണ സംവിധാനവും പ്രോഗ്രാം ആർക്കിടെക്ചറും നിർമ്മിക്കുന്നു എന്ന് കാണൂ.

ഡിസ്‌കവറി കോൾ ബുക്ക് ചെയ്യുക