Scovai Scovai
AI & Operations 2026-09-14 1 min read

आप अपने एजेंट बिल की सबसे सस्ती चौथाई को अनुकूलित कर रहे हैं: McKinsey मानवीय निगरानी को एक AI एजेंट की परिवर्तनीय लागत का 70–75% आँकता है

DSL

Dr. Sarah Liu

आप अपने एजेंट बिल की सबसे सस्ती चौथाई को अनुकूलित कर रहे हैं: McKinsey मानवीय निगरानी को एक AI एजेंट की परिवर्तनीय लागत का 70–75% आँकता है

बैंकिंग में ग्राहक सेवा एजेंट की लागत निकालिए और टोकन का बिल उसकी परिवर्तनीय परिचालन लागत का 20 से 25 प्रतिशत बैठता है। मानवीय निगरानी — एजेंट के काम की जाँच करने वाले फंक्शनल और जोखिम विशेषज्ञ — 70 से 75 प्रतिशत बैठती है (McKinsey QuantumBlack, 2026)।

वही वर्कफ़्लो। वही बिल। और इस साल मैंने एजेंट पर जितने भी बिज़नेस केस पढ़े, उनमें से लगभग हर एक छोटी वाली संख्या को अनुकूलित करता है।

मॉडल चयन, प्रॉम्प्ट कैशिंग, कम जोखिम वाली कॉल्स के लिए सस्ता इन्फ़रेंस स्तर — इंजीनियरिंग का ध्यान वहीं जाता है, क्योंकि लागत वहीं पठनीय है। वह हर महीने आती है, मद-दर-मद, आरोपित करने योग्य। निगरानी किसी और के कॉस्ट सेंटर में वेतनभोगी घंटों के रूप में आती है, इसलिए उसे कभी AI एजेंट लागत के रूप में गिना ही नहीं जाता। उसे इस कारण के रूप में गिना जाता है कि पायलट चुपचाप स्केल क्यों नहीं हो पाया।

McKinsey ने वास्तव में किसकी कीमत लगाई

एजेंटिक वर्कफ़्लो की अर्थव्यवस्था पर QuantumBlack की 24 अगस्त 2026 की गाइड वह करती है जिसे एजेंट-विश्लेषण लगभग हमेशा छोड़ देते हैं: वह पूर्ण हुए काम की कीमत लगाती है, सॉफ़्टवेयर की नहीं। एजेंट, नियतात्मक प्रणालियाँ, और आउटपुट की समीक्षा करने वाले लोग — सब कुछ एक ही पूर्णतः भारित संख्या में।

प्रमुख उदाहरण है बैंक खाता खोलना। यह वर्कफ़्लो कई नियतात्मक प्रणालियों के साथ पाँच से सात एजेंट चलाता है, और दो से चार टीमें निगरानी देती हैं। प्रत्येक पूर्ण ऑनबोर्डिंग की पूर्णतः भारित लागत लगभग 50-150 डॉलर से घटकर लगभग 10-30 डॉलर रह जाती है (McKinsey QuantumBlack, 2026)।

यह तीन से पाँच गुना का सुधार है। इसलिए यह तर्क नहीं है कि एजेंट फ़ायदेमंद नहीं होते। यह तर्क है कि आप यह जानने के लिए ग़लत मद पर नज़र रखे हुए हैं कि आपके एजेंट फ़ायदेमंद हैं या नहीं।

पैमाना समझने के लिए: McKinsey कुछ बैंकों में ग्राहकोन्मुख एकल-एजेंट वर्कफ़्लो को चलाने की सालाना लागत 20,000-30,000 डॉलर और बहु-एजेंट टीम की 100,000-200,000 डॉलर आँकता है। ये आँकड़े सार्वजनिक शोध और सार्वजनिक मूल्य-सूची के McKinsey विश्लेषण से आते हैं, किसी अंकेक्षित ग्राहक-बही से नहीं — इसलिए अनुपातों को कसकर पकड़िए और निरपेक्ष रकम को ढीला छोड़िए।

AI एजेंट लागत को असल में क्या चलाता है: अपवाद दर, मॉडल नहीं

बैंकिंग ग्राहक ऑनबोर्डिंग में McKinsey की अपेक्षा है कि एजेंटिक रन्स का 10 से 20 प्रतिशत जोखिम और फंक्शनल विशेषज्ञों द्वारा समीक्षित होगा।

वही समीक्षा दर पूरा खेल है, और अंकगणित को धीरे-धीरे देखना सार्थक है — नीचे का उदाहरण मेरा है, McKinsey का नहीं, पर इनपुट उन्हीं के हैं।

15% समीक्षा दर और प्रति समीक्षा 20 मिनट विशेषज्ञ समय वाला एक वर्कफ़्लो लीजिए। 1,000 रन्स पर यह वरिष्ठ फंक्शनल समय के 50 घंटे बनते हैं। समीक्षा दर घटाकर 5% कीजिए और वही 1,000 रन्स लगभग 17 घंटे में निपटते हैं। आपने किसी मॉडल, किसी प्रॉम्प्ट या किसी वेंडर अनुबंध को छुए बिना महँगी मद का दो-तिहाई हटा दिया।

और ध्यान दीजिए कि वह समीक्षा कौन कर रहा है। McKinsey स्पष्ट रूप से फंक्शनल और जोखिम विशेषज्ञ बताता है — वही लोग जिनके विवेक की रक्षा के लिए वर्कफ़्लो अस्तित्व में है, न कि कोई कनिष्ठ QA परत जिसे आप सस्ते में भर सकें। निगरानी की लागत ठीक इसीलिए ऊँची है क्योंकि सस्ती निगरानी निगरानी होती ही नहीं; समीक्षक इतना वरिष्ठ होना चाहिए कि एजेंट के निर्णय को पलट सके। कोई भी योजना जो यह मानती है कि समीक्षा परत नीचे सौंपी जा सकती है, दरअसल समीक्षा बंद करने की योजना है।

अब इसकी तुलना उस लीवर से कीजिए जिसे हर कोई असल में खींचता है। McKinsey टोकन लागत के केवल तीन चालक बताता है: मॉडल गुणवत्ता, विलंबता की आवश्यकता, और कार्य की आवृत्ति। जुलाई 2026 की शुरुआत में अग्रणी मूल्य-निर्धारण शीर्ष श्रेणी के मॉडल के लिए लगभग 5 डॉलर प्रति दस लाख इनपुट टोकन और 30 डॉलर प्रति दस लाख आउटपुट टोकन था, जबकि पहले के हल्के मॉडल के लिए 0.20 और 1.25 डॉलर। पच्चीस गुना का अंतर — जो बिल के एक-चौथाई पर लागू होता है।

और यहीं स्पष्ट दिखने वाले अनुकूलन के भीतर जाल है। टोकन घटाने के लिए मॉडल नीचे कीजिए तो त्रुटि दर बढ़ती है। ऊँची त्रुटि दर अपवाद दर बढ़ाती है। ऊँची अपवाद दर समीक्षक घंटे बढ़ाती है, यानी वही तीन-चौथाई। टोकन की बचत नियमित रूप से निगरानी में उस वृद्धि को वित्तपोषित करती है जिसे कोई मापता नहीं, और वर्कफ़्लो महँगा होता जाता है जबकि डैशबोर्ड उसे सस्ता दिखाता है।

समीक्षा के घंटे गायब क्यों नहीं होते

स्वतंत्र प्रमाण मौजूद हैं कि निगरानी की मद संरचनात्मक है, न कि परिपक्वता की ऐसी समस्या जिससे आप बढ़कर बाहर निकल आएँ।

MIT Technology Review Insights और Microsoft ने 300 तकनीकी कार्यकारियों व व्यवसायियों का सर्वेक्षण किया और 101 एजेंटिक कार्यों को 0-100 के विश्वास पैमाने पर क्रमबद्ध किया। विश्वास कार्य की सत्यापनीयता और व्यावसायिक संदर्भ की पूर्णता का अनुसरण करता था, मॉडल क्षमता का नहीं: स्वचालित रिपोर्ट निर्माण को 83.5 और बॉयलरप्लेट कोड को 82.5 मिले, दोनों में मूल्यांकन का एक ही वस्तुनिष्ठ मापदंड है; वहीं सर्विस मेश कॉन्फ़िगरेशन को 37.5 और डिज़ास्टर रिकवरी परीक्षण को 43 मिले — वही अंतर्निहित मॉडल, बस यह जानने का कोई साफ़ तरीका नहीं कि आउटपुट सही था या नहीं। जवाबदेही ने 48% उत्तरदाताओं को और भ्रांतियों ने 47% को चिंतित किया, और 59% पहले से ही स्थायी मानवीय निगरानी की योजना बना रहे हैं (MIT Technology Review Insights, 2026)।

उत्पादन डेटा भी उसी दिशा में इशारा करता है। Perplexity के एजेंट उत्पाद की उसके सर्च उत्पाद से तुलना करने वाले एक अध्ययन में पाया गया कि समतुल्य कार्यों का निपटान 269 मिनट से घटकर 36 मिनट रह गया — समय में 87% और लागत में 94% की कमी — जबकि उपयोगकर्ताओं का अनुवर्ती कार्य ऊपर की ओर, सत्यापन और विस्तार की ओर खिसक गया (arXiv 2606.07489, 2026)।

मानवीय कार्य समीक्षा चरण में स्थानांतरित हो जाता है। McKinsey बस पहली संस्था है जिसने उसके उतरने की जगह पर कीमत लगाई है।

आयतन और पुन:उपयोग तय करते हैं कि गणित बैठता है या नहीं

McKinsey की अर्थव्यवस्था का दूसरा आधा हिस्सा स्थिर लागत है, और यही वह आधा हिस्सा है जो तय करता है कि मध्यम-बाज़ार के एजेंट कार्यक्रम सीमा पार करते भी हैं या नहीं।

सालाना 2,500 नए ग्राहकों की ऑनबोर्डिंग करने वाला संवादी एजेंट 10,000-15,000 डॉलर का पड़ता है। आयतन दोगुना कीजिए और लागत केवल 15,000-20,000 डॉलर तक बढ़ती है — क्योंकि AI अवसंरचना और एजेंट ऑर्केस्ट्रेशन काफ़ी हद तक स्थिर हैं, और स्थिर लागतें परिशोधित होती हैं। ध्यान दीजिए कि उस ऑर्केस्ट्रेशन मद के भीतर क्या है: एजेंट को प्रोडक्शन में बनाए रखने के लिए स्थायी डेटा साइंस क्षमता, जिसके बारे में McKinsey का अवलोकन है कि उसे "अक्सर हर कुछ दिनों में समायोजित करना पड़ता है"।

इसलिए कम आयतन वाले वर्कफ़्लो दो बार हारते हैं। उन्हें स्थिर लागत पर परिशोधन नहीं मिलता, और उनका निगरानी अनुपात ऊँचा बना रहता है क्योंकि उनमें कभी इतने रन्स जमा ही नहीं होते कि कोई अपवाद के प्रतिरूप पहचानकर उन्हें डिज़ाइन से हटा सके।

मध्यम-बाज़ार का निकास मार्ग पैमाना नहीं, पुन:उपयोग है। यदि कोई अकेला वर्कफ़्लो अवसंरचना और ऑर्केस्ट्रेशन मद को परिशोधित करने लायक आयतन नहीं लाता, तो प्रश्न यह बन जाता है कि एक ही एजेंट निर्माण पर कितने वर्कफ़्लो चल सकते हैं — McKinsey की रूपरेखा है: एक बार बनाइए, कई वर्कफ़्लो पर तैनात कीजिए। एक एजेंट, एक संदर्भ परत और एक समीक्षा प्रोटोकॉल साझा करने वाली तीन निकटवर्ती प्रक्रियाएँ उस स्थिर-लागत सीमा को पार कर लेती हैं जिसे उनमें से कोई अकेले पार नहीं करती। यह पहले पायलट से पहले लिया जाने वाला वास्तुशिल्पीय निर्णय है, और एक बार तीन टीमें अपना-अपना बिंदु-समाधान ख़रीद लें तो इसे बाद में लगाना बहुत कठिन हो जाता है।

यह असमानता अपनाने के आँकड़ों में दिखती है। McKinsey के State of AI 2026 में पाया गया कि 1 अरब डॉलर से अधिक राजस्व वाले संगठन जो एजेंट स्केल कर रहे हैं, 27% से बढ़कर 40% हो गए, जबकि 1 अरब डॉलर से कम वाले 22% पर स्थिर रहे। लगभग 20% ने बताया कि AI की परिचालन लागतों ने उनके उपयोग को सीमित किया, और AI को कम-से-कम कुछ EBIT प्रभाव देने वालों का हिस्सा साल-दर-साल अपरिवर्तित 37% पर रहा (McKinsey, 2026)।

अपनाना संचित होता है। रिपोर्ट किया गया वित्तीय प्रभाव नहीं। यह उस लागत-मद का हस्ताक्षर है जिसे कोई प्रबंधित नहीं कर रहा।

ईमानदार प्रतिवाद: यह बैंकिंग है, और यह एक अनुमान है

दो चेतावनियाँ जिन्हें आपको अपने CFO के बजाय मुझसे सुनना चाहिए।

पहली, 70-75% का आँकड़ा विनियमित, ग्राहकोन्मुख वित्तीय सेवाओं से लिया गया है। निगरानी की तीव्रता नियामकीय जोखिम और त्रुटि के परिणाम का फलन है। 200 लोगों की लॉजिस्टिक्स कंपनी में आंतरिक टिकट छँटाई एक अलग वक्र पर है, और वहाँ बँटवारा बराबरी के अधिक क़रीब हो सकता है।

दूसरी, ये सार्वजनिक मूल्य-सूची और सार्वजनिक शोध पर बनी प्रतिरूपित लागतें हैं, किसी ग्राहक परियोजना में मापी गई बहियाँ नहीं। इन्हें सुपरिभाषित अनुमान मानिए, माप नहीं।

पर ध्यान दीजिए कि त्रुटि किस दिशा में जाती है। टोकन की क़ीमतें लगातार गिरी हैं और गिरती रहेंगी। समीक्षकों के वेतन न गिरे हैं, न गिरेंगे। बीतता हर महीना अनुपात को टोकन के और अधिक विरुद्ध ले जाता है, उनकी ओर वापस नहीं। यदि 70-75% आज आपके संदर्भ के लिए ग़लत है, तो ईमानदार सुधार यह पूछना है कि अठारह महीनों में यह क्या बनेगा — यह मान लेना नहीं कि यह वापस उस स्तर पर आ जाएगा जिसे टोकन डैशबोर्ड देख सकता है।

पायलट स्वीकृत करने से पहले समीक्षा के घंटों की कीमत लगाइए

अगले एजेंट प्रस्ताव के मूल्यांकन के तरीके में पाँच बदलाव।

  1. अपवाद दर को बिज़नेस केस में एक नामित संख्या के रूप में रखिए। मानवीय समीक्षा वाले रन्स का प्रतिशत, प्रति समीक्षा अपेक्षित मिनट, समीक्षक की भारित प्रति घंटा लागत। यदि इन तीन आँकड़ों पर कोई प्रतिबद्ध नहीं होता, तो आपके पास बिज़नेस केस नहीं है — बजट नत्थी किया हुआ एक डेमो है।
  2. दायरा बढ़ाने से पहले सत्यापनीयता का निर्माण कीजिए। MIT–Microsoft की रैंकिंग दिखाती है कि विश्वास उन कार्यों का अनुसरण करता है जिनका एक ही पठनीय सफलता-मापदंड हो। यह गुण बनाया जा सकता है: मापदंड को उपकरणीकृत कीजिए, व्यावसायिक संदर्भ को कूटबद्ध कीजिए, दायरा सँकरा कीजिए। तैनाती का क्रम सत्यापनीयता से तय कीजिए, इससे नहीं कि कौन-सा कार्य सबसे सरल दिखता है।
  3. संभावित वर्कफ़्लो को पहले वार्षिक रन संख्या से क्रमबद्ध कीजिए। स्थिर लागत को परिशोधित पुन:उपयोग और आयतन ही करते हैं। कम आयतन वाला चतुर उपयोग-प्रकरण, ऊँचे आयतन वाले नीरस प्रकरण से हर बार ख़राब निवेश होता है।
  4. रखरखाव की मद का बजट स्पष्ट रूप से बनाइए। हर कुछ दिनों में समायोजित होने वाले एजेंटों के लिए स्थायी इंजीनियरिंग क्षमता चाहिए। यह स्थायी स्थिर लागत है, परियोजना व्यय नहीं।
  5. पूर्ण हुए काम का ROI रिपोर्ट कीजिए। काम पूरा करने की पूर्णतः भारित लागत — मनुष्य, एजेंट और नियतात्मक प्रणालियाँ मिलाकर — काम के मूल्य के सापेक्ष मापी गई। प्रति टोकन लागत नहीं, और सैद्धांतिक रूप से बचाए गए घंटे भी नहीं।

McKinsey का अपना नुस्ख़ा सहज-बोध के उलट है: मॉडल चयन को अनुकूलित करने के बजाय, वर्कफ़्लो को फिर से डिज़ाइन कीजिए ताकि अपवाद दर घटे और वे समीक्षा प्रक्रियाएँ सरल हों जो महँगे मानवीय हस्तक्षेप को जन्म देती हैं। यह प्रक्रिया-अभियांत्रिकी का आदेश है, जो उस चीज़ के भीतर बैठा है जिसे सब लोग ख़रीद-निर्णय मानते आए हैं।

इस तिमाही में क्या तय करना है

वह एजेंट पायलट खोजिए जो आपके हस्ताक्षर की प्रतीक्षा कर रहा है, और एक ऐसा आँकड़ा माँगिए जो प्रस्तुति में नहीं है: प्रति सौ रन्स अपेक्षित समीक्षक घंटे।

यदि उत्तर कंधे उचकाना हो, तो आपसे कोई सॉफ़्टवेयर स्वीकृत करने को नहीं कहा जा रहा। आपसे एक ऐसी समीक्षा टीम की नियुक्ति करने को कहा जा रहा है जिसका बजट किसी ने नहीं बनाया — और वह भी AI एजेंट लागत के उन्हीं तीन-चौथाई हिस्से पर, जिसे दिखाने के लिए आपका डैशबोर्ड कभी बनाया ही नहीं गया था।

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.