1,258 लोगों को AI एजेंटों के साथ जोड़िए, उनसे 7,266 डिस्प्ले विज्ञापन बनवाइए, फिर 1,168 स्वतंत्र मूल्यांकनकर्ताओं से उस काम को अंक दिलवाइए। पूरे प्रयोग-डिज़ाइन में सबसे खराब संयोजन न कोई कमज़ोर मॉडल था, न कोई अप्रशिक्षित उपयोगकर्ता। वह था बहिर्मुखी मनुष्य और कर्तव्यनिष्ठ AI का साथ काम करना (Ju & Aral, PNAS, 2026)।
कर्तव्यनिष्ठा। वही गुण जिसकी ओर हर वेंडर डिफ़ॉल्ट रूप से अपने मॉडल को ढालता है — सावधान, विस्तृत, काम पर केंद्रित। गलत व्यक्ति को सौंपे जाने पर उसी ने प्रयोग का सबसे निम्न-गुणवत्ता वाला काम पैदा किया।
यही वह निष्कर्ष है जिस पर मिड-मार्केट ऑपरेशंस टीमों को ठहरकर सोचना चाहिए, क्योंकि लगभग सभी ने इसका उल्टा दाँव लगाया है: एक ही असिस्टेंट पर्सोना, एक बार कॉन्फ़िगर किया गया, सबके लिए लागू। यह अध्ययन पहला बड़े पैमाने का कारणात्मक प्रमाण है कि पर्सोना स्वयं एक प्रदर्शन चर है — और उसे वेंडर के डिफ़ॉल्ट पर छोड़ देना एक निर्णय है, तटस्थ स्थिति नहीं।
प्रयोग ने वास्तव में क्या मापा
हारंग जू (Johns Hopkins Carey Business School) और सिनान अराल (MIT Sloan, निदेशक, MIT Initiative on the Digital Economy) ने एक पूर्व-पंजीकृत यादृच्छिक प्रयोग किया: 1,258 प्रतिभागियों को बिग फाइव व्यक्तित्व गुणों पर मापा गया, फिर उन्हें ऐसे AI एजेंटों के साथ यादृच्छिक रूप से जोड़ा गया जिन्हें उन्हीं पाँच गुणों में से प्रत्येक का उच्च या निम्न स्तर स्वतंत्र रूप से प्रदर्शित करने का निर्देश दिया गया था (Ju & Aral, PNAS, 2026)।
टीमों के पास 40 मिनट, रीयल-टाइम चैट और समकालिक टेक्स्ट व इमेज एडिटिंग टूल थे, जिनसे एक वास्तविक थिंक टैंक की वार्षिक रिपोर्ट के लिए डिस्प्ले विज्ञापन बनाने थे। उत्पादन: 7,266 विज्ञापन। इसके बाद 1,168 स्वतंत्र मूल्यांकनकर्ताओं ने उन्हें टेक्स्ट और इमेज गुणवत्ता पर अंक दिए (MIT Sloan / EurekAlert, 2026)।
अब वह हिस्सा जो इसे महज़ प्रयोगशाला-परिणाम से आगे ले जाता है। शोधकर्ताओं ने विज्ञापनों को दो सप्ताह तक X पर चलाया — लगभग पचास लाख इंप्रेशन — और क्लिक-थ्रू दर तथा प्रति-क्लिक लागत मापी। आँका गया गुणवत्ता स्तर बाज़ार-प्रदर्शन का पूर्वानुमान निकला: बेहतर टेक्स्ट गुणवत्ता ने क्लिक-थ्रू दर लगभग 7 प्रतिशत बढ़ाई और प्रति-क्लिक लागत लगभग 30 सेंट घटाई (MIT Sloan / EurekAlert, 2026)।
डिज़ाइन के दो निर्णय ज़ोर देने योग्य हैं, क्योंकि यही इस काम को पहले से प्रचलित पर्सोना-चर्चाओं से अलग करते हैं। गुणों के स्तर यादृच्छिक रूप से सौंपे गए और स्वतंत्र रूप से बदले गए, इसलिए तुलना अलग-अलग टूल चुनने वाले स्व-चयनित उपयोगकर्ताओं के बीच नहीं है — यह कारणात्मक है। और अध्ययन ने मनुष्यों को उसी बिग फाइव उपकरण से मापा जिससे एजेंटों को निर्देशित किया गया था, और यही अंतःक्रिया को आकलन-योग्य बनाता है। अधिकांश वेंडर शोध बताते हैं कि उपयोगकर्ता किसी पर्सोना के बारे में क्या महसूस करते हैं। यह बताता है कि जोड़ी ने काम के साथ क्या किया।
तो कारण-शृंखला आद्योपांत पूरी है। पर्सोना की जोड़ी ने गुणवत्ता हिलाई। गुणवत्ता ने पैसा हिलाया।
जोड़ी तालिका: कौन-से संयोजन मददगार रहे, कौन-से नुकसानदेह
परिणाम "समान को समान से मिलाओ" तक सीमित नहीं हैं — और पढ़ने से पहले लगभग सभी यही मान बैठते हैं।
सबसे मज़बूत जोड़ियाँ रहीं: बहिर्मुखी मनुष्य के साथ बहिर्मुखी AI, कर्तव्यनिष्ठ मनुष्य के साथ कर्तव्यनिष्ठ AI, और अनुभव-खुले मनुष्य के साथ कर्तव्यनिष्ठ AI — यह अंतिम जोड़ी दर्पण नहीं, पूरक है (MIT Sloan / EurekAlert, 2026)।
जिन जोड़ियों ने गुणवत्ता को सार्थक रूप से गिराया, शोधपत्र के दिए क्रम में:
- बहिर्मुखी मनुष्य + कर्तव्यनिष्ठ AI — अध्ययन की सबसे निम्न गुणवत्ता
- कर्तव्यनिष्ठ मनुष्य + सहमतिशील (agreeable) AI
- तंत्रिकातापी (neurotic) मनुष्य + कर्तव्यनिष्ठ AI
दूसरी पंक्ति दो बार पढ़िए
कर्तव्यनिष्ठ AI तीन सबसे खराब जोड़ियों में से दो में और तीन सर्वश्रेष्ठ जोड़ियों में से दो में आता है। इन आँकड़ों में कोई सार्वभौमिक रूप से अच्छा पर्सोना नहीं है। कर्तव्यनिष्ठ एजेंट कर्तव्यनिष्ठ व्यक्ति को दिया जाए तो वह उपलब्ध सर्वश्रेष्ठ संयोजनों में था; वही एजेंट बहिर्मुखी व्यक्ति को दिया जाए तो सबसे खराब। एक ही कॉन्फ़िगरेशन, विपरीत परिणाम — पूरी तरह इस बात से तय कि वह किसे मिला।
और ध्यान दीजिए कि दूसरी पंक्ति वेंडर के मानक उत्तर का क्या करती है। सहमतिशील AI — सहायक, समायोजक, कभी प्रतिवाद न करने वाला — ने कर्तव्यनिष्ठ लोगों का उत्पादन गिरा दिया। उपयोगकर्ता-संतुष्टि के लिए सबसे अधिक ट्यून किया गया पर्सोना ठीक उसी समूह के लिए हानिकारक निकला जो आपका सबसे सावधानीपूर्ण काम करने की सर्वाधिक संभावना रखता है।
एक ही संगठन-व्यापी पर्सोना प्रदर्शन पर मौन कर क्यों है
यह रहा परिचालन अनुवाद, और यह असहज इसलिए है क्योंकि इसे ठीक करने में कुछ खर्च नहीं होता और कोई इसे माप नहीं रहा।
जब आप 300 लोगों पर एक ही असिस्टेंट कॉन्फ़िगरेशन लागू करते हैं, तो आप तटस्थ रोलआउट नहीं चला रहे। आप एक गैर-यादृच्छिक प्रयोग चला रहे हैं जिसमें आपके कार्यबल के एक हिस्से को ठीक वही जोड़ी सौंप दी गई है जिसे इस अध्ययन ने सबसे खराब परिणाम देने वाला पाया — और न उनके पास, न आपके पास ऐसा कोई उपकरण है जो इसे पकड़ सके। विफलता थोड़े कमज़ोर ड्राफ्ट, थोड़ा अधिक पुनर्कार्य और कुछ टीमों में इस धुँधले अहसास के रूप में दिखती है कि टूल "इतना उपयोगी नहीं है"। यह कभी लागत-मद के रूप में नहीं दिखती।
वह पुनर्कार्य सबसे महँगी जगह गिरता है। बैंकिंग के एजेंटिक वर्कफ़्लो पर McKinsey QuantumBlack का लागत विश्लेषण टोकन खर्च को एजेंट की परिवर्तनीय संचालन लागत का 20 से 25 प्रतिशत और कार्यात्मक व जोखिम विशेषज्ञों द्वारा मानवीय निगरानी को 70 से 75 प्रतिशत बताता है (McKinsey QuantumBlack, 2026)। इस ढाँचे में आउटपुट गुणवत्ता कोई नरम मापदंड नहीं है। उत्पादन के समय खोया हर गुणवत्ता-अंक समीक्षा दर पर चुकाया जाता है — उस वरिष्ठ व्यक्ति द्वारा जो जाँच करता है।
और जाँच कहीं नहीं जा रही। MIT Technology Review Insights और Microsoft के उस अध्ययन में, जिसमें 300 प्रौद्योगिकी अधिकारियों ने 101 एजेंटिक कार्यों को क्रमबद्ध किया, 59 प्रतिशत पहले से स्थायी मानवीय निगरानी की योजना बना रहे हैं, और भरोसा मॉडल की कच्ची क्षमता से अधिक कार्य की सत्यापन-योग्यता का अनुसरण करता है (MIT Technology Review Insights, 2026)।
इसलिए पर्सोना का बेमेल होना उपयोगकर्ता-अनुभव की शिकायत नहीं है। यह आपके AI स्टैक की सबसे बड़ी लागत-मद पर एक मौन गुणक है।
विचरण पहले से ही पद के भीतर है
यदि आप प्रमाण चाहते हैं कि यह केवल प्रयोगशाला में नहीं, आपकी अपनी कंपनी में मापने योग्य है, तो वह आपके अपनाव-आँकड़ों में पहले से मौजूद है। बिक, ब्लैंडिन, डेमिंग और शूमाकर ने राष्ट्रीय स्तर पर प्रतिनिधि सर्वेक्षण को विस्तृत O*NET कार्यों से जोड़कर पाया कि जनरेटिव AI के एक्सपोज़र माप कर्मचारियों के बीच अपनाव की भिन्नता का केवल लगभग आधा हिस्सा समझाते हैं — एक ही काम, एक ही टूल के साथ, लोग व्यवस्थित रूप से अलग-अलग ढंग से अपनाते हैं (NBER Working Paper 35677, 2026)।
आधा विचरण पदों के बीच नहीं, पद के भीतर है। अधिकांश ऑपरेशंस टीमें इसे प्रेरणा या प्रशिक्षण के खाते में डाल देती हैं। PNAS का परिणाम उसके एक हिस्से के लिए कम चापलूस और अधिक क्रियान्वयन-योग्य व्याख्या देता है: टूल उस व्यक्ति के लिए कॉन्फ़िगर है जो इसे इस्तेमाल नहीं कर रहा।
यह पुनर्रचना बदल देती है कि आप कम-अपनाव वाले समूह के साथ क्या करते हैं। जो टीम चुपचाप डिफ़ॉल्ट एजेंट से कमतर आउटपुट पा रही है, उसे एक और सक्षमता सत्र भेजना कारण को नहीं छूता — यह उन लोगों के घंटे बढ़ाता है जिनके ड्राफ्ट फिर भी सहकर्मियों से अधिक पुनर्कार्य माँगेंगे।
ईमानदार प्रतिवाद
तीन सीमाएँ, और वे मायने रखती हैं।
कार्य विज्ञापन निर्माण था, ऑपरेशंस नहीं। डिस्प्ले विज्ञापन बनाने वाले चालीस-मिनट के रचनात्मक सत्र आपकी तिमाही क्लोज़िंग, वेंडर ऑनबोर्डिंग या टिकट ट्रायेज नहीं हैं। व्यक्तित्व-जोड़ी ने किसी रचनात्मक कार्य में गुणवत्ता हिलाई — यह निष्कर्ष है; वह आपके वर्कफ़्लो में भी हिलाएगी — यह अनुमान है। इसे परखने योग्य मज़बूत पूर्वधारणा मानिए, तय नतीजा नहीं।
लेखकों की व्यावसायिक स्थिति है। जू और अराल ने Pairium की सह-स्थापना की, जो अध्ययन में प्रयुक्त Pairit प्रयोग-मंच बनाती और वितरित करती है (Ju & Aral, PNAS, 2026)। काम पूर्व-पंजीकृत है और PNAS में सहकर्मी-समीक्षित है, जो स्पष्ट खामियों को सीमित करता है — पर जिन शोधकर्ताओं के पास निष्कर्ष है, वही उपाय भी बेचते हैं, और यह आपकी व्याख्या का हिस्सा होना चाहिए।
सबको पूर्णता से जोड़ने की अपनी लागत है। इसी साहित्य के काम पाते हैं कि विविध AI पर्सोना मानव-AI सहयोगी विचार-सृजन में समरूपीकरण प्रभाव को कम करते हैं (Wan & Kalman, 2026)। हर जोड़ी को व्यक्तिगत आउटपुट गुणवत्ता के लिए अनुकूलित कीजिए और आप अपनी टीमों की सोच का विचरण दबा सकते हैं — बेहतर ड्राफ्ट, पर अधिक एक-जैसे ड्राफ्ट। यदि आपके कार्य को चमक नहीं, विस्तार चाहिए, तो यह अदला-बदली वास्तविक है।
इनमें से कुछ भी यथास्थिति को नहीं बचाता। डिफ़ॉल्ट कॉन्फ़िगरेशन इन सीमाओं के विरुद्ध बचाव नहीं है; यह एकमात्र विकल्प है जो आपके कार्यबल के किसी हिस्से के लिए गलत होना निश्चित है — और कोई आँकड़ा आपको नहीं बताता कि किस हिस्से के लिए।
इस तिमाही क्या तय करना है
चार कदम, किसी में नया वेंडर खर्च नहीं।
- पर्सोना को IT कॉन्फ़िगरेशन मानना बंद कीजिए। असिस्टेंट का सिस्टम प्रॉम्प्ट एक प्रदर्शन पैरामीटर है जिसके आउटपुट गुणवत्ता पर मापे गए प्रभाव हैं। जो AI सक्षमता का स्वामी है, वही इसका स्वामी है — और उसे वर्तमान सेटिंग का औचित्य देना होगा।
- ऐसे किसी कार्य में एक जोड़ी-परीक्षण चलाइए जो पहले से आकलन-योग्य आउटपुट देता है। कंटेंट, सपोर्ट उत्तर, प्रथम-ड्राफ्ट विश्लेषण। दो पर्सोना, यादृच्छिक आवंटन, एक तिमाही, अंध गुणवत्ता-मूल्यांकन। आप एक प्रकाशित डिज़ाइन को छोटे पैमाने पर दोहरा रहे हैं — यह सबसे सस्ता शोध है जो आप कभी करवाएँगे।
- उच्च-उत्पादन भूमिकाओं में अपने बहिर्मुखी और उच्च-तंत्रिकाताप वाले कर्मचारियों को सबसे ध्यान से देखिए। डिफ़ॉल्ट कर्तव्यनिष्ठ एजेंट के सामने अध्ययन ने यही दो मानव प्रोफ़ाइल चिह्नित कीं। यदि कोई स्पष्ट रूप से सक्षम व्यक्ति चुपचाप टूल से कम पा रहा है, तो बेमेल अब एक जीवंत परिकल्पना है, प्रशिक्षण की समस्या नहीं।
- पर्सोना आवंटन बनाने से पहले पर्सोना का विकल्प दीजिए। गुण-आधारित पूर्ण आवंटन के लिए व्यक्तित्व डेटा चाहिए, जो अधिकांश मिड-मार्केट कंपनियों के पास नहीं है और शायद वे रखना भी न चाहें। दो-तीन चयन-योग्य असिस्टेंट प्रोफ़ाइल बिना किसी शासन-जोखिम के प्रभाव का एक हिस्सा पकड़ लेते हैं।
AI के साथ व्यक्तित्व की जोड़ी अब एक मापा गया चर है जिस पर कीमत लगी है। आप इसे पहले से तय कर रहे हैं — एक बार, वैश्विक रूप से, यह स्वीकार करके कि वेंडर ने जो भेजा वही ठीक है।
इस तिमाही का सवाल यह नहीं है कि पर्सोना मायने रखता है या नहीं। PNAS ने उसका उत्तर दे दिया। सवाल यह है कि क्या आप यह निर्णय सबके लिए डिफ़ॉल्ट से लेते रहेंगे, और फिर नतीजे को मॉडल की गलती कहेंगे।