मुख्य सामग्री पर जाएँ

प्रश्न

कृत्रिम बुद्धिमत्ता मेरे डेटा को क्या देखती है?

दो अलग-अलग समय को अलग करना ज़रूरी है, जिन्हें शब्द ‘डेटा’ एक साथ मिला देता है। जनन के दौरान, आप जो लिखते हैं, अपना विवरण और संलग्न की गई फ़ाइलों का पाठ, वह विनिर्देश और कोड बनाने के लिए एक मॉडल प्रदाता को भेजा जाता है; प्रदाताओं के नाम गोपनीयता नीति में दिए गए हैं। बाद में, जब ऐप चलने लगती है, तो कुछ भी नहीं भेजा जाता, डिलीवर किया गया कोड अपनी निर्भरताओं में कोई कृत्रिम बुद्धिमत्ता क्लाइंट नहीं रखता, और सर्वर पर लिखी गई कॉन्फ़िगरेशन फ़ाइल में कोई API कुंजी नहीं होती। दूसरे शब्दों में, आपके ग्राहक, आपके सेवा अनुरोध, आपके सदस्य, जो भी डेटा आप बाद में ऐप में दर्ज करेंगे, वह संरचनात्मक रूप से किसी मॉडल तक पहुँच ही नहीं सकता, क्योंकि ऐप के कोड, कनेक्शन या कॉन्फ़िगरेशन में इसके लिए कोई प्रवेश-मार्ग नहीं है। बाहर जाने वाली एकमात्र सामग्री वह है जो आपने अपनी आवश्यकता का वर्णन करने के लिए लिखी है।

क्या जाता है मॉडल की ओर, और कब

जनन को आपके कारोबार को समझने की आवश्यकता होती है: यह आपका विवरण ही है जो उसे बताता है, इसलिए यह एक मॉडल प्रदाता को भेजा जाता है, साथ ही आपके द्वारा जोड़ी गई फ़ाइलों का पाठ भी भेजा जाता है। गोपनीयता नीति में इन प्रदाताओं के नाम दिए गए हैं, Anthropic, OpenAI, xAI और Google, और यह भी स्पष्ट किया गया है कि ये प्रसंस्करण यूरोपीय संघ के बाहर हो सकते हैं, जो यूरोपीय आयोग की मानक अनुबंधात्मक धाराओं द्वारा नियंत्रित हैं। यह कोई छोटा विवरण नहीं है जिसे पंक्तियों के बीच पढ़ना होगा: यह जनन की मूल सामग्री है, और ऐसा कोई संस्करण नहीं है जहाँ आपका विवरण आपके पास ही रहे और फिर भी आपके जैसी ऐप बन जाए।

इस स्थानांतरण का एक अंत होता है। यह जनन के दौरान होता है, विनिर्देश और फिर कोड बनाने के लिए, और यह केवल अगले जनन के समय दोबारा होता है, जब आप फिर से शुरू करते हैं, या कोई संशोधन माँगते हैं। इन दोनों के बीच कुछ भी नहीं होता। न तो निरंतर सिंक्रनाइज़ेशन होता है, न ही किसी मॉडल की ओर उपयोग का प्रवाह होता है, न ही आपकी ऐप की सामग्री का कोई पृष्ठभूमि विश्लेषण किया जाता है।

जो कभी भी नहीं जाता: आपके द्वारा बाद में दर्ज किए जाने वाले डेटा

डिप्लॉय की गई ऐप एक सामान्य सॉफ़्टवेयर है, और यह डिलीवर किए गए कोड के तीन स्थानों पर सत्यापित किया जा सकता है। इसकी निर्भरता सूची में कोई कृत्रिम बुद्धिमत्ता क्लाइंट नहीं है, केवल Next.js, React, Prisma और प्रदर्शन पुस्तकालय हैं। डिप्लॉय के समय सर्वर पर लिखी गई कॉन्फ़िगरेशन फ़ाइल केवल चार पंक्तियों की है: डेटाबेस का पता, दो तकनीकी गुप्त सूचनाएँ और एक बिल्ड संख्या; उसमें कोई API कुंजी नहीं है। और आपके डैशबोर्ड पर दिखाए गए आँकड़े आपके डेटाबेस पर निश्चित (डिटरमिनिस्टिक) क्वेरी द्वारा गणना किए जाते हैं, कभी भी किसी मॉडल द्वारा आपकी पंक्तियों को पढ़ने के लिए नहीं।

यह परिणाम उसी प्रश्न के लिए महत्वपूर्ण है जो उपयोगकर्ताओं को सबसे अधिक चिंतित करता है: क्या मेरे डेटा का उपयोग मॉडल के प्रशिक्षण में किया जाएगा? सबसे अनुकूल नहीं होने वाली परिस्थिति में भी, जिस सामग्री का प्रशिक्षण में उपयोग किया जा सकता है, वह केवल आपका प्रारंभिक विवरण हो सकता है: वह वाक्य जिसमें आप स्पष्ट करते हैं कि आप एक कार्यशाला, सेवा आवेदन और ग्राहकों का प्रबंधन करते हैं। कभी भी आपके ग्राहक रिकॉर्ड की सामग्री, आपके सेवा आवेदनों का इतिहास या आपके सदस्यों की सूची नहीं, क्योंकि ये पंक्तियाँ किसी भी समय मॉडल की ओर जाने का कोई मार्ग नहीं रखतीं।

संलग्न फ़ाइलें: दो मार्ग, लेकिन केवल एक मार्ग मॉडल से होकर गुज़रता है

संलग्न फ़ाइल हमेशा एक ही मार्ग का अनुसरण नहीं करती है, और कोड में इस अंतर को स्पष्ट रूप से पहचाना जा सकता है। एक स्प्रेडशीट, CSV, PDF या टेक्स्ट फ़ाइल को सर्वर पर सामान्य निकास उपकरणों द्वारा पढ़ा जाता है, कोई मॉडल फ़ाइल को स्वयं नहीं देखता। दूसरी ओर, एक फ़ोटो या स्क्रीनशॉट वास्तव में एक दृष्टि मॉडल को भेजा जाता है, जिसका कार्य ठीक उसे वर्णित करना है, यह कागज़ के फॉर्म या फोटोग्राफ़ किए गए टेबल को समझने का एकमात्र तरीका है।

एक बिंदु को स्पष्ट रूप से कहना ज़रूरी है, क्योंकि यह एक व्यावहारिक निर्णय को बदल देता है: फ़ाइल से निकाला गया पाठ, जो अधिकतम बारह हज़ार वर्णों तक हो सकता है, मॉडल को भेजे गए संदर्भ में शामिल हो जाता है। अतः आपके डेटा संरचना को दिखाने के लिए संलग्न की गई स्प्रेडशीट भी अपने पाठ के रूप में आपके विवरण के साथ भेजी जाती है। यदि उस फ़ाइल में वास्तविक व्यक्तिगत डेटा है, तो अच्छी प्रथा केवल एक वाक्य में समाहित है: सिर्फ़ हेडर पंक्ति और कुछ अज्ञातकरण किए गए उदाहरण पंक्तियाँ संलग्न करें। जनरेटर को आपके कॉलम की संरचना (स्कीमा) की आवश्यकता होती है, जैसे कॉलम के नाम, डेटा प्रकार और संबंध, लेकिन आपके ग्राहकों के वास्तविक नामों की नहीं।

जो गारंटी दी गई है, और जो नहीं

सबसे पहले एक स्पष्ट गारंटी, जो कोड में लिखी गई है: जब आप अपनी वास्तविक पंक्तियों के साथ शुरुआत करने के लिए एक CSV संलग्न करते हैं, तो ये पंक्तियाँ एक निश्चित मिलान प्रक्रिया द्वारा आपके डेटाबेस में रखी जाती हैं, विभाजक का पता लगाना, आपके हेडर और क्षेत्रों के बीच मिलान, प्रकार-आधारित रूपांतरण, और इस चरण में कोई मॉडल शामिल नहीं होता। कोड के उसी स्थान पर कारण स्पष्ट रूप से लिखा गया है: उपयोगकर्ता के डेटा को फिर से आविष्कार नहीं किया जाना चाहिए। यदि कोई मॉडल किसी सदस्य टेबल को ‘पूरा’ करने के लिए कहा जाए, तो वह ऐसी पंक्तियाँ बनाएगा जो तर्कसंगत लगेंगी लेकिन गलत होंगी, जो एकमात्र वास्तव में अस्वीकार्य परिणाम है।

इस पृष्ठ द्वारा दावा नहीं किया गया है कि प्रत्येक मॉडल प्रदाता की आंतरिक नीति क्या है, जो उन्हें भेजे गए डेटा के पुनः उपयोग के संबंध में है। यह उनकी अनुबंधात्मक प्रतिबद्धताओं का विषय है, न कि इस उत्पाद के व्यवहार का; गोपनीयता नीति में उनके नाम दिए गए हैं और स्थानांतरण के ढांचे का वर्णन किया गया है, और यहीं आपको जाँच करनी चाहिए। इस उत्पाद द्वारा गारंटी की गई बात है प्रवाह की सीमा, कौन सा डेटा बाहर जाता है, कब जाता है, और विशेष रूप से कौन सा डेटा कभी भी बाहर नहीं जाता। यही कारण है कि यह पैरामीटर संकीर्ण होने के कारण प्रशिक्षण का प्रश्न आपकी ग्राहक फ़ाइल पर नहीं आता।

और आगे जानने के लिए

मिलते-जुलते प्रश्न

अपनी आवश्यकता का वर्णन करें, अपने डेटा को सुरक्षित रखें