प्रौद्योगिकी

कोडिंग AI ने खुद को री-ट्रेन करके बग ठीक किए और अपनी सुरक्षा सीमाएं मिटा दीं

Adrian Kessler
हमें Google पर जोड़ें

एक AI कोडिंग एजेंट को, जिसे एक सॉफ्टवेयर रिपॉजिटरी तक पहुंच दी गई थी और एप्लिकेशन के गलत आउटपुट को सही करने के लिए कहा गया था, उसने समस्या को उस रास्ते से हल किया जिसे किसी ने भी निर्दिष्ट नहीं किया था: उसने रिपॉजिटरी के अंदर ट्रेनिंग डेटा और फाइन-ट्यूनिंग स्क्रिप्ट का पता लगाया, विफलताओं को दूर करने के लिए सिंथेटिक ट्रेनिंग रिकॉर्ड तैयार किए, फाइन-ट्यूनिंग रन को अंजाम दिया, और रिपॉजिटरी के स्वयं के डिप्लॉयमेंट टूलिंग का उपयोग करके संशोधित मॉडल को फिर से तैनात कर दिया। टेस्ट एक्यूरेसी शून्य से बढ़कर परफेक्ट स्कोर तक पहुंच गई। बग ठीक हो गया।

AI सुरक्षा फर्म Irregular के शोधकर्ताओं ने बुधवार को यह प्रयोग प्रकाशित किया। उन्होंने जो दस्तावेजित किया है, वह किसी विशिष्ट उत्पाद में कोई कमजोरी नहीं है — यह एक व्यवहार पैटर्न है जो स्वाभाविक रूप से तब उभरता है जब एक सक्षम कोडिंग एजेंट को वह पहुंच दी जाती है जो कई एंटरप्राइज डिप्लॉयमेंट पहले से ही प्रदान करते हैं।

सुरक्षा के निहितार्थ एक द्वितीयक परीक्षण में स्पष्ट रूप से सामने आते हैं। Irregular ने एक ऐसा मॉडल लिया जिसे प्रतिस्पर्धी कंपनियों के नामों के बारे में सवालों को अस्वीकार करने के लिए ट्रेन किया गया था — 10 सवाल, 10 इनकार — और इसे एजेंट को इस निर्देश के साथ दिया कि एप्लिकेशन बहुत अधिक उपयोगकर्ताओं के सवालों को अस्वीकार कर रहा है। एजेंट ने इनकार को संबोधित करने के लिए अपना ट्रेनिंग डेटा तैयार किया और मॉडल को फाइन-ट्यून किया। इसके बाद, उन्हीं 10 सवालों पर शून्य इनकार मिला। प्रतिबंध को किसी जेलब्रेक द्वारा ओवरराइड नहीं किया गया था। एजेंट ने बस इसे प्रशिक्षण के माध्यम से अस्तित्व से बाहर कर दिया था।

तीसरा परीक्षण एक अलग तरह की क्षति को ट्रैक करता है। Irregular ने छह सिंथेटिक मान — API कुंजियाँ और ईमेल पते — को उस ट्रेनिंग डेटा में एम्बेड किया जिसका एजेंट ने उपयोग किया। एजेंट द्वारा मॉडल को फिर से ट्रेन करने के बाद, संशोधित संस्करण ने पूछताछ करने पर उनमें से तीन मानों को शब्दशः पुन: प्रस्तुत किया। मूल मॉडल के पास उन तक कोई पहुंच नहीं थी। नए मॉडल के पास थी।

इनमें से किसी के लिए भी किसी असाधारण सेटअप की आवश्यकता नहीं है। इसके लिए जो चाहिए वह है शेल एक्सेस, मॉडल वेट पर राइट परमिशन, ट्रेनिंग यूटिलिटीज और डिप्लॉयमेंट टूलिंग। संगठन जो अपने बुनियादी ढांचे पर व्यापक रखरखाव अधिकारों के साथ AI एजेंट चलाते हैं — स्वचालित कोड पाइपलाइनों के लिए एक सामान्य कॉन्फ़िगरेशन — पहले से ही इन शर्तों को पूरा करते हैं।

यह जोखिम क्लाउड-होस्टेड AI सेवाओं तक नहीं फैलता है जहां मॉडल वेट एजेंट के लिए सुलभ नहीं हैं। एक मानक API के माध्यम से ChatGPT या Claude का एकीकरण कुछ भी फिर से ट्रेन नहीं कर सकता है। Irregular का निष्कर्ष विशेष रूप से उन ओपन-वेट मॉडल्स पर लागू होता है जो ऐसे वातावरण में तैनात किए जाते हैं जहां एजेंट पूरे स्टैक को नियंत्रित करता है। जैसे-जैसे उद्यम लागत और गोपनीयता कारणों से सेल्फ-होस्टेड मॉडल की ओर बढ़ रहे हैं, यह श्रेणी बढ़ रही है।

Irregular अनुशंसा करता है कि किसी भी एजेंट-संशोधित मॉडल को सेवा में लगाने से पहले अलग मानव अनुमोदन की आवश्यकता हो, ट्रेनिंग रन के लिए पूर्ण प्रोवेनेंस रिकॉर्ड बनाए रखा जाए, और तैनाती से पहले अपडेटेड मॉडल पर स्वतंत्र सुरक्षा मूल्यांकन चलाए जाएं। फर्म को उम्मीद है कि जैसे-जैसे AI कोडिंग एजेंट किसी दिए गए परिणाम के लिए सबसे सीधा रास्ता पहचानने की अपनी क्षमता में सुधार करेंगे, सेल्फ-रीट्रेनिंग अधिक बार सामने आएगी — भले ही वह रास्ता कार्य निर्धारित करने वाले लोगों द्वारा पूर्वानुमानित किया गया हो या नहीं। पूर्ण शोध पत्र इस पतझड़ में आने की उम्मीद है।

टैग: , , , , ,

हमें Google पर जोड़ें

चर्चा

0 टिप्पणियाँ हैं।