साइबरस्पेस में मशीन सीखने का एक संक्षिप्त इतिहास

जटिल खतरे परिदृश्य में सभी बिंदुओं को कैसे जोड़ा जाए

मूल रूप में प्रकाशित सुरक्षा घुसपैठ
लेखक डेविड बर्टनडॉ एलबर्ट ZHICHUN लाइट

डेवलपर्स खतरे की पहचान को स्वचालित करने के लिए मशीन लर्निंग (एमएल) का उपयोग करने में अधिक रुचि दिखा रहे हैं।

(छवि सौजन्य: बिगस्टॉक डॉट कॉम )

साइबर हमले की मात्रा बढ़ने के साथ ही सुरक्षा विश्लेषक भारी पड़ गए हैं। इस समस्या को हल करने के लिए, डेवलपर्स मशीन लर्निंग (एमएल) का उपयोग करने में अधिक रुचि दिखा रहे हैं ताकि खतरा-शिकार को स्वचालित किया जा सके। वास्तव में, शोधकर्ताओं ने 1980 के दशक के अंत से साइबर सुरक्षा समाधानों में एमएल को लागू करने की कोशिश की है, लेकिन प्रगति धीमी रही है। आज, ML बिग डेटा के आगमन के साथ बढ़ते हुए वादे को दिखा रहा है क्योंकि जानकारी की गुणवत्ता जिससे एमएल सीख सकता है सुधार कर रहा है। हालाँकि, अभी बहुत कुछ किया जाना बाकी है।

विसंगति का पता लगाने - प्रारंभिक दिनों

जब हम सुरक्षा की बात करते हैं, तो हम एक ऐसी प्रणाली चाहते हैं जो अच्छे और बुरे, सामान्य और असामान्य के बीच अंतर कर सके। इसलिए, सुरक्षा में विसंगति पहचान का उपयोग करना स्वाभाविक है। विसंगति पहचान की शुरुआत 1987¹ में मानी जा सकती है, जब शोधकर्ताओं ने घुसपैठ पहचान प्रणाली (IDS) बनाना शुरू किया था। लगभग 1998-1999 में, DARPA (इंटरनेट बनाने वाली सरकारी एजेंसी) ने मानक सेट तैयार किए और सुरक्षा में मशीन लर्निंग विधियों पर शोध का आह्वान किया²। दुर्भाग्य से, कुछ ही परिणाम व्यावहारिक साबित हुए और उससे भी कम उत्पाद परिचालन स्तर तक पहुँच पाए।

विसंगति का पता लगाने के अनूपर्वेटेड लर्निंग पर आधारित है, जो एक प्रकार का स्व-संगठित सीखने है जो पहले से मौजूद लेबल के उपयोग के बिना डेटा सेट में पहले से अज्ञात पैटर्न को खोजने में मदद करता है। संक्षेप में, अनिश्चित सीखने पर आधारित एक प्रणाली जानती है कि सामान्य क्या है, और विसंगति के रूप में असामान्य कुछ भी पहचानता है। उदाहरण के लिए, एक आईडी को पता चल सकता है कि 'सामान्य' ट्रैफ़िक कैसा दिखता है, और यह किसी भी ट्रैफ़िक वेरिएंट पर अलर्ट करेगा जो उस ज्ञान से मेल नहीं खाता है जैसे कि भेद्यता स्कैनर। संक्षेप में, अनिश्चित सीखने पर आधारित विसंगति का पता लगाने की प्रणाली एक द्विआधारी निर्णय (सामान्य / असामान्य) बनाती है और परिष्कृत मूल्यांकन नहीं करती है। कुछ लोग अनपेक्षित शिक्षण अनुप्रयोगों को 'वन-क्लास समस्याओं' के रूप में संदर्भित करते हैं।

जैसा कि आप कल्पना कर सकते हैं, बिना पढ़े-लिखे सीखने पर आधारित प्रणालियाँ बहुत सारी झूठी सकारात्मकताएँ पैदा कर सकती हैं, क्योंकि असामान्य रूप से समझी जाने वाली स्थिति पूरी तरह से सहज हो सकती है (फिर से भेद्यता स्कैनर पर विचार करें)। यह एक समस्या है जो सुरक्षा विश्लेषक आज भी संघर्ष करते हैं।

बिग डेटा का उदय

2000 के बाद, डेवलपर्स और शोधकर्ताओं ने पर्यवेक्षित शिक्षण के आधार पर स्पैम, फ़िशिंग और URL फ़िल्टरिंग सिस्टम बनाना शुरू किया। पर्यवेक्षित सीखने में, निर्णय एक कथित खतरे के खिलाफ डेटा (या लेबल) के एक सेट की तुलना पर आधारित होते हैं। ऐसा ही एक उदाहरण एक URL ब्लैकलिस्ट है, जहां आने वाले ई-मेल को अवांछनीय URL की सूची से मिलान किया जाता है और यदि यह सूची में किसी लेबल से मेल खाता है तो उसे अस्वीकार कर दिया जाता है। एक पर्यवेक्षित शिक्षण एल्गोरिथ्म डेटा का विश्लेषण करता है और एक हीन फ़ंक्शन का उत्पादन करता है (यानी, यह ट्रैफ़िक व्यवहार इस इनपुट डेटा से मेल खाता है, इसलिए यह खराब है), जिसका उपयोग नए उदाहरणों को मैप करने के लिए किया जा सकता है।

पर्यवेक्षित शिक्षण का उपयोग करने वाले प्रारंभिक फ़िल्टरिंग सिस्टम अपेक्षाकृत छोटे डेटासेट पर आधारित थे, लेकिन डेटासेट बिग डेटा के आगमन के साथ आकार और परिष्कार में विकसित हुए हैं। उदाहरण के लिए, जीमेल ज्ञात अच्छे पतों का एक इंटरनेट-स्केल डेटाबेस प्रदान करता है, और जो स्वीकार्य है उसके परिष्कृत मॉडल के साथ अपने एमएल इंजन को प्रशिक्षित करना आसान है।

बिग डेटा पर आधारित बड़े मॉडल (कई मापदंडों के संदर्भ में), जैसे कि गहन शिक्षण मॉडल, धीरे-धीरे अधिक लोकप्रिय हो गए हैं। उदाहरण के लिए, पर्यवेक्षित एमएल को सालों से एंटी-वायरस सिग्नेचर जनरेशन में सफलतापूर्वक उपयोग किया जाता है, और 2012 में, Cylance ने हस्ताक्षर के अलावा डेटासेट्स के आधार पर अगली पीढ़ी के एंटी-वायरस सिस्टम की पेशकश शुरू की, जैसे कि विषम यातायात व्यवहार।

सुपरवाइज्ड और अनसपर्विस्ड लर्निंग का मेल

पर्यवेक्षित शिक्षण ने सुरक्षा अनुप्रयोगों में अधिक सफलता दिखाई है, लेकिन इसके लिए लेबल किए गए डेटा के बड़े सेट तक आसान पहुंच की आवश्यकता होती है, जो कि साइबर अटैक जैसे कि एपीटी (उन्नत लगातार खतरे) और उद्यमों पर लक्षित शून्य-दिन के हमलों के लिए उत्पन्न करना बहुत मुश्किल है। इसलिए, हम आसानी से सभी साइबर हमले को हल करने के लिए पर्यवेक्षित एमएल को लागू नहीं कर सकते हैं।

यह वह जगह है जहाँ असुरक्षित सीखने की स्थिति में वापस आता है। हमें अतिरिक्त उन्नत एआई / एमएल विकसित करने की आवश्यकता है जो अतिरिक्त साइबर सुरक्षा चुनौतियों को हल करने के लिए अनपेक्षित या अर्ध-पर्यवेक्षित (जैसे, अनुकूली सीखने के माध्यम से) हो सकते हैं। अनुकूली शिक्षा (मानव-निर्देशित विश्लेषण) जो पर्यवेक्षित और अनुपयोगी शिक्षा के साथ मिलकर उन APT और शून्य-दिवस के कारनामों का पता लगाने की आपकी क्षमता को बेहतर बनाता है।

एक नई दिशा: डॉट्स कनेक्ट करना

सरल विसंगति का पता लगाने के साथ बड़ी समस्याओं में से एक झूठी सकारात्मकता की मात्रा है। इस मुद्दे को संबोधित करने का एक तरीका कई घटनाओं (डॉट्स) को सहसंबंधित करना और फिर मूल्यांकन करना है कि सहसंबंध साइबर हमले के लिए एक मजबूत संकेत दर्शाता है या नहीं। उदाहरण के लिए, एक 'डॉट' सुबह 2 बजे नेटवर्क में एक कार्यकारी लॉगिंग हो सकता है, और जबकि यह अकेले एक झूठी सकारात्मक के रूप में देखा जा सकता है, यह अलर्ट को ट्रिगर करने के लिए पर्याप्त नहीं होगा। हालाँकि, यदि कार्यकारी को रूस या चीन में एक आईपी पते से 2 बजे लॉग इन करते हुए देखा जाता है, तो यह अलर्ट को ट्रिगर करेगा।

डेवलपर्स और शोधकर्ता अब साइबर सुरक्षा उत्पादों में पर्यवेक्षित और अनुपयोगी सीखने का संयोजन कर रहे हैं। उदाहरण के लिए, स्टेलर साइबर की स्टारलाइट उत्पाद कई घटनाओं को सहसंबंधित करता है और मूल्यांकन करता है कि क्या, जब एक साथ देखा जाता है, तो वे एक खतरा पैदा करते हैं। यह दृष्टिकोण गलत सकारात्मकता को काफी कम कर देता है और विश्लेषकों को एपीटी या शून्य-दिवस के हमलों को अधिक तेज़ी से पहचानने में मदद करता है।

अगला सीमांत एमएल स्व-शिक्षण करना होगा, ताकि खतरों का पता लगाने और उनका जवाब देने के पिछले अनुभवों को संभावित खतरों के नए मूल्यांकन में शामिल किया जाएगा। इस प्रकार प्रणाली समय के साथ और अधिक सटीक विकसित होगी। कुछ सुरक्षा प्रणालियाँ आज स्व-शिक्षण तकनीक को लागू करने लगी हैं, लेकिन साइबर सुरक्षा में एमएल का इतिहास अपेक्षाकृत कम है, और भविष्य में बड़े पैमाने पर सुधार सामने आएंगे। जबकि सुरक्षा विश्लेषकों को हमेशा इस बारे में अंतिम निर्णय लेने की आवश्यकता होगी कि क्या एक खतरे को मारने के लिए, एमएल ठीक से लागू होने पर अपने काम को बहुत आसान बना सकते हैं।

सन्दर्भ:

[१] डी डेनिंग, "एक घुसपैठ-जांच मॉडल," सॉफ्टवेयर इंजीनियरिंग पर IEEE लेनदेन, वॉल्यूम। 1, नहीं। 13, पीपी 2-222, 232।

[२] आर। लिप्पमैन, आरके कनिंघम, डीजे फ्राइड, आई। ग्राफ, केआर केंडल, एसई वेबस्टर और एमए जिस्समैन, "2 के DARPA ऑफ-लाइन घुसपैठ का पता लगाने के मूल्यांकन, प्रोक में परिणाम"। घुसपैठ की पहचान में हालिया अग्रिम, 1998।

ऊपर स्क्रॉल करें