फीचर चयन: Difference between revisions
No edit summary |
No edit summary |
||
| Line 26: | Line 26: | ||
उपसमुच्चय चयन उपयुक्तता के लिए समूह के रूप में सुविधाओं के उपसमुच्चय का मूल्यांकन करता है। उपसमुच्चय [[खोज एल्गोरिथ्म]] को रैपर, फिल्टर और एम्बेडेड विधियों में विभाजित किया जा सकता है। रैपर्स संभावित सुविधाओं के स्थान के माध्यम से खोज करने के लिए खोज एल्गोरिदम का उपयोग करते हैं और उपसमुच्चय पर मॉडल चलाकर प्रत्येक उपसमुच्चय का मूल्यांकन करते हैं। रैपर कम्प्यूटेशनल रूप से मूल्यवान हो सकते हैं और मॉडल में अधिक फिट होने पर कठिन परिस्थिति हो सकती है। खोज दृष्टिकोण में फ़िल्टर रैपर के समान होते हैं, किन्तु यह किसी मॉडल के विरुद्ध मूल्यांकन करने के अतिरिक्त, सरल फ़िल्टर का मूल्यांकन किया जाता है। एंबेडेड तकनीकें मॉडल में अंतर्निहित और विशिष्ट होती हैं। | उपसमुच्चय चयन उपयुक्तता के लिए समूह के रूप में सुविधाओं के उपसमुच्चय का मूल्यांकन करता है। उपसमुच्चय [[खोज एल्गोरिथ्म]] को रैपर, फिल्टर और एम्बेडेड विधियों में विभाजित किया जा सकता है। रैपर्स संभावित सुविधाओं के स्थान के माध्यम से खोज करने के लिए खोज एल्गोरिदम का उपयोग करते हैं और उपसमुच्चय पर मॉडल चलाकर प्रत्येक उपसमुच्चय का मूल्यांकन करते हैं। रैपर कम्प्यूटेशनल रूप से मूल्यवान हो सकते हैं और मॉडल में अधिक फिट होने पर कठिन परिस्थिति हो सकती है। खोज दृष्टिकोण में फ़िल्टर रैपर के समान होते हैं, किन्तु यह किसी मॉडल के विरुद्ध मूल्यांकन करने के अतिरिक्त, सरल फ़िल्टर का मूल्यांकन किया जाता है। एंबेडेड तकनीकें मॉडल में अंतर्निहित और विशिष्ट होती हैं। | ||
अनेक लोकप्रिय खोज दृष्टिकोण ग्रीडी एल्गोरिदम [[पहाड़ी की चढ़ाई|हिल क्लिंबिंग]] का उपयोग करते हैं, जो सुविधाओं के उम्मीदवार उपसमूह का पुनरावृत्तीय मूल्यांकन करता है, फिर उपसमूह को संशोधित करता है और मूल्यांकन करता है कि क्या नया उपसमूह पुराने की तुलना में सही है। उपसमुच्चय के मूल्यांकन के लिए स्कोरिंग मीट्रिक (गणित) की आवश्यकता होती है जो सुविधाओं के उपसमूह को ग्रेड करती है। व्यापक खोज सामान्यतः अव्यावहारिक होती है, इसलिए कुछ कार्यान्वयनकर्ता (या ऑपरेटर) परिभाषित स्टॉपिंग बिंदु पर होते हैं, उस बिंदु तक खोजे गए उच्चतम स्कोर वाले सुविधाओं के उपसमुच्चय को संतबषजनक सुविधा उपसमुच्चय के रूप में चुना जाता है। इसको रोकने का मानदंड एल्गोरिथम के अनुसार भिन्न होता है |इस प्रकार यह संभावित मानदंडों में सम्मिलित हैं | उपसमुच्चय स्कोर सीमा से अधिक होता है | कार्य का अधिकतम अनुमत रन | अनेक लोकप्रिय खोज दृष्टिकोण ग्रीडी एल्गोरिदम [[पहाड़ी की चढ़ाई|हिल क्लिंबिंग]] का उपयोग करते हैं, जो सुविधाओं के उम्मीदवार उपसमूह का पुनरावृत्तीय मूल्यांकन करता है, फिर उपसमूह को संशोधित करता है और मूल्यांकन करता है कि क्या नया उपसमूह पुराने की तुलना में सही है। उपसमुच्चय के मूल्यांकन के लिए स्कोरिंग मीट्रिक (गणित) की आवश्यकता होती है जो सुविधाओं के उपसमूह को ग्रेड करती है। व्यापक खोज सामान्यतः अव्यावहारिक होती है, इसलिए कुछ कार्यान्वयनकर्ता (या ऑपरेटर) परिभाषित स्टॉपिंग बिंदु पर होते हैं, उस बिंदु तक खोजे गए उच्चतम स्कोर वाले सुविधाओं के उपसमुच्चय को संतबषजनक सुविधा उपसमुच्चय के रूप में चुना जाता है। इसको रोकने का मानदंड एल्गोरिथम के अनुसार भिन्न होता है |इस प्रकार यह संभावित मानदंडों में सम्मिलित हैं | उपसमुच्चय स्कोर सीमा से अधिक होता है | कार्य का अधिकतम अनुमत रन टाइम सरपास्ड हो गया है | | ||
वैकल्पिक खोज-आधारित तकनीकें [[लक्षित प्रक्षेपण खोज]] पर आधारित होती हैं जो उच्च स्कोर वाले डेटा के निम्न-आयामी अनुमानों का पता लगाती हैं | फिर उन विशेषताओं का चयन किया जाता है जिनके निचले-आयामी स्थान में सबसे बड़े प्रक्षेपण होते हैं। | वैकल्पिक खोज-आधारित तकनीकें [[लक्षित प्रक्षेपण खोज]] पर आधारित होती हैं जो उच्च स्कोर वाले डेटा के निम्न-आयामी अनुमानों का पता लगाती हैं | फिर उन विशेषताओं का चयन किया जाता है जिनके निचले-आयामी स्थान में सबसे बड़े प्रक्षेपण होते हैं। | ||
| Line 43: | Line 43: | ||
</ref><ref>{{Cite book|chapter-url=https://dl.acm.org/doi/abs/10.1145/3449726.3459481|doi = 10.1145/3449726.3459481|chapter = Scatter search for high-dimensional feature selection using feature grouping|title = आनुवंशिक और विकासवादी संगणना सम्मेलन साथी की कार्यवाही|year = 2021|last1 = García-Torres|first1 = Miguel|last2 = Gómez-Vela|first2 = Francisco|last3 = Divina|first3 = Federico|last4 = Pinto-Roa|first4 = Diego P.|last5 = Noguera|first5 = José Luis Vázquez|last6 = Román|first6 = Julio C. Mello|pages = 149–150|isbn = 9781450383516|s2cid = 235770316}}</ref> | </ref><ref>{{Cite book|chapter-url=https://dl.acm.org/doi/abs/10.1145/3449726.3459481|doi = 10.1145/3449726.3459481|chapter = Scatter search for high-dimensional feature selection using feature grouping|title = आनुवंशिक और विकासवादी संगणना सम्मेलन साथी की कार्यवाही|year = 2021|last1 = García-Torres|first1 = Miguel|last2 = Gómez-Vela|first2 = Francisco|last3 = Divina|first3 = Federico|last4 = Pinto-Roa|first4 = Diego P.|last5 = Noguera|first5 = José Luis Vázquez|last6 = Román|first6 = Julio C. Mello|pages = 149–150|isbn = 9781450383516|s2cid = 235770316}}</ref> | ||
* [[परिवर्तनीय पड़ोस खोज|परिवर्तनीय निकटतम खोज]] <ref>F.C. Garcia-Lopez, M. Garcia-Torres, B. Melian, J.A. Moreno-Perez, J.M. Moreno-Vega. [https://web.archive.org/web/20190830132140/https://pdfs.semanticscholar.org/9428/2985d2c2ea4eb9f49846bedc12003a47db49.pdf Solving Feature Subset Selection Problem by a Hybrid Metaheuristic]. In ''First International Workshop on Hybrid Metaheuristics'', pp. 59–68, 2004.</ref><ref>M. Garcia-Torres, F. Gomez-Vela, B. Melian, J.M. Moreno-Vega. [https://www.researchgate.net/profile/Miguel_Garcia_Torres/publication/229763203_Parallel_Scatter_Search/links/5b2788a00f7e9be8bdaeb0d0/Parallel-Scatter-Search.pdf High-dimensional feature selection via feature grouping: A Variable Neighborhood Search approach], ''Information Sciences'', vol. 326, pp. 102-118, 2016.</ref> | * [[परिवर्तनीय पड़ोस खोज|परिवर्तनीय निकटतम खोज]] <ref>F.C. Garcia-Lopez, M. Garcia-Torres, B. Melian, J.A. Moreno-Perez, J.M. Moreno-Vega. [https://web.archive.org/web/20190830132140/https://pdfs.semanticscholar.org/9428/2985d2c2ea4eb9f49846bedc12003a47db49.pdf Solving Feature Subset Selection Problem by a Hybrid Metaheuristic]. In ''First International Workshop on Hybrid Metaheuristics'', pp. 59–68, 2004.</ref><ref>M. Garcia-Torres, F. Gomez-Vela, B. Melian, J.M. Moreno-Vega. [https://www.researchgate.net/profile/Miguel_Garcia_Torres/publication/229763203_Parallel_Scatter_Search/links/5b2788a00f7e9be8bdaeb0d0/Parallel-Scatter-Search.pdf High-dimensional feature selection via feature grouping: A Variable Neighborhood Search approach], ''Information Sciences'', vol. 326, pp. 102-118, 2016.</ref> | ||
वर्गीकरण समस्याओं के लिए दो लोकप्रिय फ़िल्टर मेट्रिक्स सहसंबंध और पारस्परिक सूचना हैं,चूंकि गणितीय अर्थ में कोई भी वास्तविक मीट्रिक (गणित) या 'दूरी माप' नहीं है, क्योंकि वह त्रिकोण असमानता का पालन करने में विफल रहते हैं और इस प्रकार किसी भी वास्तविक 'दूरी' की गणना नहीं करते हैं - उन्हें 'स्कोर' के रूप में माना जाना चाहिए। इन अंकों की गणना उम्मीदवार सुविधा (या सुविधाओं के समुच्चय) और वांछित आउटपुट श्रेणी के मध्य की जाती है। चूँकि, यह ऐसे | वर्गीकरण समस्याओं के लिए दो लोकप्रिय फ़िल्टर मेट्रिक्स सहसंबंध और पारस्परिक सूचना हैं,चूंकि गणितीय अर्थ में कोई भी वास्तविक मीट्रिक (गणित) या 'दूरी माप' नहीं है, क्योंकि वह त्रिकोण असमानता का पालन करने में विफल रहते हैं और इस प्रकार किसी भी वास्तविक 'दूरी' की गणना नहीं करते हैं - उन्हें 'स्कोर' के रूप में माना जाना चाहिए। इन अंकों की गणना उम्मीदवार सुविधा (या सुविधाओं के समुच्चय) और वांछित आउटपुट श्रेणी के मध्य की जाती है। चूँकि, यह ऐसे सत्य मेट्रिक्स होते हैं जो पारस्परिक सूचना का सरल कार्य करते हैं <ref>{{Cite journal|arxiv=q-bio/0311039|last1=Kraskov|first1=Alexander|title=पारस्परिक सूचना पर आधारित पदानुक्रमित क्लस्टरिंग|last2=Stögbauer|first2=Harald|last3=Andrzejak|first3=Ralph G|last4=Grassberger|first4=Peter|year=2003|bibcode=2003q.bio....11039K}}</ref> तथा आपसी सूचना या मीट्रिक देखें। | ||
अन्य उपलब्ध फ़िल्टर मेट्रिक्स में सम्मिलित हैं | | अन्य उपलब्ध फ़िल्टर मेट्रिक्स में सम्मिलित हैं | | ||
| Line 56: | Line 56: | ||
==अधिकतमता मानदंड== | ==अधिकतमता मानदंड== | ||
अधिकतमता मानदंड का चुनाव कठिन होता है क्योंकि सुविधा चयन कार्य में अनेक उद्देश्य होते हैं। अनेक सामान्य मानदंडों में स्पष्टता की माप सम्मिलित होता है, जिसे चयनित सुविधाओं की संख्या द्वारा दंडित किया जाता है। उदाहरणों में अकाइक सूचना मानदंड (एआईसी) और मैलोज़ | अधिकतमता मानदंड का चुनाव कठिन होता है क्योंकि सुविधा चयन कार्य में अनेक उद्देश्य होते हैं। अनेक सामान्य मानदंडों में स्पष्टता की माप सम्मिलित होता है, जिसे चयनित सुविधाओं की संख्या द्वारा दंडित किया जाता है। उदाहरणों में अकाइक सूचना मानदंड (एआईसी) और मैलोज़ C<sub>p</sub> सम्मिलित हैं | जिनमें प्रत्येक अतिरिक्त सुविधा के लिए 2 का दंड है। यह एआईसी [[सूचना सिद्धांत]] पर आधारित है, और प्रभावी रूप से [[अधिकतम एन्ट्रापी सिद्धांत]] के माध्यम से प्राप्त होता है। <ref>{{Citation | first=H. |last=Akaike |author-link=Hirotugu Akaike | contribution = Prediction and entropy | pages=1–24 | title= A Celebration of Statistics | editor1-first= A. C. | editor1-last= Atkinson | editor2-first= S. E. | editor2-last= Fienberg | editor2-link= Stephen Fienberg | year = 1985 | publisher= Springer|url=https://apps.dtic.mil/dtic/tr/fulltext/u2/a120956.pdf|archive-url=https://web.archive.org/web/20190830132141/https://apps.dtic.mil/dtic/tr/fulltext/u2/a120956.pdf|url-status=live|archive-date=August 30, 2019}}.</ref><ref>{{Citation |last1=Burnham |first1=K. P. |last2=Anderson |first2=D. R. |year=2002 |title=Model Selection and Multimodel Inference: A practical information-theoretic approach |edition=2nd |publisher= [[Springer-Verlag]] |url=https://books.google.com/books?id=fT1Iu-h6E-oC|isbn=9780387953649 }}.</ref> | ||
अन्य मानदंड [[बायेसियन सूचना मानदंड]] (बीआईसी) हैं, जो प्रत्येक जोड़े गए फीचर के लिए <math>\sqrt{\log{n}}</math> के दंड का उपयोग करता है, [[न्यूनतम विवरण लंबाई]] (एमडीएल) जो असम्बद्ध रूप से <math>\sqrt{\log{n}}</math> का उपयोग करता है, [[बोनफेरोनी सुधार]] / आरआईसी जो <math>\sqrt{2\log{p}}</math> का उपयोग करता है, अधिकतम निर्भरता सुविधा चयन, और विभिन्न प्रकार के नए मानदंड जो [[झूठी खोज दर|फाल्स डिस्कवर रेट]] (एफडीआर) से प्रेरित हैं, जो <math>\sqrt{2\log{\frac{p}{q}}}</math> के समीप कुछ का उपयोग करते हैं। सुविधाओं के सबसे प्रासंगिक उपसमूह का चयन करने के लिए अधिकतम [[एन्ट्रापी दर]] मानदंड का भी उपयोग किया जा सकता है। <ref>{{cite journal |last1=Einicke |first1=G. A. |title=दौड़ने के दौरान घुटने और टखने की गतिशीलता में परिवर्तन को वर्गीकृत करने के लिए सुविधाओं का अधिकतम-एंट्रॉपी दर चयन|journal=IEEE Journal of Biomedical and Health Informatics |volume=28 |issue=4 |pages=1097–1103 |year=2018 |doi= 10.1109/JBHI.2017.2711487 |pmid=29969403 |s2cid=49555941 }}</ref> | अन्य मानदंड [[बायेसियन सूचना मानदंड]] (बीआईसी) हैं, जो प्रत्येक जोड़े गए फीचर के लिए <math>\sqrt{\log{n}}</math> के दंड का उपयोग करता है, [[न्यूनतम विवरण लंबाई]] (एमडीएल) जो असम्बद्ध रूप से <math>\sqrt{\log{n}}</math> का उपयोग करता है, [[बोनफेरोनी सुधार]] / आरआईसी जो <math>\sqrt{2\log{p}}</math> का उपयोग करता है, अधिकतम निर्भरता सुविधा चयन, और विभिन्न प्रकार के नए मानदंड जो [[झूठी खोज दर|फाल्स डिस्कवर रेट]] (एफडीआर) से प्रेरित हैं, जो <math>\sqrt{2\log{\frac{p}{q}}}</math> के समीप कुछ का उपयोग करते हैं। सुविधाओं के सबसे प्रासंगिक उपसमूह का चयन करने के लिए अधिकतम [[एन्ट्रापी दर]] मानदंड का भी उपयोग किया जा सकता है। <ref>{{cite journal |last1=Einicke |first1=G. A. |title=दौड़ने के दौरान घुटने और टखने की गतिशीलता में परिवर्तन को वर्गीकृत करने के लिए सुविधाओं का अधिकतम-एंट्रॉपी दर चयन|journal=IEEE Journal of Biomedical and Health Informatics |volume=28 |issue=4 |pages=1097–1103 |year=2018 |doi= 10.1109/JBHI.2017.2711487 |pmid=29969403 |s2cid=49555941 }}</ref> | ||
| Line 70: | Line 70: | ||
चारों ओर विभिन्न फीचर चयन तंत्र हैं जो विभिन्न सुविधाओं को स्कोर करने के लिए पारस्परिक सूचना का उपयोग करते हैं। वह सामान्यतः सभी समान एल्गोरिदम का उपयोग करते हैं | | चारों ओर विभिन्न फीचर चयन तंत्र हैं जो विभिन्न सुविधाओं को स्कोर करने के लिए पारस्परिक सूचना का उपयोग करते हैं। वह सामान्यतः सभी समान एल्गोरिदम का उपयोग करते हैं | | ||
#सभी सुविधाओं (<math> f_{i} \in F </math>) और लक्ष्य वर्ग ({{mvar|c}}) के मध्य स्कोर के रूप में पारस्परिक सूचना की गणना करें | #सभी सुविधाओं (<math> f_{i} \in F </math>) और लक्ष्य वर्ग ({{mvar|c }}) के मध्य स्कोर के रूप में पारस्परिक सूचना की गणना करें | ||
# सबसे बड़े स्कोर वाली सुविधा का चयन करें (उदाहरण के लिए . <math>\underset{f_{i} \in F}\operatorname{argmax}(I(f_{i},c))</math>) और इसे चयनित सुविधाओं ({{mvar|S}}) के समुच्चय में जोड़ें | # सबसे बड़े स्कोर वाली सुविधा का चयन करें (उदाहरण के लिए . <math>\underset{f_{i} \in F}\operatorname{argmax}(I(f_{i},c))</math>) और इसे चयनित सुविधाओं ({{mvar|S }}) के समुच्चय में जोड़ें | ||
# उस स्कोर की गणना करें जो पारस्परिक सूचना से प्राप्त किया जा सकता है | # उस स्कोर की गणना करें जो पारस्परिक सूचना से प्राप्त किया जा सकता है | ||
# सबसे बड़े स्कोर वाली सुविधा का चयन करें और इसे चुनिंदा सुविधाओं के समुच्चय में जोड़ें (उदाहरण के लिए) <math>\underset{f_{i} \in F}\operatorname{argmax}(I_{derived}(f_{i},c))</math>) | # सबसे बड़े स्कोर वाली सुविधा का चयन करें और इसे चुनिंदा सुविधाओं के समुच्चय में जोड़ें (उदाहरण के लिए) <math>\underset{f_{i} \in F}\operatorname{argmax}(I_{derived}(f_{i},c))</math>) | ||
| Line 81: | Line 81: | ||
===न्यूनतम-अतिरेक-अधिकतम-प्रासंगिकता (एमआरएमआर) सुविधा चयन=== | ===न्यूनतम-अतिरेक-अधिकतम-प्रासंगिकता (एमआरएमआर) सुविधा चयन=== | ||
पेंग एट अल.<ref>{{cite journal |last1=Peng |first1=H. C. |last2=Long |first2=F. |last3=Ding |first3=C. |title=Feature selection based on mutual information: criteria of max-dependency, max-relevance, and min-redundancy |journal= [[IEEE Transactions on Pattern Analysis and Machine Intelligence]] |volume=27 |issue=8 |pages=1226–1238 |year=2005 |doi=10.1109/TPAMI.2005.159 |pmid=16119262|citeseerx=10.1.1.63.5765 |s2cid=206764015 }} [http://home.penglab.com/proj/mRMR/index.htm Program]</ref> सुविधा चयन विधि प्रस्तावित की गई जो सुविधाओं का चयन करने के लिए पारस्परिक सूचना , सहसंबंध, या दूरी/समानता स्कोर का उपयोग कर सकती है। इसका उद्देश्य अन्य चयनित सुविधाओं की उपस्थिति में किसी सुविधा की प्रासंगिकता को उसके अतिरेक द्वारा दंडित करना है। क्लास {{mvar|c}} के लिए फीचर सम्मुचय {{mvar|S}} की प्रासंगिकता को व्यक्तिगत फीचर {{math|''f<sub>i</sub>''}} और क्लास {{mvar|c}} के मध्य सभी पारस्परिक सूचना मानों के औसत मान से द्वारा परिभाषित किया गया है | | पेंग एट अल.<ref>{{cite journal |last1=Peng |first1=H. C. |last2=Long |first2=F. |last3=Ding |first3=C. |title=Feature selection based on mutual information: criteria of max-dependency, max-relevance, and min-redundancy |journal= [[IEEE Transactions on Pattern Analysis and Machine Intelligence]] |volume=27 |issue=8 |pages=1226–1238 |year=2005 |doi=10.1109/TPAMI.2005.159 |pmid=16119262|citeseerx=10.1.1.63.5765 |s2cid=206764015 }} [http://home.penglab.com/proj/mRMR/index.htm Program]</ref> सुविधा चयन विधि प्रस्तावित की गई जो सुविधाओं का चयन करने के लिए पारस्परिक सूचना , सहसंबंध, या दूरी/समानता स्कोर का उपयोग कर सकती है। इसका उद्देश्य अन्य चयनित सुविधाओं की उपस्थिति में किसी सुविधा की प्रासंगिकता को उसके अतिरेक द्वारा दंडित करना है। क्लास {{mvar|c }} के लिए फीचर सम्मुचय {{mvar|S }} की प्रासंगिकता को व्यक्तिगत फीचर {{math|''f<sub>i</sub>'' }} और क्लास {{mvar|c }} के मध्य सभी पारस्परिक सूचना मानों के औसत मान से द्वारा परिभाषित किया गया है | | ||
:<math> D(S,c) = \frac{1}{|S|}\sum_{f_{i}\in S}I(f_{i};c) </math>. | :<math> D(S,c) = \frac{1}{|S|}\sum_{f_{i}\in S}I(f_{i};c) </math>. | ||
समुच्चय में सभी सुविधाओं का अतिरेक {{mvar|S}} सुविधा के मध्य सभी पारस्परिक सूचना मानों का औसत मान {{math|''f<sub>i</sub>''}} और सुविधा {{math|''f<sub>j</sub>''}} है | | समुच्चय में सभी सुविधाओं का अतिरेक {{mvar|S }} सुविधा के मध्य सभी पारस्परिक सूचना मानों का औसत मान {{math|''f<sub>i</sub>'' }} और सुविधा {{math|''f<sub>j</sub>'' }} है | | ||
:<math> R(S) = \frac{1}{|S|^{2}}\sum_{f_{i},f_{j}\in S}I(f_{i};f_{j})</math> | :<math> R(S) = \frac{1}{|S|^{2}}\sum_{f_{i},f_{j}\in S}I(f_{i};f_{j})</math> | ||
| Line 93: | Line 93: | ||
\left[\frac{1}{|S|}\sum_{f_{i}\in S}I(f_{i};c) - | \left[\frac{1}{|S|}\sum_{f_{i}\in S}I(f_{i};c) - | ||
\frac{1}{|S|^{2}}\sum_{f_{i},f_{j}\in S}I(f_{i};f_{j})\right].</math> | \frac{1}{|S|^{2}}\sum_{f_{i},f_{j}\in S}I(f_{i};f_{j})\right].</math> | ||
मान लीजिए कि {{mvar|n}} पूर्ण-समुच्चय सुविधाएँ हैं। मान लीजिए {{math|''x<sub>i</sub>''}} फीचर {{math|''f<sub>i</sub>''}} के लिए समुच्चय सदस्यता संकेतक फलन है, जिससे {{math|1=''x<sub>i</sub>''=1}} उपस्थिति को संकेत करे और {{math|1=''x<sub>i</sub>''=0}} वैश्विक स्तर पर अधिकतम फीचर समुच्चय में फीचर {{math|''f<sub>i</sub>''}} की अनुपस्थिति को संकेत करे। मान लीजिए <math>c_i=I(f_i;c)</math> और <math>a_{ij}=I(f_i;f_j)</math> हैं। फिर उपरोक्त को अनुकूलन समस्या के रूप में लिखा जा सकता है | मान लीजिए कि {{mvar|n }} पूर्ण-समुच्चय सुविधाएँ हैं। मान लीजिए {{math|''x<sub>i</sub>''}} फीचर {{math|''f<sub>i</sub>''}} के लिए समुच्चय सदस्यता संकेतक फलन है, जिससे {{math|1=''x<sub>i</sub>''=1}} उपस्थिति को संकेत करे और {{math|1=''x<sub>i</sub>''=0}} वैश्विक स्तर पर अधिकतम फीचर समुच्चय में फीचर {{math|''f<sub>i</sub>''}} की अनुपस्थिति को संकेत करे। मान लीजिए <math>c_i=I(f_i;c)</math> और <math>a_{ij}=I(f_i;f_j)</math> हैं। फिर उपरोक्त को अनुकूलन समस्या के रूप में लिखा जा सकता है | ||
:<math>\mathrm{mRMR}= \max_{x\in \{0,1\}^{n}} | :<math>\mathrm{mRMR}= \max_{x\in \{0,1\}^{n}} | ||
| Line 109: | Line 109: | ||
\mathrm{QPFS}: \min_\mathbf{x} \left\{ \alpha \mathbf{x}^T H \mathbf{x} - \mathbf{x}^T F\right\} \quad \mbox{s.t.} \ \sum_{i=1}^n x_i=1, x_i\geq 0 | \mathrm{QPFS}: \min_\mathbf{x} \left\{ \alpha \mathbf{x}^T H \mathbf{x} - \mathbf{x}^T F\right\} \quad \mbox{s.t.} \ \sum_{i=1}^n x_i=1, x_i\geq 0 | ||
</math> | </math> | ||
जहां <math>F_{n\times1}=[I(f_1;c),\ldots, I(f_n;c)]^T</math> फीचर प्रासंगिकता का सदिश है, यह मानते हुए कि कुल मिलाकर {{mvar|n}} फीचर हैं, तथा <math>H_{n\times n}=[I(f_i;f_j)]_{i,j=1\ldots n}</math> फीचर जोड़ीदार अतिरेक का आव्युह है, और <math>\mathbf{x}_{n\times 1}</math> सापेक्ष फीचर भार का प्रतिनिधित्व करता है। क्यूएफपीएस को द्विघात प्रोग्रामिंग के माध्यम से समाधान किया जाता है। वर्तमान में यह दिखाया गया है कि क्यूएफपीएस लघु एन्ट्रापी वाले फीचर्स के प्रति पक्षपाती है, <ref name="CMI" /> इसकी लिए इसे फीचर सेल्फ रिडंडेंसी टर्म <math>I(f_i;f_i)</math> को {{mvar|H}} के विकर्ण पर रखा गया है। | जहां <math>F_{n\times1}=[I(f_1;c),\ldots, I(f_n;c)]^T</math> फीचर प्रासंगिकता का सदिश है, यह मानते हुए कि कुल मिलाकर {{mvar|n }} फीचर हैं, तथा <math>H_{n\times n}=[I(f_i;f_j)]_{i,j=1\ldots n}</math> फीचर जोड़ीदार अतिरेक का आव्युह है, और <math>\mathbf{x}_{n\times 1}</math> सापेक्ष फीचर भार का प्रतिनिधित्व करता है। क्यूएफपीएस को द्विघात प्रोग्रामिंग के माध्यम से समाधान किया जाता है। वर्तमान में यह दिखाया गया है कि क्यूएफपीएस लघु एन्ट्रापी वाले फीचर्स के प्रति पक्षपाती है, <ref name="CMI" /> इसकी लिए इसे फीचर सेल्फ रिडंडेंसी टर्म <math>I(f_i;f_i)</math> को {{mvar|H }} के विकर्ण पर रखा गया है। | ||
=== सशर्त पारस्परिक सूचना === | === सशर्त पारस्परिक सूचना === | ||
Revision as of 14:17, 4 August 2023
| Part of a series on |
| Machine learning and data mining |
|---|
| Scatterplot featuring a linear support vector machine's decision boundary (dashed line) |
यंत्र अधिगम और सांख्यिकी में, फीचर चयन होता हैं, जिसे वैरिएबल चयन, विशेषता चयन या वैरिएबल उपसमुच्चय चयन के रूप में भी जाना जाता है | यह मॉडल निर्माण में उपयोग के लिए प्रासंगिक फीचर (मशीन लर्निंग) (वेरिएबल , प्रडिक्टर) के उपसमुच्चय का चयन करने की प्रक्रिया है। फीचर चयन तकनीकों का उपयोग अनेक कारणों से किया जाता है |
फीचर चयन तकनीक का उपयोग करते समय केंद्रीय आधार यह है कि डेटा में कुछ विशेषताएं सम्मिलित हैं जो तब अनावश्यक हैं या अप्रासंगिक हैं, और इस प्रकार सूचना को अधिक हानि के अतिरिक्त उन्हें हटाया जा सकता है। [9] यह निरर्थक और अप्रासंगिक दो भिन्न-भिन्न धारणाएँ होती हैं, क्योंकि प्रासंगिक विशेषता किसी अन्य प्रासंगिक विशेषता की उपस्थिति में निरर्थक हो सकती है जिसके साथ यह दृढ़ता से सहसंबद्ध होता है।[10]
फीचर चयन तकनीकों को फीचर निष्कर्षण से भिन्न किया जाना चाहिए। [11] फीचर निष्कर्षण मूल सुविधाओं के कार्यों से नई सुविधाएँ बनाता है, जबकि फीचर चयन सुविधाओं का उपसमुच्चय लौटाता है। फीचर चयन तकनीकों का उपयोग अधिकांशतः उन डोमेन में किया जाता है जहाँ अनेक सुविधाएँ और तुलनात्मक रूप से प्रतिरुप (या डेटा बिंदु) होते हैं। फीचर चयन के अनुप्रयोग के लिए आदर्श स्तिथियों में स्टाइलोमेट्री और डीएनए माइक्रोएरे डेटा का विश्लेषण सम्मिलित होता है, जहां अनेक हजारों विशेषताएं होती हैं, और इसमें कुछ दसियों से सैकड़ों प्रतिरुप हैं।
परिचय
फीचर चयन एल्गोरिथ्म को नए फीचर उपसमुच्चय के प्रस्ताव के लिए खोज तकनीक के संयोजन के रूप में देखा जा सकता है | इसके साथ ही मूल्यांकन उपाय जो विभिन्न फीचर उपसमुच्चय को स्कोर करता है।यह सबसे सरल एल्गोरिदम सुविधाओं के प्रत्येक संभावित उपसमूह का परीक्षण करना है जो त्रुटि दर को कम करता है। यह स्पेस की विस्तृत खोज है, और यह लघु से लघु फीचर समुच्चय को छोड़कर सभी के लिए कम्प्यूटेशनल रूप से कठिन है। मूल्यांकन मेट्रिक का चुनाव एल्गोरिदम को अधिक रूप से प्रभावित करता है, और यह मूल्यांकन मेट्रिक्स होता हैं जो फीचर चयन एल्गोरिदम की तीन मुख्य श्रेणियों के मध्य अंतर करते हैं | इसमें रैपर, फिल्टर और एम्बेडेड विधियां होती हैं। [10]
- रैपर विधियाँ फीचर उपसमुच्चय को स्कोर करने के लिए पूर्वानुमानित मॉडल का उपयोग करती हैं। प्रत्येक नए उपसमुच्चय का उपयोग मॉडल को प्रशिक्षित करने के लिए किया जाता है, जिसका परीक्षण होल्ड-आउट समुच्चय पर किया जाता है। उस होल्ड-आउट समुच्चय (मॉडल की त्रुटि दर) पर की गई त्रुटियों की संख्या की गणना करने से उस उपसमुच्चय के लिए स्कोर मिलता है। चूँकि रैपर विधियाँ प्रत्येक उपसमुच्चय के लिए नए मॉडल को प्रशिक्षित करती हैं, वह कम्प्यूटेशनल रूप से बहुत गहन होती हैं, किन्तु सामान्यतः यह उस विशेष प्रकार के मॉडल या विशिष्ट समस्या के लिए सबसे अच्छा प्रदर्शन करने वाला फीचर समुच्चय प्रदान करती हैं।
- फ़िल्टर विधियाँ फीचर उपसमुच्चय को स्कोर करने के लिए त्रुटि दर के अतिरिक्त प्रॉक्सी माप का उपयोग करती हैं। फीचर समुच्चय की उपयोगिता को ध्यान में रखते हुए, गणना करने में तीव्र होने के लिए इस उपाय को चुना गया है। सामान्य उपायों में आपसी सूचना सम्मिलित होती है,[10] यह बिंदुवार आपसी सूचना हैं ,[12]