फीचर चयन: Difference between revisions

From Vigyanwiki
No edit summary
No edit summary
Line 175: Line 175:


==नियमित ट्री==
==नियमित ट्री==
[[ निर्णय वृक्ष | निर्णय ट्री]] या ट्री [[सामूहिक शिक्षा]] की विशेषताओं को निरर्थक दिखाया गया है। वर्तमान विधि जिसे नियमितीकृत ट्री कहा जाता है <ref name="DengRunger2012">H. Deng, G. Runger, "[https://arxiv.org/abs/1201.1587 Feature Selection via Regularized Trees]", Proceedings of the 2012 International Joint Conference on Neural Networks (IJCNN), IEEE, 2012</ref> फीचर उपसमुच्चय चयन के लिए उपयोग किया जा सकता है। नियमितीकृत ट्री वर्तमान नोड को विभाजित करने के लिए पूर्व ट्री नोड्स पर चयनित वेरिएबल के समान वेरिएबल का उपयोग करके दंडित करते हैं। नियमितीकृत ट्री को केवल ट्री मॉडल (या ट्री संयोजन मॉडल) बनाने की आवश्यकता होती है और इस प्रकार वह कम्प्यूटेशनल रूप से कुशल होते हैं।
[[ निर्णय वृक्ष | डिसिजन ट्री]] या ट्री [[सामूहिक शिक्षा]] की विशेषताओं को निरर्थक दिखाया गया है। वर्तमान विधि जिसे नियमितीकृत ट्री कहा जाता है <ref name="DengRunger2012">H. Deng, G. Runger, "[https://arxiv.org/abs/1201.1587 Feature Selection via Regularized Trees]", Proceedings of the 2012 International Joint Conference on Neural Networks (IJCNN), IEEE, 2012</ref> फीचर उपसमुच्चय चयन के लिए उपयोग किया जा सकता है। नियमितीकृत ट्री वर्तमान नोड को विभाजित करने के लिए पूर्व ट्री नोड्स पर चयनित वेरिएबल के समान वेरिएबल का उपयोग करके दंडित करते हैं। नियमितीकृत ट्री को केवल ट्री मॉडल (या ट्री संयोजन मॉडल) बनाने की आवश्यकता होती है और इस प्रकार वह कम्प्यूटेशनल रूप से कुशल होते हैं।


नियमितीकृत ट्री स्वाभाविक रूप से संख्यात्मक और श्रेणीगत विशेषताओं, अंतःक्रियाओं और गैर-रैखिकताओं को संभालते हैं। वह विशेषता मापदंडो (इकाइयों) के लिए अपरिवर्तनीय हैं और यह आउटलेर्स के प्रति असंवेदनशील हैं, और इस प्रकार, [[सामान्यीकरण (सांख्यिकी)]] जैसे कम [[डेटा प्रीप्रोसेसिंग]] की आवश्यकता होती है। नियमित यादृच्छिक फॉरेस्ट (आरआरएफ)<ref name="RRF">[https://cran.r-project.org/web/packages/RRF/index.html RRF: Regularized Random Forest], [[R (programming language)|R]] package on [[CRAN (R programming language)|CRAN]]</ref> प्रकार का नियमित ट्री है। निर्देशित आरआरएफ उन्नत आरआरएफ होता है जो सामान्य यादृच्छिक फॉरेस्ट से महत्व स्कोर द्वारा निर्देशित होता है।
नियमितीकृत ट्री स्वाभाविक रूप से संख्यात्मक और श्रेणीगत विशेषताओं, अंतःक्रियाओं और गैर-रैखिकताओं को संभालते हैं। वह विशेषता मापदंडो (इकाइयों) के लिए अपरिवर्तनीय हैं और यह आउटलेर्स के प्रति असंवेदनशील हैं, और इस प्रकार, [[सामान्यीकरण (सांख्यिकी)]] जैसे कम [[डेटा प्रीप्रोसेसिंग]] की आवश्यकता होती है। नियमित यादृच्छिक फॉरेस्ट (आरआरएफ)<ref name="RRF">[https://cran.r-project.org/web/packages/RRF/index.html RRF: Regularized Random Forest], [[R (programming language)|R]] package on [[CRAN (R programming language)|CRAN]]</ref> प्रकार का नियमित ट्री है। निर्देशित आरआरएफ उन्नत आरआरएफ होता है जो सामान्य यादृच्छिक फॉरेस्ट से महत्व स्कोर द्वारा निर्देशित होता है।
Line 212: Line 212:
| फ़िल्टर || || r<sup>2</sup> || फुओंग 2005<ref name="M. Phuong, Z pages 301-309"/>
| फ़िल्टर || || r<sup>2</sup> || फुओंग 2005<ref name="M. Phuong, Z pages 301-309"/>
|-
|-
| एसएनपीएस || [[Genetic algorithm|जेनेटिक एल्गोरिदम]] || डब्ल्यूरैपर || [[Decision tree learning|निर्णय ट्री]] || वर्गीकरण स्पष्टता (10 गुना) || शाह 2004<ref>{{cite journal | last1 = Shah | first1 = S. C. | last2 = Kusiak | first2 = A. | year = 2004 | title = Data mining and genetic algorithm based gene/SNP selection | journal = Artificial Intelligence in Medicine | volume = 31 | issue = 3| pages = 183–196 | doi = 10.1016/j.artmed.2004.04.002 | pmid = 15302085 }}</ref>
| एसएनपीएस || [[Genetic algorithm|जेनेटिक एल्गोरिदम]] || डब्ल्यूरैपर || [[Decision tree learning|डिसिजन ट्री]] || वर्गीकरण स्पष्टता (10 गुना) || शाह 2004<ref>{{cite journal | last1 = Shah | first1 = S. C. | last2 = Kusiak | first2 = A. | year = 2004 | title = Data mining and genetic algorithm based gene/SNP selection | journal = Artificial Intelligence in Medicine | volume = 31 | issue = 3| pages = 183–196 | doi = 10.1016/j.artmed.2004.04.002 | pmid = 15302085 }}</ref>
|-
|-
| एसएनपीएस || [[Hill climbing|हिल क्लिंबिंग]] || फ़िल्टर + डब्ल्यूरैपर || [[Naive Bayes classifier|नाइव बायेसियन]] || वर्गों का पूर्वानुमानित अवशिष्ट योग || लांग 2007<ref>{{cite journal | last1 = Long | first1 = N. | last2 = Gianola | first2 = D. | last3 = Weigel | first3 = K. A | year = 2011 | title = Dimension reduction and variable selection for genomic selection: application to predicting milk yield in Holsteins | journal = Journal of Animal Breeding and Genetics | volume = 128 | issue = 4| pages = 247–257 | doi=10.1111/j.1439-0388.2011.00917.x| pmid = 21749471 }}</ref>
| एसएनपीएस || [[Hill climbing|हिल क्लिंबिंग]] || फ़िल्टर + डब्ल्यूरैपर || [[Naive Bayes classifier|नाइव बायेसियन]] || वर्गों का पूर्वानुमानित अवशिष्ट योग || लांग 2007<ref>{{cite journal | last1 = Long | first1 = N. | last2 = Gianola | first2 = D. | last3 = Weigel | first3 = K. A | year = 2011 | title = Dimension reduction and variable selection for genomic selection: application to predicting milk yield in Holsteins | journal = Journal of Animal Breeding and Genetics | volume = 128 | issue = 4| pages = 247–257 | doi=10.1111/j.1439-0388.2011.00917.x| pmid = 21749471 }}</ref>
Line 228: Line 228:
| जेनेटिक एल्गोरिदम || डब्ल्यूरैपर || बहुरेखीय प्रतिगमन, [[Partial least squares regression|आंशिक न्यूनतम वर्ग]]|| [[root-mean-square error|मूल-माध्य-वर्ग त्रुटि]] पूर्वानुमान का || ब्रॉडहर्स्ट एट अल. 1997<ref>{{cite journal |first1=D. |last1=Broadhurst |first2=R. |last2=Goodacre |first3=A. |last3=Jones |first4=J. J. |last4=Rowland |first5=D. B. |last5=Kell |title=Genetic algorithms as a method for variable selection in multiple linear regression and partial least squares regression, with applications to pyrolysis mass spectrometry |journal=Analytica Chimica Acta |volume=348 |issue=1–3 |pages=71–86 |year=1997 |doi=10.1016/S0003-2670(97)00065-2 }}</ref>
| जेनेटिक एल्गोरिदम || डब्ल्यूरैपर || बहुरेखीय प्रतिगमन, [[Partial least squares regression|आंशिक न्यूनतम वर्ग]]|| [[root-mean-square error|मूल-माध्य-वर्ग त्रुटि]] पूर्वानुमान का || ब्रॉडहर्स्ट एट अल. 1997<ref>{{cite journal |first1=D. |last1=Broadhurst |first2=R. |last2=Goodacre |first3=A. |last3=Jones |first4=J. J. |last4=Rowland |first5=D. B. |last5=Kell |title=Genetic algorithms as a method for variable selection in multiple linear regression and partial least squares regression, with applications to pyrolysis mass spectrometry |journal=Analytica Chimica Acta |volume=348 |issue=1–3 |pages=71–86 |year=1997 |doi=10.1016/S0003-2670(97)00065-2 }}</ref>
|-
|-
| स्पैम || [[Mutation (genetic algorithm)|बाइनरी पीएसओ + म्यूटेशन]] || डब्ल्यूरैपर || [[Decision tree|निर्णय ट्री]] || भारांकित निवेश || झांग 2014<ref name="sciencedirect.com"/>  
| स्पैम || [[Mutation (genetic algorithm)|बाइनरी पीएसओ + म्यूटेशन]] || डब्ल्यूरैपर || [[Decision tree|डिसिजन ट्री]] || भारांकित निवेश || झांग 2014<ref name="sciencedirect.com"/>  
|-
|-
| माइक्रोएरे || [[Tabu search|ताबू सर्च]] + [[Particle swarm optimization|पीएसओ]]|| डब्ल्यूरैपर ||  [[Support Vector Machine|सपोर्ट सदिश मशीन,]][[k-nearest neighbors algorithm|, K निकटतम नेबर]] || [[Euclidean Distance|यूक्लिडियन दूरी]]  || चुआंग 2009<ref>{{cite journal | last1 = Chuang | first1 = L.-Y. | last2 = Yang | first2 = C.-H. | year = 2009 | title = Tabu search and binary particle swarm optimization for feature selection using microarray data | journal = Journal of Computational Biology | volume = 16 | issue = 12| pages = 1689–1703 | doi = 10.1089/cmb.2007.0211 | pmid = 20047491 }}</ref>
| माइक्रोएरे || [[Tabu search|ताबू सर्च]] + [[Particle swarm optimization|पीएसओ]]|| डब्ल्यूरैपर ||  [[Support Vector Machine|सपोर्ट सदिश मशीन,]][[k-nearest neighbors algorithm|, K निकटतम नेबर]] || [[Euclidean Distance|यूक्लिडियन दूरी]]  || चुआंग 2009<ref>{{cite journal | last1 = Chuang | first1 = L.-Y. | last2 = Yang | first2 = C.-H. | year = 2009 | title = Tabu search and binary particle swarm optimization for feature selection using microarray data | journal = Journal of Computational Biology | volume = 16 | issue = 12| pages = 1689–1703 | doi = 10.1089/cmb.2007.0211 | pmid = 20047491 }}</ref>
Line 284: Line 284:
* {{tmath|l_1}}-नियमितीकरण तकनीकें, जैसे विरल प्रतिगमन, लैस्सो, और {{tmath|l_1}}-एसवीएम
* {{tmath|l_1}}-नियमितीकरण तकनीकें, जैसे विरल प्रतिगमन, लैस्सो, और {{tmath|l_1}}-एसवीएम
*नियमित ट्री,<ref name="DengRunger2012" /> जैसे आरआरएफ पैकेज में नियमित यादृच्छिक फॉरेस्ट प्रयुक्त किया गया <ref name="RRF" />*
*नियमित ट्री,<ref name="DengRunger2012" /> जैसे आरआरएफ पैकेज में नियमित यादृच्छिक फॉरेस्ट प्रयुक्त किया गया <ref name="RRF" />*
*[[निर्णय वृक्ष सीखना|निर्णय ट्री सीखना]] <ref>R. Kohavi and G. John, "[https://ai.stanford.edu/~ronnyk/wrappersPrint.pdf Wrappers for feature subset selection]", ''[[Artificial Intelligence (journal)|Artificial intelligence]]'' 97.1-2 (1997): 273-324</ref>
*[[निर्णय वृक्ष सीखना|डिसिजन ट्री]] <ref>R. Kohavi and G. John, "[https://ai.stanford.edu/~ronnyk/wrappersPrint.pdf Wrappers for feature subset selection]", ''[[Artificial Intelligence (journal)|Artificial intelligence]]'' 97.1-2 (1997): 273-324</ref>
* [[मेमेटिक एल्गोरिदम]]
* [[मेमेटिक एल्गोरिदम]]
* [[ यादृच्छिक बहुपद लॉगिट | रैंडम मल्टीनोमियल लॉगिट]] (आरएमएनएल)
* [[ यादृच्छिक बहुपद लॉगिट | रैंडम मल्टीनोमियल लॉगिट]] (आरएमएनएल)

Revision as of 13:53, 4 August 2023

यंत्र अधिगम और सांख्यिकी में, फीचर चयन होता हैं, जिसे वैरिएबल चयन, विशेषता चयन या वैरिएबल उपसमुच्चय चयन के रूप में भी जाना जाता है | यह मॉडल निर्माण में उपयोग के लिए प्रासंगिक फीचर (मशीन लर्निंग) (वेरिएबल , प्रडिक्टर) के उपसमुच्चय का चयन करने की प्रक्रिया है। फीचर चयन तकनीकों का उपयोग अनेक कारणों से किया जाता है |

  • शोधकर्ताओं/उपयोगकर्ताओं द्वारा व्याख्या करना और उसको सरल बनाने के लिए मॉडलों का सरलीकरण,[1]
  • कम समय में प्रशिक्षण,[2]
  • आयामीता के कर्स से बचने के लिए,[3]
  • लर्निंग मॉडल क्लास के साथ डेटा की अनुकूलता में सुधार,[4]
  • इनपुट स्पेस में उपस्थित अंतर्निहित सममित स्थान को एनकोड करें। [5][6][7][8]

फीचर चयन तकनीक का उपयोग करते समय केंद्रीय आधार यह है कि डेटा में कुछ विशेषताएं सम्मिलित हैं जो तब अनावश्यक हैं या अप्रासंगिक हैं, और इस प्रकार सूचना को अधिक हानि के अतिरिक्त उन्हें हटाया जा सकता है। [9] यह निरर्थक और अप्रासंगिक दो भिन्न-भिन्न धारणाएँ होती हैं, क्योंकि प्रासंगिक विशेषता किसी अन्य प्रासंगिक विशेषता की उपस्थिति में निरर्थक हो सकती है जिसके साथ यह दृढ़ता से सहसंबद्ध होता है।[10]

फीचर चयन तकनीकों को फीचर निष्कर्षण से भिन्न किया जाना चाहिए। [11] फीचर निष्कर्षण मूल सुविधाओं के कार्यों से नई सुविधाएँ बनाता है, जबकि फीचर चयन सुविधाओं का उपसमुच्चय लौटाता है। फीचर चयन तकनीकों का उपयोग अधिकांशतः उन डोमेन में किया जाता है जहाँ अनेक सुविधाएँ और तुलनात्मक रूप से प्रतिरुप (या डेटा बिंदु) होते हैं। फीचर चयन के अनुप्रयोग के लिए आदर्श स्तिथियों में स्टाइलोमेट्री और डीएनए माइक्रोएरे डेटा का विश्लेषण सम्मिलित होता है, जहां अनेक हजारों विशेषताएं होती हैं, और इसमें कुछ दसियों से सैकड़ों प्रतिरुप हैं।

परिचय

फीचर चयन एल्गोरिथ्म को नए फीचर उपसमुच्चय के प्रस्ताव के लिए खोज तकनीक के संयोजन के रूप में देखा जा सकता है | इसके साथ ही मूल्यांकन उपाय जो विभिन्न फीचर उपसमुच्चय को स्कोर करता है।यह सबसे सरल एल्गोरिदम सुविधाओं के प्रत्येक संभावित उपसमूह का परीक्षण करना है जो त्रुटि दर को कम करता है। यह स्पेस की विस्तृत खोज है, और यह लघु से लघु फीचर समुच्चय को छोड़कर सभी के लिए कम्प्यूटेशनल रूप से कठिन है। मूल्यांकन मेट्रिक का चुनाव एल्गोरिदम को अधिक रूप से प्रभावित करता है, और यह मूल्यांकन मेट्रिक्स होता हैं जो फीचर चयन एल्गोरिदम की तीन मुख्य श्रेणियों के मध्य अंतर करते हैं | इसमें रैपर, फिल्टर और एम्बेडेड विधियां होती हैं। [10]

  • रैपर विधियाँ फीचर उपसमुच्चय को स्कोर करने के लिए पूर्वानुमानित मॉडल का उपयोग करती हैं। प्रत्येक नए उपसमुच्चय का उपयोग मॉडल को प्रशिक्षित करने के लिए किया जाता है, जिसका परीक्षण होल्ड-आउट समुच्चय पर किया जाता है। उस होल्ड-आउट समुच्चय (मॉडल की त्रुटि दर) पर की गई त्रुटियों की संख्या की गणना करने से उस उपसमुच्चय के लिए स्कोर मिलता है। चूँकि रैपर विधियाँ प्रत्येक उपसमुच्चय के लिए नए मॉडल को प्रशिक्षित करती हैं, वह कम्प्यूटेशनल रूप से बहुत गहन होती हैं, किन्तु सामान्यतः यह उस विशेष प्रकार के मॉडल या विशिष्ट समस्या के लिए सबसे अच्छा प्रदर्शन करने वाला फीचर समुच्चय प्रदान करती हैं।
  • फ़िल्टर विधियाँ फीचर उपसमुच्चय को स्कोर करने के लिए त्रुटि दर के अतिरिक्त प्रॉक्सी माप का उपयोग करती हैं। फीचर समुच्चय की उपयोगिता को ध्यान में रखते हुए, गणना करने में तीव्र होने के लिए इस उपाय को चुना गया है। सामान्य उपायों में आपसी सूचना सम्मिलित होती है,[10] बिंदुवार आपसी सूचना हैं ,[12] पियर्सन उत्पाद-क्षण सहसंबंध गुणांक, रिलीफ (सुविधा चयन) | रिलीफ-आधारित एल्गोरिदम,[13] और अंतर/अंतर कक्षा दूरी या प्रत्येक वर्ग/सुविधा संयोजन के लिए सांख्यिकीय परिकल्पना परीक्षण के स्कोर सम्मिलित हैं।[12][14] फ़िल्टर सामान्यतः रैपर्स की तुलना में कम कम्प्यूटेशनल रूप से गहन होते हैं, किन्तु वह फीचर समुच्चय का उत्पादन करते हैं जो विशिष्ट प्रकार के पूर्वानुमानित मॉडल के अनुरूप नहीं होता है।[15] ट्यूनिंग की इस कमी का अर्थ है कि फ़िल्टर से समुच्चय किया गया फीचर रैपर से समुच्चय की तुलना में अधिक सामान्य है, सामान्यतः रैपर की तुलना में कम पूर्वानुमान प्रदर्शन देता है। चूँकि फीचर समुच्चय में पूर्वानुमान मॉडल की धारणाएँ सम्मिलित नहीं हैं, और इसलिए यह सुविधाओं के मध्य संबंधों को प्रदर्शित करने के लिए अधिक उपयोगी है। अनेक फ़िल्टर स्पष्ट सर्वोत्तम फीचर उपसमुच्चय के अतिरिक्त फीचर रैंकिंग प्रदान करते हैं, और रैंकिंग में कट-ऑफ पॉइंट क्रॉस-वैलिडेशन (सांख्यिकी)|क्रॉस-वैलिडेशन के माध्यम से चुना जाता है। फ़िल्टर विधियों का उपयोग रैपर विधियों के लिए प्रीप्रोसेसिंग चरण के रूप में भी किया गया है, जिससे बड़ी समस्याओं पर रैपर का उपयोग किया जा सकता है। अन्य लोकप्रिय दृष्टिकोण रिकर्सिव फीचर एलिमिनेशन एल्गोरिदम है,[16] सामान्यतः मॉडल का निरंतर निर्माण करने और कम वजन वाले फीचर्स को हटाने के लिए समर्थन सदिश मशीन के साथ उपयोग किया जाता है।
  • एंबेडेड विधियां तकनीकों का समूह होती है जो मॉडल निर्माण प्रक्रिया के भागों के रूप में फीचर चयन करती है। इस दृष्टिकोण का उदाहरण रेखीय मॉडल के निर्माण के लिए लासो (सांख्यिकी) विधि होती है, जो प्रतिगमन गुणांक को एल 1 दंड के साथ दंडित करता है, उनमें से अनेक को शून्य तक सिकोड़ देता है। कोई भी विशेषता जिसमें गैर-शून्य प्रतिगमन गुणांक है, उसे लैस्सो एल्गोरिथ्म द्वारा 'चयनित' किया जाता है। लैस्सो में सुधारों में बोलासो सम्मिलित है जो प्रतिरूपों को बूटस्ट्रैप करता है;[17] इलास्टिक नेट नियमितीकरण, जो लैस्सो के L1 दंड को रिज प्रतिगमन के L2 दंड के साथ जोड़ता है | और फ़ीआलेक्ट जो प्रतिगमन गुणांक के संयुक्त विश्लेषण के आधार पर सभी विशेषताओं को स्कोर करता है। [18] एईएफएस आगे लैस्सो को ऑटोएन्कोडर्स के साथ नॉनलाइनियर परिदृश्य तक विस्तारित करता है।[19] कम्प्यूटेशनल सम्मिश्रता के संदर्भ में यह दृष्टिकोण फिल्टर और रैपर के मध्य होते हैं।

पारंपरिक प्रतिगमन विश्लेषण में, फीचर चयन का सबसे लोकप्रिय रूप वेरिएबल चरणबद्ध प्रतिगमन है, जो रैपर तकनीक होती है। यह ग्रीडी एल्गोरिदम है जो प्रत्येक समय में सबसे अच्छी सुविधा जोड़ता है | और (सबसे व्यर्थ सुविधा को हटा देता है)। मुख्य नियंत्रण उद्देश्य यह तय करना है कि एल्गोरिदम को कब रोकना है। मशीन लर्निंग में, यह सामान्यतः क्रॉस-वैलिडेशन (सांख्यिकी)|क्रॉस-वैलिडेशन द्वारा किया जाता है। आँकड़ों में, कुछ मानदंड अनुकूलित किए गए हैं। इससे श्रंखला बनाने की अंतर्निहित समस्या उत्पन्न होती है। इससे अधिक शक्तिशाली विधियों का अनुमान लगाया गया है, जैसे शाखा और बाउंड और टुकड़े-टुकड़े रैखिक नेटवर्क होते हैं।

उपसमुच्चय चयन

उपसमुच्चय चयन उपयुक्तता के लिए समूह के रूप में सुविधाओं के उपसमुच्चय का मूल्यांकन करता है। उपसमुच्चय खोज एल्गोरिथ्म को रैपर, फिल्टर और एम्बेडेड विधियों में विभाजित किया जा सकता है। रैपर्स संभावित सुविधाओं के स्थान के माध्यम से खोज करने के लिए खोज एल्गोरिदम का उपयोग करते हैं और उपसमुच्चय पर मॉडल चलाकर प्रत्येक उपसमुच्चय का मूल्यांकन करते हैं। रैपर कम्प्यूटेशनल रूप से मूल्यवान हो सकते हैं और मॉडल में अधिक फिट होने पर कठिन परिस्थिति हो सकती है। खोज दृष्टिकोण में फ़िल्टर रैपर के समान होते हैं, किन्तु यह किसी मॉडल के विरुद्ध मूल्यांकन करने के अतिरिक्त, सरल फ़िल्टर का मूल्यांकन किया जाता है। एंबेडेड तकनीकें मॉडल में अंतर्निहित और विशिष्ट होती हैं।

अनेक लोकप्रिय खोज दृष्टिकोण ग्रीडी एल्गोरिदम हिल क्लिंबिंग का उपयोग करते हैं, जो सुविधाओं के उम्मीदवार उपसमूह का पुनरावृत्तीय मूल्यांकन करता है, फिर उपसमूह को संशोधित करता है और मूल्यांकन करता है कि क्या नया उपसमूह पुराने की तुलना में सही है। उपसमुच्चय के मूल्यांकन के लिए स्कोरिंग मीट्रिक (गणित) की आवश्यकता होती है जो सुविधाओं के उपसमूह को ग्रेड करती है। व्यापक खोज सामान्यतः अव्यावहारिक होती है, इसलिए कुछ कार्यान्वयनकर्ता (या ऑपरेटर) परिभाषित स्टॉपिंग बिंदु पर होते हैं, उस बिंदु तक खोजे गए उच्चतम स्कोर वाले सुविधाओं के उपसमुच्चय को संतबषजनक सुविधा उपसमुच्चय के रूप में चुना जाता है। इसको रोकने का मानदंड एल्गोरिथम के अनुसार भिन्न होता है |इस प्रकार यह संभावित मानदंडों में सम्मिलित हैं | उपसमुच्चय स्कोर सीमा से अधिक होता है | कार्य का अधिकतम अनुमत रन समय सरपास्ड हो गया है |

वैकल्पिक खोज-आधारित तकनीकें लक्षित प्रक्षेपण खोज पर आधारित होती हैं जो उच्च स्कोर वाले डेटा के निम्न-आयामी अनुमानों का पता लगाती हैं | फिर उन विशेषताओं का चयन किया जाता है जिनके निचले-आयामी स्थान में सबसे बड़े प्रक्षेपण होते हैं।

खोज दृष्टिकोण में सम्मिलित हैं |

वर्गीकरण समस्याओं के लिए दो लोकप्रिय फ़िल्टर मेट्रिक्स सहसंबंध और पारस्परिक सूचना हैं,चूंकि गणितीय अर्थ में कोई भी वास्तविक मीट्रिक (गणित) या 'दूरी माप' नहीं है, क्योंकि वह त्रिकोण असमानता का पालन करने में विफल रहते हैं और इस प्रकार किसी भी वास्तविक 'दूरी' की गणना नहीं करते हैं - उन्हें 'स्कोर' के रूप में माना जाना चाहिए। इन अंकों की गणना उम्मीदवार सुविधा (या सुविधाओं के समुच्चय) और वांछित आउटपुट श्रेणी के मध्य की जाती है। चूँकि, यह ऐसे सच्चे मेट्रिक्स होते हैं जो पारस्परिक सूचना का सरल कार्य करते हैं [30] तथा आपसी सूचना या मीट्रिक देखें।

अन्य उपलब्ध फ़िल्टर मेट्रिक्स में सम्मिलित हैं |

  • वर्ग पृथक्करण
  • संगति-आधारित सुविधा चयन
  • सहसंबंध-आधारित सुविधा चयन

अधिकतमता मानदंड

अधिकतमता मानदंड का चुनाव कठिन होता है क्योंकि सुविधा चयन कार्य में अनेक उद्देश्य होते हैं। अनेक सामान्य मानदंडों में स्पष्टता की माप सम्मिलित होता है, जिसे चयनित सुविधाओं की संख्या द्वारा दंडित किया जाता है। उदाहरणों में अकाइक सूचना मानदंड (एआईसी) और मैलोज़ Cp सम्मिलित हैं | जिनमें प्रत्येक अतिरिक्त सुविधा के लिए 2 का जुर्माना है। एआईसी सूचना सिद्धांत पर आधारित है, और प्रभावी रूप से अधिकतम एन्ट्रापी सिद्धांत के माध्यम से प्राप्त होता है। [31][32]

अन्य मानदंड बायेसियन सूचना मानदंड (बीआईसी) हैं, जो प्रत्येक जोड़े गए फीचर के लिए के दंड का उपयोग करता है, न्यूनतम विवरण लंबाई (एमडीएल) जो असम्बद्ध रूप से का उपयोग करता है, बोनफेरोनी सुधार / आरआईसी जो