रियायती संचयी लाभ: Difference between revisions

Revision as of 12:07, 11 April 2023

रियायती संचयी लाभ (DCG) श्रेणी गुणवत्ता का परिमाण है। सूचना पुनर्प्राप्ति में इसका उपयोग अधिकतर वर्ल्ड वाइड वेब खोज इंजन कलन विधि या संबंधित अनुप्रयोगों की प्रभावशीलता को मापने के लिए किया जाता है। खोज-इंजन परिणाम सेट में दस्तावेजों के श्रेणीबद्ध प्रासंगिकता (सूचना पुनर्प्राप्ति) परिणाम का उपयोग करते हुए डीसीजी परिणाम सूची में दस्तावेज़ की स्थिति के आधार पर उसकी उपयोगिता या लाभ को मापता है। लाभ परिणाम सूची के शीर्ष से नीचे तक संचित होता है प्रत्येक परिणाम के लाभ को निचले श्रेणीयों पर छूट दी जाती है।^[1]

सिंहावलोकन

डीसीजी और उससे संबंधित उपायों का उपयोग करने में दो धारणाएं बनाई जाती हैं।

खोज इंजन परिणाम सूची में पहले प्रदर्शित होने पर अत्यधिक प्रासंगिक दस्तावेज़ (उच्च पद वाले) अधिक उपयोगी होते हैं।
अत्यधिक प्रासंगिक दस्तावेज सामान्य रूप से प्रासंगिक दस्तावेज़ों की तुलना में अधिक उपयोगी होते हैं, जो बदले में गैर-प्रासंगिक दस्तावेज़ों की तुलना में अधिक उपयोगी होते हैं।

डीसीजी पहले के अधिक आदिम संचयी लाभ नामक उपाय से उत्पन्न होता है।

संचयी लाभ

संचयी लाभ (सीजी) खोज परिणाम सूची में सभी परिणामों के श्रेणीबद्ध प्रासंगिकता मूल्यों का योग है। DCG के इस पूर्ववर्ती परिणाम सेट की उपयोगिता के विचार में परिणाम सूची में पद (स्थिति) को सम्मिलित नहीं करता है। विशेष पद स्थिति $p$ पर सीजी को इस प्रकार परिभाषित किया गया है :

\mathrm {CG_{p}} =\sum _{i=1}^{p}rel_{i}

जहाँ $rel_{i}$ स्थान $i$ पर परिणाम की श्रेणीबद्ध प्रासंगिकता है।

CG फ़ंक्शन के साथ परिकलित मान खोज परिणामों के क्रम में परिवर्तन से अप्रभावित रहता है यानी अत्यधिक प्रासंगिक दस्तावेज़ $d_{i}$ को उच्च पद , कम प्रासंगिक दस्तावेज़ $d_{j}$ CG से ऊपर ले जाने से इसके लिए परिकलित मान सीजी (यह मानते हुए $i,j\leq p$ ) नहीं बदलता है। खोज परिणामों की उपयोगिता के बारे में ऊपर की गई दो मान्यताओं के आधार पर (N)DCG को सामान्यतौर पर CG से अधिक पसंद किया जाता है।

संचयी लाभ को कभी-कभी ग्रेडेड प्रेसिजन कहा जाता है क्योंकि यह सटीक मापीय के समान होता है यदि क्रम निर्धारण मान द्विआधारी है।

रियायती संचयी लाभ

DCG का आधार यह है कि खोज परिणाम सूची में नीचे दिखाई देने वाले अत्यधिक प्रासंगिक दस्तावेज़ों को दंडित किया जाना चाहिए क्योंकि श्रेणीबद्ध प्रासंगिकता मान परिणाम की स्थिति के लिए लघुगणकीय से आनुपातिक रूप से कम हो जाता है।

विशेष पद स्थिति $p$ पर संचित DCG के पारंपरिक सूत्र को इस रूप में परिभाषित किया जाता है:

\mathrm {DCG_{p}} =\sum _{i=1}^{p}{\frac {rel_{i}}{\log _{2}(i+1)}}=rel_{1}+\sum _{i=2}^{p}{\frac {rel_{i}}{\log _{2}(i+1)}}

पहले लघुगणक कमी कारक का उपयोग करने के लिए सैद्धांतिक रूप से कोई ठोस औचित्य नहीं था<ref name=CMS2009>B. Croft; D. Metzler; T. Strohman (2010). Search Engines: Information Retrieval in Practice. Addison Wesley.</ref> इस तथ्य के अलावा कि यह एक सहज कमी पैदा करता है, लेकिन वांग एट अल (2013)^[2] ने सामान्यीकृत डीसीजी (एनडीसीजी) में लघुगणकीय कमी कारक का उपयोग करने के लिए सैद्धांतिक आश्वासन दिया। लेखक बताते हैं कि प्रत्येक जोड़ी के अलग-अलग श्रेणी कार्यों के लिए एनडीसीजी यह तय कर सकता है कि कौन सा सुसंगत तरीके से बेहतर है।

डीसीजी का वैकल्पिक सूत्रीकरण^[3] प्रासंगिक दस्तावेजों को पुनः प्राप्त करने पर अधिक जोर देता है:

\mathrm {DCG_{p}} =\sum _{i=1}^{p}{\frac {2^{rel_{i}}-1}{\log _{2}(i+1)}}

बाद वाला सूत्र सामान्य तौर पर प्रमुख वेब खोज कंपनियों^[4] और डेटा विज्ञान प्रतियोगिता मंच जैसे कागल सहित उद्योग में उपयोग किया जाता है।

डीसीजी के ये दो सूत्रीकरण समान हैं जब दस्तावेजों के प्रासंगिक मूल्य द्विआधारी हैं ^[5]^: 320 $rel_{i}\in \{0,1\}$ .

ध्यान दें कि क्रॉफ्ट एट अल (2010) और बर्गेस एट अल (2005) बेस ई के लॉग के साथ दूसरा डीसीजी (DCG) प्रस्तुत करते हैं, जबकि ऊपर डीसीजी के दोनों संस्करण बेस 2 के लॉग का उपयोग करते हैं। डीसीजी के पहले सूत्रीकरण के साथ एनडीसीजी की गणना करते समय लॉग का आधार कोई मायने नहीं रखता लेकिन इसका आधार लॉग दूसरे सूत्रीकरण के लिए एनडीसीजी के मूल्य को प्रभावित करता है। स्पष्ट रूप से लॉग का आधार दोनों योगों में डीसीजी के मान को प्रभावित करता है।

सामान्यीकृत डीसीजी

वेब खोज प्रश्न के आधार पर खोज परिणाम सूचियां लंबाई में भिन्न होती हैं। खोज इंजन के प्रदर्शन की तुलना एक प्रश्न से अगली तक लगातार डीसीजी का उपयोग करके प्राप्त नहीं किया जा सकता है इसलिए $p$ के चुने हुए मान के लिए प्रत्येक स्थान पर संचयी लाभ को सभी प्रश्नों में सामान्यीकृत किया जाना चाहिए। यह कॉर्पस में सभी प्रासंगिक दस्तावेजों को उनकी सापेक्ष प्रासंगिकता के आधार पर क्रमबद्ध करके किया जाता है, जिससे स्थिति के माध्यम से अधिकतम संभव डीसीजी का उत्पादन $p$ होता है, जिसे आइडियल डीसीजी (आईडीसीजी) भी कहा जाता है। किसी प्रश्न के लिए सामान्यीकृत छूट प्राप्त संचयी लाभ या nDCG की गणना इस प्रकार की जाती है:

\mathrm {nDCG_{p}} ={\frac {DCG_{p}}{IDCG_{p}}}

,

जहां IDCG आइडियल बट्टाकृत संचयी लाभ है,

\mathrm {IDCG_{p}} =\sum _{i=1}^{|REL_{p}|}{\frac {rel_{i}}{\log _{2}(i+1)}}

[1]

[2]

[3]

[4]

[5]

@@ Line 7: / Line 7: @@
 डीसीजी और उससे संबंधित उपायों का उपयोग करने में दो धारणाएं बनाई जाती हैं।
-#खोज इंजन परिणाम सूची में पहले प्रदर्शित होने पर अत्यधिक प्रासंगिक दस्तावेज़ (उच्च रैंक वाले) अधिक उपयोगी होते हैं।
+#खोज इंजन परिणाम सूची में पहले प्रदर्शित होने पर अत्यधिक प्रासंगिक दस्तावेज़ (उच्च पद      वाले) अधिक उपयोगी होते हैं।
 #अत्यधिक प्रासंगिक दस्तावेज सामान्य रूप से प्रासंगिक दस्तावेज़ों की तुलना में अधिक उपयोगी होते हैं, जो बदले में गैर-प्रासंगिक दस्तावेज़ों की तुलना में अधिक उपयोगी होते हैं।
@@ Line 14: / Line 14: @@
 ===संचयी लाभ===
-संचयी लाभ (सीजी) खोज परिणाम सूची में सभी परिणामों के श्रेणीबद्ध प्रासंगिकता मूल्यों का योग है। DCG के इस पूर्ववर्ती परिणाम सेट           की उपयोगिता के विचार में परिणाम सूची में रैंक (स्थिति) को सम्मिलित नहीं करता है। विशेष रैंक स्थिति <math>p</math> पर सीजी को इस प्रकार परिभाषित किया गया है :
+संचयी लाभ (सीजी) खोज परिणाम सूची में सभी परिणामों के श्रेणीबद्ध प्रासंगिकता मूल्यों का योग है। DCG के इस पूर्ववर्ती परिणाम सेट           की उपयोगिता के विचार में परिणाम सूची में पद      (स्थिति) को सम्मिलित नहीं करता है। विशेष पद      स्थिति <math>p</math> पर सीजी को इस प्रकार परिभाषित किया गया है :
 :<math> \mathrm{CG_{p}} = \sum_{i=1}^{p} rel_{i} </math>
 जहाँ <math>rel_{i}</math> स्थान <math>i</math> पर परिणाम की श्रेणीबद्ध प्रासंगिकता है।
-CG फ़ंक्शन के साथ परिकलित मान खोज परिणामों के क्रम में परिवर्तन से अप्रभावित रहता है यानी अत्यधिक प्रासंगिक दस्तावेज़ <math>d_{i}</math> को उच्च रैंक, कम प्रासंगिक दस्तावेज़ <math>d_{j}</math> CG से ऊपर ले जाने से इसके लिए परिकलित मान सीजी (यह मानते हुए <math>i,j \leq p</math>) नहीं बदलता है। खोज परिणामों की उपयोगिता के बारे में ऊपर की गई दो मान्यताओं के आधार पर (N)DCG को सामान्यतौर पर CG से अधिक पसंद किया जाता है।
+CG फ़ंक्शन के साथ परिकलित मान खोज परिणामों के क्रम में परिवर्तन से अप्रभावित रहता है यानी अत्यधिक प्रासंगिक दस्तावेज़ <math>d_{i}</math> को उच्च पद     , कम प्रासंगिक दस्तावेज़ <math>d_{j}</math> CG से ऊपर ले जाने से इसके लिए परिकलित मान सीजी (यह मानते हुए <math>i,j \leq p</math>) नहीं बदलता है। खोज परिणामों की उपयोगिता के बारे में ऊपर की गई दो मान्यताओं के आधार पर (N)DCG को सामान्यतौर पर CG से अधिक पसंद किया जाता है।
 संचयी लाभ को कभी-कभी ग्रेडेड प्रेसिजन कहा जाता है क्योंकि यह सटीक मापीय के समान होता है यदि क्रम निर्धारण मान द्विआधारी है।
@@ Line 27: / Line 27: @@
 DCG का आधार यह है कि खोज परिणाम सूची में नीचे दिखाई देने वाले अत्यधिक प्रासंगिक दस्तावेज़ों को दंडित किया जाना चाहिए क्योंकि श्रेणीबद्ध प्रासंगिकता मान परिणाम की स्थिति के लिए लघुगणकीय से आनुपातिक रूप से कम हो जाता है।
-विशेष रैंक स्थिति <math>p</math> पर संचित DCG के पारंपरिक सूत्र को इस रूप में परिभाषित किया जाता है:
+विशेष पद      स्थिति <math>p</math> पर संचित DCG के पारंपरिक सूत्र को इस रूप में परिभाषित किया जाता है:
 :<math> \mathrm{DCG_{p}} = \sum_{i=1}^{p} \frac{rel_{i}}{\log_{2}(i+1)} = rel_1 + \sum_{i=2}^{p} \frac{rel_{i}}{\log_{2}(i+1)} </math>
@@ Line 134: / Line 134: @@
 == यह भी देखें ==
 * [[मूल्यांकन उपाय (सूचना पुनर्प्राप्ति)]]
-* [[रैंक करना सीखना]]
+* [[रैंक करना सीखना|पद      करना सीखना]]
 == संदर्भ ==

Anonymous

Search

रियायती संचयी लाभ: Difference between revisions

Namespaces

More

Page actions

Revision as of 12:07, 11 April 2023

Contents

सिंहावलोकन

संचयी लाभ

रियायती संचयी लाभ

सामान्यीकृत डीसीजी