AI एजेंट · पाठ

रिट्रीवल के लिए कोसाइन समानता

कोसाइन समानता दो वेक्टरों के बीच के कोण को मापती है—यह अर्थ-आधारित खोज के लिए मानक दूरी माप है।

पाठ 3, कुल 4 में से13 चरण

रिट्रीवल के लिए कोसाइन समानता, CoddyKit पर AI एजेंट का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह AI एजेंट सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

इस पाठ के कुछ हिस्सों का अभी तक अनुवाद नहीं हुआ है और वे अंग्रेज़ी में दिखाए गए हैं।

समानता मापना

दो वेक्टर कितने निकट हैं? दूरी मापने की तीन सामान्य विधियाँ:

  • कोसाइन समानता — वेक्टरों के बीच कोण
  • dot गुणनफल — प्रक्षेपण
  • यूक्लिडीय (L2) दूरी — सीधी रेखा की दूरी

पाठ एम्बेडिंग के लिए कोसाइन डिफ़ॉल्ट है।

कोसाइन समानता का सूत्र

वेक्टर A और B के लिए:

cos(A, B) = (A . B) / (|A| * |B|)

परिणाम -1 और 1 के बीच होता है:

  • 1 = समान दिशा
  • 0 = लंबवत (असंबंधित)
  • -1 = विपरीत

NumPy में Python के साथ

सीधा कार्यान्वयन:

import numpy as np

def cosine_similarity(a, b):
    a = np.array(a)
    b = np.array(b)
    return np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b))

print(cosine_similarity(vec_apple, vec_orange))   # high
print(cosine_similarity(vec_apple, vec_car))      # low

पहले से सामान्यीकृत सदिश

यदि आपकी एम्बेडिंग पहले से सामान्यीकृत हैं (OpenAI की एम्बेडिंग ऐसी ही होती हैं), तो कोसाइन = डॉट गुणनफल होता है और आप भाग देने की प्रक्रिया छोड़ सकते हैं:

def cosine_normalized(a, b):
    return np.dot(a, b)   # faster

Top-K पुनर्प्राप्ति

किसी प्रश्न से सबसे अधिक समानता रखने वाले K दस्तावेज़ ढूँढने के लिए, हर दस्तावेज़ की समानता की गणना करें और उन्हें क्रमबद्ध करें:

def topk(query_vec, doc_vecs, k=5):
    scores = [(np.dot(query_vec, v), i) for i, v in enumerate(doc_vecs)]
    scores.sort(reverse=True)
    return scores[:k]

बड़े पैमाने पर विस्तार

सरल Top-K विधि में प्रत्येक प्रश्न के लिए O(N) समय लगता है — 10k दस्तावेज़ों के लिए यह ठीक है, लेकिन 10M दस्तावेज़ों पर धीमी होगी। बड़े दस्तावेज़-संग्रहों के लिए निकटतम पड़ोसी का अनुमानित (ANN) अनुक्रमण इस्तेमाल करें: HNSW, IVF, FAISS।

यूक्लिडीय क्यों नहीं

L2 दूरी सदिश की LENGTH को अर्थपूर्ण मानती है। एम्बेडिंग के लिए परिमाण की तुलना में दिशा अधिक महत्वपूर्ण होती है — इसी कारण कोसाइन बेहतर है।

(सामान्यीकृत सदिशों के लिए L2 और कोसाइन एक ही क्रम देते हैं, इसलिए इससे कोई फर्क नहीं पड़ता।)

डॉट बनाम कोसाइन

यदि सदिश पहले से सामान्यीकृत हैं, तो डॉट गुणनफल = कोसाइन होता है और यह तेज़ है (भाग देने की आवश्यकता नहीं होती)। अधिकांश उत्पादन प्रणालियाँ सामान्यीकृत सदिशों पर डॉट गुणनफल का इस्तेमाल करती हैं।

A Tiny End-to-End Retrieval

docs = ['Python is a programming language', 'Pizza is Italian food', 'The Eiffel Tower is in Paris']
doc_vecs = [embed(d) for d in docs]

query_vec = embed('What is Python?')
scores = [(cosine_similarity(query_vec, v), d) for v, d in zip(doc_vecs, docs)]
scores.sort(reverse=True)
for s, d in scores:
    print(f'{s:.3f}  {d}')
# 0.83  Python is a programming language
# 0.45  Pizza is Italian food
# 0.41  The Eiffel Tower is in Paris

संकर पुनर्प्राप्ति

दोनों के लाभ पाने के लिए कोसाइन समानता को कीवर्ड खोज (BM25) के साथ मिलाएँ — अर्थ-आधारित खोज + सटीक मिलान। आज अधिकांश उत्पादन प्रणालियाँ संकर पुनर्प्राप्ति का इस्तेमाल करती हैं।

सीमा-आधारित छनाई

LLM को अप्रासंगिक संदर्भ भेजने से बचने के लिए समानता की सीमा से नीचे आने वाले परिणाम हटा दें:

results = [r for r in retrieved if r.score > 0.7]

कोसाइन का परास

कोसाइन समानता के मानों का परास क्या होता है?

पुनरावलोकन

एम्बेडिंग पुनर्प्राप्ति के लिए कोसाइन समानता मानक माप है। उत्पादन-स्तर पर उपयोग के लिए इसे संकर खोज और ANN के साथ मिलाएँ।

शुरुआत निःशुल्क

एआई शिक्षक के साथ AI एजेंट सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
60
पाठ
239

अक्सर पूछे जाने वाले प्रश्न

क्या “रिट्रीवल के लिए कोसाइन समानता” पाठ निःशुल्क है?

हाँ—“रिट्रीवल के लिए कोसाइन समानता” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और AI एजेंट पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“रिट्रीवल के लिए कोसाइन समानता” में मैं क्या सीखूँगा?

कोसाइन समानता दो वेक्टरों के बीच के कोण को मापती है—यह अर्थ-आधारित खोज के लिए मानक दूरी माप है। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI एजेंट का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या AI एजेंट शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI एजेंट शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।

“रिट्रीवल के लिए कोसाइन समानता” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस AI एजेंट पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर AI एजेंट पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. एम्बेडिंग क्या होती हैं (वेक्टर निरूपण)
  2. text-embedding-3 से एम्बेडिंग बनाना
  3. रिट्रीवल के लिए कोसाइन समानता
  4. एम्बेडिंग मॉडल की तुलना (OpenAI बनाम Cohere बनाम OSS)
← AI एजेंट पर वापस जाएँ