रिट्रीवल के लिए कोसाइन समानता
कोसाइन समानता दो वेक्टरों के बीच के कोण को मापती है—यह अर्थ-आधारित खोज के लिए मानक दूरी माप है।
रिट्रीवल के लिए कोसाइन समानता, CoddyKit पर AI एजेंट का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह AI एजेंट सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
इस पाठ के कुछ हिस्सों का अभी तक अनुवाद नहीं हुआ है और वे अंग्रेज़ी में दिखाए गए हैं।
समानता मापना
दो वेक्टर कितने निकट हैं? दूरी मापने की तीन सामान्य विधियाँ:
- कोसाइन समानता — वेक्टरों के बीच कोण
- dot गुणनफल — प्रक्षेपण
- यूक्लिडीय (L2) दूरी — सीधी रेखा की दूरी
पाठ एम्बेडिंग के लिए कोसाइन डिफ़ॉल्ट है।
कोसाइन समानता का सूत्र
वेक्टर A और B के लिए:
cos(A, B) = (A . B) / (|A| * |B|)
परिणाम -1 और 1 के बीच होता है:
- 1 = समान दिशा
- 0 = लंबवत (असंबंधित)
- -1 = विपरीत
NumPy में Python के साथ
सीधा कार्यान्वयन:
import numpy as np
def cosine_similarity(a, b):
a = np.array(a)
b = np.array(b)
return np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b))
print(cosine_similarity(vec_apple, vec_orange)) # high
print(cosine_similarity(vec_apple, vec_car)) # lowपहले से सामान्यीकृत सदिश
यदि आपकी एम्बेडिंग पहले से सामान्यीकृत हैं (OpenAI की एम्बेडिंग ऐसी ही होती हैं), तो कोसाइन = डॉट गुणनफल होता है और आप भाग देने की प्रक्रिया छोड़ सकते हैं:
def cosine_normalized(a, b):
return np.dot(a, b) # fasterTop-K पुनर्प्राप्ति
किसी प्रश्न से सबसे अधिक समानता रखने वाले K दस्तावेज़ ढूँढने के लिए, हर दस्तावेज़ की समानता की गणना करें और उन्हें क्रमबद्ध करें:
def topk(query_vec, doc_vecs, k=5):
scores = [(np.dot(query_vec, v), i) for i, v in enumerate(doc_vecs)]
scores.sort(reverse=True)
return scores[:k]बड़े पैमाने पर विस्तार
सरल Top-K विधि में प्रत्येक प्रश्न के लिए O(N) समय लगता है — 10k दस्तावेज़ों के लिए यह ठीक है, लेकिन 10M दस्तावेज़ों पर धीमी होगी। बड़े दस्तावेज़-संग्रहों के लिए निकटतम पड़ोसी का अनुमानित (ANN) अनुक्रमण इस्तेमाल करें: HNSW, IVF, FAISS।
यूक्लिडीय क्यों नहीं
L2 दूरी सदिश की LENGTH को अर्थपूर्ण मानती है। एम्बेडिंग के लिए परिमाण की तुलना में दिशा अधिक महत्वपूर्ण होती है — इसी कारण कोसाइन बेहतर है।
(सामान्यीकृत सदिशों के लिए L2 और कोसाइन एक ही क्रम देते हैं, इसलिए इससे कोई फर्क नहीं पड़ता।)
डॉट बनाम कोसाइन
यदि सदिश पहले से सामान्यीकृत हैं, तो डॉट गुणनफल = कोसाइन होता है और यह तेज़ है (भाग देने की आवश्यकता नहीं होती)। अधिकांश उत्पादन प्रणालियाँ सामान्यीकृत सदिशों पर डॉट गुणनफल का इस्तेमाल करती हैं।
A Tiny End-to-End Retrieval
docs = ['Python is a programming language', 'Pizza is Italian food', 'The Eiffel Tower is in Paris']
doc_vecs = [embed(d) for d in docs]
query_vec = embed('What is Python?')
scores = [(cosine_similarity(query_vec, v), d) for v, d in zip(doc_vecs, docs)]
scores.sort(reverse=True)
for s, d in scores:
print(f'{s:.3f} {d}')
# 0.83 Python is a programming language
# 0.45 Pizza is Italian food
# 0.41 The Eiffel Tower is in Parisसंकर पुनर्प्राप्ति
दोनों के लाभ पाने के लिए कोसाइन समानता को कीवर्ड खोज (BM25) के साथ मिलाएँ — अर्थ-आधारित खोज + सटीक मिलान। आज अधिकांश उत्पादन प्रणालियाँ संकर पुनर्प्राप्ति का इस्तेमाल करती हैं।
सीमा-आधारित छनाई
LLM को अप्रासंगिक संदर्भ भेजने से बचने के लिए समानता की सीमा से नीचे आने वाले परिणाम हटा दें:
results = [r for r in retrieved if r.score > 0.7]कोसाइन का परास
कोसाइन समानता के मानों का परास क्या होता है?
पुनरावलोकन
एम्बेडिंग पुनर्प्राप्ति के लिए कोसाइन समानता मानक माप है। उत्पादन-स्तर पर उपयोग के लिए इसे संकर खोज और ANN के साथ मिलाएँ।
एआई शिक्षक के साथ AI एजेंट सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 60
- पाठ
- 239
अक्सर पूछे जाने वाले प्रश्न
क्या “रिट्रीवल के लिए कोसाइन समानता” पाठ निःशुल्क है?
हाँ—“रिट्रीवल के लिए कोसाइन समानता” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और AI एजेंट पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“रिट्रीवल के लिए कोसाइन समानता” में मैं क्या सीखूँगा?
कोसाइन समानता दो वेक्टरों के बीच के कोण को मापती है—यह अर्थ-आधारित खोज के लिए मानक दूरी माप है। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI एजेंट का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या AI एजेंट शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI एजेंट शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।
“रिट्रीवल के लिए कोसाइन समानता” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस AI एजेंट पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर AI एजेंट पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- एम्बेडिंग क्या होती हैं (वेक्टर निरूपण)
- text-embedding-3 से एम्बेडिंग बनाना
- रिट्रीवल के लिए कोसाइन समानता
- एम्बेडिंग मॉडल की तुलना (OpenAI बनाम Cohere बनाम OSS)