SQL में लिफ्ट, सांख्यिकीय महत्त्व और सुरक्षा-जाँच
रूपांतरण लिफ्ट निकालना और उन डेटा-जाँचों को लागू करना जो खराब प्रयोग का संकेत देती हैं
SQL में लिफ्ट, सांख्यिकीय महत्त्व और सुरक्षा-जाँच, CoddyKit पर कोडिंग साक्षात्कार की तैयारी का एक निःशुल्क पाठ है। यह 4 में से 4वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह कोडिंग साक्षात्कार की तैयारी सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। कोडिंग साक्षात्कार की तैयारी पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
मापदंडों से निर्णय तक
हर विकल्प का रूपांतरण केवल शुरुआत है। साक्षात्कार का प्रश्न है: क्या प्रयोग-विकल्प वास्तव में बेहतर रहा? इसके लिए वृद्धि निकालनी होगी, यह आँकना होगा कि अंतर वास्तविक है या शोर, और ऐसे सुरक्षा-मापदंडों की जाँच करनी होगी जो खराब प्रयोग को पकड़ सकें।
आप एसक्यूएल में पूरा सांख्यिकीय पैकेज नहीं चलाएँगे, लेकिन वे इनपुट और सांख्यिकीय महत्त्व का वह मोटा संकेत निकाल सकते हैं जिसे साक्षात्कारकर्ता देखना चाहते हैं।
प्रति-विकल्प सारांश CTE
आगे की सारी गणना एक सुव्यवस्थित सारांश पर आधारित होती है: हर विकल्प के लिए उपयोगकर्ता संख्या n, रूपांतरित उपयोगकर्ताओं की संख्या c, और रूपांतरण दर p। इसे एक बार CTE में निकालें और फिर उपयोग करें।
WITH summary AS (
SELECT
variant,
COUNT(DISTINCT user_id) AS n,
COUNT(DISTINCT converted_user) AS c
FROM experiment_flat
GROUP BY variant
)
SELECT
variant, n, c,
1.0 * c / n AS p
FROM summary;निरपेक्ष और सापेक्ष वृद्धि
वृद्धि की दो परिभाषाएँ होती हैं, और साक्षात्कारकर्ता सामान्यतः सापेक्ष वाली अपेक्षित करते हैं:
- निरपेक्ष वृद्धि = p_treatment - p_control (प्रतिशत-बिंदु)।
- सापेक्ष वृद्धि = (p_treatment - p_control) / p_control (प्रतिशत सुधार)।
यह कहना कि वृद्धि 2 बिंदु है और यह कहना कि सापेक्ष वृद्धि 20% है, एक ही परिणाम का वर्णन कर सकता है। स्पष्ट रहें।
स्वयं-सारणी-परिवर्तन से वृद्धि की गणना
दो विकल्पों की एक ही पंक्ति में तुलना करने के लिए सशर्त समूहीकरण से नियंत्रण और प्रयोग विकल्पों को अगल-बगल लाएँ, फिर अंकगणित करें।
इससे अपने-आप से जोड़ने की नाज़ुक प्रक्रिया से बचा जा सकता है और वृद्धि का सूत्र पढ़ने में सरल रहता है।
WITH s AS (
SELECT variant,
COUNT(DISTINCT user_id) AS n,
COUNT(DISTINCT converted_user) AS c
FROM experiment_flat GROUP BY variant
),
rates AS (
SELECT
MAX(CASE WHEN variant='control' THEN 1.0*c/n END) AS p_ctrl,
MAX(CASE WHEN variant='treatment' THEN 1.0*c/n END) AS p_trt
FROM s
)
SELECT
p_ctrl, p_trt,
p_trt - p_ctrl AS abs_lift,
ROUND(100.0 * (p_trt - p_ctrl) / p_ctrl, 2) AS rel_lift_pct
FROM rates;अंतर केवल शोर क्यों हो सकता है
प्रयोग विकल्प की ऊँची दर यादृच्छिक नमूना-भाग्य का परिणाम हो सकती है। सांख्यिकीय महत्त्व पूछता है: यदि दोनों विकल्प वास्तव में एक जैसे हों, तो इतने बड़े अंतर की संभावना कितनी है?
मुख्य घटक हर दर की मानक त्रुटि है, जो नमूना आकार बढ़ने पर घटती है। बड़े नमूने छोटे बदलावों को विश्वसनीय बनाते हैं; छोटे नमूनों में बड़े बदलाव भी संदिग्ध हो सकते हैं।
अनुपात की मानक त्रुटि
n उपयोगकर्ताओं पर रूपांतरण दर p के लिए मानक त्रुटि sqrt(p * (1 - p) / n) होती है। इसे हर विकल्प के लिए सीधे एसक्यूएल में निकालें।
तुलना करने से पहले यह हर दर में होने वाले उतार-चढ़ाव को मापता है।
WITH s AS (
SELECT variant,
COUNT(DISTINCT user_id) AS n,
COUNT(DISTINCT converted_user) AS c
FROM experiment_flat GROUP BY variant
)
SELECT
variant, n,
1.0 * c / n AS p,
SQRT( (1.0*c/n) * (1 - 1.0*c/n) / n ) AS std_err
FROM s;दो अनुपातों का Z-स्कोर
सांख्यिकीय महत्त्व का एक मोटा संकेत दो-अनुपात z-स्कोर है: दरों के अंतर को उस अंतर की मानक त्रुटि से भाग देने पर प्राप्त मान। लगभग 1.96 से अधिक परिमाण सामान्य 95% सीमा के अनुरूप होता है।
स्पष्ट रूप से बताएँ कि यह एक अनुमान है, उचित परीक्षण का विकल्प नहीं; फिर भी यह एसक्यूएल में इस प्रश्न का उत्तर देता है कि क्या यह अंतर संभवतः वास्तविक है।
WITH r AS (
SELECT
MAX(CASE WHEN variant='control' THEN 1.0*c/n END) AS p1,
MAX(CASE WHEN variant='control' THEN n END) AS n1,
MAX(CASE WHEN variant='treatment' THEN 1.0*c/n END) AS p2,
MAX(CASE WHEN variant='treatment' THEN n END) AS n2
FROM (
SELECT variant, COUNT(DISTINCT user_id) n,
COUNT(DISTINCT converted_user) c
FROM experiment_flat GROUP BY variant
) s
)
SELECT
p2 - p1 AS abs_lift,
(p2 - p1) / SQRT( p1*(1-p1)/n1 + p2*(1-p2)/n2 ) AS z_score
FROM r;Z-स्कोर की व्याख्या
संख्या को निष्कर्ष में बदलें, ताकि साक्षात्कारकर्ता को केवल गणित नहीं बल्कि व्यावसायिक समझ भी दिखाई दे:
|z| >= 1.96: लगभग 95% विश्वसनीयता पर अंतर सांख्यिकीय रूप से महत्त्वपूर्ण है।|z| < 1.96: पर्याप्त प्रमाण नहीं है; वृद्धि शोर हो सकती है।
पढ़ने योग्य लेबल निकालने के लिए इसे CASE में रखें और सांख्यिकीय महत्त्व को हमेशा वृद्धि के व्यावहारिक आकार के साथ दिखाएँ।
SELECT
z_score,
CASE WHEN ABS(z_score) >= 1.96
THEN 'significant at 95%'
ELSE 'not significant' END AS verdict
FROM (
SELECT 2.3 AS z_score
) t;नमूना अनुपात असंगति (SRM)
साक्षात्कारकर्ता जिस पहले सुरक्षा-मापदंड की जाँच करते हैं: क्या उपयोगकर्ता वास्तव में तय योजना के अनुसार विभाजित हुए? लाखों उपयोगकर्ताओं वाले 50/50 प्रयोग का 53/47 पर पहुँचना चेतावनी का संकेत है—यादृच्छिकीकरण या लॉग दर्ज करने की व्यवस्था में त्रुटि है।
देखी गई गिनतियों की अपेक्षित विभाजन से तुलना करें। बड़ा विचलन पूरे परीक्षण को अमान्य कर देता है, इससे पहले कि आप मापदंड देखें।
WITH cnt AS (
SELECT variant, COUNT(DISTINCT user_id) AS n
FROM experiment_flat GROUP BY variant
),
tot AS (SELECT SUM(n) AS total FROM cnt)
SELECT
c.variant, c.n,
ROUND(100.0 * c.n / t.total, 2) AS observed_pct,
50.0 AS expected_pct
FROM cnt c CROSS JOIN tot t;सुरक्षा-मापदंड
सुरक्षा-मापदंड वह मापदंड है जो प्राथमिक मापदंड में सुधार होने पर भी खराब नहीं होना चाहिए। सामान्य सुरक्षा-मापदंड हैं: पृष्ठ की विलंबता, धनवापसी दर, सदस्यता छोड़ने की दर और त्रुटि दर।
उन्हें सफलता के मापदंड के साथ हर विकल्प के लिए दिखाएँ। ऐसा प्रयोग विकल्प जो रूपांतरण बढ़ाए लेकिन धनवापसी दोगुनी कर दे, सफल नहीं है। बिना पूछे सुरक्षा-मापदंड निकालना उत्पाद-संबंधी विवेक दिखाता है।
SELECT
variant,
AVG(load_ms) AS avg_latency_ms,
ROUND(100.0 * SUM(refunded) / COUNT(*), 2) AS refund_rate_pct,
ROUND(100.0 * SUM(errored) / COUNT(*), 2) AS error_rate_pct
FROM experiment_flat
GROUP BY variant;पूरा परिणाम-सारांश
साक्षात्कारकर्ता जिस पूर्ण प्रयोग-सारांश को पसंद करते हैं, उसमें एक ही परिणाम में चार बातें होती हैं: हर विकल्प की दरें, सापेक्ष वृद्धि, सांख्यिकीय महत्त्व का निष्कर्ष और SRM जाँच। CTE की परतें बनाएँ और इसे निर्णय के लिए तैयार एक तालिका के रूप में प्रस्तुत करें।
अंत में कहें: अंतर महत्त्वपूर्ण है, वृद्धि का आकार स्वीकार्य है, सुरक्षा-मापदंड स्वस्थ हैं, विभाजन संतुलित है—इसलिए जारी करें या रोकें।
WITH s AS (
SELECT variant, COUNT(DISTINCT user_id) n,
COUNT(DISTINCT converted_user) c
FROM experiment_flat GROUP BY variant
),
r AS (
SELECT
MAX(CASE WHEN variant='control' THEN 1.0*c/n END) p1,
MAX(CASE WHEN variant='control' THEN n END) n1,
MAX(CASE WHEN variant='treatment' THEN 1.0*c/n END) p2,
MAX(CASE WHEN variant='treatment' THEN n END) n2
FROM s
)
SELECT
ROUND(100.0*(p2-p1)/p1, 2) AS rel_lift_pct,
CASE WHEN ABS((p2-p1)/SQRT(p1*(1-p1)/n1 + p2*(1-p2)/n2)) >= 1.96
THEN 'significant' ELSE 'not significant' END AS verdict,
CASE WHEN ABS(1.0*n2/(n1+n2) - 0.5) > 0.02
THEN 'SRM warning' ELSE 'split ok' END AS srm_check
FROM r;त्वरित जाँच
प्रयोग विकल्प में रूपांतरण की सापेक्ष वृद्धि 25% है, लेकिन हर विकल्प में केवल 40 उपयोगकर्ता हैं। सही निष्कर्ष क्या है?
पुनरावलोकन: वृद्धि, सांख्यिकीय महत्त्व और सुरक्षा-मापदंड
अब आप कच्चे विकल्प-मापदंडों को निर्णय में बदल सकते हैं:
- निरपेक्ष (बिंदु) वृद्धि और सापेक्ष (प्रतिशत) वृद्धि में अंतर समझें।
- हर दर की मानक त्रुटि और दो-अनुपात z-स्कोर को सांख्यिकीय महत्त्व के मोटे संकेत के रूप में निकालें (|z| >= 1.96 ~ 95%)।
- यह सुनिश्चित करने के लिए SRM जाँच करें कि विभाजन योजना से मेल खाता है।
- यह सुनिश्चित करने के लिए सुरक्षा-मापदंड दिखाएँ कि सफलता किसी गिरावट को छिपा न दे।
- निर्णय के लिए तैयार एक परिणाम-सारांश प्रस्तुत करें और सांख्यिकीय महत्त्व को हमेशा वृद्धि के व्यावहारिक आकार के साथ दिखाएँ।
इससे एसक्यूएल में फ़नल और A/B परीक्षण विश्लेषण पूरा होता है।
एआई शिक्षक के साथ कोडिंग साक्षात्कार की तैयारी सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 90
- पाठ
- 360
अक्सर पूछे जाने वाले प्रश्न
क्या “SQL में लिफ्ट, सांख्यिकीय महत्त्व और सुरक्षा-जाँच” पाठ निःशुल्क है?
हाँ—“SQL में लिफ्ट, सांख्यिकीय महत्त्व और सुरक्षा-जाँच” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और कोडिंग साक्षात्कार की तैयारी पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। कोडिंग साक्षात्कार की तैयारी पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“SQL में लिफ्ट, सांख्यिकीय महत्त्व और सुरक्षा-जाँच” में मैं क्या सीखूँगा?
रूपांतरण लिफ्ट निकालना और उन डेटा-जाँचों को लागू करना जो खराब प्रयोग का संकेत देती हैं आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ कोडिंग साक्षात्कार की तैयारी का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या कोडिंग साक्षात्कार की तैयारी शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर कोडिंग साक्षात्कार की तैयारी शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 4वाँ पाठ है।
“SQL में लिफ्ट, सांख्यिकीय महत्त्व और सुरक्षा-जाँच” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस कोडिंग साक्षात्कार की तैयारी पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर कोडिंग साक्षात्कार की तैयारी पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- बहु-चरणीय फ़नल बनाना
- क्रमबद्ध घटनाएँ और समय विंडो
- A/B परीक्षण का आवंटन और मेट्रिक्स
- SQL में लिफ्ट, सांख्यिकीय महत्त्व और सुरक्षा-जाँच