Claude Architect · पाठ

दावे से स्रोत का मानचित्रण

दावों के साथ URL, दस्तावेज़ नाम, उद्धरण और तिथियाँ सुरक्षित रखिए।

पाठ 1, कुल 4 में से13 चरण

दावे से स्रोत का मानचित्रण, CoddyKit पर Claude Architect का एक निःशुल्क पाठ है। यह 4 में से 1वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह Claude Architect सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। Claude Architect पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

स्रोत-उत्पत्ति संबंधी जानकारी क्यों महत्वपूर्ण है

बहु-एजेंट शोध प्रणाली में समन्वयक उन उप-एजेंटों के निष्कर्ष एकत्रित करता है, जिन्होंने अलग-अलग दस्तावेज़ों से तथ्य निकाले हैं। एकत्रित उत्तर तभी विश्वसनीय होता है, जब हर दावे का संबंध उसके स्रोत तक पता लगाया जा सके।

दावे-से-स्रोत मानचित्रण हर तथ्यात्मक कथन को उसके मूल स्रोत से जोड़ता है: यूआरएल, दस्तावेज़ का नाम, सटीक उद्धरण और प्रकाशन तिथि। इस संबंध के बिना आपके पास ऐसा कथन रह जाता है, जिसे कोई मानव समीक्षक सत्यापित नहीं कर सकता और कोई अगला एजेंट जाँच नहीं सकता।

आर्किटेक्ट परीक्षा के लिए, स्रोत-उत्पत्ति संबंधी जानकारी डोमेन 4 (प्रॉम्प्ट इंजीनियरिंग और संरचित आउटपुट) में आती है और परिदृश्य 3 (बहु-एजेंट शोध) तथा परिदृश्य 6 (संरचित डेटा निष्कर्षण) में फिर दिखाई देती है।

किसी स्रोत के चार आधार

स्रोत-मानचित्रण में हमेशा चार आधार होने चाहिए, ताकि कोई मानव या अन्य एजेंट प्रमाण को फिर से ढूँढ़ और सत्यापित कर सके:

  • यूआरएल — दस्तावेज़ कहाँ उपलब्ध है (या कोई स्थिर पहचानकर्ता)।
  • दस्तावेज़ का नाम — मानव-पठनीय शीर्षक।
  • उद्धरण — दावे का समर्थन करने वाला शब्दशः पाठ, भावानुवाद नहीं।
  • प्रकाशन तिथि — स्रोत कब प्रकाशित हुआ या आखिरी बार कब अद्यतन हुआ।

शब्दशः उद्धरण से समीक्षक पुष्टि कर सकता है कि मॉडल ने कुछ गढ़ा या बढ़ा-चढ़ाकर नहीं कहा। तिथि से बाद में उत्पन्न विरोधाभासों को सुलझाया जा सकता है, जैसा हम देखेंगे।

मानचित्रण को संरचित आउटपुट के रूप में मॉडल करें

मॉडल से उद्धरणों को ऐसे गद्य में पिरोने के लिए न कहें जहाँ वे आसानी से छूट सकते हैं। इसके बजाय, किसी उपकरण के माध्यम से JSON Schema का उपयोग करके एक संरचित रूप अनिवार्य करें। tool_use को स्कीमा के साथ जोड़ने से वाक्य-विन्यास संबंधी त्रुटियाँ समाप्त होती हैं और आवश्यक फ़ील्ड मौजूद होने का प्रवर्तन होता है।

हर दावा एक ऐसी वस्तु बन जाता है, जिसमें अपने स्रोत-आधार शामिल होते हैं। यही सत्यापन योग्य स्रोत-उत्पत्ति रिकॉर्ड की नींव है।

extract_claims = {
    "name": "record_claims",
    "description": "Record each factual claim with its full source provenance.",
    "input_schema": {
        "type": "object",
        "properties": {
            "claims": {
                "type": "array",
                "items": {
                    "type": "object",
                    "properties": {
                        "claim": {"type": "string"},
                        "source_url": {"type": "string"},
                        "document_name": {"type": "string"},
                        "quote": {"type": "string"},
                        "publication_date": {"type": "string"}
                    },
                    "required": ["claim", "quote", "document_name"]
                }
            }
        },
        "required": ["claims"]
    }
}

आवश्यक फ़ील्ड: केवल वही जो हमेशा मौजूद हों

एक सूक्ष्म, लेकिन परीक्षा के लिए अत्यंत महत्वपूर्ण, नियम है: किसी फ़ील्ड को आवश्यक तभी चिह्नित करें, जब वह स्रोत में हमेशा मौजूद हो। यदि आप ऐसी फ़ील्ड को आवश्यक बनाते हैं जो अनुपस्थित हो सकती है, तो स्कीमा पूरा करने के लिए मॉडल उसका मान गढ़ देगा।

किसी ब्लॉग पोस्ट में औपचारिक publication_date नहीं हो सकती; किसी आंतरिक PDF में source_url नहीं हो सकता। इसलिए claim, quote और document_name आवश्यक हैं (ये हमेशा उपलब्ध होते हैं), जबकि source_url और publication_date वैकल्पिक रहें। खाली तिथि ईमानदार है; गढ़ी हुई तिथि स्रोत-उत्पत्ति की विफलता है।

tool_choice के साथ संरचित आउटपुट अनिवार्य करें

मुक्त-रूप गद्य के बजाय स्रोत-उत्पत्ति वाली वस्तु वापस पाने की गारंटी के लिए मॉडल को tool_choice से सीमित करें। {"type": "tool", "name": "record_claims"} सेट करने पर वही विशिष्ट उपकरण अनिवार्य हो जाता है, इसलिए हर उत्तर स्कीमा-सत्यापित JSON के रूप में आता है।

"any" का उपयोग करने पर किसी न किसी उपकरण के चलने की गारंटी होगी; लेकिन जब आपके पास केवल एक निष्कर्षण उपकरण हो, तो नामित उपकरण को अनिवार्य करना सबसे कड़ी गारंटी देता है।

resp = client.messages.create(
    model="claude-sonnet-4-5",
    max_tokens=2048,
    tools=[extract_claims],
    tool_choice={"type": "tool", "name": "record_claims"},
    messages=[{
        "role": "user",
        "content": (
            "Extract every factual claim from the document below. "
            "For each, attach the verbatim quote, document name, "
            "and the source URL and publication date if present.\n\n"
            f"<document>{source_text}</document>"
        ),
    }],
)

शब्दशः उद्धरण मनगढ़ंत बातों को कम करते हैं

शब्दशः उद्धरण (भावानुवाद नहीं) माँगना केवल रिकॉर्ड-रखरखाव नहीं, बल्कि विश्वसनीयता बढ़ाने का साधन है। जब मॉडल को समर्थन देने वाला सटीक पाठ कॉपी करना पड़ता है, तो उसके लिए ऐसा दावा करना बहुत कठिन हो जाता है जो स्रोत में था ही नहीं।

प्रॉम्प्ट में स्पष्ट मानदंड और 2-4 उदाहरण देकर इसे और मजबूत करें। कुछ उदाहरण आउटपुट के प्रारूप, किनारी मामलों और मनगढ़ंत बातों को कम करने के लिए विशेष रूप से प्रभावी होते हैं — मॉडल आपके नमूनों को केवल दोहराने के बजाय उस पैटर्न को सामान्यीकृत करता है।

PROMPT = (
    "Rules:\n"
    "- 'quote' MUST be copied verbatim from the document. Never paraphrase.\n"
    "- If a claim has no exact supporting sentence, DO NOT emit it.\n"
    "- Leave 'publication_date' empty if the document states no date.\n\n"
    "Example:\n"
    "claim: 'Revenue grew 12% in Q3.'\n"
    "quote: 'Third-quarter revenue rose 12% year over year.'\n"
    "document_name: 'FY24 Q3 Earnings Release'\n"
)

उप-एजेंटों के बीच स्रोत-उत्पत्ति संबंधी जानकारी बनाए रखें

हब-और-प्रवक्ता शोध प्रणाली में उप-एजेंट समन्वयक के वार्तालाप इतिहास को विरासत में नहीं लेते। हर उप-एजेंट को अपने निष्कर्ष स्रोत-मानचित्रण के साथ लौटाने चाहिए, क्योंकि तथ्य का स्रोत जानने का समन्वयक के पास कोई दूसरा तरीका नहीं है।

इसके बाद समन्वयक इन स्व-पूर्ण दावे की वस्तुओं को एकत्रित करता है। यदि कोई उप-एजेंट बिना उद्धरण या दस्तावेज़ के नाम के केवल एक वाक्य लौटाता है, तो उसके संदर्भ से बाहर निकलते ही वह तथ्य सत्यापन योग्य नहीं रहता — उसे मान्य निष्कर्ष नहीं, बल्कि अनुपस्थित स्रोत-उत्पत्ति जानकारी मानें।

# Each subagent returns claim objects, not loose prose.
subagent_result = {
    "agent": "market-research",
    "claims": [
        {
            "claim": "EV sales reached 14M units in 2023.",
            "quote": "Global EV sales hit 14 million units in 2023.",
            "document_name": "IEA Global EV Outlook 2024",
            "source_url": "https://iea.org/evo-2024",
            "publication_date": "2024-04-23",
        }
    ],
}
# Coordinator aggregates self-contained, traceable claims.
aggregated.extend(subagent_result["claims"])

विरोधाभासों को चिह्नित करें — मनमाने ढंग से चयन न करें

जब दो स्रोत किसी आँकड़े पर असहमत हों, तो किसी एक को चुपचाप चुन लेना गलत तरीका है। सही तरीका है विरोधाभास को चिह्नित करना और दोनों दावों को उनके स्रोतों सहित सामने रखना।

अक्सर प्रकाशन तिथि स्पष्ट विरोधाभास को सुलझा देती है: 2021 का आँकड़ा और 2024 का आँकड़ा विरोधाभासी नहीं हैं — वे समय-श्रृंखला हैं। इसी कारण हर मानचित्रण में तिथि का आधार आवश्यक है। दोनों को सुरक्षित रखें, लेबल करें और निर्णय मानव (या तिथि-सचेत नियम) पर छोड़ दें।

conflict = {
    "metric": "global_ev_sales_units",
    "values": [
        {"value": "6.6M", "document_name": "IEA EV Outlook 2022",
         "publication_date": "2022-05-23"},
        {"value": "14M", "document_name": "IEA EV Outlook 2024",
         "publication_date": "2024-04-23"},
    ],
    "note": "Not contradictory: different reporting years. Dates resolve it.",
}

स्व-सुधार से अनुपस्थित स्रोतों का पता लगाएँ

स्व-सुधार दो ऐसे मान निकालकर काम करता है जिनकी आप तुलना कर सकें। स्रोत-उत्पत्ति के लिए मॉडल से कहें कि हर दावे के साथ यह संकेत भी दे कि समर्थन करने वाला उद्धरण वास्तव में मिला या नहीं, फिर प्रोग्राम के माध्यम से सत्यापित करें कि हर दावे में एक उद्धरण मौजूद है।

इससे वह मौन विफलता पकड़ी जाती है जिसमें आत्मविश्वास से भरा वाक्य बिना किसी प्रमाण के भेज दिया जाता है। यहाँ सत्यापन संरचनात्मक है — पुनःप्रयास चक्र के लिए बिल्कुल उपयुक्त।

def validate_provenance(claims):
    problems = []
    for c in claims:
        if not c.get("quote", "").strip():
            problems.append(f"No quote: {c['claim']!r}")
        if not c.get("document_name"):
            problems.append(f"No document_name: {c['claim']!r}")
    return problems  # empty list == provenance complete

प्रतिक्रिया के साथ पुनःप्रयास करें — लेकिन इसकी सीमाएँ समझें

यदि सत्यापन में कोई संरचनात्मक कमी (लापता उद्धरण, गलत प्रारूप वाली तिथि) मिलती है, तो प्रतिक्रिया के साथ पुनःप्रयास करें: मॉडल को मूल दस्तावेज़, उसका अपना गलत आउटपुट और सत्यापन की सटीक त्रुटि भेजें। इससे प्रारूप और संरचना संबंधी गलतियाँ विश्वसनीय रूप से सुधरती हैं।

महत्वपूर्ण सीमा: जब जानकारी स्रोत में अनुपस्थित हो, तब पुनःप्रयास मदद नहीं करता। यदि दस्तावेज़ में वास्तव में प्रकाशन तिथि नहीं है, तो बार-बार पुनःप्रयास करने से वह उत्पन्न नहीं होगी — और आपको ऐसा करने देना भी नहीं चाहिए। फ़ील्ड को खाली चिह्नित करें और आगे बढ़ें, बजाय इसके कि चक्र हमेशा चलता रहे।

problems = validate_provenance(claims)
if problems:
    retry = client.messages.create(
        model="claude-sonnet-4-5",
        max_tokens=2048,
        tools=[extract_claims],
        tool_choice={"type": "tool", "name": "record_claims"},
        messages=[
            {"role": "user", "content": f"<document>{source_text}</document>"},
            {"role": "assistant", "content": prior_output},
            {"role": "user", "content":
                "These claims lack a verbatim quote or document_name: "
                + "; ".join(problems)
                + ". Add the exact supporting quote, or DROP the claim "
                  "if no supporting text exists. Do not invent sources."},
        ],
    )

सामग्री के प्रकार के अनुसार स्रोत-उत्पत्ति प्रस्तुत करें

दावों का मानचित्रण हो जाने के बाद, उन्हें ऐसी संरचना में प्रस्तुत करें जो सामग्री के अनुकूल हो। वित्तीय जानकारी को सारणियों, समाचार को गद्य और तकनीकी निष्कर्षों को सूचियों के रूप में प्रस्तुत करें — और हर एक में उसके स्रोत-आधार दिखाई दें।

मानव निगरानी के लिए, दस्तावेज़ का नाम, तिथि और लिंक वाली फुटनोट या अंतिम स्तंभ सत्यापन को जाँच-पड़ताल के बजाय एक नज़र का काम बना देता है। जो स्रोत-उत्पत्ति दिखाई नहीं देती, उसे कोई जाँचेगा नहीं।

| Metric        | Value | Source                    | Date       |
|---------------|-------|---------------------------|------------|
| EV sales 2023 | 14M   | IEA Global EV Outlook 2024| 2024-04-23 |
| EV sales 2022 | 6.6M  | IEA Global EV Outlook 2022| 2022-05-23 |

<!-- Financials -> table. News -> prose. Tech findings -> list. -->

त्वरित जाँच: विरोधी आँकड़े

एक बहु-एजेंट शोध प्रणाली बाज़ार के आकार का ऐसा आँकड़ा एकत्रित करती है, जिसे दो उप-एजेंटों ने अलग-अलग बताया है: एक प्राथमिक स्रोत कहता है "$4.2B (2021 की रिपोर्ट)", और दूसरा कहता है "$7.1B (2024 की रिपोर्ट)"। समन्वयक को मानव समीक्षक के लिए सत्यापन योग्य उत्तर तैयार करना है।

पुनरावलोकन: दावे-से-स्रोत मानचित्रण

परीक्षा और उत्पादन प्रणालियों के लिए मुख्य बातें:

  • हर दावे को चार आधारों से जोड़ें: यूआरएल, दस्तावेज़ का नाम, शब्दशः उद्धरण, प्रकाशन तिथि।
  • tool_use + JSON Schema से रूप लागू करें और tool_choice के माध्यम से उसे अनिवार्य करें।
  • किसी फ़ील्ड को तभी आवश्यक चिह्नित करें जब वह हमेशा मौजूद हो — संभावित रूप से अनुपस्थित फ़ील्ड को कभी आवश्यक न बनाएँ, वरना मॉडल उसे गढ़ देगा।
  • उप-एजेंट इतिहास विरासत में नहीं लेते, इसलिए हर एक को स्व-पूर्ण और पता लगाने योग्य दावे लौटाने चाहिए।
  • विरोधाभासों को चिह्नित करें; मनमाने ढंग से चयन करने के बजाय तिथियों को दिखने वाले विरोधाभासों को सुलझाने दें।
  • संरचनात्मक कमियों के लिए प्रतिक्रिया के साथ पुनःप्रयास करें — लेकिन स्वीकार करें कि स्रोत में अनुपस्थित जानकारी पुनःप्रयास से नहीं मिल सकती।
  • मानव निगरानी के लिए स्रोतों को दिखाई देते हुए सामग्री के प्रकार के अनुसार प्रस्तुत करें (सारणियाँ/गद्य/सूचियाँ)।
शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
26
पाठ
104

अक्सर पूछे जाने वाले प्रश्न

क्या “दावे से स्रोत का मानचित्रण” पाठ निःशुल्क है?

हाँ — Claude Architect अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “दावे से स्रोत का मानचित्रण” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। Claude Architect पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“दावे से स्रोत का मानचित्रण” में मैं क्या सीखूँगा?

दावों के साथ URL, दस्तावेज़ नाम, उद्धरण और तिथियाँ सुरक्षित रखिए। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ Claude Architect का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या Claude Architect शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर Claude Architect शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 1वाँ पाठ है।

“दावे से स्रोत का मानचित्रण” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस Claude Architect पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर Claude Architect पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. दावे से स्रोत का मानचित्रण
  2. परस्पर-विरोधी डेटा और तिथियाँ
  3. समेकित मेट्रिक्स विफलताएँ छिपाते हैं
  4. स्तरीकृत सैंपलिंग और कैलिब्रेशन
← Claude Architect पर वापस जाएँ