Claude Architect · Lektion

Sådan bedømmes scenariespørgsmål

Skaleret fra 100-1000, 720 for at bestå, ingen straf for gæt

Lektion 1 af 413 trin

Sådan bedømmes scenariespørgsmål er en gratis Claude Architect-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Claude Architect, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Claude Architect-kurset indeholder 4 lektioner i alt.

Hvad "scoring" egentlig måler

Hvert spørgsmål på eksamen Claude Certified Architect er en scenariebaseret multiple choice-opgave: 4 svarmuligheder, præcis 1 korrekt. Scoring er processen, der omdanner dit mønster af rigtige og forkerte svar til ét tal, som certificeringsorganet kan bruge til at bestå eller ikke bestå dig.

Denne lektion handler om den mekanik: hvordan rå svar bliver til en skaleret score, hvad grænsen på 720 betyder, og hvorfor reglen om ingen straf for at gætte ændrer, hvordan du bør handle på hver eneste opgave.

Rå score kontra skaleret score

Din rå score er ganske enkelt, hvor mange opgaver du besvarede korrekt. Eksamen viser ikke dette tal til dig. I stedet omregner den din rå præstation til et fast skaleret interval fra 100 til 1000.

Skalering findes, så forskellige eksamensversioner — som kan indeholde forskellige scenarier med lidt forskellig sværhedsgrad — forbliver sammenlignelige. En score på 720 på en lettere version og en score på 720 på en sværere version repræsenterer den samme dokumenterede kompetence. Du skal aldrig selv beregne skaleringen; du skal bare over grænsen.

# Conceptual model: raw correctness -> fixed scaled band
SCALE_MIN, SCALE_MAX = 100, 1000
PASS = 720

# Two forms, different raw difficulty, same scaled bar
for form, scaled in [("easy form", 725), ("hard form", 718)]:
    print(form, "->", "PASS" if scaled >= PASS else "FAIL")

Beståelsesgrænsen på 720

Beståelsesgrænsen er 720 på skalaen fra 100 til 1000 — ikke 72 %. Fordi scoren er skaleret og ikke en rå procentdel, kan du ikke pålideligt omregne "720" til "svarede korrekt på N ud af M".

Den praktiske konsekvens er, at du skal sigte efter en behagelig margin over 720. Hvis du behandler 720 som dit mål, er du kun én eller to uheldige opgaver fra ikke at bestå. Arkitekter, der består konsekvent, ligger tydeligt over grænsen i stedet for at balancere på den.

PASS = 720

def result(scaled_score: int) -> str:
    margin = scaled_score - PASS
    status = "PASS" if margin >= 0 else "FAIL"
    return f"{status} (margin {margin:+d})"

print(result(745))  # comfortable
print(result(721))  # razor-thin
print(result(715))  # just under

Hver opgave scores uafhængigt

Opgaver scores uafhængigt: hvert spørgsmål bidrager for sig. Der gives ingen delvis kredit i en opgave med 4 svarmuligheder — du valgte enten den ene korrekte mulighed, eller også gjorde du ikke.

Det afgørende er, at 4 af de 8 scenarier vises ved hver eksamen, og at alle spørgsmål i disse fire scenarier scores. Ingen af dem er uden betydning. Der findes ingen regel om, at "kun de sværeste tæller", og heller ingen mekanisme, hvor den laveste score bortfalder, som du kan regne med.

Ingen straf for at gætte

Dette er den vigtigste scoringregel for din adfærd: Et forkert svar og et ubesvaret spørgsmål giver begge nul point. Forkerte svar trækkes ikke fra din rå score.

Derfor er det altid dårligere at lade en opgave stå ubesvaret end at svare på den. Et tomt svar garanterer nul point; ethvert svar — selv et upræcist gæt — har en større end nul chance for at være korrekt. Reglen er enkel og absolut: Besvar alle spørgsmål.

# Why a blank is never optimal under no-penalty scoring
blank_ev = 0.0                 # blank: guaranteed zero
blind_guess_ev = 1 / 4         # 4 options, 1 correct
print("Blank EV:", blank_ev)
print("Blind guess EV:", blind_guess_ev)
print("Always answer:", blind_guess_ev > blank_ev)

Eliminering øger dine odds

Fordi der ikke er nogen straf, øger hver mulighed, du med sikkerhed kan udelukke, den forventede værdi af at gætte. Et blindt gæt blandt fire muligheder er 1/4 værd; udeluk én, og du er på 1/3; udeluk to, og du er på 1/2.

På denne eksamen er de letteste muligheder at udelukke antimønstrene — at analysere modeltekst for ord som "færdig" for at afslutte en løkke, at bruge iterationsgrænser som den primære stopmekanisme, at håndhæve kritiske forretningsregler med prompts i stedet for hooks eller at kræve skemafelter, som kan mangle. Får du øje på ét af dem, har du som regel fundet et forkert svar.

# Expected value rises as you eliminate distractors
def guess_ev(remaining_options: int) -> float:
    return 1 / remaining_options

for remaining in (4, 3, 2):
    print(f"{remaining} options left -> EV {guess_ev(remaining):.2f}")

Scoring omfatter alle 5 domæner

De opgaver, der scores, spænder over de fem vægtede domæner, og vægtningen beskriver, hvordan eksamen er sammensat:

  • D1 Agentarkitektur og orkestrering — 27 %
  • D2 Værktøjsdesign og MCP — 18 %
  • D3 Claude Code-konfiguration og workflows — 20 %
  • D4 Prompt engineering og struktureret output — 20 %
  • D5 Konteksthåndtering og pålidelighed — 15 %

D1 har den største vægt, så point her flytter din skalerede score mest. Men et svagt domæne, som du springer over, er permanent tabte point — der er ikke noget domæne, du trygt kan ignorere.

DOMAIN_WEIGHTS = {
    "D1 Agent Architecture & Orchestration": 27,
    "D2 Tool Design & MCP": 18,
    "D3 Claude Code Config & Workflows": 20,
    "D4 Prompt Engineering & Structured Output": 20,
    "D5 Context Management & Reliability": 15,
}
assert sum(DOMAIN_WEIGHTS.values()) == 100
print("Heaviest:", max(DOMAIN_WEIGHTS, key=DOMAIN_WEIGHTS.get))

Kun den ene bedste mulighed giver point

Mange scenarieopgaver har mere end én mulighed, der ser teknisk gyldig ud. Scoringen godskriver kun det ene bedste svar i den givne kontekst — det, der afspejler en sund Claude-arkitektur for netop den situation.

Derfor er overfladisk plausibilitet ikke nok. "Det kunne fungere" taber til "det er den korrekte praksis i produktion her". Eksamen tester en arkitekts anvendte dømmekraft efter mindst 6 måneders erfaring med Claude i produktion, ikke din evne til at genkende en mulighed, der lyder forsvarlig.

Sådan tester et scenariespørgsmål dig

En opgave, der scores, placerer dig i en reel situation og spørger hvad du skal gøre nu. Den korrekte mulighed svarer til et princip fra faktabladet; distraktorerne svarer til antimønstre. Eksempel: En agentisk løkke returnerer stop_reason == "tool_use" — hvad er det rigtige kontrolflow?

Det svar, der giver point, afslutter på stop_reason, kører værktøjer, føjer resultaterne til hele historikken og gentager, indtil end_turn. Distraktorer ville analysere assistentens tekst for "færdig" eller stoppe hårdt ved en iterationsgrænse. Det er din forståelse af princippet bag scenariet, der giver pointet.

# The credited control flow on a scored loop item
while True:
    resp = client.messages.create(
        model=MODEL, max_tokens=1024, messages=history, tools=tools
    )
    if resp.stop_reason == "tool_use":
        history.append({"role": "assistant", "content": resp.content})
        history.append(run_tools(resp))   # append results, continue
        continue
    break  # end_turn / max_tokens / stop_sequence -> stop on stop_reason

Et passende tempo beskytter din score

Da tomme svar giver nul point, og hver opgave er uafhængig, er et langsomt tempo en risiko for din score: Tid, du bruger på at gruble over én opgave, stjæler tid fra opgaver, du kunne have besvaret korrekt. Lad ikke ét svært scenarie opsluge resten af eksamen.

En disciplineret løkke er: læs scenariet, udeluk antimønstrene, vælg den stærkeste tilbageværende mulighed, og markér opgaven og gå videre, hvis du sidder fast. Du kan vende tilbage til markerede opgaver, men du må aldrig løbe tør for tid med ubesvarede spørgsmål — det er point, du gav afkald på uden grund.

# A simple per-item triage you can run in your head
def triage(seconds_spent, eliminated):
    if eliminated >= 3:
        return "answer now (1 option left)"
    if seconds_spent > 90:
        return "commit best guess, flag, move on"
    return "keep eliminating anti-patterns"

print(triage(120, 1))  # commit best guess, flag, move on

Omsæt scoringreglerne til en plan

Scoringsmodellen belønner en bestemt strategi:

  • Besvar 100 % af opgaverne — når der ikke er nogen straf, er et tomt svar ren tabt forventet værdi.
  • Udeluk antimønstre først for at øge hvert gæt fra 1/4 mod 1/2.
  • Vælg den ene bedste mulighed i konteksten, ikke blot en mulighed, der kan fungere.
  • Fordel din forberedelse på alle 5 domæner, og vægt D1 (27 %) højest, eftersom du ikke kan vælge, hvilke 4 af 8 scenarier der vises.
  • Skab en margin over 720 — behandl 720 som gulvet, ikke som målet.

Hurtigt tjek: scoringens mekanik

Anvend det, du har lært om, hvordan scenariespørgsmål scores.

Opsamling: sådan fungerer scoring

Vigtige pointer om, hvordan scenariespørgsmål bedømmes:

  • Skaleret, ikke råscore: Resultatet omregnes til en fast skala fra 100 til 1000, så prøverne forbliver sammenlignelige.
  • Bestået = 720 på den skala (ikke 72 %) — sigt efter en buffer over dette.
  • Uafhængige spørgsmål: 4 af 8 scenarier vises, hvert spørgsmål bedømmes, der gives ingen delvis point, og kun én mulighed er bedst.
  • Ingen straf for gæt: Både ubesvarede og forkerte svar giver nul point, så besvar alt.
  • Udeluk anti-patterns for at hæve hvert gæt fra 1/4 mod 1/2.
  • Dæk alle 5 domæner (D1 27 %, D2 18 %, D3 20 %, D4 20 %, D5 15 %), og disponér tiden, så intet står ubesvaret.
Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
26
Lektioner
104

Ofte stillede spørgsmål

Er lektionen “Sådan bedømmes scenariespørgsmål” gratis?

Ja — alle 3 lektioner i læringssporet Claude Architect, inklusive “Sådan bedømmes scenariespørgsmål”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Claude Architect-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Sådan bedømmes scenariespørgsmål”?

Skaleret fra 100-1000, 720 for at bestå, ingen straf for gæt Du øver dig i Claude Architect med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Claude Architect?

Der kræves ingen tidligere erfaring. Claude Architect på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.

Hvor lang tid tager lektionen “Sådan bedømmes scenariespørgsmål”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Claude Architect-lektion?

Ja. Alle Claude Architect-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Sådan bedømmes scenariespørgsmål
  2. Læsning af et scenarieprompt
  3. Eliminér forkerte svar
  4. Gennemgang af en komplet prøveeksamen
← Tilbage til Claude Architect